news 2026/8/5 7:34:53

用 4 台云服务器,跑通一套“能面试”的多智能体系统

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
用 4 台云服务器,跑通一套“能面试”的多智能体系统

用 4 台云服务器,跑通一套“能面试”的多智能体系统

配套课程:《AI Agent 系统设计面试现场》
关键词:多智能体协作 · 分布式部署 · 意图识别 · 规划执行 · 上下文管理 · 智能检索 · 评估反馈

0. 为什么写这篇

学完《AI Agent 系统设计面试现场》你会发现:面试官要的不是“我用了 RAG 和大模型”,而是当真实问题摆在面前时,你能不能从混乱输入里识别意图、从复杂任务里拆出 Plan、从失败执行里定位根因、从上下文爆炸里保住关键信息

这篇不是概念科普。我把课程里的五大主线(意图识别 / 规划执行 / 上下文管理 / 智能检索 / 评估反馈)落成了一套真能跑、且跨 4 台机器分布协作的多智能体系统,并把一次端到端调用的真实链路、指标、甚至“失败→自愈”的全过程记录下来,作为你面试时可以直接讲的项目。

1. 系统架构:5 类 Agent,4 台机器

课程强调 Agent 不是单体脚本,而是有职责边界、可编排、可观测的协作体。本系统拆成 5 个 Agent + 1 个编排网关:

角色Agent职责(对应课程主线)部署机器
网关 / 编排gateway串起整条链路,做失败重试与根因回溯调度m1
意图识别intent三层意图机制(L1 归一 / L2 分类 / L3 澄清)m1
规划planG4C 计划 + Replan 根因回溯m1
执行 / 工具execTAO 工具选择 + 工具注册表m2
上下文 / 检索memoryf(Context)上下文管理 + 零依赖 RAGm3
评估 / 反馈eval量化指标 + 反馈闭环 + 看板m4

架构图(跨机内网调用):

┌──────────────────────── m1 (120.46.194.24) ───────────────────────┐ 用户 ──POST /chat──▶ gateway ──▶ intent(8001) ──┐ │ ├──▶ plan(8002) │ └──▶ memory(8004, m3 内网) ←── exec 也会调 ├──▶ exec(8003, m2 内网) ──┘ └──▶ eval(8005, m4 内网) m2 exec ──▶ memory(8004, m3) m4 eval ──▶ dashboard(8006)

每个 Agent 是独立的 HTTP 服务进程(标准库http.server,零三方依赖),通过内网192.168.0.0/24互相寻址。这样做的好处:

  • 职责隔离:某个 Agent 挂了不影响其它(配合 systemdRestart=on-failure)。
  • 贴近生产:真实多智能体系统本就是“服务网格”形态,而不是单机if/else
  • 可观测:每次调用都有全链路Trace,可直接喂给 Eval 出指标。

2. 部署实战(华为云 FlexusX + Ubuntu 24.04)

4 台8vCPU / 16GiB的 FlexusX,Ubuntu 24.04,全部在同一个 VPC、同一可用区,内网互通(实测延迟 < 0.3ms)。

核心部署脚本(deploy.py)做三件事:

  1. 逐文件 SFTP 上传代码(agentkit/包 +service.py+demo_run.py)。这里踩过一个坑:用 tar 包整体上传再解压,会出现文件内容被串号的情况(实测service.py的 md5 居然和__init__.py一致)。改成逐文件上传后稳定。
  2. 写 systemd unit 并托管。比nohup &可靠得多——SSH 会话断开后进程不会被回收:
[Unit] Description=AgentKit intent After=network.target [Service] Type=simple WorkingDirectory=/opt/agentkit Environment=AGENT=intent Environment=AGENTKIT_CONFIG=/opt/agentkit/config.json ExecStart=/usr/bin/python3 /opt/agentkit/service.py Restart=on-failure RestartSec=2 [Install] WantedBy=multi-user.target
  1. 从 m1 内部探活各 Agent(注意:健康检查要走内网地址,不能从本地机器直连私网)。

启动后服务状态:

● agentkit-exec.service active (running) ● agentkit-memory.service active (running) ● agentkit-eval.service active (running) ● agentkit-dashboard.service active (running)

跨机连通性实测(m1 → m2 私网):

$ curl -s http://192.168.0.40:8003/health {"status": "ok", "agent": "exec"}

3. 端到端实测:一次调用干了什么

以课程里的“面试主线剧情”为场景,发一句话:

用户:那个最划算的帮我订了

系统走完的完整链路(节选自真实Trace):

阶段Agent关键输出
意图intent那个机票(指代消解),意图=book,置信度 0.92
规划planG4C 计划:检索→对比→下单
检索memoryRAG 命中《机票产品知识》片段
对比exec最划算排序:航司B(650) < 航司C(720) < 航司A(880)
执行exec下单失败:missing param: destination(缺目的地)
重规划plan根因回溯:失败点在执行层,但根因在输入层(缺参数)
澄清gateway从用户画像补全destination=上海
重试exec下单成功,订单号ORD_xxx

最终评估:总分 0.945(良好),自愈=成功,Replan 次数=1

一次“缺参数”的失败,没有让系统在失败层傻重试,而是回溯到根因、补参数、重跑,这正是课程第二章 Replan 上下讲的核心。

4. 你能从这篇得到什么

  • 一套可运行、可部署、可观测的多智能体代码(见仓库agentkit/)。
  • 一个能直接写进简历、经得起追问的项目叙事:不是“调大模型”,而是“意图识别→规划→执行→上下文/检索→评估反馈”全链路工程。
  • 一组真实指标失败自愈证据,面试时能甩数据。

下一篇讲意图识别的三层机制,我会贴出intent_agent.py的真实实现,以及它是怎么把“那个最划算的帮我订了”听懂的。


系列目录

  1. 总览:4 台 ECS 跑通可运行的多智能体系统
  2. 意图识别:三层机制(L1 归一 / L2 分类 / L3 澄清)
  3. 规划执行:G4C 计划与 Replan 根因回溯
  4. 上下文与检索:f(Context) 与零依赖 RAG
  5. 执行与评估:TAO 工具选择与评估反馈闭环
  6. 面试话术与简历:把项目讲专业
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/5 7:34:47

诚实的认知论:未知、边界与自我之场

在人类漫长的思想史中&#xff0c;认知论始终是一个充满悖论的领域。我们渴望理解宇宙的终极真理&#xff0c;却又常常受限于感官的边界与理性的局限。当面对那些超出经验范畴、无法被逻辑完全解构的宏大命题时&#xff0c;人类的本能反应往往是向外求索——祈求一个全知全能的…

作者头像 李华
网站建设 2026/8/5 7:34:36

储油罐变位识别与罐容表标定:数学建模与工程实践详解

1. 项目缘起&#xff1a;一个被忽视的工业测量难题最近在整理过去参与的工业项目资料时&#xff0c;翻到了一个非常有意思的案例——关于储油罐的变位识别与罐容表标定。这听起来可能有点枯燥&#xff0c;像是教科书里的内容&#xff0c;但实际处理起来&#xff0c;却是一个融合…

作者头像 李华
网站建设 2026/8/5 7:32:50

后端技术栈选型不是越多越好,关键看这三层逻辑

有个现象我观察了很久&#xff1a;不少后端团队的技术栈&#xff0c;不是“选”出来的&#xff0c;是“堆”出来的。业务刚起步&#xff0c;生产环境里躺着五六个数据库&#xff1b;代码还没跑通&#xff0c;先把服务拆成十几个微服务&#xff1b;日志量每天不到1G&#xff0c;…

作者头像 李华
网站建设 2026/8/5 7:31:17

从玩具到工具:构建健壮AI对话助手的工程化实践

最近在AI圈里有个很有意思的现象&#xff1a;很多开发者&#xff0c;尤其是刚入门的朋友&#xff0c;都在尝试用各种大模型API“组装”自己的AI应用。但结果往往是&#xff1a;Demo跑通了&#xff0c;界面做出来了&#xff0c;可一放到真实场景里&#xff0c;要么响应慢得像“人…

作者头像 李华
网站建设 2026/8/5 7:29:59

高通学习23--DMA-BUF/IOMMU/Memory(TODO)

(TODO)Linux共享内存DMA-BUF主要对象进程硬件设备进程访问者CPUCPU DMA设备需要MMU是通常需要IOMMU/SMMU支持零拷贝有限核心能力Camera不适合标准方案Display不适合标准方案NPU/DSP不适合常用

作者头像 李华
网站建设 2026/8/5 7:29:49

OpenClaw一键部署全解析:从Docker容器化到自动化配置实战

1. 项目概述&#xff1a;从手动到自动的部署革命如果你最近在折腾AI智能体&#xff0c;尤其是想快速搭建一个能帮你处理各种任务、连接不同工具的“数字员工”&#xff0c;那么OpenClaw这个名字你肯定不陌生。它是一个功能强大的开源AI智能体框架&#xff0c;简单来说&#xff…

作者头像 李华