具身智能学习路径小白入门具身智能学习路径https://mp.weixin.qq.com/s/rh4nN-KCYCECIyH32d8rhQ
RAG与知识工程方法知识工程学习方法
源自:Tsinghua Science and Technology
作者:秦川、金龙等
大模型的发展推动人工智能迎来范式变革,催生具备复杂推理、规划能力,且可与数字环境、物理环境交互的自主智能体。该领域正以前所未有的速度蓬勃发展,亟需一套完整、体系化的综述梳理现有研究成果,为后续创新提供指引。本文围绕基于大模型的人工智能智能体展开全面综述。首先,拆解现代大模型智能体的核心架构,剖析推理、感知、记忆、规划、行动与学习各大核心模块之间的协同机制;其次,系统梳理智能体评测体系,归纳现有基准测试、评价指标,以及各模块存在的性能权衡问题;再者,广泛调研此类智能体在众多领域带来的变革性应用,覆盖数字场景与具身智能系统。文末总结当前亟待解决的关键难题,并展望未来研究方向,为下一代大模型智能体的发展勾勒研究路线。。
论文信息
中文标题:大模型智能体综述:架构、评测与应用
英文原题:A survey of large-model-based AI agents
作者:秦川、金龙
关键词:人工智能、大模型、AI 智能体、具身智能、深度学习
DOI:10.26599/TST.2026.9010072
为什么需要大模型智能体
过去的大模型更像“被动的写手”:你问一句,它答一段。但人们真正想要的,是能主动感知环境、制定计划、调用工具、在虚拟或物理世界里把事办成的“智能体”。从专用模型到通用、目标导向的智能体,是不可逆的范式转变。
然而,这个领域每天都有新架构、新方法、新应用冒出来:记忆系统、工具增强、自我反思等概念快速演进,却也导致研究图景“繁荣而碎片化”。对资深研究者和新人而言,从信息洪流中分辨“基础原理”与“一时风口”都成了难题。本文的价值,正是给出一套统一的“词汇表”和概念框架,把五花八门的智能体设计讲清楚、比明白。
给智能体装上“大脑”:以推理为中心的模块化架构
本文的核心观点可以浓缩成一句话:大模型智能体不是单个模型,而是一套由大模型统一调度、以“推理”为中央认知引擎的模块化系统。
它的运转像一条闭环:感知模块先采集原始数据;但真正“看懂世界”的,是推理核心——它把含糊的感官信息转化成对当前状态的结构化理解;接着它决定往记忆里存什么、从记忆里取什么,并把高层目标分解成可执行的策略;行动模块据此挑选工具、确定参数去执行;最后,学习模块对全程做元级复盘,分析轨迹、找出错误、更新记忆,形成“执行—反思—改进”的持续循环
六大模块协同运转
第一项 推理模块(中枢)
这是智能体的“大脑”。大模型在预训练中获得了语言与语义推理、常识推理、逻辑与数学推理等内在能力;前沿方向还包括因果推理(推断“谁导致谁”,对稳健决策至关重要)、社会推理、多模态推理与伦理推理。
为了让推理更可靠,研究分两路:一是“推理时缩放”,用更大算力换更稳的推理,如思维链(CoT)、自洽(多路径投票)、思维树(ToT)、Self-Refine(生成—自评—精炼);二是“把推理学进权重”,通过监督微调、结果监督强化学习(RLHF 思路)、过程监督强化学习(对每一步推理给奖励)来根本提升能力。
第二项 感知模块
让智能体“认识世界”。文本感知以 Transformer 为基,并向更高效的长文本架构(Mamba、Jamba 等状态空间模型)演进;视觉感知通常用 ViT 编码、再经 CLIP/投影器对齐到语言空间(如 LLaVA);听觉感知靠 Whisper 等做语音转写与情绪识别。更重要的是,感知早已超越“文本/视觉/听觉”三件套,扩展到空间与本体感知、触觉(HapticLLaMA 把振动译成语言描述)、化学嗅觉乃至神经信号。
第三项 记忆模块
负责存储与组织交互历史,形式包括日志、轨迹、向量数据库,以及自然语言、嵌入、结构化列表等。挑战在于长期记忆的检索质量与延迟:分层记忆(H-MEM,四级语义抽象)、MemOS(KV 式记忆注入,首字延迟最高提速约 94%)等方案显著提升了长程检索的准确率与效率。
第四项 规划模块
把复杂目标拆成可管理的子任务,策略分静态、动态与分层规划。它依赖推理引擎去评估逻辑依赖、做因果推断,并校验子目标的可行性。
第五项 行动模块
把计划翻译成可执行操作:调用 API、执行代码,或在物理世界里完成真实交互(如机器人动作)。
第六项 学习模块
让智能体自我改进:通过反思(Self-Refine、Reflexion 用语言复盘带来显著提升)、记忆巩固与技能习得,把一次经验沉淀为长期能力,构成持续改进的飞轮。
在评测中见真章:六类基准与关键发现
为严谨比较各类架构,本文建立统一评测框架:基准分六大类——Web 导航、代码、数学、医学、艺术与设计、游戏,以及科学,外加“安全与鲁棒性”一类;指标分四类——任务表现(成功率、Pass@k、进度率)、输出质量、效率、鲁棒性。
几个数字很能说明问题:在网页智能体基准 WebArena 上,前沿智能体端到端成功率仅约 11%–14%,短板在主动探索与失败恢复;在旅行规划 TravelPlanner 上,GPT-4 的最终通过率低至 0.6%;在真实电脑任务 OSWorld(369 项)上,最强模型成功率仅 12.24%。工具空间从常规扩到 147K token 的 schema 时,Claude-4-Sonnet 的工具调用成功率从 62.4% 跌到 44.2%。
这些差距暴露了三类反复出现的失败模式:脆弱的工具选择(靠表面匹配而非语义理解)、不一致的规划(推理链越长越易累积错误)、脆弱的跨模态推理(具身场景里的感知噪声会顺着推理链酿成错误动作)。换言之,今天的智能体离“可靠”还有距离。
落地应用:从数字世界到物理世界
数字智能体充当“认知助理”,自动化复杂工作流,并在多个领域放大人类能力:
- Web:WebArena、Mind2Web、SeeClick——把浏览器 DOM 当结构化 API,或用视觉定位直接“看屏操作”。
- 代码:SWE-Agent 设计专用智能体—计算机接口(ACI);CodeLlama、Qwen2.5-Coder、DeepSeek-Coder-V2 等支撑“代码即行动”;AgentCoder 用“程序员—测试设计—测试执行”三角色多智能体协作。
- 数学:DeepSeek-Prover 把大模型与定理证明器结合、用 RL 换可机器验证的正确性;AlphaGeometry、ToRA(推理与 Python 执行交织)等各有打法。
- 医学:Med-Gemini、MDAgents(多智能体自主协作形成诊断共识),但始终坚持“医生在环”以确保安全与可解释。
- 艺术与设计:GenArtist 统一图像生成与编辑,MusicAgent 编排专业音频模型作曲。
- 游戏与社会:Generative Agents 在虚拟小镇涌现可信的个体与群体行为;Cicero 在《外交》游戏中达到人类水平,靠的是把战略推理与对话模型紧耦合。
- 科学发现:自主系统正在加速化学、物理、生物等研究。
具身智能体则架起“计算”与“物理动作”之间的桥:固定基座机械臂操作、移动机器人导航、自动驾驶(VLA 架构、LMDrive 端到端驾驶),以及普适智能体(智能家居、AR/VR 可穿戴、空中无人机蜂群)。
未来挑战与方向
- 推理的可靠性:模型仍易受到事实幻觉、逻辑谬误与对因果的“浅层理解”的困扰;方向是神经—符号结合、过程监督奖励、推理过程的不确定量化。
- 长程规划与战略前瞻:反应式框架(如 ReAct)擅长短程任务,却易陷局部最优、难为长远收益做短期牺牲;方向是与蒙特卡洛树搜索等经典规划混合。
- 开放世界适应:让智能体仅凭文档就零/少样本用上新工具,并缓解终身学习中的“灾难性遗忘”与“仿真到现实(sim-to-real)”鸿沟。
- 智能体安全:端到端 VLA 决策不透明、语义意图未必动态可行、中心化架构存在单点脆弱;方向是可验证的安全约束与能“硬干预”的安全中间件。
- 多智能体协作:通信瓶颈、个体目标合理却群体“涌现错位”、协调开销随规模超线性膨胀;方向是轻量、去中心化的共识协议。
具身部署:多模态大模型推理太慢、跟不上实时控制,感知噪声沿推理链级联放大,仿真与真实环境的域差距明显。