从初代 Claude 到 Claude 5:一文看懂 Anthropic 如何把“安全助手”做成 Agent
图 1:Claude 处理多项任务的概念插画。图片来源:Anthropic《Introducing Claude 4》
提到大语言模型,很多人先想到 GPT;但在长文档分析、自然写作和编程领域,Claude 同样是一条不能忽视的技术主线。
Claude 由 Anthropic 开发。与“先发布模型,再讨论安全”的叙事不同,Anthropic 在产品诞生前就把可控、可解释和安全对齐放在研究中心。此后 Claude 的每次重要升级,都围绕几个很稳定的问题展开:
- 模型怎样既有能力,又遵循清晰原则?
- 怎样读懂更长的文档和代码库?
- 怎样在速度、价格和智能之间做选择?
- 怎样从回答问题,走向使用工具和完成任务?
本文将沿着这四个问题,回顾 Claude 从 2021 年 Anthropic 成立,到 2026 年第五代模型的完整发展路径。
先给结论:Claude 的历史是一条“助手 → 工作台 → Agent”路线
如果把六年的变化压缩成一行,可以写成:
安全研究 → Constitutional AI → 长上下文 → 分层模型 → Artifacts → 操作电脑 → 混合推理 → Claude Code → 长任务 Agent
这条路线与“模型越来越大”有关,却不只由规模推动。Claude 真正形成辨识度的地方,是把安全训练、长上下文、产品工作区和工具执行逐步组合起来。
| 阶段 | 代表节点 | 真正改变了什么 |
|---|---|---|
| 研究奠基 | Anthropic、Constitutional AI | 把“模型应遵循什么原则”写进训练方法 |
| 产品起步 | Claude 1、Claude 2 | 从合作伙伴测试走向公开聊天和 API |
| 长文本优势 | 100K、Claude 2.1 的 200K | 可一次分析长文档、报告和代码库 |
| 模型分层 | Claude 3 Haiku/Sonnet/Opus | 用户可按速度、成本和能力选模型 |
| 工作空间 | Claude 3.5、Artifacts | 输出从聊天气泡进入可编辑工作区 |
| 工具执行 | Computer Use、Claude Code | Claude 开始点击、输入、修改和测试 |
| Agent 化 | Claude 4、Claude 5 | 推理与工具交替,持续完成多步骤任务 |
01|2021—2022:先有 Anthropic 的安全研究,后有 Claude
Anthropic 于 2021 年初成立,由 Dario Amodei 和 Daniela Amodei 等人领导。官方早期材料给公司的定位不是“聊天机器人公司”,而是研究如何构建可靠、可解释、可控制的大规模 AI 系统。
2022 年 12 月,Anthropic 发布 Constitutional AI,也就是“宪法式 AI”研究。这里的“宪法”并不是国家法律,而是一组用自然语言写出的行为原则。
它的简化训练流程是:
- 模型先生成回答;
- 根据原则批评自己的回答;
- 修改不符合原则的内容;
- 用修改后的回答进行监督学习;
- 再让 AI 根据同一套原则比较候选答案;
- 使用 AI 反馈进行强化学习,即 RLAIF。
图 2:Constitutional AI 包含监督学习和基于 AI 反馈的强化学习两个阶段。图片来源:Anthropic《Claude’s Constitution》
传统 RLHF 主要由人类标注者比较回答;Constitutional AI 则尝试让模型在明确原则的指导下参与监督。这么做不能自动解决所有安全问题,但有两个重要价值:
- 原则可以公开阅读和讨论,比隐含在大量标注数据中更透明;
- 部分监督可由 AI 扩展,减少人类反复接触有害内容的需要。
因此,Claude 从一开始就不只是模型名称,也承载了 Anthropic 对“helpful、honest、harmless”——有帮助、诚实、无害——这一目标的探索。
02|2023:Claude 正式登场,长上下文成为第一张名片
2023 年 3 月 14 日,Anthropic 正式发布 Claude。初始版本已经过 Notion、Quora 和 DuckDuckGo 等合作伙伴测试,并通过聊天界面和 API 提供能力。
当时有两个版本:
- Claude:能力更强的主模型;
- Claude Instant:更快、更便宜的轻量模型。
Claude 在摘要、问答、写作、搜索辅助和编程等任务上提供服务,但真正迅速形成差异化的,是它的上下文窗口。
从 9K 到 100K:一次读进一本书
2023 年 5 月,Claude 的上下文从 9K 扩展到 100K token,约相当于 7.5 万个英文单词。用户可以一次提交数百页材料,让模型跨章节检索、总结和比较。
需要注意:上下文窗口大,不等于每个细节都能百分之百记住。长文本能力还取决于信息位置、任务难度、提示方法和模型本身的检索能力。
Claude 2 与 2.1:长文本进入企业场景
2023 年 7 月,Claude 2 发布,并通过公开测试网站 claude.ai 面向更多用户。它提升了编程、数学和推理能力,也能生成更长回答。
11 月发布的 Claude 2.1 又把上下文扩大到 200K token,约相当于 15 万个英文单词或 500 多页材料,同时加入系统提示词和工具使用测试。
至此,Claude 的早期形象已经很清晰:它不只适合闲聊,更希望成为处理合同、财报、论文、技术文档和代码库的工作助手。
03|2024:Claude 3 建立 Haiku、Sonnet、Opus 三档体系
2024 年 3 月,Claude 3 家族发布。Anthropic 没有只给出一个模型,而是同时推出三种定位:
- Haiku:速度最快、成本最低;
- Sonnet:能力、速度和价格的平衡档;
- Opus:面向高难任务的旗舰档。
这套命名后来成为理解 Claude 的关键。Haiku、Sonnet、Opus 不是第 1、2、3 代,而是同一代产品中的不同能力层级。
Claude 3 还补上了图像输入能力,可以分析照片、图表、页面截图和技术图示。Claude 从纯文本助手变成了视觉语言模型。
这一步的意义并不只是“模型更多”。对于开发者而言,同一套模型家族可以覆盖:
- 大量低延迟请求;
- 日常分析和内容生成;
- 少量但复杂、价值更高的任务。
04|2024 年中:Claude 3.5 Sonnet 与 Artifacts,把聊天框变成工作区
2024 年 6 月,Claude 3.5 Sonnet 发布。它以 Sonnet 档的速度和价格,在多项能力上超过上一代旗舰 Claude 3 Opus。
这说明模型进步不一定表现为“旗舰越来越贵”,也可能表现为:原本只有最高档才能做到的事,逐渐下放到更实用的中间档。
与 3.5 Sonnet 同时出现的 Artifacts,对普通用户的影响甚至不亚于模型升级。
当 Claude 生成代码、文档、图表或网页时,结果不再全部挤在对话消息中,而是显示在独立区域,用户可以预览、修改和继续迭代。
它改变了 Claude 的产品形态:
对话负责描述意图,Artifact 负责承载作品。
AI 产品由“问一句、答一句”,开始转向“对话旁边有一张持续编辑的工作台”。
05|2024 年末:Computer Use,让 Claude 学会操作人类的软件
2024 年 10 月,Anthropic 发布升级版 Claude 3.5 Sonnet,并公开测试 Computer Use。
图 4:Computer Use 让 Claude 根据屏幕画面移动鼠标、点击和输入。图片来源:Anthropic《Introducing computer use》
传统工具调用通常要求开发者为每个服务准备结构化 API;Computer Use 尝试走另一条路:让 Claude 像人一样观察屏幕、移动光标、点击按钮和输入文字。
这意味着即使旧软件没有专门为 AI 提供接口,模型也有机会通过原有图形界面完成任务。
但官方在发布时也明确说明,这项能力仍处于实验阶段,可能缓慢、笨拙或出错。Computer Use 还会引入新的安全问题,例如网页中隐藏的提示注入、误点按钮和高权限操作。
因此,Computer Use 的历史意义不是“AI 已能完全代替人操作电脑”,而是:
大模型的输出第一次系统性地从文字扩展成界面动作。
06|2025:Claude 3.7 把快速回答与深度推理合进同一个模型
2025 年 2 月,Claude 3.7 Sonnet 发布。Anthropic 将其称为混合推理模型:
- 普通模式可以快速回答;
- Extended Thinking 可以在复杂问题上投入更多推理;
- API 用户可以控制思考预算,在成本、速度和质量之间调整。
这与单独维护“普通模型”和“推理模型”的思路不同。Claude 3.7 希望让同一个模型既能快速响应,也能在需要时深入思考。
Claude Code:Claude 找到了最重要的 Agent 场景
Claude 3.7 发布时,Anthropic 还推出 Claude Code 研究预览版。
图 5:Claude Code 最初以终端工具形态发布。图片来源:Anthropic《Claude 3.7 Sonnet and Claude Code》
Claude Code 不只是把代码复制进聊天框。得到授权后,它可以:
- 搜索并读取代码库;
- 编辑多个文件;
- 执行命令和测试;
- 根据失败结果继续修改;
- 提交代码或参与 GitHub 工作流。
这构成了一个典型 Agent 闭环:
理解目标 → 观察环境 → 采取行动 → 检查反馈 → 修正方案
编程之所以成为 Agent 最早成熟的场景之一,是因为结果相对容易验证:代码能否编译、测试能否通过、页面能否运行,都能给模型提供清晰反馈。
07|2025:Claude 4 从“会推理”走向“边推理边使用工具”
2025 年 5 月,Claude Opus 4 和 Claude Sonnet 4 发布。它们延续混合推理路线,并增加了一个关键能力:在 Extended Thinking 过程中调用工具。
模型可以形成这样的循环:
分析问题 ↓ 搜索资料或运行代码 ↓ 读取工具返回结果 ↓ 继续推理 ↓ 再次调用工具或输出结论相比“先想完,再一次性调用工具”,推理与工具交替更适合研究、编程和长时间任务。
Claude 4 发布时,Claude Code 也从研究预览走向正式可用,并逐渐进入终端、IDE、GitHub 和自动化流程。
同年后续的 Sonnet 4.5、Haiku 4.5 和 Opus 4.5,则继续强化编程、Computer Use、智能体执行与成本效率。此时 Claude 的竞争重点已经从“能不能回答”,转向“能不能持续做完”。
08|2026:Claude 4.x 快速迭代,第五代开始重构模型层级
2026 年初,Claude Opus 4.6 和 Sonnet 4.6 延续 Agent 与专业工作的方向。Sonnet 4.6 提供 100 万 token 上下文测试,并强化 Computer Use、长上下文推理、Agent 规划和知识工作。
随后 Opus 4.7、Opus 4.8 继续改善工具效率、长任务可靠性和自我检查。这里不必把每个小版本都看成全新一代,它们更像 Claude 4 家族的快速工程迭代。
Fable 5 与 Mythos 5:能力与访问边界开始分层
2026 年 6 月,Anthropic 发布 Claude Fable 5 与 Claude Mythos 5。
根据官方说明,两者使用相同的底层模型,但部署方式不同:
- Fable 5:加入更强安全防护,面向通用用户和高难知识工作;
- Mythos 5:在部分领域放宽防护,仅通过可信访问计划提供给少量网络安全和研究合作方。
这代表一个新的行业问题:当模型在网络安全、生物研究等领域的能力变得更强时,“是否开放”不再只是产品定价问题,也涉及能力分级、身份验证和使用审计。
Sonnet 5:把第五代 Agent 能力带到主流档
2026 年 6 月 30 日,Claude Sonnet 5 发布并成为 Free 和 Pro 计划的默认模型。官方把它定位为更具 Agent 能力的 Sonnet:可以制定计划、使用浏览器与终端,并以更低成本持续执行多步骤任务。
截至 2026 年 7 月,Claude 的第五代并不是单一旗舰:
- Fable 面向最高难度的通用任务;
- Mythos 面向受限的高能力专业场景;
- Sonnet 面向更大规模的日常 Agent 工作负载。
Claude 的名字到底应该怎样读?
Claude 的命名比单纯的数字版本更复杂,可以分成三层。
| 名称组成 | 表示什么 | 示例 |
|---|---|---|
| Claude | 产品与模型家族总称 | Claude.ai、Claude API |
| 3、4、5 | 模型代际 | Claude 3、Claude 4、第五代 |
| .5、.6、.7、.8 | 同一代中的重要迭代 | Sonnet 3.7、Opus 4.8 |
| Haiku | 快速、低成本档 | Claude 3 Haiku |
| Sonnet | 能力与成本平衡档 | Claude Sonnet 5 |
| Opus | Claude 3/4 时代的高能力档 | Claude Opus 4.8 |
| Fable | 第五代通用高能力模型 | Claude Fable 5 |
| Mythos | 受限访问的高能力专业模型 | Claude Mythos 5 |
所以,“Opus 比 Sonnet 数字大”这种说法并不准确,因为它们不是数字;而“Sonnet 5 一定强于所有 Opus 4.x”也不能仅凭代际得出,需要看具体任务、成本和评测条件。
真正推动 Claude 演进的五条主线
1. 安全对齐从附加规则变成训练方法
Constitutional AI、新版 Claude Constitution、系统卡和分级部署,都说明安全不是发布页面最后的一段免责声明,而是 Claude 技术与产品设计的一部分。
2. 长上下文从卖点变成基础设施
从 9K、100K、200K 到 100 万 token 测试,Claude 长文本能力逐步服务于代码库、合同、研究报告和企业知识库。但上下文越长,越需要检索、压缩和验证机制。
3. 模型从单一旗舰变成成本曲线
Haiku、Sonnet、Opus 的设计让开发者不必在所有任务上使用最贵模型。第五代进一步出现 Fable、Mythos 和 Sonnet 的角色分工。
4. 产品从聊天窗口变成工作环境
Projects、Artifacts、连接器和文件能力让对话拥有长期材料与可编辑输出,Claude 不再只是“发消息的机器人”。
5. 输出从文字变成可验证的动作
Computer Use、工具调用和 Claude Code 把输出扩展到点击、搜索、编辑文件、运行测试和操作外部系统。能否可靠完成闭环,开始比单次回答更重要。
从 Claude 的历史中,不应得出哪些结论?
误区一:Claude 只是一款更长上下文的聊天机器人
长上下文是早期优势,但 Claude 后续最重要的变化已经转向 Artifacts、Computer Use、编程和 Agent。
误区二:有“宪法”就不会犯错
Constitutional AI 是对齐方法,不是正确性证明。Claude 仍可能产生错误事实、误解要求或执行错误操作。
误区三:上下文窗口越大,记忆就越可靠
窗口表示模型最多能接收多少内容,并不保证所有位置的信息都被同等准确地使用。
误区四:Computer Use 等于可以放任模型操作电脑
界面操作会受到提示注入、误操作和权限过大的影响。涉及删除、支付、发布和发送信息时,应保留人工确认。
误区五:官方基准分数就是你的实际效果
基准测试依赖提示词、工具、采样次数和测试环境。生产选型仍应使用自己的真实任务评估。
结语:Claude 的下一阶段,是“更长时间地保持可靠”
Claude 的发展路线可以概括为:
- 2021—2022 年,Anthropic 建立安全与可控研究基础;
- 2023 年,Claude 产品化,并凭长上下文形成特点;
- 2024 年,三档模型、视觉能力和 Artifacts 构成完整产品体系;
- 2024 年末,Computer Use 让模型开始操作外部环境;
- 2025 年,混合推理和 Claude Code 建立 Agent 闭环;
- 2026 年,第五代模型开始按照成本、风险与访问权限重新分层。
Claude 最初希望成为一个“有帮助、诚实、无害”的对话助手;今天,它正在变成能阅读项目、使用工具、修改文件并持续推进任务的协作者。
下一阶段真正困难的问题,可能不再是“模型能否做出一次惊艳演示”,而是:
它能否在数小时甚至数天的任务里持续理解目标、正确使用权限、发现自己的错误,并交付可验证的结果?
这也是从大语言模型走向真正 Agent 系统时,最值得关注的分界线。
官方资料与延伸阅读
- Anthropic,2021:Anthropic raises $124 million to build more reliable, general AI systems
- Anthropic,2022:Constitutional AI: Harmlessness from AI Feedback
- Anthropic,2023:Introducing Claude
- Anthropic,2023:Claude’s Constitution
- Anthropic,2023:Introducing 100K Context Windows
- Anthropic,2023:Claude 2
- Anthropic,2023:Introducing Claude 2.1
- Anthropic,2024:Introducing the next generation of Claude
- Anthropic,2024:Claude 3.5 Sonnet
- Anthropic,2024:Introducing computer use
- Anthropic,2025:Claude 3.7 Sonnet and Claude Code
- Anthropic,2025:Introducing Claude 4
- Anthropic,2026:Introducing Claude Sonnet 4.6
- Anthropic,2026:Introducing Claude Opus 4.8
- Anthropic,2026:Claude Fable 5 and Claude Mythos 5
- Anthropic,2026:Introducing Claude Sonnet 5
本文资料截止于 2026 年 7 月 31 日。Claude 的模型名称、默认模型、价格和开放范围变化较快,请以 Anthropic 官方页面和开发者文档为准。
本文配图均下载自相应的 Anthropic 官方发布页,仅用于技术科普和版本说明;图片版权归 Anthropic 或相应权利人所有。发布到 CSDN 时建议保留图注与来源链接。
下一篇预告:Claude 的 Haiku、Sonnet、Opus、Fable、Mythos 命名体系到底怎么理解?