尽管人工智能失控的担忧不断,但两大AI模型厂商并未放慢脚步:Anthropic PBC今日发布了Claude Opus 5.5,并将价格下调20%;几分钟后,OpenAI Group PBC也推出了两款新的GPT-6模型——Sol和Luna,价格仅为上一代同名模型的一半。
Opus 5.5的输入价格为每百万Token 4美元,输出价格为每百万Token 20美元,Anthropic表示,以典型工作负载计算,这比Opus 5便宜40%。缓存读取的降价幅度最大,下降60%至20美分。更快的服务模式需要额外付费,输入每百万Token 8美元,输出每百万Token 40美元。
OpenAI将两款新模型的价格较同名的GPT-5.6版本下调了一半,Sol的输入价格降至每百万Token 2美元,输出价格为每百万Token 10美元。Luna的价格更低了一个数量级,分别为10美分和50美分。
Anthropic表示,Opus 5.5在大多数工作中的表现与其Fable 5.1模型相当。其输出生成速度比7月底发布的Opus 5快30%以上。在智能体编码测试Terminal-Bench 4.0中,新模型得分为66.4%,而Fable 5.1为55.8%。在AutomationBench测试中,新模型的任务完成率为40%,而Opus 5仅为26.9%。
已公布数据中差距最大的是科学研究领域,Terminal-Bench-Science 0.1测试中,Opus 5得分为29%,而新模型达到58.7%。在以Elo评分衡量知识工作能力的GDPval-AA v2.1测试中,Opus 5.5的评分为1846,而Opus 5为1708。借助工具完成的Humanity's Last Exam测试,得分为67.7%。一位测试者在不到一天的时间内完成了68万行代码的迁移工作,Anthropic表示,这项工作原本需要一个工程团队耗费数周时间。
在Anthropic随发布公布的测试记录中,Box Inc.人工智能产品副总裁Yashodha Bhavnani表示,新模型给出的回答冗长度降低了40%,但准确性没有下降。GitHub Inc.首席产品官Mario Rodriguez表示,在VS Code中,该模型“用不到Opus 5一半的步骤解决了更多终端任务”。Anthropic表示,该模型会将最重要的信息放在最前面。公告中引用的其他客户也表示,重试次数和返工工作有所减少。
在安全性方面,Anthropic表示,在用于对齐测试的自动化行为审计中,Opus 5.5是迄今为止表现最强的模型,试图绕过限制边界的行为比Opus 5减少了85%。对提示词注入攻击的抵御能力也有所提升,在Gray Swan基准测试中达到了与Fable 5.1相当的水平。
网络安全相关工作的限制沿用了Fable 5.1的做法,大多数此类任务被转交给更早的Opus 4.8模型处理。被判定为高风险的生物学相关工作同样被隔离限制,更广泛的访问权限需要通过验证程序获得,该程序现已包含生命科学专项审核。Frontier Design和METR两家机构均在发布前对该模型进行了测试。
OpenAI的两款新模型则瞄准了更低的成本区间。Sol和Luna基本采用了与9月3日开始推出的GPT-6 Astra相同的训练方法,随后针对成本进行了调优。Luna是两者中价格更低的一款,主要面向摘要和信息提取等高频常规任务。Sol则承担重复性的编码和智能体工作。面向法律研究场景打造的Astra for Law配置版本于9月17日推出。
OpenAI报告称,Sol在AutomationBench测试中的任务完成率为33.2%,单次成本为27美分;在软件工程测试DeepSWE v1.1中得分68.8%,与此前的Claude Fable 5相差仅1.1个百分点。Luna在同一测试中得分为66.6%。据该公司介绍,Sol的出错率约为上一代模型的一半,而在更高算力设置下,Luna的表现可与GPT-5.6 Sol相当,但成本仅为其百分之一左右。由于OpenAI的对比对象是Fable 5.1和Opus 5,因此这两款新品并未与彼此进行直接对比。
该公司将缓存输入Token的读取价格下调了90%。OpenAI表示,缓存命中率有所提升,编码智能体现在可以改变推理强度和可用工具集,而不会破坏缓存。据该公司介绍,两款新模型给出的回答更简短,行话更少,低价值细节也更少。
Opus 5.5已在Claude开发者平台上线,模型名称为claude-opus-5-5,同时也可通过亚马逊网络服务公司(AWS)、谷歌云和微软Azure使用。Claude Sonnet 5.5和Claude Haiku 5.5预计将在未来几周内推出。
OpenAI的两款新模型已面向开发者开放,分别命名为gpt-6-sol和gpt-6-luna,并已上线ChatGPT Work及面向Plus、Pro、Business、Enterprise和Edu订阅用户的Codex。免费版和Go版用户可在桌面应用中使用Luna,但两款模型均尚未登陆ChatGPT主聊天界面。
Q&A
Q1:Claude Opus 5.5相比Opus 5有哪些提升?
A:Opus 5.5在多项测试中表现更强,如Terminal-Bench 4.0得分66.4%(Opus5为55.8%),AutomationBench任务完成率40%(Opus5为26.9%),输出速度提升超30%,价格还降低了约40%。
Q2:OpenAI新推出的Sol和Luna模型分别是做什么用的?
A:Sol主要用于重复性的编码和智能体任务,在DeepSWE v1.1测试中得分68.8%;Luna价格更低,面向摘要、信息提取等高频常规任务,得分66.6%,两者价格均为上一代同名模型的一半。
Q3:Claude Opus 5.5和GPT-6新模型的价格分别是多少?
A:Opus 5.5输入价格为每百万Token 4美元、输出20美元;OpenAI的Sol输入2美元、输出10美元,Luna则低至输入10美分、输出50美分。