news 2026/8/23 6:10:36

Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」?

标签:AI、大模型、开源模型、自改进、强化学习

Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」?

8 月 19 日,DeepReinforce 团队放出 Ornith-1.5。
三个数字让人头皮发麻:9B 模型在 SWE-Bench Verified 拿到 70.6,接近 Qwen3.6-35B 的 73.4;GPQA Diamond 86.4,匹敌 Claude Opus 4.8;DeepSWE 从上一版的 8.0 跳到 56.0,涨了 48 分。
但——所有这些数字,都是它自己评的。

这篇文章不急着下结论,先把它到底在干嘛讲清楚,把为什么有人觉得它在自欺欺人摆到桌面上。
数据对比和实机体验,留给后面两篇。


一、先看三个数字,再决定要不要读下去

Ornith-1.5 是 DeepReinforce(前身为 DeepReinforce.ai,核心研究者来自斯坦福 NLP 组)刚放出来的开源模型系列,三个尺寸:397B MoE、35B MoE、9B Dense。9B 那版,6.6GB 就能跑。

先看一组让人困惑的对比:

BenchmarkOrnith-1.5-9BQwen3.6-35B-A3BGemma-4-31B
Terminal-Bench 2.147.049.2-
SWE-Bench Verified70.673.452.0
SWE-Bench Pro47.549.535.7
GPQA Diamond86.486.084.3
ClawEval66.568.748.5
BrowseComp56.462.0-

9B 的模型,在编码、推理、信息检索上大面积匹敌甚至超过 30B+ 的模型。这不是"小步优化",是量级差

再看旗舰版 397B 的成绩:Terminal-Bench 2.1 拿到 86.1,DeepSWE 拿到 56.0,官方说这跟 Claude Opus 4.8(85.0 / 59.0)在一个水平线上。

一个 9B 的模型打出这个成绩,要么是它真的很强,要么是……它给自己出题的时候出了点偏题。

这就是本文要追问的核心问题。


二、Ornith-1.5 到底做了什么:一句话讲清

它把"训练任务策划"这件事,从人类手里拿走了,交给了模型自己。

Ornith-1.0(2026 年 6 月)做到了自脚手架(self-scaffolding):模型能自己搭建执行框架——工具调用、任务分解、重试策略。但训练任务本身,还是人编的。

Ornith-1.5 往前走了一步。它的训练循环是一个三段闭环:

第一阶段:自己出题。给定一个代码库或环境、任务类型的大方向、以及自己过去做过的题的历史,模型生成一道比它目前能力边界再难一点的新任务。目标成功率设为20%——即大部分时候它做不出来,但又有足够成功样本来训练。

第二阶段:自己搭脚手架。针对这道题,模型生成或优化一套专属执行框架:指令、工具、分解策略、编排逻辑。

第三阶段:自己解题。策略网络基于任务+脚手架生成解决方案,通过 GRPO(Group Relative Policy Optimization)强化学习,把奖励信号同时回传给三个阶段。

这套系统有三重防作弊奖励:有效性(题目可执行、可验证)、前沿难度(卡在能力边界附近)、新颖性(不能跟做过的题太像)。

听起来很美。但问题也来了——


三、那个绕不开的问题:它真的不是自欺欺人吗?

当一个系统既出题、又出题的评分标准、还自己答题——你怎么知道它不是在给自己开卷考试?

这不是刁难。自评分(self-scoring)是所有"自改进"系统共同面对的原罪。OpenAI 说 GPT-5.3-Codex "instrumental in creating itself",但所有人都清楚这句话意味着什么:模型参与了训练管线的某一步,不等于它真的在自我进化。

Ornith-1.5 的防御机制有三层:

  1. 三重 reward 信号——出题质量、脚手架质量、答案质量分别打分,互不相同,理论上可以互相制衡
  2. 20% 目标成功率——不让你只挑能做对的题
  3. Anti-hacking 过滤器——SWE-Bench 评测时会移除 Git 历史、断网、限制外部资源访问,防止模型"作弊"

但社区质疑的是更深层的东西:出题和打分的标准本身,仍然是模型自己定义和执行的。一个足够聪明的模型,理论上可以学会生成"它自己能答对、又通过了有效性检查"的题目——这不算完全作弊,但也不算真正的难度提升。

MIT Technology Review 恰好在 Ornith-1.5 发布前一天发表了一篇对 AI 递归自改进的质疑文章。核心发现是:在 NeurIPS 未发表论文上测试的 AI 代理,产出的工作"nowhere close to the mark"。Anthropic 联合创始人 Jack Clark 的评论更直接:"对短期递归自改进时间表持悲观信号(a bearish signal on short recursive self-improvement timelines)。"

Hacker News 上社区对 Ornith-1.0 的吐槽也直接搬过来了——"benchmaxxed versions of Qwen or Gemma 4"。这话不客气,但也不冤枉:9B 版本的 backbone 确实是 Qwen 3.5。


四、那 +48 分的 DeepSWE 怎么解释?

如果 Ornith-1.5 只是"调参调出来的 Qwen 3.5",那最大的疑点是——DeepSWE 从 8.0 跳到 56.0,这个幅度不合理。

DeepSWE 不是那种容易刷分的闭卷测试题。它是真实的软件工程任务,代码库、问题描述、补丁要求都是来自真实项目。要在这个评测上从 8 分到 56 分,靠 prompt tuning 或微调不可能做到。

两种可能性:

  1. 自改进确实起了作用。模型自己出题逼自己解决更难的问题,形成了真正的能力螺旋——这就是 Ornith AI 想证明的事。
  2. 训练管线的变化产生了系统性提升,不一定是"自改进"本身,但方向是对的。比如任务生成的多样性比人工策划更丰富,或者 GRPO 的联合优化比单目标训练更有效。

不管是哪种,训练方法确实变了,而不是把 Qwen 3.5 重新调了一遍包。


五、为什么我还是要关注它

理由有三个。

第一,性价比是真实的。9B、6.6GB、SWE-Bench Verified 70.6、GPQA 86.4——不管数字水分多大,能在消费级显卡和手机上跑出这个效果,本身就是里程碑。

第二,自出题训练的思路方向是对的。人类策划训练任务的瓶颈越来越明显:数据质量见顶、benchmark 越来越容易被刷、长尾任务没人写。如果模型能自己扩展训练课程,这条路再难也值得走。

第三,MIT 协议 + 开源权重 = 你可以自己验证。不像某些模型只能信官方数字,Ornith-1.5 的权重、评测脚本、模型卡全都在 HuggingFace 上。这意味着——

我可以自己跑一遍。这就是后面两篇要做的事。


六、后面两篇干什么

第二篇:纯数据对比。把 Ornith-1.5-9B 拉到一张表上,跟 Ornith-1.0-9B、Qwen3.5-9B、Gemma-4-31B、Qwen3.6-35B-A3B 逐条对比——编码、推理、检索、工具调用,哪些真的强、哪些其实被反超了。

第三篇:实机部署 + 亲身体验。在本地用 Ollama 跑起来,写代码、改 bug、用工具——看看 70.6 的 SWE-Bench 分数,在日常开发里到底兑不兑现。

三篇走完,"自改进是真的还是假的"这个问题,就有答案了。


七、一句话

Ornith-1.5 最牛的不是它的分数——是它让你无法简单地用"又一个刷分模型"打发它。+48 分的 DeepSWE 提升、9B 打出 35B 的编码分数、全开源 MIT 协议——哪怕它有自评分的硬伤,也比大多数"号称突破"的发布更值得认真看一眼。

但它是不是真的"自改进",我们后面见。


本文数据基于 Ornith AI 官方公告(ornith.ai/ornith_1_5.html)、HuggingFace 模型卡(ornith-ai/Ornith-1.5-9B)、Ollama 库、Byteiota 及 RuntimeWire 分析整理。Benchmark 数据均为官方自测,尚未经独立第三方复现。截稿于 2026-08-20。

这是 Ornith-1.5 系列第一篇。下一篇会做纯 Benchmark 横评,看看数字背后的真实差距。你觉得自改进这条路走得通吗?评论区聊聊。


附:核心信源

事项来源
Ornith-1.5 发布及技术细节ornith.ai/ornith_1_5.html
9B 完整 Benchmark 数据HuggingFace: ornith-ai/Ornith-1.5-9B
模型规格(架构/上下文/量化)HuggingFace model card、Ollama library
DeepSWE +48 分分析Byteiota 深度评测
社区质疑 / 技术背景RuntimeWire、Hacker News 讨论
递归自改进质疑MIT Technology Review(2026-08-18 发文)
Jack Clark 评论Byteiota 引用
MIT 许可证 / 开源协议HuggingFace、ornith.ai 官方文档
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/23 6:08:48

学生党开学季显示器选购指南:泰坦军团26款型号深度解析

又到了开学季,对于即将步入大学或返校的同学们来说,一台合适的显示器是提升学习效率和游戏体验的“硬通货”。面对市场上琳琅满目的型号,从24寸到32寸,从1K到4K,从平面到曲面,如何选择才不会踩坑&#xff1…

作者头像 李华
网站建设 2026/8/23 6:04:25

大厂 MCP 面试实录:可复用模板工作流与向量检索结合方案设计

大厂 MCP 面试实录:可复用模板工作流与向量检索结合方案设计 本文采用互联网技术岗位 MCP 方向模拟面试实录形式,围绕「内部 AI 助手可复用 MCP 模板工作流落地」业务场景展开,考察候选人对 MCP 协议核心能力、安全边界、RAG 结合落地的实践能…

作者头像 李华
网站建设 2026/8/23 6:03:29

卖货难、招商难、运营难:你的私域系统真的在解决问题吗?

卖货难、招商难、运营难:你的私域系统真的在解决问题吗? “系统上了,团队配了,三个月过去,卖货还是靠朋友圈刷屏,招商靠熟人介绍,运营靠手动拉群。”这是很多企业做私域社交电商的真实写照。问题…

作者头像 李华
网站建设 2026/8/23 5:57:32

从 Scratch 到 NOI:一套能走通的科技特长生培养路径

从 Scratch 到 NOI:一套能走通的科技特长生培养路径 市面上的编程课很多,但真正能让孩子"从零基础一路打到竞赛"的完整路径,很少。很多家长的钱花了一堆,孩子却始终在"学了个热闹"的阶段打转——Scratch 玩过…

作者头像 李华
网站建设 2026/8/23 5:56:31

爬虫老手转大模型:数据能力凭什么从采集变成 RAG 的护城河

这篇我按“先跑起来、再讲取舍”的方式写《同样转大模型,爬虫背景的优势和短板分别是什么?》。概念会讲,但重点放在代码怎么组织、哪里容易踩坑。摘要上周需求评审,产品经理甩过来一个"简单的小需求":给客服…

作者头像 李华
网站建设 2026/8/23 5:50:16

数学建模期末高效复习:从知识地图到代码模板的实战指南

1. 项目概述:从“抱佛脚”到“稳扎稳打”的建模复习策略又到期末了,看到“数学建模期末复习”这个标题,你是不是感觉一阵头大?脑子里瞬间闪过那些看不懂的算法、理不清的模型、跑不通的代码,还有永远也写不完的论文摘要…

作者头像 李华