AI Coding
1. Hugging Face 开源「多 Harness RL」指南:同一模型跨 harness 得分 62% vs 33%
事件:Hugging Face(Lewis Tunstall 等)发布完全开源的多 harness 强化学习指南与代码。核心发现:同一模型、同一权重,在 Mini-SWE-Agent 中解出 62% 任务,在另一 harness 中仅 33%——近 29 个百分点的差距,接近翻倍。方法是用一个 proxy 把 Claude Code / Codex / OpenCode 指向它(支持 OpenAI Chat、OpenAI Responses、Anthropic Messages、Gemini 四种 API 格式),在不改动任何 harness 代码的前提下记录 vLLM 采样出的精确 token id 与 logprobs,作为 RL 训练数据。Liquid AI 的 LFM2.5-2.6B 同时在 4 个 harness 上训练,pass@1 从 42.2% 提升到 54.2%,且因「更少步数完成任务」的奖励项,工具调用减少 31%。全链路(proxy / TRL 训练脚本 / 7 个模型)均已开源。
为什么值得关注:这是「卷 harness 而非卷模型」叙事至今最硬的实证——harness 不再是推理期脚手架,而成了可训练的变量;RL 训练在 harness 之外(behind the harness)而非之内,意味着小模型也能通过「跨运行环境泛化训练」拉平与前沿模型的工程差距。31% 的工具调用下降还是直接的推理成本削减。对 coding agent 厂商,这等于把「模型能力」的部分护城河转移到了「训练—运行环境适配」上。
2. llama.cpp 与 Ollama 双双落地「决策模型」本地端点 /v1/systemone
事件:llama.cpp 于 10/02 合并 PR #29818,server 新增 /v1/systemone 端点,遵循 TypeSafe Jev 的 System One 格式;首发支持 Julia-1(144M)、Laya(421M)、Kev-4B、lev(4B)、OpenJev(27B,多模态)五个开源模型族,RTX PRO 6000 上单次决策延迟 3–43ms。Ollama 0.35 此前几天已上线同形端点(Bespoke nimble 9B / Together tev1)。决策模型不生成文本,而是读一次输入、对给定选项打分并返回概率(choice / score / noul 三类)。OpenAI 在 9/29 DevDay 也已有限预览基于 GPT-6 Luna 的 Decisions API(约 150ms,对比普通 Luna 1.6s)。
为什么值得关注:一个月内,决策模型从一家创业公司(TypeSafe Jev)扩散到两大本地运行时(llama.cpp、Ollama)再到 OpenAI,且端点形状趋同,正在形成事实标准。意义在于 agent 基础设施分层:分类、路由、内容审核、检索过滤、「下一步调哪个工具」这类高频结构化判断,不再需要走生成式模型 + JSON schema + 重试,而是一次前向传播的低延迟本地调用。对端侧 / 私有化 agent 部署是实质性的降本与数据主权红利。
3. Cursor 收购 Continue:开源 BYO-Model coding agent 的归宿与治理风险
事件:Continue 官网 10/02 变更为「已被 Cursor 收购」公告,承诺开源代码库(Apache-2.0)保持自由可用、仓库未归档、当日仍有提交。Continue 曾是 VS Code / JetBrains 中「自带模型」coding agent 的事实标准答案——银行、国防、医疗等受数据驻留约束的团队用它把源码留在自己基础设施。收购后,其托管账户层(订阅)前景不明,社区提示:纯自托管用户可继续维护 fork,但依赖 Continue 云端账户系统的部分需优先审计。
为什么值得关注:这是开源 coding agent 商业化归宿的一个样本——代码开源不等于服务延续,收购后「代码留、服务并」是常态。对受数据主权约束的企业(本系列反复提示的合规红线),BYO-model 路线的长期路线图不确定性上升,呼应 9 月智谱 ZCode 数据主权事件:工具链集中化与开源治理,是 coding agent 采用决策中必须前置评估的维度。
4. Claude Code 2.1.289 安全与韧性加固(10/04 当日)
事件:Anthropic 当日发布 Claude Code 2.1.289:deny rules 现在能捕获以 env- 前缀(如环境变量注入)的 shell 命令;插件与 mods 改为「单独失败」而非拖垮整个 session(fail alone instead of ending the session)。
为什么值得关注:延续本系列长期追踪的「agent 安全合规硬化」主线。env- 前缀 shell 命令是 agent 执行层被忽视的注入面(环境变量可被仓库内恶意配置劫持);插件 / mods 故障隔离则把「一个扩展崩溃 → 整个 agent 会话丢失」的脆弱性降下来。两者都是 coding agent 从「个人玩具」走向「企业可信执行」的必要工程化补丁,也是 Agent 安全从警告走向产品默认设置的信号。
具身智能
1. 现代汽车部署 2.5 万台波士顿动力 Atlas,并在美建 3 万台年产能工厂
事件:波士顿动力上周在佐治亚州现代 Metaplant America 园区启用机器人 Metaplant 应用中心(RMAC),作为 Atlas 测试与训练基地,训练员以遥操作方式训练。现代汽车集团计划未来数年向现代 / 起亚全球工厂部署 2.5 万台 Atlas,并在美国建设年产能 3 万台的机器人生产设施;官方确认 2028 年率先在佐治亚 Metaplant 部署(初期零部件排序,2030 扩至零部件装配)。CES2026 发布的 Atlas 量产版含 56 自由度、举重 50kg、−20℃~40℃ 工作、电量不足自换电池。
为什么值得关注:这是 Atlas 从演示明星转为「企业级规模部署 + 产能本地化」的最硬承诺之一,直接对标特斯拉 Optimus 的量产叙事。2.5 万台部署 + 3 万美厂产能,把「真干活」从一个口号变成可验收的订单与产线数据;对国内整机场(宇树 / 智元 / 优必选)而言,海外头部玩家已把竞争维度拉到「万台级部署 + 自有供应链」。
2. 特斯拉 Optimus Gen3 渲染图疑似泄露,量产数据加速(周产翻 10 倍)
事件:10/03 科技站点 NotaTeslaApp 报道,特斯拉安卓 App 中一组机器人渲染图被发现,疑似展示第三代 Optimus Gen3 外观——相较前代对外露机械结构做了更多包覆、机身更紧凑(原帖后被删但已被转发)。量产侧:特斯拉当前周产「数百台」Optimus,较二季度翻约 10 倍,年底冲刺周产超 1000 台,弗里蒙特专属产线远期设计年产能 100 万台。行业层面:2026 全球出货预计破 5 万台(同比 +178%),中国约 3 万台;智元完成全球首个万台级量产、上半年出货约 9700 台、占全球 43% 居首;Q1 国内产业链融资 681 亿元已超 2025 全年。供应链瓶颈集中在丝杠(灵巧手微型滚珠丝杠下单量最大、超产能爬坡)与轴承(ASP 超 2 万、柔性 / 交叉滚子 / 角接触轴承为释放瓶颈)。
为什么值得关注:Gen3 外观细节 + 周产翻 10 倍,是 A 股机器人板块最直接的风向标催化;而丝杠 / 轴承「下单量远超产能」的信号,再次印证本系列反复提示的「上游卖铲人」逻辑——硬件瓶颈从本体转移到了精密传动与轴承,相关细分环节的供需错配可能先于整机业绩兑现。投资以官方披露为准。
3. 昆山张浦具身智能「场景化落地」:12 款产品从展台走向产线闭环
事件:10/04 中青报报道,江苏昆山张浦镇具身智能新品发布会推出 12 款瞄准真实作业难题的产品:轻量化轮足巡检机器狗(充电桩自主出发、乘梯换层、巡检产线、违停上报云端、结束回充,全程无人介入)、重载轮足作业机器狗(巡检同时靠机械臂抓取搬运,形成「发现—处置」闭环)、自研关节模组与全能云枢机器人平台。企业定调:「能走只是入场券,能干活才创造价值」,不做通用机器人,聚焦垂直场景(汽车线束、食品精细化等)打破柔性操作难题。张浦全镇 378 家智能制造企业、年产值近 500 亿元提供真实场景底座。
为什么值得关注:这是「实干时代」叙事在县域制造的具象样本——从「参数华丽的展品」转向「可上岗、能闭环」的垂直场景机器人,且关键模组(关节)自研。对国产替代路径而言,垂直场景 + 自研关节 / 执行器,比追逐通用本体更先形成收入闭环,也更符合 A 股当前从「主题」切「订单与业绩」的定价逻辑。
4. FieldAI 拟以 100 亿美元估值融资 7 亿美元:不造本体、只做「通用机器人智能层」
事件:AGI HUNT 10/04 日报援引行业消息,FieldAI 正以约 100 亿美元估值募集 7 亿美元,定位为「universal intelligence layer」——不生产机器人本体,而是一层通用智能,可驱动人形、无人机、机器狗与工业机器等多种硬件。其逻辑是用一套大脑适配多形态 body,而非绑定单一机器人。
为什么值得关注:这是「价值从本体转向大脑 / 操作系统」判断的又一估值锚——100 亿美元估值押注的不是硬件出货量,而是跨本体的通用控制与决策能力。对照本系列追踪的智元 GE-Act、宇树 UnifoLM、蚂蚁 LingBot 等大脑开源路线,FieldAI 的高估值说明资本市场已在为「机器人 Android / 中间件」定价,对 A 股「跨本体大脑 + 上游卖铲人」两条线都是外部参照。(以官方 / 媒体报道为准)
跨主线信号(能源 + A 股投资侧)
- 算力能源锚:coding 与具身两条线共同指向「推理 / 训练下沉 + 本地化」——llama.cpp / Ollama 决策模型本地端点、Claude Code 自托管式安全、Atlas 美厂产能本地化,都在把算力需求从集中云推向边缘与自有设施,绿电算力与边缘供电仍是能源侧长逻辑。
- Agent 安全合规成 coding + 具身共享红线:Claude Code 2.1.289 的 env 注入封堵、插件故障隔离,与具身侧「万台级部署」对功能安全的硬要求同源——可执行系统的默认安全,正从警告变为产品出厂设置。
- A 股三条线:① 上游卖铲人(丝杠 / 轴承 / 关节模组 / 减速器,特斯拉与国产整机双链共振);② 跨本体大脑(FieldAI 估值锚 + 国产大脑开源路线);③ 绿电算力 + 城市 / 县域实景(昆山模式)。投资以官方披露为准。
一句话总结
本期 coding 与具身在「价值重心下移」上汇流:coding 把能力红利从大模型转向 harness 训练与本地决策端点,具身把竞争从 demo 推向万台级真干活;丝杠轴承卡点与 FieldAI 百亿大脑估值共同指向——下一阶段超额收益在供应链瓶颈与跨本体智能层,而非整机叙事。