news 2026/10/5 3:50:38

AI 日报 · 2026-10-04

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI 日报 · 2026-10-04

AI Coding

1. Hugging Face 开源「多 Harness RL」指南:同一模型跨 harness 得分 62% vs 33%

事件:Hugging Face(Lewis Tunstall 等)发布完全开源的多 harness 强化学习指南与代码。核心发现:同一模型、同一权重,在 Mini-SWE-Agent 中解出 62% 任务,在另一 harness 中仅 33%——近 29 个百分点的差距,接近翻倍。方法是用一个 proxy 把 Claude Code / Codex / OpenCode 指向它(支持 OpenAI Chat、OpenAI Responses、Anthropic Messages、Gemini 四种 API 格式),在不改动任何 harness 代码的前提下记录 vLLM 采样出的精确 token id 与 logprobs,作为 RL 训练数据。Liquid AI 的 LFM2.5-2.6B 同时在 4 个 harness 上训练,pass@1 从 42.2% 提升到 54.2%,且因「更少步数完成任务」的奖励项,工具调用减少 31%。全链路(proxy / TRL 训练脚本 / 7 个模型)均已开源。

为什么值得关注:这是「卷 harness 而非卷模型」叙事至今最硬的实证——harness 不再是推理期脚手架,而成了可训练的变量;RL 训练在 harness 之外(behind the harness)而非之内,意味着小模型也能通过「跨运行环境泛化训练」拉平与前沿模型的工程差距。31% 的工具调用下降还是直接的推理成本削减。对 coding agent 厂商,这等于把「模型能力」的部分护城河转移到了「训练—运行环境适配」上。

2. llama.cpp 与 Ollama 双双落地「决策模型」本地端点 /v1/systemone

事件:llama.cpp 于 10/02 合并 PR #29818,server 新增 /v1/systemone 端点,遵循 TypeSafe Jev 的 System One 格式;首发支持 Julia-1(144M)、Laya(421M)、Kev-4B、lev(4B)、OpenJev(27B,多模态)五个开源模型族,RTX PRO 6000 上单次决策延迟 3–43ms。Ollama 0.35 此前几天已上线同形端点(Bespoke nimble 9B / Together tev1)。决策模型不生成文本,而是读一次输入、对给定选项打分并返回概率(choice / score / noul 三类)。OpenAI 在 9/29 DevDay 也已有限预览基于 GPT-6 Luna 的 Decisions API(约 150ms,对比普通 Luna 1.6s)。

为什么值得关注:一个月内,决策模型从一家创业公司(TypeSafe Jev)扩散到两大本地运行时(llama.cpp、Ollama)再到 OpenAI,且端点形状趋同,正在形成事实标准。意义在于 agent 基础设施分层:分类、路由、内容审核、检索过滤、「下一步调哪个工具」这类高频结构化判断,不再需要走生成式模型 + JSON schema + 重试,而是一次前向传播的低延迟本地调用。对端侧 / 私有化 agent 部署是实质性的降本与数据主权红利。

3. Cursor 收购 Continue:开源 BYO-Model coding agent 的归宿与治理风险

事件:Continue 官网 10/02 变更为「已被 Cursor 收购」公告,承诺开源代码库(Apache-2.0)保持自由可用、仓库未归档、当日仍有提交。Continue 曾是 VS Code / JetBrains 中「自带模型」coding agent 的事实标准答案——银行、国防、医疗等受数据驻留约束的团队用它把源码留在自己基础设施。收购后,其托管账户层(订阅)前景不明,社区提示:纯自托管用户可继续维护 fork,但依赖 Continue 云端账户系统的部分需优先审计。

为什么值得关注:这是开源 coding agent 商业化归宿的一个样本——代码开源不等于服务延续,收购后「代码留、服务并」是常态。对受数据主权约束的企业(本系列反复提示的合规红线),BYO-model 路线的长期路线图不确定性上升,呼应 9 月智谱 ZCode 数据主权事件:工具链集中化与开源治理,是 coding agent 采用决策中必须前置评估的维度。

4. Claude Code 2.1.289 安全与韧性加固(10/04 当日)

事件:Anthropic 当日发布 Claude Code 2.1.289:deny rules 现在能捕获以 env- 前缀(如环境变量注入)的 shell 命令;插件与 mods 改为「单独失败」而非拖垮整个 session(fail alone instead of ending the session)。

为什么值得关注:延续本系列长期追踪的「agent 安全合规硬化」主线。env- 前缀 shell 命令是 agent 执行层被忽视的注入面(环境变量可被仓库内恶意配置劫持);插件 / mods 故障隔离则把「一个扩展崩溃 → 整个 agent 会话丢失」的脆弱性降下来。两者都是 coding agent 从「个人玩具」走向「企业可信执行」的必要工程化补丁,也是 Agent 安全从警告走向产品默认设置的信号。


具身智能

1. 现代汽车部署 2.5 万台波士顿动力 Atlas,并在美建 3 万台年产能工厂

事件:波士顿动力上周在佐治亚州现代 Metaplant America 园区启用机器人 Metaplant 应用中心(RMAC),作为 Atlas 测试与训练基地,训练员以遥操作方式训练。现代汽车集团计划未来数年向现代 / 起亚全球工厂部署 2.5 万台 Atlas,并在美国建设年产能 3 万台的机器人生产设施;官方确认 2028 年率先在佐治亚 Metaplant 部署(初期零部件排序,2030 扩至零部件装配)。CES2026 发布的 Atlas 量产版含 56 自由度、举重 50kg、−20℃~40℃ 工作、电量不足自换电池。

为什么值得关注:这是 Atlas 从演示明星转为「企业级规模部署 + 产能本地化」的最硬承诺之一,直接对标特斯拉 Optimus 的量产叙事。2.5 万台部署 + 3 万美厂产能,把「真干活」从一个口号变成可验收的订单与产线数据;对国内整机场(宇树 / 智元 / 优必选)而言,海外头部玩家已把竞争维度拉到「万台级部署 + 自有供应链」。

2. 特斯拉 Optimus Gen3 渲染图疑似泄露,量产数据加速(周产翻 10 倍)

事件:10/03 科技站点 NotaTeslaApp 报道,特斯拉安卓 App 中一组机器人渲染图被发现,疑似展示第三代 Optimus Gen3 外观——相较前代对外露机械结构做了更多包覆、机身更紧凑(原帖后被删但已被转发)。量产侧:特斯拉当前周产「数百台」Optimus,较二季度翻约 10 倍,年底冲刺周产超 1000 台,弗里蒙特专属产线远期设计年产能 100 万台。行业层面:2026 全球出货预计破 5 万台(同比 +178%),中国约 3 万台;智元完成全球首个万台级量产、上半年出货约 9700 台、占全球 43% 居首;Q1 国内产业链融资 681 亿元已超 2025 全年。供应链瓶颈集中在丝杠(灵巧手微型滚珠丝杠下单量最大、超产能爬坡)与轴承(ASP 超 2 万、柔性 / 交叉滚子 / 角接触轴承为释放瓶颈)。

为什么值得关注:Gen3 外观细节 + 周产翻 10 倍,是 A 股机器人板块最直接的风向标催化;而丝杠 / 轴承「下单量远超产能」的信号,再次印证本系列反复提示的「上游卖铲人」逻辑——硬件瓶颈从本体转移到了精密传动与轴承,相关细分环节的供需错配可能先于整机业绩兑现。投资以官方披露为准。

3. 昆山张浦具身智能「场景化落地」:12 款产品从展台走向产线闭环

事件:10/04 中青报报道,江苏昆山张浦镇具身智能新品发布会推出 12 款瞄准真实作业难题的产品:轻量化轮足巡检机器狗(充电桩自主出发、乘梯换层、巡检产线、违停上报云端、结束回充,全程无人介入)、重载轮足作业机器狗(巡检同时靠机械臂抓取搬运,形成「发现—处置」闭环)、自研关节模组与全能云枢机器人平台。企业定调:「能走只是入场券,能干活才创造价值」,不做通用机器人,聚焦垂直场景(汽车线束、食品精细化等)打破柔性操作难题。张浦全镇 378 家智能制造企业、年产值近 500 亿元提供真实场景底座。

为什么值得关注:这是「实干时代」叙事在县域制造的具象样本——从「参数华丽的展品」转向「可上岗、能闭环」的垂直场景机器人,且关键模组(关节)自研。对国产替代路径而言,垂直场景 + 自研关节 / 执行器,比追逐通用本体更先形成收入闭环,也更符合 A 股当前从「主题」切「订单与业绩」的定价逻辑。

4. FieldAI 拟以 100 亿美元估值融资 7 亿美元:不造本体、只做「通用机器人智能层」

事件:AGI HUNT 10/04 日报援引行业消息,FieldAI 正以约 100 亿美元估值募集 7 亿美元,定位为「universal intelligence layer」——不生产机器人本体,而是一层通用智能,可驱动人形、无人机、机器狗与工业机器等多种硬件。其逻辑是用一套大脑适配多形态 body,而非绑定单一机器人。

为什么值得关注:这是「价值从本体转向大脑 / 操作系统」判断的又一估值锚——100 亿美元估值押注的不是硬件出货量,而是跨本体的通用控制与决策能力。对照本系列追踪的智元 GE-Act、宇树 UnifoLM、蚂蚁 LingBot 等大脑开源路线,FieldAI 的高估值说明资本市场已在为「机器人 Android / 中间件」定价,对 A 股「跨本体大脑 + 上游卖铲人」两条线都是外部参照。(以官方 / 媒体报道为准)


跨主线信号(能源 + A 股投资侧)

  • 算力能源锚:coding 与具身两条线共同指向「推理 / 训练下沉 + 本地化」——llama.cpp / Ollama 决策模型本地端点、Claude Code 自托管式安全、Atlas 美厂产能本地化,都在把算力需求从集中云推向边缘与自有设施,绿电算力与边缘供电仍是能源侧长逻辑。
  • Agent 安全合规成 coding + 具身共享红线:Claude Code 2.1.289 的 env 注入封堵、插件故障隔离,与具身侧「万台级部署」对功能安全的硬要求同源——可执行系统的默认安全,正从警告变为产品出厂设置。
  • A 股三条线:① 上游卖铲人(丝杠 / 轴承 / 关节模组 / 减速器,特斯拉与国产整机双链共振);② 跨本体大脑(FieldAI 估值锚 + 国产大脑开源路线);③ 绿电算力 + 城市 / 县域实景(昆山模式)。投资以官方披露为准。

一句话总结

本期 coding 与具身在「价值重心下移」上汇流:coding 把能力红利从大模型转向 harness 训练与本地决策端点,具身把竞争从 demo 推向万台级真干活;丝杠轴承卡点与 FieldAI 百亿大脑估值共同指向——下一阶段超额收益在供应链瓶颈与跨本体智能层,而非整机叙事。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/5 3:50:27

插件系统设计、加载失败排查与兼容性管理实战指南

做开发的这些年,几乎每天都要跟插件打交道。编辑器里的补全插件、CI流水线里的构建插件、甚至电脑上的音乐播放器,都被大大小小的插件体系包裹着。早些年我不太在意这些东西,直到有一次同事的IDE环境集体罢工,报了一串failed to l…

作者头像 李华
网站建设 2026/10/5 3:50:26

OpenShell:一键把Win11开始菜单改回经典样式

这段时间折腾 Windows 系统美化,我把很多精力都放在了一款开源工具上——OpenShell(其实项目全名是 Open-Shell,社区里也常写作 OpenShell)。如果你已经被 Win11 那个扁平化开始菜单折磨到想换回 Win7 时代的布局,这篇…

作者头像 李华
网站建设 2026/10/5 3:49:55

薛定谔方程与薛定谔的猫:从波函数到量子计算的核心逻辑

"薛定谔"这四个字,这几年几乎成了互联网的万能前缀。打开任何一个社区,都能看到"薛定谔的猫"被改编成各种版本——"薛定谔的更新""薛定谔的工资条""薛定谔的TA到底喜不喜欢我"。但说实话,…

作者头像 李华
网站建设 2026/10/5 3:49:55

智慧养老评估系统实战:Spark与Python的数据分析全流程

我最近刚交付了一个面向智慧养老场景的数据分析项目——养老机构服务能力评估与可视化分析系统,技术栈绕不开Spark、Python、可视化这三样。说实话,甲方一开始跟我说要做个“评估平台”的时候,我脑子里第一反应是:这不就是个做仪表…

作者头像 李华
网站建设 2026/10/5 3:49:33

Ubuntu 20.04 源码编译 OpenCV 3.3.1:修复 FFmpeg 与 Python 兼容错误

简介:面向Ubuntu 20.04用户的OpenCV 3.3.1编译资源包,专为需要在较新系统上复现旧版OpenCV的开发者与计算机视觉学习者准备。该资源针对OpenCV 3.3.1与新版FFmpeg接口不匹配导致的三个典型编译错误(CODEC_FLAG_GLOBAL_HEADER未声明、AVFMT_RA…

作者头像 李华