AI科技圈最近一周又发生了啥
OpenAI全面开放GPT-6 Astra模型
GPT-6 Astra模型在ARC-AGI-3基准上取得99.9%的得分,在FrontierMath Tier 4上达到97.6%,并在网络安全测试ExploitBench中拿下100%,成为首个触发OpenAI准备框架“关键级”网络安全门槛的模型。该模型针对真实工作环境进行训练,在OSWorld 2.0中任务完成时间较GPT-5.6 Sol缩短约47%,在BenchCAD中几何重合度达95.9%且估算API成本降低约43%,输出Token比Claude Opus 5少约65%。API标准定价为输入每百万Token 10美元、输出50美元,已向Work/Codex中所有Pro、Enterprise和Business Premium用户及API正式开放,并计划继续向Plus和Business用户推送,同时为所有Plus、Pro和Business用户进行完整额度刷新
https://openai.com/index/gpt-6-astra/
阿里联合淘天集团发布E-Commerce Bench电商经营评测基准
E-Commerce Bench用于评估大模型在模拟电商市场中的长程经营能力。模型需以10万元本金、在365天内同时运营多家网店,面对真实市场数据驱动的需求与供应商行为,完成选品、谈判、定价、库存与现金流管理等决策。评测从盈利、谈判质量、反欺诈、运营效率等七个维度对18个模型进行打分,结果显示GPT-5.6 Sol以143万元总资产位居盈利榜首,但反欺诈仅排第16位;开源模型中Qwen3.8-Max-Preview表现最佳,回报达4.16倍,且是唯一在重复进货时展现价格压低能力的模型。同时所有模型在谈判、反欺诈等维度均远未达到上限
https://github.com/QwenLM/E-CommerceBench
英伟达约130亿美元收购Hugging Face
英伟达宣布将以约130亿美元的价格收购人工智能初创公司Hugging Face,其中包括约119亿美元的支付给投资者部分及为留任员工提供的10亿美元股权激励。此举旨在加快开放权重模型的普及,Hugging Face将继续保持开放平台定位,超过1800万名开发者、研究人员和创作者使用该平台,共享模型超过300万个。此次收购成为英伟达史上规模最大的交易之一
https://mp.weixin.qq.com/s/Jvox0Xsq5vE23W9NHojUTQ
微软推出MAI-Transcribe-2语音识别模型
微软发布的MAI-Transcribe-2语音识别模型在FLEURS多语言基准测试中平均词错率为5.2%,排名第一,并在Artificial Analysis平台的准确率与延迟帕累托前沿上占据领先位置。该模型支持说话人分离、词级时间戳、关键词偏置、可配置转录风格(逐字记录或清理版)以及60种语言的自动识别与代码切换。在效率方面,其处理速度比GPT-Transcribe快10倍、比Scribe v2快7倍、比Gemini 3.5 Transcribe快5倍,同时保持更高准确率。模型定价为每音频小时0.10美元
https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/
谷歌推出Gemini 3.8 Flash系列模型
Gemini 3.8 Flash在保持与3.7版本相同速度与成本(输入每百万Token 0.75美元,输出3.75美元)的基础上,提升了推理与代码能力,在DeepSWE v1.1长周期软件工程测试中取得73.7%的成绩,并在金融与法律等专业领域Agent任务中超越前代及部分前沿模型。同期发布的Gemini 3.8 Flash Cyber通过Fairwind Program向安全防御人员开放,在CyberGym漏洞发现基准上达到86.2%的成功率,并在CWE-Bench补丁修复测试中以47.2%的Pass@1成绩接近领先模型,同时成本显著更低
https://mp.weixin.qq.com/s/JHZVEmZexvadAinLYc-GIg
李飞飞旗下World Labs发布新一代世界模型Atlas
Atlas是一款从零预训练的多模态自回归扩散Transformer,原生支持文本、图像、视频和3D数据,能将输入图像锚定三维空间位置形成空间上下文。模型具备相机可控生成(从一到六张参考图输出最高1440p、最长1分钟视频)、空间重建(输出点云与3D高斯泼溅)、时空模拟及图像生成四大能力。在相机可控生成的人类盲评中,Atlas对多款主流视频模型的胜率达75%至94%;在稀疏视角重建任务上,其平均误差为25.3,优于多个开源专用模型。Atlas目前仅向少数合作伙伴开放早期访问,将用于驱动Marble产品及机器人仿真等应用
https://www.worldlabs.ai/blog/atlas
Anthropic发布Claude Fable 5.1和Mythos 5.1模型
Claude Fable 5.1与Mythos 5.1采用相同基础模型,区别在于安全防护等级不同。基准测试显示,Fable 5.1在Terminal-Bench-Science 0.1(52.6%)和GDPval-AA v2(1853分)等测试中均超过前代Fable 5、Opus 5及GPT-5.6 Sol。两款模型缓存读取费用下调75%,典型工作负载下成本较Fable 5降低约25%。Mythos 5.1在分子设计任务中结合亲和力比顶级竞赛作品高出10倍,命中率接近50%。Anthropic还推出了零数据保留的企业级前沿防护措施,并为符合欧盟法案要求的输出添加不可见水印
https://www.anthropic.com/claude-fable-and-mythos-5-1
DeepSeek开源多模态模型V4-Flash-Vision-Exp
DeepSeek在Hugging Face上开源了其V4系列首个多模态模型V4-Flash-Vision-Exp,采用MIT许可证,公开内容包括模型文件、核心模块的PyTorch实现及参考代码。该模型原生支持图片输入,可进行图像描述、截图文字识别和图表分析等任务。官方称其在Agent、推理等纯文本任务上与V4-Flash正式版持平,而在需要视觉理解的Agent基准测试中多模态能力已接近Opus-4.8
https://www.ithome.com/0/996/637.htm
OpenAI向部分大客户提供按结果付费模式
OpenAI开始向部分大客户提供一种新的付费方式,只有当AI真正完成任务时才需付费。这种模式反映了AI时代软件行业收费方式的转变,即从按席位或使用量收费转向按业务结果收费。客户管理公司Sierra、编程智能体公司Cognition及Salesforce等均已采用或探索类似模式。这一转变要求AI厂商承担更多风险,但也面临诸多挑战,包括如何定义和衡量AI创造的具体结果,以及如何将结果归因于AI的贡献
https://mp.weixin.qq.com/s/fTuFtvIH7NQGbRuio0DsdQ
OpenClaw发布2.0版本
OpenClaw发布的2.0版本是该项目有史以来最大的一次更新,共有933名贡献者参与,合并了超过1.6万个pull request。此次更新重构了安装流程,新增引导式安装并支持复用已有AI访问权限;浏览器端Control UI被重写为以对话为中心的结构,启动时间从约1.6秒降至575毫秒;底层存储迁移至SQLite,并新增了支持权限控制的共享云会话功能。安全方面,文档明确将模型选择视为对抗prompt injection的缓解措施,并指出工具策略、执行审批和沙箱才是真正的强制防御层
https://openclaw.ai/blog/openclaw-2-accidentally
OpenAI宣布终止与Cursor的合作关系
OpenAI发布声明,因Cursor被SpaceX收购后无法确信其能在服务条款范围内使用技术,将自11月12日起终止Cursor对OpenAI模型的直接访问权限。OpenAI提及SpaceX旗下xAI曾违反服务条款的历史,而Cursor创始人回应称OpenAI模型仅占其用户流量的约5%。此次断供的背景是OpenAI正为具备潜在关键级网络攻击能力的Astra模型部署做准备,需严格控制分发渠道。此前Anthropic也曾因类似原因切断过Windsurf等产品的模型访问权限
https://mp.weixin.qq.com/s/CH5o8ER5iluS5RY5or664w