news 2026/9/21 10:09:10

罗福莉的两个反共识 Hybrid Attention架构(混合注意力),其中,Hybrid Sliding Window Attention(混合滑动窗口注意力)和 Full Attention(全局

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
罗福莉的两个反共识 Hybrid Attention架构(混合注意力),其中,Hybrid Sliding Window Attention(混合滑动窗口注意力)和 Full Attention(全局

罗福莉的两个反共识

原创 邱晓芬 智能涌现2025年12月17日 16:39北京

在小说阅读器中沉浸阅读

1、AI的发展根基不稳固,像是空中楼阁;2、数据和算力,不是AI真正的护城河。

邱晓芬

编辑苏建勋

官宣加入小米一个月后,原Deepseek核心成员、被称为“天才少女”的罗福莉首次露面,并在小米“人车家全生态合作伙伴大会”上公开发表演讲。

这次亮相,她的身份是小米MiMo大模型的负责人。

罗福莉略显紧张,偶尔卡壳。在演讲开场,罗福莉将AI的演进与生物进化做对比,指出AI正在以非线性的方式重演人类大脑6亿年的进化史。

在她看来,经过了强化、模拟、心智的发展,语言是生物智能最后的产物,而AI的发展则是完全反过来——大模型是从语言开始解码人类的思维,自上而下倒推智能的产生。

为此,小米也从语言出发,发布了全新的语言基座模型 MiMo-V2-Flash。据其介绍,这一大语言模型的核心特点可以概括为三点:更强的代码和工具调用能力、更高推理效率和更低成本、更强的强化学习训练。

具体而言,为了实现极致推理效率,罗福莉团队重新设计了模型结构,其中包括两项核心创新。

据罗福莉介绍,小米 MiMo-V2-Flash采用了Hybrid Attention架构(混合注意力),其中,Hybrid Sliding Window Attention(混合滑动窗口注意力)和 Full Attention(全局注意力)的比例大概是 5:1。

这种架构的好处是,不仅能适配当代主流的Infra推理框架,还兼顾长短文推理和知识检索的综合性能。

其次,小米也挖掘MTP(Multi-Token Prediction,多令牌预测)的潜力。

MTP最早是用于推理加速,后来DeepSeek将其用于提升基座模型。

而小米也在训练时加入了一层MTP层以提升基座潜能,并在微调时加入了更多层的 MTP,这样使得用少量算力就提升了 MTP 层的接受率,实现2.2到2.6倍的推理加速。

罗福莉用价格和效率列了一个象限,证明MiMo-V2-Flash的优势。

比如,在参数方面,MiMo-V2-Flash的总参数只有309B(激活15B),相比于Deepseek V3.2和Kimi K2 Thinking,参数量减少了1/2-1/3。

而在推理的速度方面,MiMo-V2-Flash是Deepseek V3.2的三倍,成本更是比Gemini 2.5pro低了20倍。

除了在预训练方面进行模型架构创新,小米大模型团队也在思考如何扩展强化学习训练。一直以来,强化学习训练通常不稳定,罗福莉提出了 MOPD(Multi-Teacher On-Policy Distillation,多教师在线策略蒸馏) 范式。

据介绍,MOPD是一种学习效率更高的模式,简短的几十步就能将各领域专家的能力快速蒸馏到 Student 模型上。

MiMo-V2-Flash目前初步具备模拟世界的能力,可以用HTML来写操作系统、模拟太阳系、或者是让它画一棵圣诞树等等。

她认为,下一代的智能体并不是一个简单的“语言模拟器”,而是一个真正理解世界、与人类共存的智能体。而要实现这一愿景,Agent关键需要具备两项潜能。

首先,在执行层面,Agent需要从过去只会回答问题,到能够完成任务,实现记忆、推理、自主规划、决策、执行的全链路闭环。

另外,在感知层面,下一代Agent也需要有统一的多模态感知,为理解物理世界打好基础——这才有利于嵌入智能眼镜等全新智能终端,融入人类日常的工作流里。

在演讲末尾,罗福莉也发表了对于当前AI行业的两点反共识看法。

在罗福莉看来,大模型本质上是一种算力的暴力美学,直接从语言入手,但跳过了对世界的感知磨砺(即下图第三层的“模拟”),也缺乏实体,跳过与世界产生交互的环节(即下图第一层的“转向”),像是“空中楼阁”一般。

比如,当前的大模型虽然能力超群,但并不懂重力这种物理法则,也产生了很多具身的幻觉。“大模型只有一个完美的语言外壳,而缺乏锚定现实世界的物理模型”,她表示。

为此,罗福莉表示,AI的下一个起点是,需要有一个和物理世界产生交互的物理模型。

她认为,AI本质上要打造的不是一个程序,而是一个在物理上有一致性、时空上有连贯性的“虚拟宇宙”。AI不是要看画面、理解文本,而是要推演整个世界的真实逻辑。“真正的智能不是从文本里读出来的,而是在交互里产生的”。

谈及竞争力方面,罗福莉认为,算力和数据并不是真正的AI护城河,而是研究文化和研究方法,将未知的问题结合模型优化成可用产品能力。

首次公开演讲,罗福莉还借此机会打了广告。她直言,小米的大模型核心团队是一个研究、产品、工程深度耦合的团队,充满创业精神,而且极度好奇、追求真理。

罗福莉回忆道,当她开始研究大模型时,国内的开源大模型与国外的大模型代差有三年的时间,但现在的差距只有几个月。

“我相信开源的价值,本质上是一种分布式技术加速主义,开源是 AGI实现普惠化,确保所有人类智慧共同进化的唯一路径”,罗福莉表示,从数据的极速压缩到算法范式创新,再到物理空间的深度链接,小米将与全球 AI共同定义未来。

(文内图片来源均为作者拍摄)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/21 21:46:16

模型漂移的检测与应对:软件测试者的实战手册

当AI模型开始"失准"——测试工程师的新挑战 一、认识模型漂移:从静态测试到动态监控的范式转移 在传统软件测试中,我们习惯于对确定性的输入输出进行验证。但当系统引入机器学习模型后,我们面临的全新问题是:模型性能…

作者头像 李华
网站建设 2026/9/21 21:45:27

金融科技的智能风控测试

引言:智能风控测试的时代挑战 随着深度学习与大数据技术在金融风控领域的深度应用,传统基于规则引擎的测试方法已难以满足新一代智能风控系统的质量保障需求。测试工程师面临模型动态更新、数据维度多元、决策链路隐蔽等全新挑战,亟需建立适…

作者头像 李华
网站建设 2026/9/21 9:07:44

Open WebUI重排序终极指南:三步提升搜索精准度90%

Open WebUI重排序终极指南:三步提升搜索精准度90% 【免费下载链接】open-webui Open WebUI 是一个可扩展、功能丰富且用户友好的自托管 WebUI,设计用于完全离线操作,支持各种大型语言模型(LLM)运行器,包括O…

作者头像 李华
网站建设 2026/9/21 21:46:16

测试预算的动态优化:从静态规划到敏捷响应

在当今快速迭代的软件开发环境中,测试预算管理不再仅仅是年初的固定分配,而是一个需要持续调整的动态过程。软件测试从业者面临着诸多挑战:项目需求频繁变更、新技术工具涌现、测试环境成本波动,以及市场竞争对质量的更高要求。静…

作者头像 李华
网站建设 2026/9/21 9:20:20

【树莓派pico/pico2】在pico-sdk中自定义板子

一、前言树莓派pico/pico2是树莓派推出的基于自家MCU(RP2040、RP2350)的核心板。现已有很多基于RP2040和RP2350芯片的各类核心板和开发板,也有用户自己制作的板子。如果用户使用的板子,其引脚定义、Flash配置和树莓派pico/pico2相…

作者头像 李华
网站建设 2026/9/22 1:50:19

【Java + Elasticsearch全量 增量同步实战】

Java Elasticsearch 全量 & 增量同步实战:打造高性能合同搜索系统在企业合同管理系统中,我们常常遇到以下挑战:合同量大,文本内容多,传统数据库查询慢搜索需求多样:全文搜索、按签署人筛选、分页排序历…

作者头像 李华