news 2026/9/7 20:56:07

【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents

note

  • 先让 Gemini 把媒体“翻译”为 detailed textual description,再让 DeepSeek 利用自己更强的 reasoning + tool-use 能力生成训练轨迹。论文也明确说,因为 Gemini 不暴露原始 reasoning traces,所以他们改用 DeepSeek-V3.2 来合成 tool-integrated trajectories
  • OmniGAIA 填补了原生全模态 Agent 评测的空白,其事件图构造法可扩展至更多场景;OmniAtlas 证明了通过高质量轨迹合成 + Masked SFT + OmniDPO 能显著提升开源模型的工具集成推理能力,但感知底座与 Hard 任务推理仍是开放挑战
  • 构造benchmark数据:真实多模态数据→ 抽事实→ 构图→ Agent 扩图→ 选一条复杂证据路径→ 隐藏关键节点→ 反向生成 Query
  • 构造训练数据:Query 已知→ DeepSeek 每步采样 k=3→ Gemini verifier 剪枝→ 找到成功轨迹→ 拿成功 trajectory 做 SFT
  • 造数据时的探索 agent loop → DeepSeek-V3.2:Hindsight-Guided Tree Exploration 里那个走 TIR 轨迹、采样 k=3 分支、调 web_search / read_video / code_executor​ 的循环体,是 DeepSeek-V3.2​ 当探索器:
    • 感知前置:Gemini-3-Flash 先把原始视频/音频转成文本描述
    • 然后 DeepSeek-V3.2 在这个文本化环境里跑 agent loop 合成轨迹
    • 剪枝验证器:Gemini-3-Flash(拿 ground-truth 判哪条分支对)
  • OmniAtlas 真正被训练的 agent loop模型 → Qwen2.5-Omni / Qwen3-Omni
    • 训练pipeline:轨迹级监督微调(Masked SFT)-> OmniDPO:细粒度错误纠正
    • OmniDPO 里的“找第一个错步”→ Gemini-3-Flash。失败轨迹归因用的 verifier 是 Gemini-3-Flash

文章目录

    • note
    • 一、研究动机
    • 二、OmniGAIA 基准 + OmniAtlas 智能体
      • 2.1 OmniGAIA:如何构造“难而可解”的全模态任务?
        • 数据底座
        • 四阶段流水线
      • 2.2 OmniAtlas:原生全模态基础智能体
        • 1) 自主工具集成推理(TIR)
        • 2) 主动全模态感知(Active Perception)
        • 3) 基于引导树探索的轨迹合成
        • 4) 轨迹级监督微调(Masked SFT)
        • 5) OmniDPO:细粒度错误纠正
    • 三、实验结果
    • 四、实验结果分析
      • 4.1 细粒度错误剖析(Figure 5 & Table 4)
      • 4.2 工具调用分布
      • 4.3 原生感知 vs. 外挂感知工具
      • 4.4 训练有效性拆解
      • 4.5 典型案例启示
    • 总结

一、研究动机

项目链接:https://github.com/RUC-NLPIR/OmniGAIA

当前多模态大模型(MLLM)存在三个明显的断层:

维度现状缺口
模型能力主流仍是视觉‑语言或音频‑语言双模态;即便出现 Qwen3‑Omni 等全模态模型,也偏重感知,缺乏长程推理 + 多轮工具调用没有“原生全模态 Agent”
评测基准OmniBench、WorldSense、Daily‑Omni、UNO‑Bench 等大多基于短音视频 + 选择题 + 感知导向缺少多跳、多轮工具、开放可验证答案的 Agent 评测
Agent 研究文本 Agent 已较成熟,但融合视‑听‑语言的全模态 Agentic 推理几乎空白无法衡量真实场景下的通用助手能力

核心诉求:补上“全模态感知 × 复杂推理 × 工具使用”三位一体的评测与训练范式,推动下一代通用 AI 助手。


二、OmniGAIA 基准 + OmniAtlas 智能体

2.1 OmniGAIA:如何构造“难而可解”的全模态任务?

数据底座
  • 视频+音频:FineVideo(43K 视频,平均 4 分钟)、LongVideoBench / LongVideo‑Reason(约 10 分钟长视频)
  • 图像+音频:COCO 2017(12.2 万图像) + FineVideo 的音频轨道
四阶段流水线

① 细粒度信号挖掘
用 Gemini‑3‑Flash 对每种模态提取时间对齐的确定信息:

  • 视频:按 ≤60s 切片,生成场景、事件、非语音环境音描述
  • 音频:时间戳 ASR、说话人日志、音频事件检测、环境标签
  • 图像:OCR、物体/人脸检测、全局描述

② 全模态事件图构建
用 DeepSeek‑V3.2 将提取的信息自动构建为图结构:节点=实体/事件,边=跨模态关系。图能自然表达分支(一对多)、级联(顺序)、混合拓扑,避免线性链的逻辑漏洞。

③ Agent 驱动的事件图扩展
赋予探索 Agent(DeepSeek‑V3.2)一套工具,主动寻找缺失证据并链接回图:

  • search_related_{video/audio/image}_info:跨模态检索
  • web_search/page_browser:引入外部时效知识
  • web_image_search/visual_question_answering:扩展视觉证据
  • code_executor:支持多步数值推理

Agent 自主决定调用时机,将图的边界推到“需要多跳关联+工具验证”的复杂度。

④ 事件模糊化(Fuzzification)生成 QA
直接问图节点是“事实查找”,因此选择长推理路径上的关键节点/边,用类型替换实体或遮蔽属性(例如把“Ruby Street Bridge”模糊为“一座可移动桥梁”)。这强制模型遍历完整逻辑链、融合多源多模态证据才能推出唯一答案。

⑤ 质量管控
LLM 委员会(DeepSeek‑V3.2 + Gemini‑3‑Pro)筛选 → 可选难度膨胀 → 3 名研究生人工核验可解性、答案唯一性。

最终产出:360 个任务,覆盖 9 个真实领域,包含 Easy / Medium / Hard 三档,答案类型均为开放可验证,且必须调用外部工具(主要是网页搜索,偶尔代码)。


2.2 OmniAtlas:原生全模态基础智能体

不是从头预训练,而是在开源全模态模型(Qwen2.5‑Omni / Qwen3‑Omni)上注入 Agent 能力的训练配方。

1) 自主工具集成推理(TIR)
  • 轨迹定义:τ = [ ( s t , a t , o t ) ] \tau = [(s_t, a_t, o_t)]τ=[(st,at,ot)],其中s t s_tst为思考,a t a_tat为工具调用或最终回答,o t o_tot为工具返回。
  • 模型基于历史自回归生成:p θ ( τ ∣ x ) = ∏ t p θ ( s t , a t ∣ x , s < t , a < t , o < t ) p_\theta(\tau|x) = \prod_t p_\theta(s_t, a_t | x, s_{<t}, a_{<t}, o_{<t})pθ(τx)=tpθ(st,atx,s<t,a<t,o<t)
  • 检测到工具调用 token 时暂停执行,把观察追加进上下文继续生成。
2) 主动全模态感知(Active Perception)

针对长视频/高分辨率图像,避免无差别下采样导致细节丢失。模型可主动调用:

  • read_video(video_id, t_start, t_end)
  • read_audio(audio_id, t_start, t_end)
  • read_image(image_ids, crop_box)

实现“按需看/听”,只加载需要的片段或区域。

3) 基于引导树探索的轨迹合成

由于闭源模型(Gemini)不暴露原生推理轨迹,作者用DeepSeek‑V3.2作为探索器:

  • 先用 Gemini‑3‑Flash 把原始多模态输入转为详细文本描述
  • 从根状态开始,每步采样k=3个候选延续(思考+工具动作)
  • Gemini‑3‑Flash 验证器(已知标准答案)剪枝错误/冗余分支,只保留成功轨迹用于训练
4) 轨迹级监督微调(Masked SFT)

标准 teacher forcing,但只对 Agent 自身生成的 token(思考、工具调用)计算损失,屏蔽工具返回的 observation。公式:
L SFT ( θ ) = − 1 ∑ m i ∑ i = 1 L m i log ⁡ p θ ( y i ∣ y < i , x ) \mathcal{L}_{\text{SFT}}(\theta) = -\frac{1}{\sum m_i} \sum_{i=1}^L m_i \log p_\theta(y_i | y_{<i}, x)LSFT(θ)=mi1i=1Lmilogpθ(yiy<i,x)
这防止模型记忆环境反馈噪声,专注学习“如何思考与行动”。

5) OmniDPO:细粒度错误纠正

全轨迹 SFT 不足以修正细微错误。OmniDPO 流程:

  • 让 SFT 模型在训练集上探索,对每个失败轨迹,用 Gemini‑3‑Flash(已知标注答案)定位第一个错误步骤
  • 生成纠正后的前缀,得到( τ win , τ lose ) (\tau_{\text{win}}, \tau_{\text{lose}})(τwin,τlose)
  • 优化masked DPO 目标,同样只在 Agent 生成 token 上计算 log‑prob:
    L D P O = − E [ log ⁡ σ ( β log ⁡ π θ ( τ w i n ) π r e f ( τ w i n ) − β log ⁡ π θ ( τ l o s e ) π r e f ( τ l o s e ) ) ] \mathcal{L}_{DPO} = -\mathbb{E} \left[ \log \sigma \left( \beta \log \frac{\pi_\theta(\tau_{win})}{\pi_{ref}(\tau_{win})} - \beta \log \frac{\pi_\theta(\tau_{lose})}{\pi_{ref}(\tau_{lose})} \right) \right]LDPO=E[logσ(βlogπref(τwin)πθ(τwin)βlogπref(τlose)πθ(τlose))]
    这样每次优化只聚焦修正单一错误模块(感知、推理或工具使用),实现精准提升。

三、实验结果

评测采用LLM‑as‑a‑Judge(DeepSeek‑V3.2)判断答案等价性,统一提供 web / browser / code 工具。

四大核心发现

  1. 闭源‑开源差距高达 4.7 倍(62.5 vs 13.3),开源社区在全模态感知与工具推理上急需突破。
  2. 单纯扩大参数无效:560B 的 LongCat 甚至不如 30B 的 Qwen3‑Omni,说明工具使用策略才是瓶颈,而非参数量。
  3. OmniAtlas 带来显著提升:Qwen3‑Omni 从 13.3 → 20.8(+7.5),小模型增益更夸张(7B 3.6→13.3,近 3.7 倍),证明训练配方能有效解锁各尺寸模型的 Agent 潜力。
  4. Hard 任务仍是共同噩梦:Gemini‑3‑Pro 在 Easy 达 78.7,Hard 暴跌至 38.5;OmniAtlas 在易/中档提升明显,但 Hard 上仍挣扎,揭示深度多跳推理是未来重点。

四、实验结果分析

4.1 细粒度错误剖析(Figure 5 & Table 4)

错误类型占比(Qwen3‑Omni‑30B):

  • 无效工具调用:81.1%
  • 推理错误:79.7%
  • 视觉感知错误:31.7%
  • 音频感知错误:33.9%

关键规律

  • 在 Hard 任务上,开源模型工具误用率饱和至90‑96%,推理错误率80‑90%,说明上游取证失败会级联导致下游推理崩溃
  • Gemini‑3‑Pro 各项错误率远低于开源(工具 35.3%,推理 15.8%),体现更成熟的规划与验证能力。
  • OmniAtlas 的改进:Qwen3‑30B 经 SFT+DPO 后,无效工具调用降至59.4%,推理错误降至64.4%,但感知错误仍徘徊 30% 左右 →感知底座是下一个必须攻克的瓶颈

4.2 工具调用分布

  • 0 次调用的模型几乎全挂→ 原生感知不足以解决 OmniGAIA 的大多数任务,必须借助外部工具。
  • 高调用次数(>10‑20)≠ 高成功率→ 大量失败轨迹伴随长尾调用,表明模型存在低效探索或“抖动”(thrashing):反复调用工具却未消除不确定性。
  • OmniAtlas 改变了调用模式:从 Qwen3‑30B 的“不敢调/少调”变为“积极调用”,分布更广,与工具错误下降、总分上升一致,但调用效率仍有优化空间

4.3 原生感知 vs. 外挂感知工具

实验设计:将听觉/视觉模型封装为工具(audio_qa/vision_qa),让 Agent 通过工具获取缺失模态信息,对比“原生全模态输入”与“工具辅助”的性能。

结论

  1. 对强模型(Gemini):原生感知就是最优解,外挂工具不仅掉点,还增加工具调用次数(4.4 → 6.8‑9.4),没有准确性‑成本优势
  2. 对弱模型(Qwen3‑Omni):外挂工具有助于Easy/Medium(13.3→15.8/18.1),但Hard 档反而下降(9.0→3.9/5.1/7.7)。说明工具输出能修补低层信号缺失,但无法替代原生跨模态融合进行长程推理。
  3. 外挂感知一致增加交互成本(Qwen 工具调用从 0.2 升至 0.5‑2.0),意味着更高延迟与部署开销。

启示:原生全模态感知应作为默认配置,外挂感知仅作为弱模型或缺失模态场景的兜底方案

4.4 训练有效性拆解

  • SFT 贡献了大部分增益(Qwen3‑30B:13.3→18.9),主要压低了无效工具调用(81.1→65.3)。
  • OmniDPO 进一步全面优化,在 SFT 基础上再提 1.9 个点,并继续降低各类错误,验证了细粒度错误纠正的有效性。

4.5 典型案例启示

参考原文附录 Table 5‑7:
同一道关于“Joliet Iron Works 历史遗址中出现的桥梁与电影《The Blues Brothers》”的问题:

  • 失败案例 I(无工具):模型依赖先验(芝加哥大桥),不调用工具验证,得出错误桥名与建成年限。
  • 失败案例 II(工具漂移):虽然调用工具,但查询被错误假设锁定(“LaSalle Street Bridge”),确认偏误导致计算正确但事实错误。
  • 成功案例(OmniAtlas):先按地点锚定(Joliet Iron Works → 附近可移动桥),再针对性检索验证桥名(Ruby Street Bridge,1935 年建)与电影开拍时间(1979 年 7 月),最后用代码计算 1979‑1935=44。

核心教训:工具访问是必要非充分条件。成功的 Agent 需要“地点优先锚定 → 假设检验 → 验证后再计算”的鲁棒模式,而非盲目检索或过早闭合。


总结

OmniGAIA 填补了原生全模态 Agent 评测的空白,其事件图构造法可扩展至更多场景;OmniAtlas 证明了通过高质量轨迹合成 + Masked SFT + OmniDPO 能显著提升开源模型的工具集成推理能力,但感知底座与 Hard 任务推理仍是开放挑战

论文最后指出三个方向:

  1. 全模态 Agentic RL:直接优化长程 Agent 策略
  2. 全模态 MCP 服务:扩展工具生态
  3. 具身全模态智能体:迈向物理世界交互
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 20:53:19

MySQL 9.0 Windows安装完整实战:MSI与ZIP双方案详解

新换了一台工作机&#xff0c;数据库环境全部重装一遍&#xff0c;顺手就把 MySQL 9.0 在 Windows 上的安装流程完整走了一遍。这篇文章不是临时翻文档写出来的&#xff0c;而是我实际踩完坑之后的完整记录。MySQL 9.0 在下载渠道、初始化方式、默认认证配置上和之前写过的 8.0…

作者头像 李华
网站建设 2026/9/7 20:51:25

城市生命线密钥安全实战:智能燃气表密钥分发与关键基础设施密码防护

换一块燃气表,接线、通气、激活,现场十分钟;但真正把一块表"接入"企业的不是管道,是密钥。旧表号不吊销,新表随便发号就入网,那么远程调价、远程关阀、用气量上报这些"城市生命线"末梢动作,就都建立在一层纸糊的信任上。 智能燃气表早已不是一块"抄表…

作者头像 李华
网站建设 2026/9/7 20:50:57

工装模具管理系统典型技术架构:分层设计与模块划分

导语 前两批把功能层拆完了&#xff0c;从本篇起进入架构层。工装模具管理系统的架构并不神秘&#xff0c;但它有一个普通业务系统没有的约束&#xff1a;它必须同时服务两个世界——办公室里用浏览器看报表的模具主管&#xff0c;和车间里拿着扫码枪、刷工卡、隔着机油摸屏幕的…

作者头像 李华
网站建设 2026/9/7 20:50:11

腾讯混元770B参数跃迁:架构重塑与工程实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 20:48:12

前端进阶Node.js完整路线:从事件循环到工程化实战

前端开发这个圈子&#xff0c;有个很有意思的现象&#xff1a;很多人写了几年JavaScript&#xff0c;DOM操作玩得飞起&#xff0c;各种框架信手拈来&#xff0c;但一提到Node.js&#xff0c;心里就开始打鼓。总觉得那是"后端工程师"的活儿&#xff0c;跟自己的主业没…

作者头像 李华