news 2026/9/2 7:56:57

FSR-Bench 榜单更新:Qwen3.8-Max 开工具配置位列第 5,双配置均进入前十

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
FSR-Bench 榜单更新:Qwen3.8-Max 开工具配置位列第 5,双配置均进入前十

评测背景

随着大模型逐步具备联网搜索、代码执行等能力,科学推理评测所考查的对象也开始从单一模型扩展到模型与工具组成的完整系统。模型不仅要理解问题,还要判断何时检索资料、如何筛选证据,以及怎样将工具返回的信息转化为可靠结论。

前沿科学推理评测集(Frontier Scientific Reasoning Benchmark,简称 FSR-Bench)正是围绕这一变化构建的高难度评测基准。它包含 867 道题,覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科,其中纯文本题 425 道、多模态题 442 道。每道题分别在开启原生工具和不开启原生工具两种配置下评测,并同时考察作答过程与最终答案。

本次更新聚焦 Qwen3.8-Max 在 FSR-Bench 中的最新表现,重点观察其在榜单中的相对位置,以及过程分、题型和工具配置等不同维度下的表现。

榜单概览

本期结果显示,Qwen3.8-Max 在 FSR-Bench 的两套配置中均进入前十。开启原生工具的 Qwen3.8-Max(w.Tool)以 50.61 分位列第 5,未开启工具时以 38.35 分位列第 8。

注:主榜将开启工具与不开启工具的配置放在同一张榜单中,开启工具的模型以“w.Tool”标识,同一模型的两种配置会被视为两个独立条目,下表仅展示前 20 名。

点击访问晓天衡宇评测社区,查看完整榜单、排行榜规则、评测集详情、详细得分榜单。

评测设计与方法

FSR-Bench(Frontier Scientific Reasoning Benchmark)包含 867 道前沿科学问题,覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科,其中纯文本题 425 道、多模态题 442 道。评测分别在不开原生工具和开启原生工具两种配置下进行,两种配置合并在同一榜单,开启工具的模型以 w.Tool 标识。由于各模型使用自身实际可用的原生工具体系,该结果用于观察不同完整系统配置下的科学问题求解表现,而非比较统一工具条件下的模型能力。

FSR-Bench 对每道题的作答过程和最终结果分别评分,均采用 100 分制;其中过程分关注推理过程的完整性与合理性,结果分关注最终答案的准确性及任务完成情况。每道题由 Qwen3.7-Max、GPT-5.6 Luna 和 Claude Sonnet 5 三个裁判模型独立评分,最终取平均值。主榜按“所有题 · 结果分”排序,过程分、纯文本题及开/不开工具等指标作为分项观察口径。

详细评测规则、输入输出格式及判分标准,请前往晓天衡宇垂直领域评测榜单查看。

分析与结论

Qwen3.8-Max 进入榜单前列,与领先模型差距已缩小

从“所有题·结果分”看,Qwen3.8-Max(w.Tool)以 50.61 分位列主榜第 5。与排名第 4 的 GPT-5.6 Sol (medium) 相差 7.59 分,略高于第 6 名 Claude Fable 5(w.Tool)的 49.97 分,领先 0.64 分。

从 Qwen 系列内部看提升更加明显:Qwen3.8-Max(w.Tool)比 Qwen3.7-Plus(w.Tool)高 12.18 分,也比 Qwen3.6-Plus(w.Tool)高 29.21 分。

整体来看,Qwen3.8-Max 在本期综合科学推理评测中已经进入榜单前列,而不只是停留在中部梯队。

纯文本科学推理表现更突出,推理过程质量值得关注

从细分成绩来看,Qwen3.8-Max(w.Tool)在纯文本题上的结果分达到 66.65,过程分达到 74.93,展现出较强的纯文本科学推理能力:在以知识理解、问题拆解和逻辑推演为主的科学问题中,Qwen3.8-Max 能够形成质量较高的分析与推理过程。

在所有题中,Qwen3.8-Max(w.Tool)的过程分为 61.89,同样高于 50.61 的结果分。过程分较高说明 Qwen3.8-Max 的表现不仅体现在最终作答结果上,也体现在知识调用、证据组织和推理展开等解题环节,为处理复杂科学问题提供了较为扎实的过程基础。

不同工具配置下均保持较好表现,原生工具进一步提升成绩

Qwen3.8-Max 在两种配置下均进入榜单前十。未开启工具时得分为 38.35 分,排名第 8;开启原生工具后提升至 50.61 分,排名升至第 5。

即使未开启工具,Qwen3.8-Max 仍保持在榜单前列;在此基础上,原生工具配置进一步提升了它的科学问题求解表现。

由于 FSR-Bench 并非统一工具条件下的严格控制实验,不同模型实际可使用的原生工具体系存在差异。因此,这里的 12.26 分更适合用于描述 Qwen3.8-Max 两套完整系统配置之间的表现变化,而不应直接解释成工具本身带来的净能力提升。

综合判断

Qwen3.8-Max 在本期综合科学推理评测中表现较为突出:两种工具配置均进入榜单前十,开启工具后进一步进入前五;同时,过程分也呈现出较好的表现。本次评测更值得关注的是 Qwen3.8-Max 的能力结构:能够形成完整的科学问题分析过程,并在原生工具参与下进一步提升整体表现。

与此同时,过程分与结果分、纯文本与多模态题之间仍存在一定差异,说明模型在不同信息形态和任务环节中的表现并不完全一致。这些差异也为进一步观察模型的科学推理能力提供了更多维度。

总体来看,Qwen3.8-Max 已经展现出较强的综合科学问题求解能力,尤其是在知识密集型任务和工具协同场景下表现突出;而如何进一步缩小过程与结果、文本与多模态之间的差距,将是其后续能力提升的重要方向。

注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。

写在最后

最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网,欢迎访问查看更详细的评测数据

👇关注晓天衡宇•评测社区官方账号,获取更多大模型相关知识~

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 7:56:33

从CPU到GPU:全面解析计算机芯片架构与应用场景

在嵌入式开发、服务器运维乃至日常的PC装机中,我们总会接触到形形色色的“芯片”。你是否曾好奇,手机里的SoC和电脑里的CPU有何不同?显卡里的GPU为何如此重要?那些不起眼的小芯片又如何支撑起庞大的数字世界?面对琳琅满…

作者头像 李华
网站建设 2026/9/2 7:54:18

广深城际快车S4839次:琶洲至深圳机场公交化出行全攻略

1. 先搞清楚这趟“快车”到底是什么,以及它解决了什么问题 看到“S4839次琶洲→深圳机场方向快车出站”这个标题,很多人第一反应可能是“这是一趟火车吗?”。实际上,它并不是我们熟悉的国铁列车,而是 广深城际铁路 运…

作者头像 李华
网站建设 2026/9/2 7:53:23

从MusicXML到歌声合成:中文乐谱数据集的预处理与工程实践

简介:本资源是面向歌声合成与音乐AI研究者的中文乐谱数据集,专为深度学习模型训练提供结构化乐谱输入,解决旋律建模、音高节奏对齐及跨模态歌声生成中的数据瓶颈问题。压缩包共172个纯XML格式乐谱文件,总大小仅1.05MB,…

作者头像 李华
网站建设 2026/9/2 7:53:12

测井AI工程化落地:Python岩性识别与曲线回归实战模板

简介:本资源是一份面向高校人工智能、自动化、电子信息等专业学生的课程设计实践项目,聚焦人工智能技术在石油测井领域的落地应用,解决岩性智能识别与测井曲线回归建模两大核心问题。压缩包共246个文件,含175个实测测井数据CSV文件…

作者头像 李华
网站建设 2026/9/2 7:53:07

MATLAB三相短路分析全攻略:从Simulink建模到短路电流计算

简介:围绕MATLAB/Simulink的电力系统三相短路故障仿真分析资料,面向电力工程专业学生、课程设计者及电气工程师,可系统解决短路计算流程不清晰、保护校验缺乏实例、Simulink建模无从下手等痛点。压缩包共12个文件,核心为MATLAB脚本…

作者头像 李华
网站建设 2026/9/2 7:52:59

谷歌收购驱动创新模式的技术风险与IBM历史镜鉴

最近看到一篇关于谷歌技术战略的分析文章,引发了业界不少讨论。文章核心观点认为,谷歌近年来的重大创新似乎越来越依赖外部收购而非内部孵化,这种模式可能使其面临类似IBM当年的困境。作为一名长期关注企业级技术栈和研发体系的技术博主&…

作者头像 李华