news 2026/10/6 2:27:36

VAR-MATH: Probing True Mathematical Reasoning in Large Language Models via Symbolic Multi-Instanc...

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
VAR-MATH: Probing True Mathematical Reasoning in Large Language Models via Symbolic Multi-Instanc...

文章主要内容和创新点

主要内容

文章聚焦于大型语言模型(LLMs)在数学推理能力评估中的局限性,指出现有模型在标准数学基准测试上的性能提升可能源于对特定模式的过拟合,而非真正的推理能力。具体而言:

  1. 现有评估存在两大缺陷:一是基准污染(公开测试题可能导致数据泄露,模型通过记忆而非推理得分);二是评估脆弱性(依赖单实例评估,对随机输出敏感,无法反映推理一致性)。
  2. 为解决这些问题,作者提出VAR-MATH框架:通过将固定数值问题转化为符号模板(用变量替换常数),要求模型解决多个结构相同但数值不同的实例,以此评估模型是否具备真正的推理能力(需所有实例均正确)。
  3. 基于该框架,作者将AMC23和AIME24转化为符号变体VAR-AMC23和VAR-AIME24。实验显示,强化学习(RL)训练的模型在这些变体上性能大幅下降(7B模型在AMC23平均下降48.0%,AIME24平均下降58.3%),表明现有RL方法更多依赖表面启发式,而非可泛化的推理能力。
创新点
  1. 揭示现有评估的核心缺陷:明确指出“基准污染”(数据泄露导致记忆)和“评估脆弱性”(单实例评估无法反映推理一致性)是现有数学推理评估的关键问题。
  2. 提出VAR-MATH框架:通过符号化模板和多实例验证,强制模型在结构相同的问题变体上保持推理一致性,有效减少基准污染并提升评估鲁棒性,
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/6 2:24:16

GetQzonehistory:把QQ空间历史说说一键备份成本地Excel和HTML

GetQzonehistory:把QQ空间历史说说一键备份成本地Excel和HTML 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 翻空间找三年前发过的某条动态,翻到手指酸也定位不…

作者头像 李华