Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models
作者:Xiaoyu Luo, Tao Ren, Wenrui Yu, Xiao Li, Qiongxiu Li, Johannes Bjerva
核心发表机构:Aalborg University、Seafill
论文链接:arXiv:2609.26637v1
发布于:arXiv 预印本(cs.CL)
|—|—|—|—|—|
|MATH| None | 72.5 | 42.5 | 25.0 | N/A |
| | Native | 86.3 | 77.5 | 97.5 | 97.5 |
| | Forced | 85.0 | 81.3 | 91.3 | 93.8 |
|HLE| None | 24.0 | 17.0 | 13.0 | N/A |
| | Native | 33.0 | 21.0 | 25.0 | 35.0 |
| | Forced | 27.0 | 22.0 | 23.0 | 32.0 |
|LCB| None | 58.0 | 52.0 | 47.0 | N/A |
| | Native | 83.0 | 77.0 | 90.0 | 92.0 |
| | Forced | 82.0 | 77.0 | 90.0 | 89.0 |
可直接读出的事实是:Forced 全面且显著高于 None(例如 Sol 在 MATH 上从 25.0 升至 91.3,Sonnet 5 在 MATH 上从 42.5 升至 81.3);Forced 与 Native 的差距普遍较小,个别处 Forced 甚至略高——Sonnet 5 的 MATH(81.3 vs 77.5)与 HLE(22.0 vs 21.0);Sol 在 LCB 上 Forced 与 Native 完全相同(90.0 vs 90.0)。HLE 上所有模型整体分数偏低,Native 最高为 Astra 的 35.0,Forced 相对 Native 的落差在该基准上相对更明显(如 Opus 4.8 从 33.0 降至 27.0,Astra 从 35.0 降至 32.0)。需要再次强调的是,由于各模型对 tool prompt 的敏感度不同,Forced-Reasoning 并不对应某个固定的 native reasoning effort 水平。
4.3 消融实验 / Ablation Study
消融一:工具通道是否必要,以及 wording 的作用(GPT-5.6 Sol)。作者先做了一个直接的对照:在禁用 native reasoning 的前提下,不附加任何工具,直接在可见回复中请求 step-by-step reasoning。在 HMMT 上,这种直接请求把准确率从 39.4% 提升到 60.6%;把 maximal-deliberation 指令从 tool description 挪到 response prompt 并调整 scratchpad 引用后,准确率仍是 60.6%;而 forced tool calling 达到 84.8%(default description)与 93.9%(maximal deliberation)。结论是:直接在普通文本中请求相同的 deliberation 无法复现 forced-tool 的结果,更强的措辞单独也不够。检查 HMMT P11 的 Plain response 可以看到,它呈现为一个简洁的条件概率解,使用编号列表与加粗的 case headings,是结构良好的 Markdown 回答而非 CoT 式文本,最终以FINAL_ANSWER: $\frac{2}{5}$收尾。
进一步的 wording 消融见下表(表注:Accuracy 为 pass@1 (%),tokens 为均值,none-reasoning 与 Tool 组均禁用 native reasoning):
| Method | MATH Acc (%) | MATH Tokens | HLE Acc (%) | HLE Tokens |
|---|---|---|---|---|
| no-tool: Default | 25.0 | 442 | 10.0 | 126 |
| no-tool: Plain | 36.3 | 906 | 12.0 | 263 |
| no-tool: Maximal | 36.3 | 670 | 12.0 | 169 |
| Native: Low | 78.8 | 1,599 | 27.0 | 819 |
| Native: Medium | 92.5 | 3,403 | 27.0 | 1,791 |
| Native: High | 97.5 | 5,526 | 25.0 | 3,293 |
| Tool: Forced Default | 81.3 | 1,940 | 15.0 | 460 |
| Tool: Forced Maximal | 91.3 | 3,481 | 23.0 | 2,106 |
在 MATH 上,Forced Default 的 81.3% 接近 Native Low 的 78.8%,Forced Maximal 的 91.3% 接近 Native Medium 的 92.5%;Native High 最高(97.5%)但 token 成本达 5,526。在 HLE 上,Forced Default 15.0%、Forced Maximal 23.0%,仍未达到 Native Low/Medium 的 27.0%,且 Native High 反而降至 25.0%。这说明 tool description 可以调节 Sol 通过 forced channel 外化多少 deliberation,也说明无工具对照中更强的 wording 并未带来进一步的准确率增益。
消融二:Astra 的 effort、wording 与推理通道分配。Astra 与 Sol 对更强措辞的反应恰好相反:maximal deliberation 会延长 Sol 的可见工具推理,却让 Astra 产生更少的可见推理并保留大量 native-channel usage。作者解读为这是一种"不愿外化推理"而非"不会回答问题"的现象,并据此选择了 think-here 描述。下表给出 MATH 上的数值(Native reasoning tokens 为每次完整交互中所有调用的 API 报告 reasoning usage 之和的均值;Zero-native rate 为完成交互记录到零 aggregate native reasoning usage 的 scheduled questions 比例):
| Task | Metric | Default | Maximal | Think-here |
|---|---|---|---|---|
| MATH | Accuracy (%) | 90.00 | 97.50 | 95.00 |
| Output tokens | 848.96 | 594.26 | 1,754.66 | |
| Native reasoning tokens | 887.18 | 1,386.40 | 13.65 | |
| Zero-native rate (%) | 27.50 | 11.25 | 93.75 |
三者的取舍非常清晰:Maximal 准确率最高(97.50%)但 output tokens 最低(594.26)而 native reasoning tokens 最高(1,386.40),zero-native rate 最低(11.25%);think-here 准确率略低(95.00%),output tokens 最高(1,754.66),但 native reasoning tokens 被压到极低的 13.65,zero-native rate 高达 93.75%。这支持了一个假设:对更强模型而言,鼓励它继续在工具空间中工作,可能比要求它给出 exhaustive account 更有效。
消融三:同时开启高 native reasoning effort 时的行为(APEX Shortlist)。主实验的 Forced 条件通常在 little or no native reasoning 下运行(Sol 用none,Astra 用可用的最低low)。为了补足"如果 native reasoning 也调高会发生什么",作者在全部 47 个 APEX Shortlist 问题上,以high与xhigh两档 native reasoning effort 保留相同 forced-tool 协议(Sol 用 maximal-deliberation,Astra 用 think-here),每个条件每个问题一个 recorded rollout:
| Model | Effort | Correct | Tool-zero | All-zero | Mean tool output tokens |
|---|---|---|---|---|---|
| Sol | high | 44/47 | 46/47 | 38/47 | 15,044 |
| Sol | xhigh | 47/47 | 42/47 | 39/47 | 19,733 |
| Astra | high | 47/47 | 38/47 | 18/47 | 5,775 |
| Astra | xhigh | 47/47 | 34/47 | 7/47 | 12,014 |
任务准确率很高(Sol high 为 44/47 即 93.6%,Sol xhigh 与 Astra 的 high/xhigh 均为 47/47),但准确率本身不能说明推理究竟在哪里执行。随着 effort 上升,tool-stage output usage 显著增加(Sol 从约 15.0k 升至 19.7k tokens,Astra 从 5.8k 升至 12.0k tokens,这些计数包括 tool framing 并排除单独 final-answer calls),而 whole-interaction zero 的稳定性下降:Astra-high 只有 18/47 保持全程零,Astra-xhigh 只有 7/47,Sol 则在约五分之四的问题上保持 whole-interaction zero。差距主要来自 final-answer call 中出现的 native reasoning。对 available reasoning summaries 的检查显示,final-stage activity 有时是在准备或组织已经开发好的工具解,有时则是在做额外的数学检查或推导。换言之,提高 native reasoning effort 可以暴露更多可见推理,但会让 fully clean extraction 变得更不可靠,尤其对 Astra。
4.4 推理表征与全局结构分析
输出长度:Forced 普遍短于 Native,Astra 压缩最明显。下表给出四个前沿模型的 NativeR N R_NRN与 ForcedO F O_FOF:
| Task | Model | NativeR N R_NRN | ForcedO F O_FOF |
|---|---|---|---|
| MATH | GPT-6 Astra | 2,903 | 1,752 |
| GPT-5.6 Sol | 5,526 | 3,925 | |
| Opus 4.8 | 24,087 | 16,283 | |
| Sonnet 5 | 27,846 | 27,851 | |
| HLE | GPT-6 Astra | 2,313 | 652 |
| GPT-5.6 Sol | 3,293 | 2,214 | |
| Opus 4.8 | 5,385 | 3,627 | |
| Sonnet 5 | 10,604 | 10,705 | |
| LCB | GPT-6 Astra | 1,962 | 939 |
| GPT-5.6 Sol | 4,058 | 2,665 | |
| Opus 4.8 | 14,849 | 12,696 | |
| Sonnet 5 | 25,128 | 26,416 |
总体上 ForcedO F O_FOF低于 NativeR N R_NRN,Astra 与 Sol 尤其明显;Sonnet 5 的 Forced 与 Native 几乎持平,LCB 上甚至略高;Astra 的 token 数在各任务上多低于 Sol、Opus 4.8 与 Sonnet 5。
局部粒度:Astra 的短不是"每句话说更短"。作者用同一批 episode annotations 计算两类量:(i) 某类型单元内的平均字符数,(ii) 该 epilogue 类型对整条 trace 贡献的总字符数(数据集为 pooled MATH annotation set)。
上图显示的是第一个量:在大多数 episode 类型上,Astra 的 characters per unit 与 Sol 和 Opus 相当,因此其 compact CoT 不能简单由异常短句或异常压缩的局部推理操作解释;相反,Sonnet 经常在单个 Analyze、Plan、Explore 单元内表达多得多的文本。
上图显示的是第二个量,也是模型间更大的差异所在:Opus,尤其是 Sonnet,会产生更多显式中间推理步骤,Analyze、Plan、Implement 等类别对总文本的贡献增长 several-fold;而 Astra 在暴露更少中间 trace 的情况下到达答案。作者由此把 Astra 的短 CoT 刻画为sparse externalization(稀疏外化),而非 local textual compression(局部文本压缩)。
推理活动组成:repertoire 并未消失。作者进一步比较各模型的推理活动分布。
上图给出四个前沿模型在 pooled MATH annotation set 上各 reasoning episode 的平均标注单元比例。所有模型中 Analyze 与 Implement 占最大份额,Planning、Exploration、Verification、Reading、Monitoring 的总体比例 comparable;没有任何模型表现出 qualitatively different activity composition。Astra 尽管轨迹显著更短,仍呈现类似的高层 profile——这印证了前两张图的结论:Astra 的紧凑性主要在于"表面化了多少中间步骤",而不是推理行为种类在定性上贫乏。
时间组织:粗略模式相似。除了静态比例,作者还考察 episode 在 trace 上的位置分布。
上图的每个 panel 展示一个模型在归一化推理进度上各 episode type 的出现概率。可以看到 Read 强烈集中在 trace 开头,Verify 在末尾更突出,Implement 通常在中后段更 prevalent,具体进展细节因模型而异。结论是:Astra 更短的 trace 不仅保留了相同的 broad episode inventory,还保留了若干相同的 coarse temporal patterns。
全局结构:Astra 的树最窄、节点最少,但深度可比。在 MATH 上,作者对每个模型每道题取一条 completed forced-reasoning trace(Astra 用 think-here + low native effort,Sol 用 maximal deliberation;包括正确与错误响应;若有多条则选 generation order 第一条;final answer 与 reference answer 被排除在 judge 输入之外)构建推理树。中位数(含 [25th, 75th] 分位数)如下:
| 模型 | Widthp pp | Depthq qq | NodesN NN |
|---|---|---|---|
| GPT-6 Astra | 5.0[3.0, 9.0] | 11.0 [8.8, 15.0] | 27.0[17.8, 44.0] |
| GPT-5.6 Sol | 12.0 [5.0, 19.3] | 11.0 [10.0, 13.0] | 60.0 [29.8, 90.3] |
| Claude Opus 4.8 | 22.0 [5.0, 44.0] | 12.0 [9.0, 14.0] | 96.0 [28.5, 220.3] |
| Claude Sonnet 5 | 28.5 [9.0, 49.3] | 13.0 [10.0, 15.0] | 136.0 [44.8, 234.8] |
同一批 traces 的均值报告在另一张表中:Astra 为p = 7.3 p=7.3p=7.3、q = 14.9 q=14.9q=14.9、N = 41.0 N=41.0N=41.0;Sol 为16.7 16.716.7、11.2 11.211.2、65.9 65.965.9;Opus 4.8 为30.6 30.630.6、11.9 11.911.9、144.2 144.2144.2;Sonnet 5 为44.3 44.344.3、12.4 12.412.4、171.4 171.4171.4。Astra 具有最小的 mean width 与 size,但在均值口径下 depth 最大;正文中"depth 相似"的比较指的是中位数口径。
上图给出对应的推理树可视化:每个 panel 展示一条接近该模型中位数图大小的单条 trace,所有 panel 使用相同的垂直与水平间距以便直接比较范围,每个标签报告 widthp pp、depthq qq与 node countN NN。结论是:Astra 产生显著更窄的树,节点数远少,同时达到 comparable depth——它遵循类似深度的解决轨迹,但 branching、revisiting 与 trial-and-error 更少,更直接地收敛到 productive path。结合活动组成来看,各模型外化的推理活动 repertoire 大体相似,差异在于它们如何被组织进完整解题轨迹。
4.5 跨模型推理复用 / Cross-Model Reuse
压缩轨迹会省略 routine steps,其有用性因此可能取决于"读者"能否补全。作者通过模型间移植 trace 来直接测试这一点。
上图呈现了完整结果:每个 panel 是一个 recipient,每一行是一个 donor;空心圆显示 donor accuracy,实心点显示 recipient 在收到 donor trace 后的 accuracy,虚线显示 recipient 自身的 standalone Native-high accuracy;左向连接表示相对 donor 的性能损失,同心点表示准确率相等。
从图中可以读出的模式有三。其一,来自 Sol 与 Opus 的 traces 被每个 recipient 重用时几乎无损失。其二,Astra 的 traces 行为不同:强 recipient 能复现几乎全部 donor accuracy,弱 recipient 恢复较少,最大 shortfall 出现在 Claude Haiku 4.5 与 GPT-5.4 Nano。其三,这种模式只出现在测试的 donors 中最压缩的那些 trace 上,且不是严格按 recipient capability 排序——GPT-5.4 Nano 与 DeepSeek-V4-Flash 具有可比的 Native-high accuracy,恢复程度却不同,说明模型规模与训练配方等与 capability 相关的因素也可能参与其中。需要强调的是,shortfall 是相对的而非绝对的:弱 recipient 恢复的 donor accuracy 较少,但仍显著优于其 unaided performance。
理解 trace 存在能力天花板。有时 donor trace 已经陈述了正确答案,recipient 仍答错并报告一个不同的最终答案。统计上,Astra 在 73/80 问题(91.25%)中在其 CoT 里明确陈述了正确答案;而在 recipient 的错误答案中,正确答案已暴露的比例为:Haiku 4.5 为 15/18 = 83.33%,GPT-5.4 Nano 为 11/16 = 68.75%,DS-V4-Flash 为 11/15 = 73.33%(答案被视为 exposed 的条件是:Astra 的 final answer 正确,且 transplanted text 明确认可该正确请求答案,允许 notation normalization 与 direct algebraic equivalence,排除 incidental numbers、rejected candidates 以及需要进一步推导的答案)。
四个典型失败案例说明这一现象的形态。在 HMMT P20(计算通过20 × 3 20\times320×3圆柱网格、从 top row 出发到 bottom row 结束且水平移动只允许向东的 Hamiltonian paths)上,Astra 给出20 ( 512 + 511 ) = 20460 20(512+511)=2046020(512+511)=20460,而 Haiku 4.5 答5242880 52428805242880、GPT-5.4 Nano 答10220 1022010220、DS-V4-Flash 答10240 1024010240——其中 Nano 明确只保留 511-path case,计算20 ⋅ 511 = 10220 20\cdot511=1022020⋅511=10220,丢掉了输入中已存在的另一项贡献。在 APEX P10(函数方程问题,求1 ≤ n ≤ 20 1\le n\le201≤n≤20上所有 attainable valuesf ( n ) < n f(n)<nf(n)<n的和)上,Astra 显式列出2 + 6 + 3 + 6 + 14 + 18 + 10 = 59 2+6+3+6+14+18+10=592+6+3+6+14+18+10=59,而 Haiku 4.5 与 GPT-5.4 Nano 都答0 00,DS-V4-Flash 答129 129129。在 HMMT P11(四道测试题独立从 algebra、combinatorics、geometry、number theory 中均匀抽 topic,条件于前三个 topics 都出现,求 number theory 也出现的概率)上,Astra 的 CoT 已显式给出24 / 60 = 2 / 5 24/60=2/524/60=2/5,而 GPT-5.4 Nano 答2 / 3 2/32/3、DS-V4-Flash 答4 / 7 4/74/7,只有 Haiku 4.5 答对。在 APEX P47(求最小正整数k kk,使得每个k kk个连续正整数块中都有数字和能被 2025 整除的数)上,Astra 给出k = 10 225 − 1 k=10^{225}-1k=10225−1,Haiku 4.5 答10 225 10^{225}10225——错误恰好是丢掉了减法,而 GPT-5.4 Nano 与 DS-V4-Flash 都给出了正确答案。
这些案例共同暗示:压缩推理 trace 不只是让 trace 更难读,而是把它推到了一定能力阈值以下读者的理解范围之外。
对监督的启示与非因果性说明。作者指出,推理 trace 作为监督信号的价值可能不是内在的,而是相对于将从中学习的模型而言的;trace 显式性是独立于 teacher strength 的一个变量。这为蒸馏中的 capacity gap 提供了一个候选机制:更强的 teacher 不一定产生更好的 student,因为最强 teacher 写的是最压缩的 trace,而压缩 trace 恰好省略了弱 student 无法自己重建的步骤。随着前沿模型持续优化 token efficiency,会出现一种张力——使前沿推理高效的同一压缩,也可能使它对最可能学习它的更小模型更不可用。作者同时明确说明,实验测量的是 in-context reuse 而非 fine-tuning,donor traces 在 correctness、content、style 上存在差异,因此比较不能隔离 compression 作为因果因素;但这一解释给出了可测试预测:将压缩 trace 展开为其隐式中间步骤,应恢复对弱 recipient 的大部分有用性,同时基本不影响强 recipient。
五、相关工作 / Related Work
隐藏 CoT 抽取。Panfilov et al. (2026) 的 “stealing” 利用供应商返回的加密推理块做跨会话、跨模型重放,用较弱的同族模型把较强模型此前生成的 trace 以明文揭示出来;Zhang et al. (2026) 的 Trace Inversion 不直接暴露已有隐藏 trace,而是从可观测输出事后重建有用 trace;Lu et al. (2026) 的 REP / Reasoning Exposure Prompting 用影子模型示例包裹在类代码的辅助格式中,诱导开启推理的模型在可见响应中把推理外化;Qu et al. (2026) 的 EchoCoT 把 REP 的暴露设定扩展到 API tool-calling 场景,加入攻击者定义的 scratchpad 工具,使已生成的 native reasoning 通过连续工具交互被反复归档与重放。本文与这些工作的区别在于:方法只依赖标准 API 接口(客户端注册自定义工具 + tool-choice 强制),其目的也不止于"恢复 trace",而是把 trace 当作观测仪器去比较前沿模型的推理方式。
在指定思考通道之外推理。Ma et al. (2025) 通过 response prefilling 绕过专用 thinking block,模型仍生成分步解答;Wang et al. (2025) 的 HybridThinking 显示,no-think 模式下的推理模型尽管 thinking block 为空,仍能在可见响应中输出推理与反思。本文正是沿着这一线索提出:当 native reasoning 被禁用或最小化时,客户端提供的工具能否充当中间推理的替代工作区?与上述工作不同的地方是,本文采用 API-as-a-service 的 tool setting,目标是禁用 native reasoning channel 并提供工具作为解决当前任务的替代工作区,无需 demonstrations 或模型内部访问。
推理轨迹分析。Li et al. (2025) 用 Schoenfeld 的 Episode Theory 把数学推理分解为功能性 episode 并分析其转移;ThinkARM(Li et al., 2026)把 episode 级分析扩展到多模型;LCoT2Tree(Jiang et al., 2025)把长 CoT 转成层级推理树,并将结构模式与推理成功关联;TRACE(Zhang et al., 2026)构建 sub-thought progression graphs,刻画过度思考的结构性来源;此外还有关于冗余推理与更短、可控压缩 CoT 诱导的工作(Chen et al., 2024;Munkhbat et al., 2025;Xia et al., 2025 TokenSkip)。本文定位是在这些视角基础上,对抽取出的前沿模型 trace在推理效率、局部表达、全局结构三个层面做比较,并把 trace 的实用性延伸为一个接收模型相关的迁移实验。
六、局限性与展望 / Limitations & Future Work
论文对自身局限的陈述相当克制且具体,可归为以下几类。
抽取轨迹的效度问题。抽取出的 trace 可能只是 post-hoc rationalization 而非真实推理,这正是必须先做开源模型对齐验证的原因。而在闭源模型上,native CoT 不可得,因此不可能确定 extracted text 反映的是模型实际内部推理,还是仅提供了一个有用的行为代理;与 native traces 的相似性和下游效用不应被解释为与模型内部计算同一。
协议的环境依赖。Forced-Reasoning 要求 API-as-a-service 接口支持 custom tools 与 named tool 的强制选择,不具备这些控制的 endpoint 不在本文范围内。同时,Forced-Reasoning 并不对应某个固定的 native reasoning effort 水平,因为不同模型对 tool prompt 的敏感度不同;prompt 设计本身是 heuristic 的,其目标不是寻找 optimal attack 或优化 prompt engineering,观察到的 wording effects 只支持 model-specific choices,未建立关于 model capability 的通用 prompt 结论。
对照条件的缺失与计量口径。GPT-6 Astra 不支持禁用 native reasoning,因此其 None 条件为 N/A,只能用最低可用的loweffort 替代,这意味着 Astra 没有严格意义上的无推理对照。此外,缺失的计数器被当作 unknown 而非 zero,这会影响 zero-native 统计的解释;APEX 补充实验每个条件每个问题只有一个 recorded rollout。
提取稳定性与失效边界。提高 native reasoning effort 虽然能暴露更多可见推理,却会让 fully clean extraction 变得不可靠,尤其对 Astra(high 只有 18/47、xhigh 只有 7/47 保持 whole-interaction zero),主要混杂源是 final-answer call 中的 native reasoning。更根本的是协议存在 refusal boundary:Claude Opus 5、Fable 5、Fable 5.1 在所有测试配置上的 extraction success rate 为0 % 0\%0%——Opus 5 拒绝 forced reasoning-tool use 与 prompt-requested reasoning-tool use(覆盖所有 tested descriptions 与 parameter names),却允许在同一道 benign mathematics question 上被直接请求可见推理;Fable 5 与 Fable 5.1 则在 disabling thinking 时返回 explicit errors,并在即使 low reasoning effort 下也拒绝 required 或 named tool choice。作者强调,这些观察只建立了测试协议的失效边界,并未识别限制来源是模型本身还是 provider-side handling。
分析方法的依赖与解释边界。推理树的 width、depth、size 依赖 segmentation 与 step assignment;小树表示更少被表示的节点,但本身不能证明内部计算更少或必要证明步骤更少;节点的水平间距没有时间或计算上的解释;depth 度量的是 sketch progression 而非路径长度。此外,推理树分析对每个模型每道 MATH 题只分析一条 completed forced-reasoning trace(多条可用时选 generation order 第一条),final answer 与 reference answer 被排除在 judge 输入之外。
迁移实验的非因果性。6.4 节已述:实验测量 in-context reuse 而非 fine-tuning,donor traces 在 correctness、content、style 上不同,因此不能隔离 compression 作为因果因素,只能给出可测试预测。
可能的缓解方向。论文提出了若干可能防御:在 provider 层面,当 native reasoning 被禁用时限制 free-form reasoning tools(这一方向与观察到的 Opus 5 行为一致);在接口层面,限制 unconstrained string arguments 或限制 forced tool selection;在输出层面,用分类器检查 tool arguments 中是否包含 deliberative traces(但合法 planning tools 也可能产生类似内容,使区分变得困难);在政策层面,reasoning-disclosure policies 应覆盖 native reasoning、tool arguments 与 visible responses,而不是只保护一个 designated channel。作者强调这些只是 possible defenses,其有效性与对合法工具使用的影响仍需评估。
伦理与披露。作者使用良性公开基准与研究者账号评估 confidentiality 与 capability-control boundary,不提取个人数据、专有提示、凭据或不安全内容;所有提取实验在 2026 年 9 月 9 日前完成;全文将提取内容理解为 extracted reasoning trace content。风险评估后,作者通过邮件向 OpenAI 与 Anthropic 安全团队报告了所有观察并提供复现代码。
七、总结 / Conclusion
论文从一个简单但尖锐的观察出发:闭源前沿模型的原始 CoT 被隐藏,benchmark 分数只说明模型能解什么,不说明它如何求解,也不说明更强、更高效的模型之间推理差异在哪。作者用一条极简的、仅依赖标准 API 的协议——注册一个自由文本参数的 scratchpad 工具并强制初始工具选择——在关闭或最小化 native reasoning 的条件下,从 GPT-6 Astra、GPT-5.6 Sol、Claude Opus 4.8 与 Claude Sonnet 5 中外化出连贯的中间推理。通过"开源模型上性能、词法、结构三层对齐 + 闭源模型上行为证据"的两级验证,作者论证这些抽取轨迹可作为 native CoT 的可比较代理。
在此基础上,论文给出了一个具有统一性的刻画:模型之间的主要差异不是执行了哪些推理操作,而是外化了多少。四个前沿模型共享大体相同的 episode repertoire 与粗略的时间组织,但在"外化多少中间步骤"上系统性地分道扬镳。最高效的 GPT-6 Astra 产生最短、冗余最少、最难被无损压缩的 trace,其推理树宽度与节点数显著最小而深度可比;在局部,它常把 routine computations 与简单推导在内部解决而不逐句 verbalize;在全局,它遵循更直接的解决路径,分支与试错更少——这正是论文标题中 “Capable yet Parsimonious” 所指的 token-efficient directed reasoning。
但这份"简洁"是有代价的。跨模型复用实验显示,来自 Sol 与 Opus 的 traces 被各接收模型几乎无损地重用,而 Astra 的压缩 trace 只有强接收模型能近乎完全利用,弱接收模型只能部分利用;即使 Astra 的 trace 在 91.25% 的问题中已明确写出正确答案,弱接收模型的错误答案中仍有 68.75%–83.33% 属于"答案已暴露却答错"。这提示压缩推理 trace 不只是让 trace 更难读,而是将其置于一定能力阈值以下读者的理解范围之外。由此引出的推论是:推理 trace 的显式性值得与产生它的模型强度分开考虑,最强 teacher 可能不是给定 student 最有用的监督来源——当 frontier 模型持续为 token 效率而压缩推理时,使它们高效的同一压缩,也可能使它们对最需要学习的更小模型更加不可用。
论文的最终定位是一个行为学视角:它不宣称揭示了模型的真实内部计算,而是提供了一个在聚合 benchmark 分数之外比较前沿模型推理方式的仪器,并同时标出了这一仪器的适用边界与失效边界。
原文摘要:The rapid capability gains of frontier language models are widely attributed to improved reasoning abilities, yet this cannot be verified as raw CoT traces in closed-source systems are hidden. By registering a simple custom tool through a standard API feature, we induce frontier models to externalize intermediate reasoning. Because these traces may reflect post-hoc rationalization rather than genuine reasoning, we first evaluate against native CoT on open-source models and extend to closed-source frontier models including GPT-6 Astra. We find that the extracted reasoning matches native reasoning performance and substantially outperforms no-reasoning baselines, across competition mathematics, science, and code generation. We then characterize how frontier models structure their intermediate reasoning. Across token efficiency, reasoning-step types, and induced reasoning trees, we identify systematic differences in how models externalize, compress, and organize reasoning. We find that Astra exhibits token-efficient directed reasoning, selecting a correct trajectory earlier, while resolving elementary steps internally and externalizing only crucial reasoning. These findings provide a behavioral lens on frontier-model reasoning beyond benchmark scores.
PDF链接:https://arxiv.org/pdf/2609.26637v1