EMON TECH MEDIA · PAPERS — DNA·52CD39

Base Models Can Reason By Taking a Cue From Training Data

基础模型(base model)的推理能力可由回答开头的特定词元线索(token cue)触发,固定这些线索即可在数学与代码任务上追平强化学习(RL)训练后的模型。作者进一步用因果数据干预证明,这些线索的效果源自训练数据中的关联。

发表日期

作者

Sophie L. Wang, Amil Dravid, Rulin Shao, Kevin Farhat, Sewon Min, Alexei A. Efros

影响力

77.1

阅读时长

约 4 分钟

标签

推理

Base Models Can Reason By Taking a Cue From Training Data

一句话概括

基础模型(base model)的推理能力可由回答开头的特定词元线索(token cue)触发,固定这些线索即可在数学与代码任务上追平强化学习(RL)训练后的模型。作者进一步用因果数据干预证明,这些线索的效果源自训练数据中的关联。

速览

  • 任务:研究训练数据如何把回答起始词元与后续推理行为关联起来,覆盖数学、代码与安全场景。
  • 关键数字:线索「.\n\nOkay」把 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提到 78%;「Alright,」把 Qwen3-14B 从 72% 提到 87%。
  • 方法:固定起始线索做评测,并用因果数据干预增删线索效果。
  • 数据与开源情况:摘要未给出。

问题背景

  • 强化学习能提升基础模型的推理表现,但提升从何而来并不清楚。
  • 常见解释聚焦算法与奖励设计,较少追问训练数据本身的作用。
  • 作者提出另一视角:训练数据把「开头怎么写」和「后面怎么推理」绑定在一起。
  • 若该绑定成立,那么推理行为可能只是被特定开头词元唤起的既有能力。

方法要点

  1. 线索固定评测:强制模型以指定词元开头,再比较其与 RL 版本的准确率。
  2. 线索概率分析:统计 RL 训练后这些线索出现的概率变化。
  3. 因果数据干预:通过改动训练数据,把任意词(如「chicken」)变成有效推理线索,或抹掉已有线索的效果。
  4. 提示词对照:把指令「Think duck duck goose」与「Think step by step」比较,检验同一机制是否适用于提示。
  5. 表示分析:比较不同线索诱发的隐藏状态(hidden state)与训练集文档类型的相关性。
  6. 安全案例:观察不同线索引发的拒绝与顺从行为,并对应到不同训练数据类型。

关键结论

  • 固定起始线索能让基础模型在数学和代码上接近 RL 训练版本,说明部分推理增益可被线索复现。
  • RL 会提高这些线索的出现概率;固定线索又能找回 RL 相对基础模型的大部分提升。
  • 线索效果可被数据编辑创造或移除,指向训练数据中的具体关联,而非词元本身的语义。
  • 提示指令的效果同样可被数据编辑改变,说明线索机制不限于回答开头的词元。
  • 不同线索对应的隐藏状态与不同训练文档类型相关,提示模型在内部切换了「数据来源模式」。
  • 安全行为也受线索影响:不同线索引出不同的拒绝与顺从模式,并对应不同训练数据类型。

读后思考

  • 这篇工作把「推理能力」部分还原为「检索式触发」:模型未必在推理时变聪明,而是被开头词元带入了训练数据里的某种写作模式。
  • 若成立,评测方式需要重新审视。固定提示模板可能无意中放大或压制模型表现,比较不同模型时尤其如此。
  • 对安全而言,线索是双刃剑:它既能稳定触发推理,也可能稳定触发顺从或拒绝,这给越狱与对齐都提供了新抓手。
  • 数据干预能「无中生有」地造出推理线索,说明线索与语义无关,而与数据分布中的共现统计有关。

局限与开放问题

  • 摘要未给出实验规模、模型数量与统计显著性,结论的普适性待确认。
  • 线索效果是否随模型规模、训练数据配比变化,摘要未给出。
  • 因果数据干预的具体做法与代价,摘要未给出,难以判断可复现性。
  • 隐藏状态与文档类型的相关性是观察性证据,因果方向仍需更多实验。
  • 安全案例只作为案例研究,能否推广到更广的对齐场景,摘要未给出。
  • 开放问题:能否主动设计训练数据,让模型不依赖特定线索也稳定推理?

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。