研究动机
作者的核心洞察是:预训练语料中的每个 token 都自带一个可验证的答案——它自己。传统 NTP 只要求模型直接输出概率分布,模型可以靠浅层统计关联"记住"下一个 token,而不真正理解为什么它应该出现。RPT 要求模型在输出预测之前先展开推理过程,通过 RL 优化推理路径,迫使模型从"死记硬背"转向"深度理解"。
这样做的好处有四个:
相关工作
依赖人类偏好数据 + 学习型 reward model,容易被 hacking,难以大规模应用
使用可验证奖励,但受限于标注数据稀缺,只能用于领域微调
最相关的工作:鼓励 LLM 为 next-token prediction 生成 helpful rationales。但 helpfulness-based reward 容易被 hacking(模型在 rationale 中重复目标 token)
用 RLVR 增强推理能力,但仅限于后训练阶段,未触及预训练范式本身
整体框架
RPT 的核心思想可以用一句话概括:将预训练语料中的每一个 next-token prediction 位置,重构为一个需要推理才能解决的"问题"——上下文是题目,下一个 token 是答案,而模型在给出答案之前必须先写一段 chain-of-thought 推理过程。
整体流程如下:
提取 context x<t
reasoning trajectories
prediction y_it
Reward r_it
RL Update
假设预训练语料中有一段物理文本:"Electric force grows with charge",后续文本为 "size and decreases with distance squared."
标准 NTP:给定上下文 "Electric force grows with charge",模型直接输出下一个 token 的概率分布,选取 argmax = "size"。模型可能只是记住 "charge" 后面常接 "size" 这个统计模式,并不理解为什么。
Next-Token Reasoning (RPT):给定同样的上下文,模型先展开思考:
"Let's think about what would logically come next in a text about electric force... Since the context mentions 'grows with charge', the next part is likely going to describe what else the force depends on... Alternatively, it could be 'magnitude' or 'amount'... Common phrases after 'grows with' include 'size', 'magnitude'... Wait, given Coulomb's Law, the force also depends on distance... So the most probable answer is \\boxed{size}"
这种推理过程迫使模型从语义理解而非统计模式匹配来预测 token。
Next-Token Reasoning 任务定义
给定预训练语料中的输入序列 $x_0 \cdots x_T$,对于每个位置 $t \in \{1, \ldots, T\}$:
- 前缀 $x_{<t}$ 被视为上下文(context)
- $x_t$ 是真实下一个 token(ground-truth)
- 模型 $\pi_\theta$ 需要先生成一段 chain-of-thought 推理序列 $c_t$,再给出预测 $y_t$
- 完整输出 $o_t = (c_t, y_t)$,其中 $o_t \sim \pi_\theta(\cdot | x_{<t})$
假设预训练语料中有一段数学解答文本:
"Thus $2^A = (2^a)^2(2^3) = "
下一个真实 token 是 "9"。
RPT 的任务:给定上下文 "Thus $2^A = (2^a)^2(2^3) = ",模型需要:
1) 先生成推理过程 $c_t$:分析指数运算、回忆 $2^3 = 8$、推导 $A = 2a + 3$ 等
2) 再给出预测 $y_t$:\\boxed{9}
3) 如果 $y_t$ 匹配真实 token $x_t = \text{"9"}$,则获得正奖励。
RL 训练流程
RPT 使用on-policy RL训练模型进行 next-token reasoning。核心流程如 Figure 3 所示:
\\boxed{} 内的内容作为预测 $y_t^i$
假设上下文是 "Electric force grows with charge",真实后续是 "size and decreases...",$G=8$。
模型生成 8 条推理轨迹,其中:
- Trajectory 1:推理后预测 \\boxed{size} → 与 ground-truth 匹配 → $r_1 = 1$
- Trajectory 2:推理后预测 \\boxed{magnitude} → 不匹配 → $r_2 = 0$
- Trajectory 3:推理后预测 \\boxed{size} → 匹配 → $r_3 = 1$
- ... 其他轨迹同理
GRPO 会提高 $r=1$ 轨迹的概率、降低 $r=0$ 轨迹的概率,使模型逐渐学会更好的推理路径。
Prefix Matching Reward
Reward 设计是 RPT 的关键创新之一。论文提出了 prefix matching reward,而非简单的 first-token matching,目的是支持多 token 预测和 out-of-vocabulary token 的情况。
- $r_t^i$:第 $i$ 条 rollout 对位置 $t$ 的 reward
- $\bar{y}_t^i$:预测序列 $y_t^i$ 的字节序列(byte sequence)
- $\bar{x}_{\geq t}$:真实续写序列 $x_{\geq t}$ 的字节序列
- $l$:预测 $\bar{y}_t^i$ 的字节长度
- $L_{gt}$:ground-truth 中各 token 边界对应的累积字节长度集合(valid boundaries)
- $\bar{x}_{\geq t}[1:l]$:真实续写字节序列的前 $l$ 个字节
1) 预测可能跨越多个 token(如预测一个完整单词而非单个 token)
2) 某些 token 可能是 out-of-vocabulary 的,在 byte 层面验证更鲁棒
3) 需要检查预测长度 $l$ 是否落在 $L_{gt}$ 的有效边界上,确保 byte prefix 对齐到完整的 token 边界
假设真实续写为 "size and decreases",对应的 token 为 ["size", " and", " decreases"]。
假设字节长度分别为 4、5、11,则 $L_{gt} = \{4, 9, 20\}$(累积字节边界)。
- 预测 $y_t^i = \text{"size"}$ → $\bar{y} = \text{"size"}$, $l=4$, $4 \in L_{gt}$, $\bar{x}_{\geq t}[1:4] = \text{"size"}$ → $r = 1$
- 预测 $y_t^i = \text{"size and"}$ → $\bar{y} = \text{"size and"}$, $l=9$, $9 \in L_{gt}$, $\bar{x}_{\geq t}[1:9] = \text{"size and"}$ → $r = 1$
- 预测 $y_t^i = \text{"magnitude"}$ → 不匹配 → $r = 0$
- 预测 $y_t^i = \text{"siz"}$ → $l=3$, $3 \notin L_{gt}$(不在有效边界上)→ $r = 0$
论文还在 Appendix A 中讨论了几种替代 reward 设计:
只看预测的第一个 token 是否匹配 ground-truth,忽略后续 token。简单但可能遗漏多 token 预测的正确情况。
正确预测 → reward=1;错误预测 → reward = $P(y_t^i | x_{<t}; \theta)$(模型给错误 token 的概率)。提供更密的信号,但可能引入偏差。
实验表明这些替代设计与 prefix matching reward 性能相近,说明 RPT 框架对 reward 设计相对鲁棒,核心收益来自 next-token reasoning 范式本身而非特定 reward 形式。
RPT 目标函数
- $\mathcal{D}$:预训练语料中所有 $\{x_{<t}\}_{t=1}^T$ 的集合
- $\pi_\theta(\cdot | x_{<t})$:模型在给定前缀下的策略分布
- $G$:每个 context 采样的 rollout 数
- $r_t^i$:如上定义的 prefix matching reward
与传统 NTP 目标和 RLVR 目标对比:
- $J_{NTP}$:标准 next-token prediction 目标(最大化 log 概率)
- $x_0 \cdots x_T$:训练语料中的输入序列
- $\theta$:语言模型参数
- $\mathcal{D}$:标注的问答对数据集 $\{(q, a)\}$
- $\pi_\theta(\cdot | q)$:模型在给定问题下的策略
- $r(o, a)$:验证器 $V$ 对输出 $o$ 和答案 $a$ 计算的可验证 reward
基于熵的数据过滤
不是所有 token 都需要推理。很多 token(如常见标点、高频词)即使不经推理也容易预测,对这些 token 做 RL 训练效率低下。论文使用熵过滤策略来选择性地训练更具挑战性的 token 位置。
假设一段数学解答:"Therefore, the answer is $\boxed{42}$."
- Token "Therefore," 前面的上下文非常明确 → proxy model 的 top-16 熵很低(约 0.2) → 被过滤掉
- Token "42" 前面的推理步骤需要深入理解 → 熵很高(约 2.0) → 保留训练
这样 RPT 训练只聚焦于"真正需要思考"的位置,大幅提升训练效率。
训练设置
| 参数 | 值 | 说明 |
|---|---|---|
| Base model | DeepSeek-R1-Distill-Qwen-14B | 具有基本推理能力的蒸馏模型 |
| 预训练数据 | OmniMATH (4,428 道竞赛级数学题) | 竞赛级数学问题和解答 |
| RL 算法 | GRPO | Group Relative Policy Optimization |
| Batch size | 256 | 每批 256 个 question |
| Rollout 数 $G$ | 8 | 每个 question 采样 8 条响应 |
| Sampling temperature | 0.8 | rollout 时的采样温度 |
| Learning rate | $1 \times 10^{-6}$ | 极低学习率 |
| KL penalty | 0 | 零 KL 惩罚 |
| 训练长度 | 8k | 8k token 训练长度 |
| 训练步数 | 1,000 | 主实验训练 1000 步 |
| 动态采样 | 从 500 步开始 | 提升训练效率 |
| 熵损失系数 | 0 | 遵循 exact on-policy RL 设置 |
\\boxed{} 内的完整序列作为模型对 next-token 的预测。特殊 token `` 用于分隔推理和预测部分。
\\boxed{}。论文在 Appendix D 中测试了 7 种 prompt 变体,发现更好的 prompt(如 v6)可以显著提升初始性能(Pass@8 从 8.5% 到 19%),但主实验使用的是最基础的 v0 版。
语言建模性能
在 OmniMATH 的 200 样本验证集上,按 entropy 阈值将 token 位置分为 Easy(entropy > 0.5)、Medium(> 1.0)、Hard(> 1.5)三个难度等级。
| 方法 | Easy | Medium | Hard | 说明 |
|---|---|---|---|---|
| Standard next-token prediction | ||||
| Qwen2.5-14B | 41.90 | 30.03 | 20.65 | 原始基座模型 |
| R1-Distill-Qwen-14B | 41.60 | 29.46 | 20.43 | 蒸馏推理模型,标准 NTP 模式 |
| Next-token reasoning | ||||
| R1-Distill-Qwen-14B | 3.31 | 1.66 | 1.41 | 推理模式但未经 RPT 训练,性能极差 |
| RPT-14B | 45.11 | 33.56 | 23.75 | RPT 训练后,全面提升 |
1) RPT-14B 在所有难度等级上都显著超越标准 NTP 基线,尤其在 Hard 难度提升 +3.32pp
2) 未经 RPT 训练的模型在 reasoning 模式下表现极差(Easy 仅 3.31%),说明 next-token reasoning 需要专门的 RL 训练才能发挥作用
3) RPT-14B 的性能甚至匹配 R1-Distill-Qwen-32B(一个两倍大的模型),暗示 RPT 是一种高效的 scaling 方式
Scaling Properties
论文分析了 RPT 的 scaling 行为,使用幂律模型拟合训练计算量 $C$ 与 next-token prediction accuracy $P(C)$ 的关系:
- $P(C)$:在验证集上的 next-token prediction accuracy
- $C$:训练计算量(FLOPs)
- $P^*$$:不可达上限(asymptotic accuracy ceiling)
- $A$:缩放系数
- $\alpha$:幂律指数
Reinforcement Fine-Tuning
测试 RPT 预训练的模型是否能更好地作为后续 RLVR 微调的起点。使用 Skywork-OR1 数据集(256 训练样本、200 测试样本),PPO 微调 15 个 epoch。
| 模型 | Before RL | After RL | 说明 |
|---|---|---|---|
| R1-Distill-Qwen-14B | 51.2 | 52.7 | +1.5pp |
| + Continual NTP training | 10.7 | 13.0 | NTP 训练摧毁推理能力 |
| RPT-14B | 56.3 | 58.3 | +2.0pp,更高起点 + 更大提升 |
1) Continual NTP training 摧毁推理能力:用标准 NTP 目标在同一数据上继续训练,推理能力从 51.2% 暴跌至 10.7%。这说明 NTP 目标与 RL 目标存在根本冲突
2) RPT-14B 的 RL 起点(56.3%)显著高于 baseline(51.2%),说明 RPT 预训练建立了更强的推理基础
3) RPT-14B 在 RL 微调后的最终性能(58.3%)也更高,体现了更好的 pretrain-then-finetune 协同
Zero-Shot 性能
| 模型 | SuperGPQA | MMLU-Pro | 说明 |
|---|---|---|---|
| Standard next-token prediction mode | |||
| R1-Distill-Qwen-14B | 32.0 | 48.4 | 基线 |
| R1-Distill-Qwen-32B | 37.2 | 56.5 | 两倍大模型 |
| Reasoning mode | |||
| R1-Distill-Qwen-14B | 36.1 | 68.9 | 推理模式基线 |
| RPT-14B | 39.0 | 71.1 | RPT 训练后全面领先 |
1) RPT-14B 在 reasoning mode 下全面超越 R1-Distill-Qwen-14B
2) RPT-14B 甚至超越两倍大的 R1-Distill-Qwen-32B(NTP mode):SuperGPQA +1.8pp, MMLU-Pro +14.6pp
3) 在数学相关学科(MMLU-Pro 的 Math)RPT-14B 达到 91.5%,远超基线的 36.5%/86.0%
推理模式分析
RPT-14B 的真实推理案例(Table 4):
"Okay, I need to figure out what the next token... Let's think about what would logically come next in a text about calculating vector magnitude. The flow so far is introducing the topic, explaining the formulas... the next part is likely going to be... Alternatively, it could be... Common phrases after 'we can go over some' could be 'examples,' 'steps,' 'methods'... But perhaps, given the user started a new section... Wait, perhaps in the original, the next part was an example... Alternatively, perhaps the next line is a new section."
这个案例展示了模型的多层推理:语义分析 → 关键短语识别 → 多候选 brainstorming → 结构线索反思 → 逐 token 细节检查。这远不止简单的模式匹配。
我的理解
- 范式创新:首次将 RL 从后训练搬到预训练,打通了 NTP ↔ RL 的范式鸿沟
- Reward 天然可验证:ground-truth token 就是答案,无需外部标注,彻底解决 RLVR 的数据稀缺问题
- 抗 hacking:rule-based reward 比 learned reward model 更鲁棒
- Scaling 规律:幂律 scaling curves 暗示可持续扩展
- 推理模式不同:hypothesis + deduction 的推理模式揭示了 next-token reasoning 的独特性
- 数据局限:仅用 OmniMATH(数学竞赛题),未验证在通用网页文本上的效果
- 模型起点:从 R1-Distill(已有推理能力)开始,而非标准 base model,未验证从零启动的效果
- 训练成本:每个 token 位置生成 G=8 条完整推理轨迹,训练开销远大于标准 NTP
- 推理效率:推理时每个 token 都要经过思考过程,延迟大幅增加
- Prompt 依赖:v0 prompt 性能较差,更好的 prompt(v6 Pass@8=19%)说明工程优化空间大
1) 预训练 × RL 的融合思路:不仅推荐/搜索领域,任何有"可验证信号"的预训练场景都可以借鉴 RPT 思路
2) 熵过滤策略:只对"难预测"的位置投入 RL 训练,这个思路可以迁移到任何有难度分层的训练场景
3) Continual NTP 摧毁推理的发现值得关注——如果模型已经学会推理,继续用 NTP 目标训练会退化,说明训练目标与期望行为必须对齐
4) 推理 ≠ 解题:next-token reasoning 的 hypothesis/deduction 模式与 problem-solving 的 breakdown 模式本质不同,这对理解"推理能力"的本质有启发