2025
arXiv:2504.09627
生成式推荐 · 显式慢思考
TIGER +19.5%
STREAM-Rec:给生成式推荐器装上一段可训练的思考过程
Slow Thinking for Sequential Recommendation · Zhang, Zhang, Sun, Lu, Zhao, Chen, Wen · RUC GSAI + 腾讯微信
沿用 TIGER 的 encoder-decoder + RQ-VAE SID 骨架,让 decoder 在吐 target SID 之前先自回归生成 l 个 reasoning token。三阶段训练:Pretrain(拼相似 item token 撑长度)→ SFT(用迭代残差量化合成 CoT + DPO 对照 direct decoder)→ RL(GRPO + 4 种 reward)。Amazon Instrument 相对 TIGER,R@5 +19.5%,N@5 +21.4%。恰好是 LARES 的显式版孪生兄弟。