📚 论文 · 笔记

学习笔记 & 论文解读

推荐 · 搜索 · LLM · NLP · 工业落地

论文 38
📝 学习笔记 18
🧪 生成式推荐 24
🤖 LLM4Rec 6
📊 传统推荐 3
🔍
2026 arXiv 2608.07055 超长序列 · Token Merge CVR 判别排序 字节电商广告 ADSS +1.036%
TM20K:老师读全文,学生读缩写——两阶段蒸馏把 20K 序列送上线
Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation · Xinchun Li, Duoru Zheng, Wenlin Zhao et al. · ByteDance · arXiv 2026.08
先用注意力分数统计证明 full attention 不可替代(20K 下比 target attention 高 0.25% AUC),再由三组观测反推出三种 token merge:LITM(同 PID 局部合并,T=3)、PATM(近期轻压远期重压)、LPTM(每 2 层长度减半)。一次性 teacher 吃完整 20K token 但永不上线,缓存 logits 蒸馏给双塔 student(main tower 保校准 + dis tower 吃 KD,λ=50)。学生 AvgL 从 8.8K 压到 1.8K、吞吐 7.5×,KD 捞回 teacher 约 85% 收益;线上 ADSS +1.036%、ADVV +0.780%,延迟仅 +5.6%(原生 20K 是 +630%)。字节电商广告已全量。
2025 arXiv:2504.09627 生成式推荐 · 显式慢思考 TIGER +19.5%
STREAM-Rec:给生成式推荐器装上一段可训练的思考过程
Slow Thinking for Sequential Recommendation · Zhang, Zhang, Sun, Lu, Zhao, Chen, Wen · RUC GSAI + 腾讯微信
沿用 TIGER 的 encoder-decoder + RQ-VAE SID 骨架,让 decoder 在吐 target SID 之前先自回归生成 l 个 reasoning token。三阶段训练:Pretrain(拼相似 item token 撑长度)→ SFT(用迭代残差量化合成 CoT + DPO 对照 direct decoder)→ RL(GRPO + 4 种 reward)。Amazon Instrument 相对 TIGER,R@5 +19.5%,N@5 +21.4%。恰好是 LARES 的显式版孪生兄弟。
2025 arXiv 2505.16865 序列推荐 · 潜在推理 Test-Time Scaling
LARES:让序列推荐器在 latent 空间里"多想几步"
Latent Reasoning for Sequential Recommendation · RUC GSAI + Meituan
把 test-time compute scaling 搬进推荐:pre-block A 编码历史,core-block C 在 latent 空间循环 K 次做"思考",参数量不变但深度可变。两阶段训练:SPT(Rec + 轨迹级 TLA + 步级 SLA 三个 InfoNCE)稳住 latent 语义;RPT 用 GRPO + NDCG/Recall 直接当奖励,进一步逼近排序目标。4 个 Amazon 子集、5 类 backbone 全面刷点,且推理成本可控。
2026 arXiv 2602.22732 生成式推荐 · 广告系统 快手广告 收入 +4.2%
GR4AD:为大规模广告系统量身设计的生成式推荐器
Generative Recommendation for Large-Scale Advertising · Peng Jiang, Kun Gai et al. · Kuaishou Technology
把 GR 搬到广告会撞上 token 化 / 学习范式 / 实时服务三堵墙。GR4AD 给四件套答案:UA-SID(MLLM 微调 + 多粒度多分辨率 RQ-Kmeans,碰撞率 85%→18%)、LazyAR(前 K 层并行 + 跨 beam 共享,QPS 翻倍)、VSL+RSPO(list-wise RL,可证为 NDCG 上界)、DBS(动态 beam serving)。快手广告全量上线,A/B 收入 +4.2%,转化率 +10.17%。
2026 KDD 2026 · arXiv 2603.02730 生成式推荐 · 训练-推理对齐 微信 pCTR +0.9%
APAO:把 Beam Search 的剪枝压力提前灌进训练里
Adaptive Prefix-Aware Optimization for Generative Recommendation · Yu, Wang, Ma, Guo, Zhang · 清华 DCST/AIR · 鹊承实验室
生成式推荐用 CE 训练 + beam search 推理,但 CE 假设前缀永远正确,beam search 却步步剪枝。APAO 把每个前缀必须存活的约束写成 prefix-aware loss(pointwise + pairwise),并用自适应权重聚焦最薄弱的前缀。4 数据集 + TIGER/Llama 双 backbone 全面打赢 S-DPO/DMPO,微信公众号 A/B pCTR +0.9%。
2025 arXiv:2507.21117 LLM4Rec 综述 系统性分类
LLM4Rec 综述:用 LLM 系统性破解推荐系统的九大顽疾
A Comprehensive Review on Harnessing Large Language Models to Overcome Recommender System Challenges · Raja, Vats, Vats, Majumder · LinkedIn / Meta / Amazon / CMU / Stanford
2025 年的 LLM4Rec 综述,作者来自工业一线。它不是简单罗列论文,而是把推荐系统的所有痛点按"数据/建模/评估/隐私"四类分层归类,对每个子问题给出具体的 LLM 解法(含公式、prompt 模板、真实工业案例)。涵盖冷启动、稀疏、噪声、漂移、多模态、可扩展性、长尾、线上线下不一致、合规审计——一张完整的"挑战 × LLM 方案"对照表。
2020 arXiv:2001.08361 Scaling Laws Power Law
Scaling Laws:语言模型的幂律缩放规律
Scaling Laws for Neural Language Models · Kaplan, McCandlish, Henighan, Brown, Chess, Child, Gray, Radford, Wu, Amodei · OpenAI
Loss 随模型参数量、数据量、计算量呈幂律下降,跨越七个数量级仍然成立。模型形状(宽度/深度)对 loss 几乎无影响。给定固定算力,最优策略是训练非常大的模型、用相对少的数据、在远未收敛时停止——这一发现重塑了整个大模型领域的资源分配策略。
2024 ICML 2024 · arXiv 2401.01335 LLM 自对齐 Self-Play Fine-Tuning
SPIN:让弱语言模型通过自我博弈变强
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models · Chen*, Deng*, Yuan* et al. · UCLA
SFT 后继续训练无收益?SPIN 用自博弈机制打破瓶颈:旧模型生成假回答作为 rejected,人类回答作为 chosen,新模型学习区分真假。仅用 50k SFT 数据(无额外偏好标注)迭代 3 轮,平均得分从 58.14→63.16(+5.02%),超越 DPO+62k GPT-4 偏好数据。理论保证:当 pθ=pdata 时全局最优且自然收敛。
2025 arXiv 2506.08007 RL 预训练 Next-Token Reasoning
Reinforcement Pre-Training (RPT):将 NTP 重构为 Reasoning Task
Reinforcement Pre-Training · Qingxiu Dong, Li Dong et al. · Microsoft Research + PKU + THU
将 next-token prediction 重构为 reasoning task,用 RL + 可验证 reward 实现通用预训练。14B 模型匹配 32B 性能,幂律 scaling curves R²>0.98。Continual NTP 训练摧毁推理能力(51.2→10.7),RPT 提供 +5.1pp 更高起点。
2026 SIGIR 2026 SID × 排序 · 快手搜索 长播率 +0.664%
SID-Coord:协调语义 ID 与哈希 ID 的短视频搜索排序
多分辨率 SID 融合 + 流行度感知门控 + 兴趣对齐 · 快手搜索 · 端到端可训练
快手提出的轻量级 SID 框架,将语义 ID 作为可训练的结构化标识符而非静态特征。三大创新:(I) 多分辨率融合捕获粗细粒度语义;(II) 目标感知门控自适应平衡 HID 记忆与 SID 泛化;(III) 兴趣对齐建模用户历史相似性。4.5B 训练样本在线 A/B:搜索长播率 +0.664%,播放时长 +0.369%,延迟增加仅 +0.005%。
📖 深度讲解 Semantic ID 基础 RQ-VAE · 协同信号 · 工程实践
Semantic ID 完全手册:生产 · 训练 · 协同信号注入
从头讲清楚 SID 的生产过程、训练机制,以及如何注入协同过滤信号 · 含完整数学推导与工程细节
系统性讲解 Semantic ID 全链路:RQ-VAE 量化原理(EMA Codebook 更新、Codebook Collapse 及 EMA/随机重置修复)、Residual 量化层级设计、SID 如何用于生成式推荐训练(Next-Token Prediction Loss)、协同信号注入方案(CF Debias / 对比对齐)、工业落地关键参数选型。是阅读 TIGER/OneRec/DAS 等论文的必备背景知识。
2025 WWW'26 · arXiv 2506.16114 GFlowNet 微调 淘宝全量 +0.43%
GFlowGR:用 GFlowNet 为生成式推荐提供 Token 级监督微调
GFlowGR: Fine-tuning Generative Recommendation Frameworks with Generative Flow Networks · 香港城市大学 + 阿里巴巴
将 GR 形式化为多步生成问题,用 GFlowNet 的 flow-matching 机制提供 token 级别监督(SFT/DPO/GRPO 只做 item 级)。三大模块:轨迹采样器(4 种策略含 CM-based Curriculum)+ 多信号奖励模型(交互信号 + CM 预估分 + token 相似度)+ DB/TB 双 loss 变体。淘宝全量广告上线,1 亿+用户 A/B 总营收 +0.43%,非首页搜索 +1.11%,训练成本 SFT 的 2.1×。
2024 ICML 2024 · arXiv 2402.17152 万亿参数 Transformer Meta +12.4%
HSTU:万亿参数序列转换器,用户行为胜过文本
Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations · Meta AI
提出 HSTU(Hierarchical Sequential Transduction Unit)架构,用生成式范式统一推荐召回与排序。M-FALCON 推理引擎支持下,模型复杂度提升 285× 仍保持低延迟。Meta A/B 线上 +12.4%,首次证明 user action sequence 比 text token 更适合推荐模型 scaling。
2026 ACM '26 · arXiv 2604.12234 Chain-of-Attribute
UniRec:用 Chain-of-Attribute 弥合生成式与判别式推荐的表达力鸿沟
Bridging the Expressive Gap between Generative and Discriminative Recommendation via Chain-of-Attribute · Shopee
CoA 先预测粗粒度属性(类目、品牌等),再以属性为条件生成 SID,通过贝叶斯公式证明每步解码不确定性严格下降。Capacity-SID 扩容 + CDC 交叉解码器约束 + RFT/DPO 对齐。端到端 110ms,比传统多阶段流水线(266ms)快 60%。
2026 arXiv 2601.21770 快手电商 · 统一架构 GMV +14.7%
OneMall:一套架构,多种场景——快手电商端到端生成式推荐框架
OneMall: One Architecture, More Scenarios · Kuaishou E-Commerce
LLM Tokenizer 将商品属性压缩为语义 SID + Query-Former 用户行为压缩 + Sparse MoE Decoder 生成 + RL(DPO/GRPO)对齐。一套架构支撑首页推荐、猜你喜欢、购物车推荐三个场景,GMV 分别 +14.7%/+10.3%/+4.9%。
2026 arXiv 2603.02999 召回+排序统一 微信 +1.34%
OneRanker:用一个模型统一生成与排序的广告推荐新范式
Unified Generation and Ranking with One Model in Industrial Advertising Recommendation · Tencent WeiXin
在 HSTU 基础上将生成式召回和判别式排序统一到一个模型:生成召回输出候选列表,同时编码增强用户表示,再在同一模型内完成排序。微信频道广告全量上线,GMV-Normal +1.34%。
2025 arXiv 2508.20900 Lazy Decoder · Scaling Law 快手极速版 +0.741%
OneRec-V2:Lazy Decoder-Only 架构 + GBPO 强化学习
OneRec-V2 Technical Report · Kuaishou
Lazy Decoder-Only 架构计算效率提升 94%(FLOPs -94%,训练资源 -90%),首次在生成式推荐验证 Scaling Law(0.1B→8B)。GBPO 用真实用户反馈驱动 RL 替代 Reward Model 方案。快手主 Feed +0.467%,极速版 +0.741%。
📋 综述 Semantic ID × 排序 7篇工业论文 · DLRM 落地方案
SID 融入排序模型:工业实践综述与 DLRM 落地方案
Google · Meta × 2 · ByteDance · Alibaba · LinkedIn · 快手 · 7 篇论文横向对比 + 6 个落地 Idea + 推荐路线
系统梳理将 Semantic ID 引入 CTR/CVR 排序模型(DLRM 类)的 7 篇工业论文(SemID / Prefix-Ngram / SIDE / TRM / GPSD / LiGR / DAS),从特征接入方式、Embedding 参数化、训练目标扩充、冷启动处理四个维度横向对比,并面向 DLRM 架构提炼 6 个可直接落地的工程 Idea(从 Embedding 替换到 CF Debias + 多视角对比对齐)。
2025 KDD 2025 · arXiv 2502.03417 排序 Scaling Semantic ID LinkedIn DAU +0.27%
LiGR:用 7 个特征超越数百特征,LinkedIn 生成式排序的工业实践
From Features to Transformers: Redefining Ranking for Scalable Impact · Fedor Borisyuk et al. · LinkedIn · KDD 2025
LiGR 将 HSTU 风格生成式推荐引入 LinkedIn Feed 排序,7 个特征超越数百特征的 DLRM 基线;Gated skip-connection 解决大模型训练稳定性;Setwise Attention 替代规则多样性;SID concat pooling 将参数量从 5.4B→1.3B;生产 A/B:DAU +0.27%,Feed 时长 +0.28%。
2025 arXiv 2509.03236 端到端生成式搜索 快手 CTR +1.67%
OneSearch:第一个工业部署的电商搜索端到端生成式框架
OneSearch: A Unified End-to-End Generative Framework for E-commerce Search · 快手电商搜索团队
RQ-OPQ 混合量化(层次语义+独特属性残差)+ 三视图用户行为序列注入(User ID / 显式短序列 / 隐式长序列 QFormer 压缩)+ 三阶段 SFT(语义对齐→共现同步→个性化)+ 自适应奖励 DPO,将 MCA 召回-精排统一为单一 BART encoder-decoder,快手商城 A/B:商品 CTR +1.67%、订单量 +3.22%、OPEX -75.40%、MFU 3.26%→27.32%。
2025 arXiv 2508.10584 双对齐 SID 快手 eCPM +3.48%
DAS:一阶段双对齐 Semantic ID,解决协同信号缺失的快手广告落地
DAS: Dual-Aligned Semantic IDs Empowered Industrial Recommender System · 快手广告算法团队
传统两阶段 SID 对齐(先 CF 后量化)存在信息损失;DAS 一阶段联合优化 UISM(双侧 RQ-VAE)+ ICDM(CF 去偏)+ MDAM(三种多视图对比对齐),四类特征接入判别式和生成式 RS,快手 4 亿日活 A/B:eCPM +3.48%,冷启动 +8.98%。
2025 arXiv 2504.02137 排序 Scaling Prefix-Ngram SID Meta 广告
Prefix-Ngram SID:Meta 广告排序的层次化语义 ID 工业实践
Semantic IDs for Large-Scale Recommendation Systems · Meta Ads
Meta 在广告排序系统中将 RQ-VAE 生成的 SID 以 Prefix-Ngram 方式展开为层次化稀疏特征,并接入 DLRM 嵌入表;提出 FLOPs 正则化防止 codebook 坍缩,实现冷启动提升和整体 CTR 正向增益,工业部署简洁高效。
2025 arXiv 2506.16698 排序 SID 扩展 SIDE Meta Instagram
SIDE:Meta 将 SID 推广到全排序栈,序列 + 交叉特征全覆盖
Scaling Item Representations via Semantic IDs · Meta Instagram
在 Prefix-Ngram 基础上,SIDE 将 SID 进一步扩展为序列历史特征(用户历史 SID 序列)和交叉计数特征(候选 SID 与历史序列匹配数),覆盖 CTR/CVR 排序全链路,Meta Instagram 生产验证整体正向,显著改善冷启动场景。
2026 arXiv 2601.22694 排序 Scaling Semantic Token
TRM:用语义 Token 替代 Item ID,解锁大排序模型的扩展潜力
Farewell to Item IDs: Unlocking the Scaling Potential of Large Ranking Models via Semantic Tokens · Zhao et al. · ByteDance
Item ID 是孤立符号,难以共享知识且制约 scaling;TRM 提出协同感知表示 + 混合 Tokenization(Gen+Mem)+ 判别式生成式联合训练,线上搜索 CTR AUC +0.65%、稀疏参数减少 33%,scaling law 特性显著改善。
2025.07 arXiv 2507.22224 框架&消融 Semantic ID
GRID:生成式推荐 Semantic ID 实践手册(Snap 开源框架)
Generative Recommendation with Semantic IDs: A Practitioner's Handbook · Snap Inc.
对生成式推荐中 SID 使用方式进行大规模消融研究的实践指南。关键发现:RK-Means(Residual K-Means)量化方案通常优于 RQ-VAE;Encoder-Decoder 架构优于 Decoder-only;同时公开了完整可复现代码框架,便于研究者快速实验不同组合。
2025 SIGIR 2025 · arXiv 2504.04400 多 Tokenizer 预训练 Semantic ID
MTGRec:多标识符 Item Tokenization + 课程学习预训练
Pre-training Generative Recommender with Multi-Identifier Item Tokenization · Zheng, Liu et al. · RUC + Huawei
现有生成式推荐 one-to-one tokenization 导致长尾 token 曝光不足、数据多样性差。MTGRec 从 RQ-VAE 训练过程取相邻 epoch 的多个 checkpoint 作为语义相关的多个 tokenizer,将单条用户序列扩增为多组 token 序列用于预训练。引入基于一阶梯度近似的数据影响力估计,动态调整各 tokenizer 数据的采样概率(课程学习)。微调时固定单一 tokenizer 保证 item 可识别。Amazon 三数据集超越 TIGER/LETTER/TIGER++,在长尾 item 改善尤其显著。
2025 SIGIR 2025 · arXiv 2409.05546 端到端 Tokenizer Semantic ID
ETEGRec:端到端联合优化 Item Tokenizer 与生成式推荐器
Generative Recommender with End-to-End Learnable Item Tokenization · Liu, Zheng et al. · RUC + Kuaishou
现有方法将 Item Tokenizer(RQ-VAE)与生成推荐器解耦训练,导致 tokenizer 无法感知推荐目标。ETEGRec 提出双 Encoder-Decoder 架构:tokenizer 和 recommender 各自一套 Enc-Dec,通过序列-物品对齐(KL 散度拉近编码器输出与物品 token 分布)和偏好-语义对齐(InfoNCE 拉近 decoder 隐态与重建物品语义)实现联合优化,并引入交替训练保证稳定性。Amazon 三数据集全面超越 TIGER/LETTER。
2025.03 arXiv 2503.02453 稀疏-稠密级联 Semantic ID 百度广告 +3.60%
COBRA:级联稀疏-稠密表示,统一生成式与稠密检索
Sparse Meets Dense: Unified Generative Recommendations with Cascaded Sparse-Dense Representations · Yang, Ji et al. · Baidu
现有生成式推荐(如 TIGER)仅用离散 SID,信息损失大;COBRA 提出级联表示:先自回归生成 SID(粗粒度),再以 SID 为条件生成稠密向量(细粒度),两者拼接作为序列输入。推理时 BeamFusion 融合 Beam 分数与 ANN 相似度分数。百度广告平台亿级用户 A/B:转化率 +3.60%,ARPU +4.15%。
2025.02 arXiv 2502.18965 端到端生成 Semantic ID 快手线上 +1.68%
OneRec:用统一生成模型替代多级漏斗,快手主场景落地
Unifying Retrieve and Rank with Generative Recommender and Preference Alignment · Deng et al. · Kuaishou
首个工业级单阶段生成推荐系统,用 Encoder-Decoder + MoE 替代三级漏斗(召回→粗排→精排)。创新点:① Balanced K-Means 残差量化解决 hourglass 现象;② Session-wise 生成(一次输出整批视频)替代逐 item 预测;③ Iterative Preference Alignment (IPA) 结合 DPO 从奖励模型自动构造偏好对。快手主页 A/B:总观看时长 +1.68%,人均观看时长 +6.56%。
2026.06 arXiv 2606.06260 生成式推荐 CoT × Reasoning Kuaishou 落地
OneReason:让生成式推荐真正"先思考再回答"
OneReason Technical Report · Kuaishou OneRec Team
解决 OneRec 系列 thinking ≤ non-thinking 的反常现象。借鉴 MLLM 诊断把根因归到 Perception × Cognition 双支柱:① Pre-training 四粒度数据(Token / Item / Relational / User)强化 itemic-text 对齐;② SFT 用 R0→R1→R2→R3 四层认知 CoT;③ RL 走 Specialize-then-Unify 先单域专精再跨域统一蒸馏。结果 thinking mode 首次稳定超越 non-thinking,并发现 CoT 监督会渗透到 non-thinking 推理。开源 OneReason-8B / 0.8B。
2025.06 arXiv 2506.13695 工程化演进 Semantic ID OPEX 10.6%
OneRec Technical Report:补齐工程体系、RL 与成本收益
OneRec Technical Report · Kuaishou
2506 技术报告把 2502 原论文中的工程细节完整展开:多模态 tokenizer(caption / OCR / ASR / 图像帧 + QFormer + RQ-Kmeans)、静态/短期/正反馈/终身四路 Encoder、P-Score/Format/Industrial Reward、ECPO 强化学习,以及 25% QPS 承接和 OPEX 仅为传统 pipeline 10.6% 的工业落地结果。
2023/2024 arXiv 2306.08121 Semantic ID 排序
SemID:将 Semantic ID 带入 YouTube 亿级排序模型
Better Generalization with Semantic IDs · Singh, Vu et al. · Google DeepMind
随机哈希 video ID 制约长尾和冷启动泛化;SemID 提出 N-gram 和 SPM 两种子词 embedding 方案,在 YouTube ~1 亿视频语料上验证 SPM-SID 同时超越随机哈希基线的整体 CTR AUC 和冷启动 CTR/1D AUC,serving cost 不增加。
2023 NeurIPS 2023 · arXiv 2305.05065 生成式推荐 Semantic ID
TIGER:用生成式检索重构推荐系统召回阶段
Recommender Systems with Generative Retrieval · Rajput, Mehta et al. · Google DeepMind
首次将生成式检索(Generative Retrieval)引入推荐系统:用 RQ-VAE 为 item 生成层级 Semantic ID,Transformer Encoder-Decoder 自回归预测下一个 item 的 Semantic ID。在 Amazon 三数据集全面超越 SASRec/BERT4Rec,原生支持冷启动和多样性调节。
2025 WWW Companion '25 电商生成式检索 京东
GRAM:LLM 共享文本编码 + 双对齐,电商一体化检索预排序
Generative Retrieval and Alignment Model: A New Paradigm for E-commerce Retrieval · JD.com
京东提出的电商生成式检索框架,利用 LLM 共享文本编码实现 query 和 item 在同一语义空间表示,双对齐机制(语义对齐+协同对齐)提升检索精度,统一检索与预排序。
2024.11 arXiv 2411.18814 生成式 + 稠密混合
LIGER:融合生成式与稠密检索的序列推荐
Unifying Generative and Dense Retrieval for Sequential Recommendation · Meta AI
分析 TIGER(生成式)与 Dense Retrieval 的性能差距和冷启动问题,提出 LIGER 混合方案:共用 SID 输入,Decoder 预测 SID,Encoder 输出 dense embedding;推理时生成式召回 K 个候选 + 补入冷启动 item,用 dense embedding 重排。四数据集取得生成式/稠密最优折中。
2025 KDD 2026 · arXiv 2512.00968 搜索相关性 × RL LLM 推理 小红书搜索
小红书 RL 搜索相关性:SAM+GRPO 工业级方案
Optimizing Generative Ranking Relevance via Reinforcement Learning in Xiaohongshu Search · 小红书 + 北邮
过程监督 RL 比 SFT 更高效地训练搜索相关性推理。小红书搜索团队提出 SAM(Self-Adaptive Margin)奖励 + GRPO 强化学习框架,工业级部署验证过程监督 RL 在搜索相关性排序上的优势。
2025 Under Review · arXiv 待发 生成式推荐 · 功能角色推理 LLM 增强 · 反事实推理 快手+北航 · 订单 +7.3%
RoleGen:唤醒沉默用户,用功能角色推理 + 反事实推断打破自我强化循环
Awakening Dormant Users: Generative Recommendation with Counterfactual Functional Role Reasoning · 快手+北航
沉默用户(30天无购买,但占DAU 40%+)数据极稀疏,传统方法只建模单步固有价值,忽视物品的工具性效应(某些物品虽不转化,但能触发意图转变推动后续购买)。RoleGen 提出功能角色轨迹(Functional Role Trajectory)抽象用户意图演化,LLM-based Reasoner 通过 FR-CoT 推理 + 反事实干预(do(r'=替代角色))探索多样化转化路径,Generative Backbone 将语义预测 grounded 到协同信号,闭环 Reasoning→Execution→Feedback→Reflection。快手 700M MAU:离线 Recall@1 +6.2%,在线订单 +7.3%,缓解马太效应(长尾物品曝光 Ratio 达 2.2)。
2025 arXiv 2510.11639 CoT 推理 · GR 停留时长 +0.159%
OneRec-Think:把 CoT 推理引入生成式推荐,显式文本推理框架
ONEREC-THINK: In-Text Reasoning for Generative Recommendation · Kuaishou
三阶段设计:Itemic Alignment(对齐商品语义空间)→ Reasoning Activation(激活 CoT 推理能力)→ Reasoning Enhancement(偏好对齐强化推理质量)。Think-Ahead 部署架构解耦思考与推荐延迟。快手 APP 线上停留时长 +0.159%。
2026 arXiv 2602.12612 LLM Agent · 自进化
Self-EvolveRec:LLM 驱动方向性反馈的自进化推荐系统
Self-Evolving Recommender Systems with LLM-based Directional Feedback · KAIST
User Simulator + Model Diagnosis Tool 提供定量+定性双重诊断反馈,LLM Researcher 解析反馈生成 arXiv 检索查询 → 组织开发报告 → Coder 实现代码修改。四阶段全自动进化流水线,全面超越传统 AutoML baseline。
2026 arXiv 2602.10226 LLM Agent · 自动化 ML YouTube 生产
Self-Evolving Recommendation System:端到端自主模型优化
End-To-End Autonomous Model Optimization With LLM Agents · Google / YouTube
首个在工业规模推荐系统中部署的 LLM Agent 自进化框架:Offline Agent(高频内循环,三类 Persona 五阶段 DAG)+ Online Agent(低频外循环,A/B 验证反馈)。YouTube 生产环境实现显著北极星指标提升。
2025 arXiv 2508.12365 电商相关性 KDD 2026 · 淘宝
TaoSR1:电商搜索相关性的 Thinking 模型
TaoSR1: The Thinking Model for E-commerce Relevance Search · Taobao & Tmall Group, Alibaba
三阶段优化框架:RAG-CoT SFT(先答后思规避错误累积)→ Pass@N DPO(可解决样本自纠正 + 困难样本 DeepSeek-R1 Oracle 引导)→ 难度感知 GRPO(标签均衡 + 有效难度范围采样)。CumPT 单参数分层部署,彻底消除传统 4 超参敏感性。淘宝 A/B:Macro F1 +4.9pt,平替 Query GSB +34.43%,IPV +2.43%。
2026 arXiv 2603.24958 流式数据集蒸馏 · 快手+中科大
DIET:用 1-2% 数据复现全量训练效果,推荐系统模型迭代成本降低 60×
DIET: Learning to Distill Dataset Continually for Recommender Systems · Jiaqing Zhang, Hao Wang et al. · 中科大 + 快手 · arXiv 2026.03
将「数据集蒸馏」引入持续学习推荐场景,维护一个随流式数据持续演化的紧凑合成记忆集(仅 1-2% 数据量)。Phase 1 用 label-conditioned EL2N 选出决策边界样本,融合历史对齐记忆;Phase 2 通过影响力引导双向寻址 + bi-level 优化精细调整合成数据。下游架构只需在合成数据上热身 + 继承参考模型 embedding,无需访问全量历史,模型迭代成本最多降低 60×,跨架构泛化(DCN→WuKong/RankMixer)均有效。
2025 KDD 2025 · arXiv 2506.03699 排序 Scaling 生成预训练 阿里 AliExpress
GPSD:生成式预训练 + 稀疏参数冻结,解锁 Transformer 判别排序 Scaling Law
Scaling Transformers for Discriminative Recommendation via Generative Pretraining · Qijiong Liu et al. · Alibaba / AliExpress · KDD 2025
判别推荐模型存在单轮次/轮次内双过拟合,制约 Scaling;GPSD 用生成预训练稀疏参数初始化判别模型后冻结(ST&SF),使密集参数从 13K 扩展到 0.3B 时遵循幂律 Scaling,跨架构(HSTU/Wukong)均有效,AliExpress 生产 CTR/CVR 双提升。
2026 arXiv 2604.00590 · 快手 排序 Scaling · 统一架构
UniMixer:统一 Attention / TokenMixer / FM 三大 Scaling 架构
UniMixer: A Unified Architecture for Scaling Laws in Recommendation Systems · Kuaishou Technology
通过 TokenMixer 等价参数化将推荐系统三大 Scaling 范式统一到一个理论框架;UniMixer-Lite 参数效率最优,Scaling 指数(0.1419)高于 RankMixer(0.1160);SiameseNorm 解决深度退化,快手广告在线 CAD +15%。
📝 学习笔记 2025 技术前沿 Forge · ROLL · Seer · slime
Agentic RL 时代的 Infra 重构:以 Forge、ROLL、Seer、slime 为例
Meta / 阿里 / Moonshot / 清华 · 权重同步 · 训推分离 · 异步流水线 · 长尾 Rollout
从「单机跑 PPO」到「千卡异步 Agent 训练」的工程演进。剖析四支团队在 Agentic RL Infra 上的核心设计:Forge(Meta)的 Actor-Rollout 异步解耦;ROLL(阿里)的统一编程接口与权重同步无缝切换;Seer(Moonshot)的流式 Rollout 与 KV Cache 迁移;slime(清华)的参数服务器 + 异步采样。四大核心问题(权重同步、训推分离、长尾 Rollout、异步流水线)的工程解法对比。
📝 学习笔记 2025 技术前沿 MMR · APD · DPP · RL4CTE
多样性 & 端到端重排方法脉络:MMR → APD → Calibrated → DPP → RL4CTE
推荐系统多样性重排五大方法 · 每篇均含推荐链路定位 + 逐步数值实例 · 含 MDP 建模与 REINFORCE 训练全流程
系统梳理推荐系统多样性重排五大方法:MMR(贪心相关性-冗余权衡)、APD(Thompson Sampling + 次模重排 + 个性化类目权重)、Calibrated Recommendations(KL 散度对齐历史兴趣分布)、Fast DPP(行列式体积 · Cholesky 贪心)、RL4CTE(CTE 长期优化 · MDP · REINFORCE + Sampled Baseline · SE 仿真环境)。每篇均有完整推荐系统实例与逐步数值计算,深入解析 RL4CTE 的 on-policy 训练机制、多轨迹采样与 GRPO 的类比。
2025 技术前沿
On-Policy Distillation(OPD)完全指南
On-Policy Cross-Stage Distillation · Forward KL vs Reverse KL · 工业界实践
系统讲解 OPD 解决的核心问题(RL 阶段灾难性遗忘)及算法流程,深入 Forward KL vs Reverse KL 两种蒸馏方向的数学本质与行为差异。涵盖 Qwen3 / GLM-5 / MiMo / DeepSeek V4 的工业界 OPD 实践对比。
📝 学习笔记 2025 技术前沿 GLM-5 / MiniMax M2 / Kimi K2.5
Agentic 能力从哪里来?拆解基座大模型的训练过程
以 GLM-5 为主线,系统梳理 Pre-Training → Mid-Training → SFT → 多阶段 RL → On-Policy Cross-Stage 蒸馏完整链路
完整还原现代基座大模型的训练流水线:28.5T tokens 预训练数据配比;Mid-Training 逐步扩展至 200K 上下文;SFT 三种 thinking 模式(Interleaved/Preserved/Turn-level);Reasoning RL + Agentic RL(SWE/Search/Terminal)+ General RL 混合奖励;On-Policy Cross-Stage Distillation 防止灾难性遗忘;Agentic 数据合成六步流水线;训推不一致(IcePop)、异步框架 off-policy 问题;Kimi K2.5 Agent Swarm(可训练 orchestrator + 冻结 subagents,延迟降低 4.5×)。
🔧 Agent 工程 2026 新概念 AGENTS.md Generator-Evaluator
Harness Engineering:让 AI Agent 不再犯同一个错误
Mitchell Hashimoto 命名 · OpenAI / Anthropic / Martin Fowler 相继跟进 · 2026 年 2 月爆火
核心思想:每次发现 Agent 犯错,就工程化一个解决方案让它永远不再犯。两种形式:AGENTS.md 错误记录文件 + 专用验证脚本工具。深度解析 Anthropic 三 Agent 架构(Planner + Generator + Evaluator),Sprint 合同机制,Playwright MCP 实时点击验证,以及与 Context Engineering 的关系。
🤖 AI 系统 Agent 技术 规划/记忆/工具
AI Agent 关键技术全景:规划 / 记忆 / 工具 / 反思 / 多 Agent
从「LLM 作为大脑」到自主完成复杂任务 · ReAct · RAG · MCP · Multi-Agent 协作 · 2025 现状
全面梳理 AI Agent 核心技术栈:规划(CoT/ToT/ReAct/Prompt Chaining);记忆(短期 Context Window、长期 RAG 向量数据库、结构化存储);工具调用(Function Calling/MCP/Computer Use);反思机制(Reflexion/Evaluator-Optimizer);多 Agent 协作(Orchestrator-Workers/Routing/Parallelization);以及 2025 年新技术 MCP 协议和 Computer Use 能力详解。附挑战与落地建议。
🔍 RAG Agent 技术 检索增强
RAG 检索增强生成:从离线向量化到在线检索全链路
Embedding · FAISS/HNSW · Dense/Sparse/Hybrid 检索 · Reranker · Chunking 策略 · 完整工程实践
完整的 RAG 技术链路:Embedding 模型原理与选型(BGE/text-embedding-3);五种 Chunking 策略对比(固定/重叠/语义/Parent-Child);IVF 和 HNSW 向量索引原理图解;Dense/Sparse/Hybrid 三种检索策略 + RRF 合并;Reranker 两阶段架构(Bi-Encoder vs Cross-Encoder);完整在线离线工程代码;进阶技巧 HyDE/Multi-Query/Self-RAG;RAGAS 评估框架。
🧠 推理 Agent 技术 ReAct / CoT
ReAct / Agent 推理框架:从 CoT 到 ReAct 到 Tree-of-Thought
CoT · ReAct 三原语 · Reflexion · Plan-Execute · ToT · 完整 Prompt 模板 · 框架选型
推理框架全景:CoT(Standard/Zero-Shot)的局限性分析;ReAct 的 Thought/Action/Observation 三原语 + 完整生产 Prompt 模板 + 代码循环实现;Reflexion 失败反思记忆;Plan-Execute 两阶段架构;LATS 蒙特卡洛树搜索;Tree-of-Thought 四组件(分解/生成/评估/搜索);六种框架对比选型表;工程实现(防止无限循环/上下文压缩/解析鲁棒性)。
🔧 工具调用 Agent 技术 MCP 协议
Function Calling & MCP:工具调用底层机制全解
JSON Schema 工具定义 · 并行调用 · 错误处理 · MCP 三层架构 · stdio/SSE Transport · 安全防御
工具调用完整技术栈:JSON Schema 工具定义规范与 Description 写法技巧;Function Calling 四轮对话全流程图解;并行工具调用(asyncio 并发执行);三种错误类型处理;MCP 协议定位(USB-C 类比);Host/Client/Server 三层架构图;MCP 三类能力(Tools/Resources/Prompts);stdio vs SSE Transport 对比;JSON-RPC 2.0 消息格式;Prompt Injection 防御机制;Function Calling vs MCP 选型建议。
🖥️ 硬件基础 背景知识 GPU 体系结构
GPU 硬件基础:CPU / GPU / 寄存器 / SRAM / HBM / PCIe 从零讲清楚
FlashAttention、KV Cache 量化等 LLM 优化论文的硬件基础 · 五层存储层级 · Warp & 内存墙 · A100 关键数字速查
从零搭建 GPU 硬件认知:五层存储层级(寄存器/SRAM/HBM/DRAM/SSD)的容量与带宽对比;SM/CUDA Core/Tensor Core 各自职责;Warp 是什么,warp divergence 为何让 RabitQ 慢 174 万倍;内存墙:312 TFLOPS 算力 vs 2 TB/s 带宽的差距;PCIe/NVLink 通信带宽与多 GPU 训练;以及「计算本身不消耗内存」的真正含义。
⚡ 推理优化 LLM 基础 推理效率
LLM 推理优化:KV Cache · vLLM · TurboQuant · Flash Attention
让大模型跑得更快、占更少内存的四项核心技术,每个都有具体数字 + 局限性分析
持续更新的推理优化笔记。KV Cache:为什么缓存 K/V 而不是 Q,MQA/GQA 如何压缩显存;vLLM/PagedAttention:分页虚拟内存消灭碎片,利用率 20%→90%+;TurboQuant:随机旋转 + 向量量化把 K/V 压到 2/4 bit;FlashAttention v1/v2/v3:Tiling + Online Softmax,HBM IO 从 O(N²) 降到 O(N),训练推理均可用。四项技术可同时叠加。
🎨 视觉生成 2025 技术前沿 完全新手向
视觉 Diffusion Model:从零开始完全图解
DDPM · Stable Diffusion · U-Net · Cross-Attention · CFG · Latent Diffusion
完全新手向Diffusion模型解读:前向扩散 → 逆向去噪 → U-Net → Cross-Attention → Latent Diffusion → CFG → DDPM/Stable Diffusion/DALL-E 2 演进史。
📝 学习笔记 LLM 基础 Tokenizer
LLM Tokenizer 方法总结:BPE / WordPiece / Unigram / SentencePiece
从字符到 Token 的完整演化路径,含每种方法的算法细节、对比与工业应用
覆盖 BPE(GPT 系列)、WordPiece(BERT)、Unigram LM(T5/XLNet)、SentencePiece(统一框架)、Byte-level BPE(GPT-2/LLaMA)、tiktoken 等主流方案。每种方法都有具体示例演示词表构建过程,并附 vocab size 选择、多语言处理、OOV 等工程实践经验。
📝 学习笔记 LLM 基础 强化学习
LLM 中的强化学习方法:RLHF / PPO / DPO / GRPO / RLAIF 全面解析
从 InstructGPT 到 DeepSeek-R1,覆盖 LLM 对齐训练的所有主流 RL 范式
从 MDP 基础讲起,详解 RLHF 三阶段,PPO 裁剪目标与 KL 惩罚,再到无需参考模型的 DPO/IPO,以及 GRPO(用于 CoT 推理的群体相对策略优化),全程结合真实例子,每个算法都有直觉理解 + 公式 + 例子三合一。附完整 PyTorch 代码示例。
📝 学习笔记 行业认知 大模型团队
大厂大模型部门:组织结构与技术栈全解析
预训练 / 后训练 / 推理效率 / 评估 / 多模态 / 应用 Agent,每个组在做什么
详细拆解工业级大模型团队的六大职能组:预训练组(Megatron/FlashAttention/Scaling Laws)、后训练对齐组(SFT/RLHF/DPO/GRPO/Red Teaming)、推理效率组(vLLM/量化/投机解码)、评估组、多模态组、应用 Agent 组。每组配有技术栈、日常工作案例和 KPI,并附 LLM × 推荐系统融合趋势分析。
🛠️ 工具框架 LLM 微调 LoRA / GRPO
LLaMA-Factory 完整解读:100+ 模型一站式微调框架
零代码 CLI + LLaMA Board GUI,覆盖预训练/SFT/DPO/RLHF/GRPO,单卡 6GB 可跑 7B QLoRA
LLaMA-Factory(ACL 2024,40k+ Stars)的完整解读。覆盖:支持的 100+ 模型系列(Qwen/Llama/DeepSeek/Gemma)、7 种训练方式 × 6 种微调方法矩阵、src/ 目录代码架构深度拆解(hparams/data/model/train/chat 各模块)、SFT/DPO/KTO/GRPO/PPO 训练器原理与 Loss 代码、Alpaca/ShareGPT/偏好数据格式规范、完整 YAML 配置字段详解 + CLI 速查表、vLLM 生产部署与 WebUI 使用。
📝 学习笔记 LLM 基础 推理引擎 / KV Cache
SGLang 深度解析:RadixAttention 与高效 LLM 推理
UC Berkeley LMSYS 出品,前缀 KV Cache 自动复用,比 vLLM 快 2~5×(有公共前缀场景)
从 KV Cache 基础讲起,重点解析 SGLang 的核心创新 RadixAttention(Radix Tree 自动前缀复用,引用计数+LRU 淘汰)。覆盖 Continuous Batching、Chunked Prefill、fork/join 并行编程原语、约束生成(JSON Schema/Regex)、多 GPU TP 部署、量化(FP8/AWQ/GPTQ)、投机解码(Speculative Decoding/Eagle-2)。含 SGLang vs vLLM 性能对比图和场景选型指南。
📝 学习笔记 LLM 基础 RL 后训练 / 强化学习
slime 深度解析:大规模 LLM 强化学习训练框架
清华 THUDM 出品,SGLang-native RL 框架,GLM-5 全系列背后引擎,支持 744B+ MoE
从 RL 后训练工程难题讲起,深度解析 slime 的三大模块:Megatron-LM 训练引擎、SGLang Rollout、Data Buffer 解耦设计。覆盖全异步训练模式(GPU 利用率 ~85%)、Colocate 分时复用、逐层权重同步机制。算法侧对比 PPO / GRPO / REINFORCE++ / GSPO / OPD,含完整数学公式推导和 KL 估计器三种实现。附完整 YAML 配置详解、自定义奖励函数接口、框架选型对比(verl / OpenRLHF / TRL / NeMo)。
📝 学习笔记 LLM 基础 ZeRO / 3D 并行
DeepSpeed 完全图解:ZeRO / 3D 并行 / Offload 从零讲清楚
微软开源的大模型训练加速库,从「显存被谁吃了」讲到 ZeRO-1/2/3、Offload、Infinity、3D 并行
完全新手向 DeepSpeed 解读。先把「训练显存到底花在哪儿」算清楚(参数+梯度+优化器=16 字节/参数),再讲 ZeRO 三档怎么逐级切:ZeRO-1 切优化器、ZeRO-2 加切梯度、ZeRO-3 连参数也切。配 GPU 内存分布图、4 卡示意、显存计算举例(1B/7B/13B 实算)。ZeRO-Offload 把状态甩 CPU、Infinity 甩 NVMe、3D 并行 DP×TP×PP(含 BLOOM-176B 实例)、混合精度 FP16/BF16、Gradient Checkpointing。附实战 ds_config.json + 选型速查表 + 7 个常见坑。
📝 学习笔记 LLM 基础 训练流水线
大模型完整训练流水线:预训练 → SFT → RLHF 深度解析
一篇讲清楚「大模型从随机初始化到会聊天的 AI」的完整教程
专门深挖 SFT 和 RLHF 的本质。SFT:监督微调的损失函数只计算回答部分,质量远比数量重要;RLHF:奖励模型从偏好排序中训练,PPO 四个模型同时运行,KL 惩罚防止 Reward Hacking。附 DPO/GRPO 与 PPO 的对比,以及 RLHF 训练崩溃的常见原因和调参建议。
📐 数学原理 LLM 基础 数学工具
LLM 背后的数学原理:Sigmoid · MLE · KL 散度 · 交叉熵 · Softmax
理解 LLM 训练中反复出现的数学工具,每个都有完整推导 + 直觉
持续更新的数学笔记。覆盖:Sigmoid 等价变形、Bradley-Terry 损失梯度分析、MLE 直觉与 NLL 损失推导、KL 散度编码代价解释与 RLHF 中的作用、交叉熵=信息熵+KL 三者统一视角、Softmax 温度系数与 top-k/top-p 采样策略。

📝 学习笔记

LLM 基础技术 · Agent 技术 · 推荐系统背景知识
📝 学习笔记 2025 技术前沿 Forge · ROLL · Seer · slime
Agentic RL 时代的 Infra 重构:以 Forge、ROLL、Seer、slime 为例
Meta / 阿里 / Moonshot / 清华 · 权重同步 · 训推分离 · 异步流水线 · 长尾 Rollout
从「单机跑 PPO」到「千卡异步 Agent 训练」的工程演进。剖析四支团队在 Agentic RL Infra 上的核心设计:Forge(Meta)的 Actor-Rollout 异步解耦;ROLL(阿里)的统一编程接口与权重同步无缝切换;Seer(Moonshot)的流式 Rollout 与 KV Cache 迁移;slime(清华)的参数服务器 + 异步采样。四大核心问题(权重同步、训推分离、长尾 Rollout、异步流水线)的工程解法对比。
📝 学习笔记 2025 技术前沿 MMR · APD · DPP · RL4CTE
多样性 & 端到端重排方法脉络:MMR → APD → Calibrated → DPP → RL4CTE
推荐系统多样性重排五大方法 · 每篇均含推荐链路定位 + 逐步数值实例 · 含 MDP 建模与 REINFORCE 训练全流程
系统梳理推荐系统多样性重排五大方法:MMR(贪心相关性-冗余权衡)、APD(Thompson Sampling + 次模重排 + 个性化类目权重)、Calibrated Recommendations(KL 散度对齐历史兴趣分布)、Fast DPP(行列式体积 · Cholesky 贪心)、RL4CTE(CTE 长期优化 · MDP · REINFORCE + Sampled Baseline · SE 仿真环境)。每篇均有完整推荐系统实例与逐步数值计算,深入解析 RL4CTE 的 on-policy 训练机制、多轨迹采样与 GRPO 的类比。
2025 技术前沿
On-Policy Distillation(OPD)完全指南
On-Policy Cross-Stage Distillation · Forward KL vs Reverse KL · 工业界实践
系统讲解 OPD 解决的核心问题(RL 阶段灾难性遗忘)及算法流程,深入 Forward KL vs Reverse KL 两种蒸馏方向的数学本质与行为差异。涵盖 Qwen3 / GLM-5 / MiMo / DeepSeek V4 的工业界 OPD 实践对比。
📝 学习笔记 2025 技术前沿 GLM-5 / MiniMax M2 / Kimi K2.5
Agentic 能力从哪里来?拆解基座大模型的训练过程
以 GLM-5 为主线,系统梳理 Pre-Training → Mid-Training → SFT → 多阶段 RL → On-Policy Cross-Stage 蒸馏完整链路
完整还原现代基座大模型的训练流水线:28.5T tokens 预训练数据配比;Mid-Training 逐步扩展至 200K 上下文;SFT 三种 thinking 模式(Interleaved/Preserved/Turn-level);Reasoning RL + Agentic RL(SWE/Search/Terminal)+ General RL 混合奖励;On-Policy Cross-Stage Distillation 防止灾难性遗忘;Agentic 数据合成六步流水线;训推不一致(IcePop)、异步框架 off-policy 问题;Kimi K2.5 Agent Swarm(可训练 orchestrator + 冻结 subagents,延迟降低 4.5×)。
🔧 Agent 工程 2026 新概念 AGENTS.md Generator-Evaluator
Harness Engineering:让 AI Agent 不再犯同一个错误
Mitchell Hashimoto 命名 · OpenAI / Anthropic / Martin Fowler 相继跟进 · 2026 年 2 月爆火
核心思想:每次发现 Agent 犯错,就工程化一个解决方案让它永远不再犯。两种形式:AGENTS.md 错误记录文件 + 专用验证脚本工具。深度解析 Anthropic 三 Agent 架构(Planner + Generator + Evaluator),Sprint 合同机制,Playwright MCP 实时点击验证,以及与 Context Engineering 的关系。
🤖 AI 系统 Agent 技术 规划/记忆/工具
AI Agent 关键技术全景:规划 / 记忆 / 工具 / 反思 / 多 Agent
从「LLM 作为大脑」到自主完成复杂任务 · ReAct · RAG · MCP · Multi-Agent 协作 · 2025 现状
全面梳理 AI Agent 核心技术栈:规划(CoT/ToT/ReAct/Prompt Chaining);记忆(短期 Context Window、长期 RAG 向量数据库、结构化存储);工具调用(Function Calling/MCP/Computer Use);反思机制(Reflexion/Evaluator-Optimizer);多 Agent 协作(Orchestrator-Workers/Routing/Parallelization);以及 2025 年新技术 MCP 协议和 Computer Use 能力详解。附挑战与落地建议。
🔍 RAG Agent 技术 检索增强
RAG 检索增强生成:从离线向量化到在线检索全链路
Embedding · FAISS/HNSW · Dense/Sparse/Hybrid 检索 · Reranker · Chunking 策略 · 完整工程实践
完整的 RAG 技术链路:Embedding 模型原理与选型(BGE/text-embedding-3);五种 Chunking 策略对比(固定/重叠/语义/Parent-Child);IVF 和 HNSW 向量索引原理图解;Dense/Sparse/Hybrid 三种检索策略 + RRF 合并;Reranker 两阶段架构(Bi-Encoder vs Cross-Encoder);完整在线离线工程代码;进阶技巧 HyDE/Multi-Query/Self-RAG;RAGAS 评估框架。
🧠 推理 Agent 技术 ReAct / CoT
ReAct / Agent 推理框架:从 CoT 到 ReAct 到 Tree-of-Thought
CoT · ReAct 三原语 · Reflexion · Plan-Execute · ToT · 完整 Prompt 模板 · 框架选型
推理框架全景:CoT(Standard/Zero-Shot)的局限性分析;ReAct 的 Thought/Action/Observation 三原语 + 完整生产 Prompt 模板 + 代码循环实现;Reflexion 失败反思记忆;Plan-Execute 两阶段架构;LATS 蒙特卡洛树搜索;Tree-of-Thought 四组件(分解/生成/评估/搜索);六种框架对比选型表;工程实现(防止无限循环/上下文压缩/解析鲁棒性)。
🔧 工具调用 Agent 技术 MCP 协议
Function Calling & MCP:工具调用底层机制全解
JSON Schema 工具定义 · 并行调用 · 错误处理 · MCP 三层架构 · stdio/SSE Transport · 安全防御
工具调用完整技术栈:JSON Schema 工具定义规范与 Description 写法技巧;Function Calling 四轮对话全流程图解;并行工具调用(asyncio 并发执行);三种错误类型处理;MCP 协议定位(USB-C 类比);Host/Client/Server 三层架构图;MCP 三类能力(Tools/Resources/Prompts);stdio vs SSE Transport 对比;JSON-RPC 2.0 消息格式;Prompt Injection 防御机制;Function Calling vs MCP 选型建议。
🖥️ 硬件基础 背景知识 GPU 体系结构
GPU 硬件基础:CPU / GPU / 寄存器 / SRAM / HBM / PCIe 从零讲清楚
FlashAttention、KV Cache 量化等 LLM 优化论文的硬件基础 · 五层存储层级 · Warp & 内存墙 · A100 关键数字速查
从零搭建 GPU 硬件认知:五层存储层级(寄存器/SRAM/HBM/DRAM/SSD)的容量与带宽对比;SM/CUDA Core/Tensor Core 各自职责;Warp 是什么,warp divergence 为何让 RabitQ 慢 174 万倍;内存墙:312 TFLOPS 算力 vs 2 TB/s 带宽的差距;PCIe/NVLink 通信带宽与多 GPU 训练;以及「计算本身不消耗内存」的真正含义。
⚡ 推理优化 LLM 基础 推理效率
LLM 推理优化:KV Cache · vLLM · TurboQuant · Flash Attention
让大模型跑得更快、占更少内存的四项核心技术,每个都有具体数字 + 局限性分析
持续更新的推理优化笔记。KV Cache:为什么缓存 K/V 而不是 Q,MQA/GQA 如何压缩显存;vLLM/PagedAttention:分页虚拟内存消灭碎片,利用率 20%→90%+;TurboQuant:随机旋转 + 向量量化把 K/V 压到 2/4 bit;FlashAttention v1/v2/v3:Tiling + Online Softmax,HBM IO 从 O(N²) 降到 O(N),训练推理均可用。四项技术可同时叠加。
🎨 视觉生成 2025 技术前沿 完全新手向
视觉 Diffusion Model:从零开始完全图解
DDPM · Stable Diffusion · U-Net · Cross-Attention · CFG · Latent Diffusion
完全新手向Diffusion模型解读:前向扩散 → 逆向去噪 → U-Net → Cross-Attention → Latent Diffusion → CFG → DDPM/Stable Diffusion/DALL-E 2 演进史。
📝 学习笔记 LLM 基础 Tokenizer
LLM Tokenizer 方法总结:BPE / WordPiece / Unigram / SentencePiece
从字符到 Token 的完整演化路径,含每种方法的算法细节、对比与工业应用
覆盖 BPE(GPT 系列)、WordPiece(BERT)、Unigram LM(T5/XLNet)、SentencePiece(统一框架)、Byte-level BPE(GPT-2/LLaMA)、tiktoken 等主流方案。每种方法都有具体示例演示词表构建过程,并附 vocab size 选择、多语言处理、OOV 等工程实践经验。
📝 学习笔记 LLM 基础 强化学习
LLM 中的强化学习方法:RLHF / PPO / DPO / GRPO / RLAIF 全面解析
从 InstructGPT 到 DeepSeek-R1,覆盖 LLM 对齐训练的所有主流 RL 范式
从 MDP 基础讲起,详解 RLHF 三阶段,PPO 裁剪目标与 KL 惩罚,再到无需参考模型的 DPO/IPO,以及 GRPO(用于 CoT 推理的群体相对策略优化),全程结合真实例子,每个算法都有直觉理解 + 公式 + 例子三合一。附完整 PyTorch 代码示例。
📝 学习笔记 行业认知 大模型团队
大厂大模型部门:组织结构与技术栈全解析
预训练 / 后训练 / 推理效率 / 评估 / 多模态 / 应用 Agent,每个组在做什么
详细拆解工业级大模型团队的六大职能组:预训练组(Megatron/FlashAttention/Scaling Laws)、后训练对齐组(SFT/RLHF/DPO/GRPO/Red Teaming)、推理效率组(vLLM/量化/投机解码)、评估组、多模态组、应用 Agent 组。每组配有技术栈、日常工作案例和 KPI,并附 LLM × 推荐系统融合趋势分析。
🛠️ 工具框架 LLM 微调 LoRA / GRPO
LLaMA-Factory 完整解读:100+ 模型一站式微调框架
零代码 CLI + LLaMA Board GUI,覆盖预训练/SFT/DPO/RLHF/GRPO,单卡 6GB 可跑 7B QLoRA
LLaMA-Factory(ACL 2024,40k+ Stars)的完整解读。覆盖:支持的 100+ 模型系列(Qwen/Llama/DeepSeek/Gemma)、7 种训练方式 × 6 种微调方法矩阵、src/ 目录代码架构深度拆解(hparams/data/model/train/chat 各模块)、SFT/DPO/KTO/GRPO/PPO 训练器原理与 Loss 代码、Alpaca/ShareGPT/偏好数据格式规范、完整 YAML 配置字段详解 + CLI 速查表、vLLM 生产部署与 WebUI 使用。
📝 学习笔记 LLM 基础 推理引擎 / KV Cache
SGLang 深度解析:RadixAttention 与高效 LLM 推理
UC Berkeley LMSYS 出品,前缀 KV Cache 自动复用,比 vLLM 快 2~5×(有公共前缀场景)
从 KV Cache 基础讲起,重点解析 SGLang 的核心创新 RadixAttention(Radix Tree 自动前缀复用,引用计数+LRU 淘汰)。覆盖 Continuous Batching、Chunked Prefill、fork/join 并行编程原语、约束生成(JSON Schema/Regex)、多 GPU TP 部署、量化(FP8/AWQ/GPTQ)、投机解码(Speculative Decoding/Eagle-2)。含 SGLang vs vLLM 性能对比图和场景选型指南。
📝 学习笔记 LLM 基础 RL 后训练 / 强化学习
slime 深度解析:大规模 LLM 强化学习训练框架
清华 THUDM 出品,SGLang-native RL 框架,GLM-5 全系列背后引擎,支持 744B+ MoE
从 RL 后训练工程难题讲起,深度解析 slime 的三大模块:Megatron-LM 训练引擎、SGLang Rollout、Data Buffer 解耦设计。覆盖全异步训练模式(GPU 利用率 ~85%)、Colocate 分时复用、逐层权重同步机制。算法侧对比 PPO / GRPO / REINFORCE++ / GSPO / OPD,含完整数学公式推导和 KL 估计器三种实现。附完整 YAML 配置详解、自定义奖励函数接口、框架选型对比(verl / OpenRLHF / TRL / NeMo)。
📝 学习笔记 LLM 基础 ZeRO / 3D 并行
DeepSpeed 完全图解:ZeRO / 3D 并行 / Offload 从零讲清楚
微软开源的大模型训练加速库,从「显存被谁吃了」讲到 ZeRO-1/2/3、Offload、Infinity、3D 并行
完全新手向 DeepSpeed 解读。先把「训练显存到底花在哪儿」算清楚(参数+梯度+优化器=16 字节/参数),再讲 ZeRO 三档怎么逐级切:ZeRO-1 切优化器、ZeRO-2 加切梯度、ZeRO-3 连参数也切。配 GPU 内存分布图、4 卡示意、显存计算举例(1B/7B/13B 实算)。ZeRO-Offload 把状态甩 CPU、Infinity 甩 NVMe、3D 并行 DP×TP×PP(含 BLOOM-176B 实例)、混合精度 FP16/BF16、Gradient Checkpointing。附实战 ds_config.json + 选型速查表 + 7 个常见坑。
📝 学习笔记 LLM 基础 训练流水线
大模型完整训练流水线:预训练 → SFT → RLHF 深度解析
一篇讲清楚「大模型从随机初始化到会聊天的 AI」的完整教程
专门深挖 SFT 和 RLHF 的本质。SFT:监督微调的损失函数只计算回答部分,质量远比数量重要;RLHF:奖励模型从偏好排序中训练,PPO 四个模型同时运行,KL 惩罚防止 Reward Hacking。附 DPO/GRPO 与 PPO 的对比,以及 RLHF 训练崩溃的常见原因和调参建议。
📐 数学原理 LLM 基础 数学工具
LLM 背后的数学原理:Sigmoid · MLE · KL 散度 · 交叉熵 · Softmax
理解 LLM 训练中反复出现的数学工具,每个都有完整推导 + 直觉
持续更新的数学笔记。覆盖:Sigmoid 等价变形、Bradley-Terry 损失梯度分析、MLE 直觉与 NLL 损失推导、KL 散度编码代价解释与 RLHF 中的作用、交叉熵=信息熵+KL 三者统一视角、Softmax 温度系数与 top-k/top-p 采样策略。

🧪 生成式推荐

自回归/seq2seq 直接生成 item ID + Semantic ID 表征;含工业落地与架构统一
2025 arXiv:2504.09627 生成式推荐 · 显式慢思考 TIGER +19.5%
STREAM-Rec:给生成式推荐器装上一段可训练的思考过程
Slow Thinking for Sequential Recommendation · Zhang, Zhang, Sun, Lu, Zhao, Chen, Wen · RUC GSAI + 腾讯微信
沿用 TIGER 的 encoder-decoder + RQ-VAE SID 骨架,让 decoder 在吐 target SID 之前先自回归生成 l 个 reasoning token。三阶段训练:Pretrain(拼相似 item token 撑长度)→ SFT(用迭代残差量化合成 CoT + DPO 对照 direct decoder)→ RL(GRPO + 4 种 reward)。Amazon Instrument 相对 TIGER,R@5 +19.5%,N@5 +21.4%。恰好是 LARES 的显式版孪生兄弟。
2025 arXiv 2505.16865 序列推荐 · 潜在推理 Test-Time Scaling
LARES:让序列推荐器在 latent 空间里"多想几步"
Latent Reasoning for Sequential Recommendation · RUC GSAI + Meituan
把 test-time compute scaling 搬进推荐:pre-block A 编码历史,core-block C 在 latent 空间循环 K 次做"思考",参数量不变但深度可变。两阶段训练:SPT(Rec + 轨迹级 TLA + 步级 SLA 三个 InfoNCE)稳住 latent 语义;RPT 用 GRPO + NDCG/Recall 直接当奖励,进一步逼近排序目标。4 个 Amazon 子集、5 类 backbone 全面刷点,且推理成本可控。
2026 arXiv 2602.22732 生成式推荐 · 广告系统 快手广告 收入 +4.2%
GR4AD:为大规模广告系统量身设计的生成式推荐器
Generative Recommendation for Large-Scale Advertising · Peng Jiang, Kun Gai et al. · Kuaishou Technology
把 GR 搬到广告会撞上 token 化 / 学习范式 / 实时服务三堵墙。GR4AD 给四件套答案:UA-SID(MLLM 微调 + 多粒度多分辨率 RQ-Kmeans,碰撞率 85%→18%)、LazyAR(前 K 层并行 + 跨 beam 共享,QPS 翻倍)、VSL+RSPO(list-wise RL,可证为 NDCG 上界)、DBS(动态 beam serving)。快手广告全量上线,A/B 收入 +4.2%,转化率 +10.17%。
2026 KDD 2026 · arXiv 2603.02730 生成式推荐 · 训练-推理对齐 微信 pCTR +0.9%
APAO:把 Beam Search 的剪枝压力提前灌进训练里
Adaptive Prefix-Aware Optimization for Generative Recommendation · Yu, Wang, Ma, Guo, Zhang · 清华 DCST/AIR · 鹊承实验室
生成式推荐用 CE 训练 + beam search 推理,但 CE 假设前缀永远正确,beam search 却步步剪枝。APAO 把每个前缀必须存活的约束写成 prefix-aware loss(pointwise + pairwise),并用自适应权重聚焦最薄弱的前缀。4 数据集 + TIGER/Llama 双 backbone 全面打赢 S-DPO/DMPO,微信公众号 A/B pCTR +0.9%。
2026 SIGIR 2026 SID × 排序 · 快手搜索 长播率 +0.664%
SID-Coord:协调语义 ID 与哈希 ID 的短视频搜索排序
多分辨率 SID 融合 + 流行度感知门控 + 兴趣对齐 · 快手搜索 · 端到端可训练
快手提出的轻量级 SID 框架,将语义 ID 作为可训练的结构化标识符而非静态特征。三大创新:(I) 多分辨率融合捕获粗细粒度语义;(II) 目标感知门控自适应平衡 HID 记忆与 SID 泛化;(III) 兴趣对齐建模用户历史相似性。4.5B 训练样本在线 A/B:搜索长播率 +0.664%,播放时长 +0.369%,延迟增加仅 +0.005%。
📖 深度讲解 Semantic ID 基础 RQ-VAE · 协同信号 · 工程实践
Semantic ID 完全手册:生产 · 训练 · 协同信号注入
从头讲清楚 SID 的生产过程、训练机制,以及如何注入协同过滤信号 · 含完整数学推导与工程细节
系统性讲解 Semantic ID 全链路:RQ-VAE 量化原理(EMA Codebook 更新、Codebook Collapse 及 EMA/随机重置修复)、Residual 量化层级设计、SID 如何用于生成式推荐训练(Next-Token Prediction Loss)、协同信号注入方案(CF Debias / 对比对齐)、工业落地关键参数选型。是阅读 TIGER/OneRec/DAS 等论文的必备背景知识。
2025 WWW'26 · arXiv 2506.16114 GFlowNet 微调 淘宝全量 +0.43%
GFlowGR:用 GFlowNet 为生成式推荐提供 Token 级监督微调
GFlowGR: Fine-tuning Generative Recommendation Frameworks with Generative Flow Networks · 香港城市大学 + 阿里巴巴
将 GR 形式化为多步生成问题,用 GFlowNet 的 flow-matching 机制提供 token 级别监督(SFT/DPO/GRPO 只做 item 级)。三大模块:轨迹采样器(4 种策略含 CM-based Curriculum)+ 多信号奖励模型(交互信号 + CM 预估分 + token 相似度)+ DB/TB 双 loss 变体。淘宝全量广告上线,1 亿+用户 A/B 总营收 +0.43%,非首页搜索 +1.11%,训练成本 SFT 的 2.1×。
2024 ICML 2024 · arXiv 2402.17152 万亿参数 Transformer Meta +12.4%
HSTU:万亿参数序列转换器,用户行为胜过文本
Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations · Meta AI
提出 HSTU(Hierarchical Sequential Transduction Unit)架构,用生成式范式统一推荐召回与排序。M-FALCON 推理引擎支持下,模型复杂度提升 285× 仍保持低延迟。Meta A/B 线上 +12.4%,首次证明 user action sequence 比 text token 更适合推荐模型 scaling。
2026 ACM '26 · arXiv 2604.12234 Chain-of-Attribute
UniRec:用 Chain-of-Attribute 弥合生成式与判别式推荐的表达力鸿沟
Bridging the Expressive Gap between Generative and Discriminative Recommendation via Chain-of-Attribute · Shopee
CoA 先预测粗粒度属性(类目、品牌等),再以属性为条件生成 SID,通过贝叶斯公式证明每步解码不确定性严格下降。Capacity-SID 扩容 + CDC 交叉解码器约束 + RFT/DPO 对齐。端到端 110ms,比传统多阶段流水线(266ms)快 60%。
2026 arXiv 2601.21770 快手电商 · 统一架构 GMV +14.7%
OneMall:一套架构,多种场景——快手电商端到端生成式推荐框架
OneMall: One Architecture, More Scenarios · Kuaishou E-Commerce
LLM Tokenizer 将商品属性压缩为语义 SID + Query-Former 用户行为压缩 + Sparse MoE Decoder 生成 + RL(DPO/GRPO)对齐。一套架构支撑首页推荐、猜你喜欢、购物车推荐三个场景,GMV 分别 +14.7%/+10.3%/+4.9%。
2026 arXiv 2603.02999 召回+排序统一 微信 +1.34%
OneRanker:用一个模型统一生成与排序的广告推荐新范式
Unified Generation and Ranking with One Model in Industrial Advertising Recommendation · Tencent WeiXin
在 HSTU 基础上将生成式召回和判别式排序统一到一个模型:生成召回输出候选列表,同时编码增强用户表示,再在同一模型内完成排序。微信频道广告全量上线,GMV-Normal +1.34%。
2025 arXiv 2508.20900 Lazy Decoder · Scaling Law 快手极速版 +0.741%
OneRec-V2:Lazy Decoder-Only 架构 + GBPO 强化学习
OneRec-V2 Technical Report · Kuaishou
Lazy Decoder-Only 架构计算效率提升 94%(FLOPs -94%,训练资源 -90%),首次在生成式推荐验证 Scaling Law(0.1B→8B)。GBPO 用真实用户反馈驱动 RL 替代 Reward Model 方案。快手主 Feed +0.467%,极速版 +0.741%。
📋 综述 Semantic ID × 排序 7篇工业论文 · DLRM 落地方案
SID 融入排序模型:工业实践综述与 DLRM 落地方案
Google · Meta × 2 · ByteDance · Alibaba · LinkedIn · 快手 · 7 篇论文横向对比 + 6 个落地 Idea + 推荐路线
系统梳理将 Semantic ID 引入 CTR/CVR 排序模型(DLRM 类)的 7 篇工业论文(SemID / Prefix-Ngram / SIDE / TRM / GPSD / LiGR / DAS),从特征接入方式、Embedding 参数化、训练目标扩充、冷启动处理四个维度横向对比,并面向 DLRM 架构提炼 6 个可直接落地的工程 Idea(从 Embedding 替换到 CF Debias + 多视角对比对齐)。
2025 KDD 2025 · arXiv 2502.03417 排序 Scaling Semantic ID LinkedIn DAU +0.27%
LiGR:用 7 个特征超越数百特征,LinkedIn 生成式排序的工业实践
From Features to Transformers: Redefining Ranking for Scalable Impact · Fedor Borisyuk et al. · LinkedIn · KDD 2025
LiGR 将 HSTU 风格生成式推荐引入 LinkedIn Feed 排序,7 个特征超越数百特征的 DLRM 基线;Gated skip-connection 解决大模型训练稳定性;Setwise Attention 替代规则多样性;SID concat pooling 将参数量从 5.4B→1.3B;生产 A/B:DAU +0.27%,Feed 时长 +0.28%。
2025 arXiv 2509.03236 端到端生成式搜索 快手 CTR +1.67%
OneSearch:第一个工业部署的电商搜索端到端生成式框架
OneSearch: A Unified End-to-End Generative Framework for E-commerce Search · 快手电商搜索团队
RQ-OPQ 混合量化(层次语义+独特属性残差)+ 三视图用户行为序列注入(User ID / 显式短序列 / 隐式长序列 QFormer 压缩)+ 三阶段 SFT(语义对齐→共现同步→个性化)+ 自适应奖励 DPO,将 MCA 召回-精排统一为单一 BART encoder-decoder,快手商城 A/B:商品 CTR +1.67%、订单量 +3.22%、OPEX -75.40%、MFU 3.26%→27.32%。
2025 arXiv 2508.10584 双对齐 SID 快手 eCPM +3.48%
DAS:一阶段双对齐 Semantic ID,解决协同信号缺失的快手广告落地
DAS: Dual-Aligned Semantic IDs Empowered Industrial Recommender System · 快手广告算法团队
传统两阶段 SID 对齐(先 CF 后量化)存在信息损失;DAS 一阶段联合优化 UISM(双侧 RQ-VAE)+ ICDM(CF 去偏)+ MDAM(三种多视图对比对齐),四类特征接入判别式和生成式 RS,快手 4 亿日活 A/B:eCPM +3.48%,冷启动 +8.98%。
2025 arXiv 2504.02137 排序 Scaling Prefix-Ngram SID Meta 广告
Prefix-Ngram SID:Meta 广告排序的层次化语义 ID 工业实践
Semantic IDs for Large-Scale Recommendation Systems · Meta Ads
Meta 在广告排序系统中将 RQ-VAE 生成的 SID 以 Prefix-Ngram 方式展开为层次化稀疏特征,并接入 DLRM 嵌入表;提出 FLOPs 正则化防止 codebook 坍缩,实现冷启动提升和整体 CTR 正向增益,工业部署简洁高效。
2025 arXiv 2506.16698 排序 SID 扩展 SIDE Meta Instagram
SIDE:Meta 将 SID 推广到全排序栈,序列 + 交叉特征全覆盖
Scaling Item Representations via Semantic IDs · Meta Instagram
在 Prefix-Ngram 基础上,SIDE 将 SID 进一步扩展为序列历史特征(用户历史 SID 序列)和交叉计数特征(候选 SID 与历史序列匹配数),覆盖 CTR/CVR 排序全链路,Meta Instagram 生产验证整体正向,显著改善冷启动场景。
2026 arXiv 2601.22694 排序 Scaling Semantic Token
TRM:用语义 Token 替代 Item ID,解锁大排序模型的扩展潜力
Farewell to Item IDs: Unlocking the Scaling Potential of Large Ranking Models via Semantic Tokens · Zhao et al. · ByteDance
Item ID 是孤立符号,难以共享知识且制约 scaling;TRM 提出协同感知表示 + 混合 Tokenization(Gen+Mem)+ 判别式生成式联合训练,线上搜索 CTR AUC +0.65%、稀疏参数减少 33%,scaling law 特性显著改善。
2025.07 arXiv 2507.22224 框架&消融 Semantic ID
GRID:生成式推荐 Semantic ID 实践手册(Snap 开源框架)
Generative Recommendation with Semantic IDs: A Practitioner's Handbook · Snap Inc.
对生成式推荐中 SID 使用方式进行大规模消融研究的实践指南。关键发现:RK-Means(Residual K-Means)量化方案通常优于 RQ-VAE;Encoder-Decoder 架构优于 Decoder-only;同时公开了完整可复现代码框架,便于研究者快速实验不同组合。
2025 SIGIR 2025 · arXiv 2504.04400 多 Tokenizer 预训练 Semantic ID
MTGRec:多标识符 Item Tokenization + 课程学习预训练
Pre-training Generative Recommender with Multi-Identifier Item Tokenization · Zheng, Liu et al. · RUC + Huawei
现有生成式推荐 one-to-one tokenization 导致长尾 token 曝光不足、数据多样性差。MTGRec 从 RQ-VAE 训练过程取相邻 epoch 的多个 checkpoint 作为语义相关的多个 tokenizer,将单条用户序列扩增为多组 token 序列用于预训练。引入基于一阶梯度近似的数据影响力估计,动态调整各 tokenizer 数据的采样概率(课程学习)。微调时固定单一 tokenizer 保证 item 可识别。Amazon 三数据集超越 TIGER/LETTER/TIGER++,在长尾 item 改善尤其显著。
2025 SIGIR 2025 · arXiv 2409.05546 端到端 Tokenizer Semantic ID
ETEGRec:端到端联合优化 Item Tokenizer 与生成式推荐器
Generative Recommender with End-to-End Learnable Item Tokenization · Liu, Zheng et al. · RUC + Kuaishou
现有方法将 Item Tokenizer(RQ-VAE)与生成推荐器解耦训练,导致 tokenizer 无法感知推荐目标。ETEGRec 提出双 Encoder-Decoder 架构:tokenizer 和 recommender 各自一套 Enc-Dec,通过序列-物品对齐(KL 散度拉近编码器输出与物品 token 分布)和偏好-语义对齐(InfoNCE 拉近 decoder 隐态与重建物品语义)实现联合优化,并引入交替训练保证稳定性。Amazon 三数据集全面超越 TIGER/LETTER。
2025.03 arXiv 2503.02453 稀疏-稠密级联 Semantic ID 百度广告 +3.60%
COBRA:级联稀疏-稠密表示,统一生成式与稠密检索
Sparse Meets Dense: Unified Generative Recommendations with Cascaded Sparse-Dense Representations · Yang, Ji et al. · Baidu
现有生成式推荐(如 TIGER)仅用离散 SID,信息损失大;COBRA 提出级联表示:先自回归生成 SID(粗粒度),再以 SID 为条件生成稠密向量(细粒度),两者拼接作为序列输入。推理时 BeamFusion 融合 Beam 分数与 ANN 相似度分数。百度广告平台亿级用户 A/B:转化率 +3.60%,ARPU +4.15%。
2025.02 arXiv 2502.18965 端到端生成 Semantic ID 快手线上 +1.68%
OneRec:用统一生成模型替代多级漏斗,快手主场景落地
Unifying Retrieve and Rank with Generative Recommender and Preference Alignment · Deng et al. · Kuaishou
首个工业级单阶段生成推荐系统,用 Encoder-Decoder + MoE 替代三级漏斗(召回→粗排→精排)。创新点:① Balanced K-Means 残差量化解决 hourglass 现象;② Session-wise 生成(一次输出整批视频)替代逐 item 预测;③ Iterative Preference Alignment (IPA) 结合 DPO 从奖励模型自动构造偏好对。快手主页 A/B:总观看时长 +1.68%,人均观看时长 +6.56%。
2026.06 arXiv 2606.06260 生成式推荐 CoT × Reasoning Kuaishou 落地
OneReason:让生成式推荐真正"先思考再回答"
OneReason Technical Report · Kuaishou OneRec Team
解决 OneRec 系列 thinking ≤ non-thinking 的反常现象。借鉴 MLLM 诊断把根因归到 Perception × Cognition 双支柱:① Pre-training 四粒度数据(Token / Item / Relational / User)强化 itemic-text 对齐;② SFT 用 R0→R1→R2→R3 四层认知 CoT;③ RL 走 Specialize-then-Unify 先单域专精再跨域统一蒸馏。结果 thinking mode 首次稳定超越 non-thinking,并发现 CoT 监督会渗透到 non-thinking 推理。开源 OneReason-8B / 0.8B。
2025.06 arXiv 2506.13695 工程化演进 Semantic ID OPEX 10.6%
OneRec Technical Report:补齐工程体系、RL 与成本收益
OneRec Technical Report · Kuaishou
2506 技术报告把 2502 原论文中的工程细节完整展开:多模态 tokenizer(caption / OCR / ASR / 图像帧 + QFormer + RQ-Kmeans)、静态/短期/正反馈/终身四路 Encoder、P-Score/Format/Industrial Reward、ECPO 强化学习,以及 25% QPS 承接和 OPEX 仅为传统 pipeline 10.6% 的工业落地结果。
2023/2024 arXiv 2306.08121 Semantic ID 排序
SemID:将 Semantic ID 带入 YouTube 亿级排序模型
Better Generalization with Semantic IDs · Singh, Vu et al. · Google DeepMind
随机哈希 video ID 制约长尾和冷启动泛化;SemID 提出 N-gram 和 SPM 两种子词 embedding 方案,在 YouTube ~1 亿视频语料上验证 SPM-SID 同时超越随机哈希基线的整体 CTR AUC 和冷启动 CTR/1D AUC,serving cost 不增加。
2023 NeurIPS 2023 · arXiv 2305.05065 生成式推荐 Semantic ID
TIGER:用生成式检索重构推荐系统召回阶段
Recommender Systems with Generative Retrieval · Rajput, Mehta et al. · Google DeepMind
首次将生成式检索(Generative Retrieval)引入推荐系统:用 RQ-VAE 为 item 生成层级 Semantic ID,Transformer Encoder-Decoder 自回归预测下一个 item 的 Semantic ID。在 Amazon 三数据集全面超越 SASRec/BERT4Rec,原生支持冷启动和多样性调节。
2024.11 arXiv 2411.18814 生成式 + 稠密混合
LIGER:融合生成式与稠密检索的序列推荐
Unifying Generative and Dense Retrieval for Sequential Recommendation · Meta AI
分析 TIGER(生成式)与 Dense Retrieval 的性能差距和冷启动问题,提出 LIGER 混合方案:共用 SID 输入,Decoder 预测 SID,Encoder 输出 dense embedding;推理时生成式召回 K 个候选 + 补入冷启动 item,用 dense embedding 重排。四数据集取得生成式/稠密最优折中。

🤖 LLM4Rec

LLM Agent / CoT 推理 / RAG 直接驱动推荐与搜索
2025 arXiv:2507.21117 LLM4Rec 综述 系统性分类
LLM4Rec 综述:用 LLM 系统性破解推荐系统的九大顽疾
A Comprehensive Review on Harnessing Large Language Models to Overcome Recommender System Challenges · LinkedIn / Meta / Amazon / CMU / Stanford
把推荐系统所有痛点按"数据/建模/评估/隐私"四类分层归类,对每个子问题给出具体的 LLM 解法(含公式、prompt 模板、真实工业案例)。冷启动、稀疏、噪声、漂移、多模态、可扩展性、长尾、线上线下不一致、合规审计——一张完整的"挑战 × LLM 方案"对照表。
2025 Under Review · arXiv 待发 生成式推荐 · 功能角色推理 LLM 增强 · 反事实推理 快手+北航 · 订单 +7.3%
RoleGen:唤醒沉默用户,用功能角色推理 + 反事实推断打破自我强化循环
Awakening Dormant Users: Generative Recommendation with Counterfactual Functional Role Reasoning · 快手+北航
沉默用户(30天无购买,但占DAU 40%+)数据极稀疏,传统方法只建模单步固有价值,忽视物品的工具性效应(某些物品虽不转化,但能触发意图转变推动后续购买)。RoleGen 提出功能角色轨迹(Functional Role Trajectory)抽象用户意图演化,LLM-based Reasoner 通过 FR-CoT 推理 + 反事实干预(do(r'=替代角色))探索多样化转化路径,Generative Backbone 将语义预测 grounded 到协同信号,闭环 Reasoning→Execution→Feedback→Reflection。快手 700M MAU:离线 Recall@1 +6.2%,在线订单 +7.3%,缓解马太效应(长尾物品曝光 Ratio 达 2.2)。
2025 arXiv 2510.11639 CoT 推理 · GR 停留时长 +0.159%
OneRec-Think:把 CoT 推理引入生成式推荐,显式文本推理框架
ONEREC-THINK: In-Text Reasoning for Generative Recommendation · Kuaishou
三阶段设计:Itemic Alignment(对齐商品语义空间)→ Reasoning Activation(激活 CoT 推理能力)→ Reasoning Enhancement(偏好对齐强化推理质量)。Think-Ahead 部署架构解耦思考与推荐延迟。快手 APP 线上停留时长 +0.159%。
2026 arXiv 2602.12612 LLM Agent · 自进化
Self-EvolveRec:LLM 驱动方向性反馈的自进化推荐系统
Self-Evolving Recommender Systems with LLM-based Directional Feedback · KAIST
User Simulator + Model Diagnosis Tool 提供定量+定性双重诊断反馈,LLM Researcher 解析反馈生成 arXiv 检索查询 → 组织开发报告 → Coder 实现代码修改。四阶段全自动进化流水线,全面超越传统 AutoML baseline。
2026 arXiv 2602.10226 LLM Agent · 自动化 ML YouTube 生产
Self-Evolving Recommendation System:端到端自主模型优化
End-To-End Autonomous Model Optimization With LLM Agents · Google / YouTube
首个在工业规模推荐系统中部署的 LLM Agent 自进化框架:Offline Agent(高频内循环,三类 Persona 五阶段 DAG)+ Online Agent(低频外循环,A/B 验证反馈)。YouTube 生产环境实现显著北极星指标提升。
2025 arXiv 2508.12365 电商相关性 KDD 2026 · 淘宝
TaoSR1:电商搜索相关性的 Thinking 模型
TaoSR1: The Thinking Model for E-commerce Relevance Search · Taobao & Tmall Group, Alibaba
三阶段优化框架:RAG-CoT SFT(先答后思规避错误累积)→ Pass@N DPO(可解决样本自纠正 + 困难样本 DeepSeek-R1 Oracle 引导)→ 难度感知 GRPO(标签均衡 + 有效难度范围采样)。CumPT 单参数分层部署,彻底消除传统 4 超参敏感性。淘宝 A/B:Macro F1 +4.9pt,平替 Query GSB +34.43%,IPV +2.43%。

🧠 LLM

大语言模型基础理论
2020 arXiv:2001.08361 Scaling Laws Power Law
Scaling Laws:语言模型的幂律缩放规律
Scaling Laws for Neural Language Models · Kaplan, McCandlish, Henighan, Brown, Chess, Child, Gray, Radford, Wu, Amodei · OpenAI
Loss 随模型参数量、数据量、计算量呈幂律下降,跨越七个数量级仍然成立。模型形状(宽度/深度)对 loss 几乎无影响。给定固定算力,最优策略是训练非常大的模型、用相对少的数据、在远未收敛时停止。
2024 ICML 2024 · arXiv 2401.01335 LLM 自对齐 Self-Play Fine-Tuning
SPIN:让弱语言模型通过自我博弈变强
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models · Chen*, Deng*, Yuan* et al. · UCLA
SFT 后继续训练无收益?SPIN 用自博弈机制打破瓶颈:旧模型生成假回答作为 rejected,人类回答作为 chosen,新模型学习区分真假。仅用 50k SFT 数据(无额外偏好标注)迭代 3 轮,平均得分从 58.14→63.16(+5.02%),超越 DPO+62k GPT-4 偏好数据。理论保证:当 pθ=pdata 时全局最优且自然收敛。
2025 arXiv 2506.08007 RL 预训练 Next-Token Reasoning
Reinforcement Pre-Training (RPT):将 NTP 重构为 Reasoning Task
Reinforcement Pre-Training · Qingxiu Dong, Li Dong et al. · Microsoft Research + PKU + THU
将 next-token prediction 重构为 reasoning task,用 RL + 可验证 reward 实现通用预训练。14B 模型匹配 32B 性能,幂律 scaling curves R²>0.98。Continual NTP 训练摧毁推理能力(51.2→10.7),RPT 提供 +5.1pp 更高起点。

📊 传统推荐

判别式排序、训练效率、传统架构优化
2026 arXiv 2608.07055 超长序列 · Token Merge CVR 判别排序 字节电商广告 ADSS +1.036%
TM20K:老师读全文,学生读缩写——两阶段蒸馏把 20K 序列送上线
Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation · Xinchun Li, Duoru Zheng, Wenlin Zhao et al. · ByteDance · arXiv 2026.08
先用注意力分数统计证明 full attention 不可替代(20K 下比 target attention 高 0.25% AUC),再由三组观测反推出三种 token merge:LITM(同 PID 局部合并,T=3)、PATM(近期轻压远期重压)、LPTM(每 2 层长度减半)。一次性 teacher 吃完整 20K token 但永不上线,缓存 logits 蒸馏给双塔 student(main tower 保校准 + dis tower 吃 KD,λ=50)。学生 AvgL 从 8.8K 压到 1.8K、吞吐 7.5×,KD 捞回 teacher 约 85% 收益;线上 ADSS +1.036%、ADVV +0.780%,延迟仅 +5.6%(原生 20K 是 +630%)。字节电商广告已全量。
2026 arXiv 2603.24958 流式数据集蒸馏 · 快手+中科大
DIET:用 1-2% 数据复现全量训练效果,推荐系统模型迭代成本降低 60×
DIET: Learning to Distill Dataset Continually for Recommender Systems · Jiaqing Zhang, Hao Wang et al. · 中科大 + 快手 · arXiv 2026.03
将「数据集蒸馏」引入持续学习推荐场景,维护一个随流式数据持续演化的紧凑合成记忆集(仅 1-2% 数据量)。Phase 1 用 label-conditioned EL2N 选出决策边界样本,融合历史对齐记忆;Phase 2 通过影响力引导双向寻址 + bi-level 优化精细调整合成数据。下游架构只需在合成数据上热身 + 继承参考模型 embedding,无需访问全量历史,模型迭代成本最多降低 60×,跨架构泛化(DCN→WuKong/RankMixer)均有效。
2025 KDD 2025 · arXiv 2506.03699 排序 Scaling 生成预训练 阿里 AliExpress
GPSD:生成式预训练 + 稀疏参数冻结,解锁 Transformer 判别排序 Scaling Law
Scaling Transformers for Discriminative Recommendation via Generative Pretraining · Qijiong Liu et al. · Alibaba / AliExpress · KDD 2025
判别推荐模型存在单轮次/轮次内双过拟合,制约 Scaling;GPSD 用生成预训练稀疏参数初始化判别模型后冻结(ST&SF),使密集参数从 13K 扩展到 0.3B 时遵循幂律 Scaling,跨架构(HSTU/Wukong)均有效,AliExpress 生产 CTR/CVR 双提升。
2026 arXiv 2604.00590 · 快手 排序 Scaling · 统一架构
UniMixer:统一 Attention / TokenMixer / FM 三大 Scaling 架构
UniMixer: A Unified Architecture for Scaling Laws in Recommendation Systems · Kuaishou Technology
通过 TokenMixer 等价参数化将推荐系统三大 Scaling 范式统一到一个理论框架;UniMixer-Lite 参数效率最优,Scaling 指数(0.1419)高于 RankMixer(0.1160);SiameseNorm 解决深度退化,快手广告在线 CAD +15%。

💰 金融

区块链 · 加密货币 · DeFi · 稳定币 · RWA