SID-Coord 把语义ID(SID)当作可训练的结构化标识符,而非静态特征,通过多分辨率融合捕获粗细粒度语义、流行度感知门控平衡记忆与泛化、兴趣对齐建模用户历史相似性,在快手搜索排序系统中显著提升了长尾物品的效果。
1.1 工业排序系统的核心矛盾
在快手等短视频搜索排序系统中,主流方案是基于稀疏ID的判别式模型:
✅ HID(哈希ID)的优势
- 高效记忆频繁交互(曝光-点击-观看)
- 推理延迟低,满足工业级实时性要求
- 训练稳定,收敛快
❌ HID的局限
- 对内容语义完全无感知
- 长尾物品泛化极差(曝光稀疏)
- 无法利用视频的多模态信息
HID擅长记忆头部物品,但泛化差;语义embedding泛化好,但引入serving开销且任务适应性差。 如何在工业约束下协调这两者,是本文要解决的核心问题。
1.2 现有方案的不足
| 方案类型 | 代表工作 | 核心做法 | 局限 |
|---|---|---|---|
| 稠密语义特征 | SimTier, MOON, MUSE, DMF | 将多模态embedding作为辅助输入 | serving开销大;任务适应性有限;与ID-based架构松耦合 |
| SID作为静态特征 | SPM, Prefix-Ngram | SID视为item-side特征直接输入 | 未利用层级结构;未根据流行度自适应;记忆-泛化未显式协调 |
关键不是引入语义表示,而是如何利用SID的多层级语义粒度,并根据物品流行度系统性协调语义泛化与ID记忆。SID不应只是静态特征,而应是可训练的结构化标识符,在判别式排序目标下端到端优化。
1.3 问题定义
输入:用户查询 $q$、用户历史行为 $H_u=\{v_1,\ldots,v_T\}$、候选视频集合 $V$
输出:对每个候选视频 $v$ 预测点击/观看概率 $P(y=1|q, H_u, v)$
约束:排序延迟 < 50ms(工业级实时性要求)
- arXiv: arxiv.org/abs/2604.10471
- PDF: arxiv.org/pdf/2604.10471
- 会议: SIGIR 2026 (Melbourne, Australia)
SID-Coord 的整体框架包含三个核心组件:
2.1 多分辨率SID建模
SID-Coord 通过残差量化(Residual Quantization, RQ)为每个视频生成三级语义ID,每级对应一个8192大小的码本,语义粒度从粗到细递进。
层级SID组合
直接使用 $\{s_v^{(1)}, s_v^{(2)}, s_v^{(3)}\}$ 作为嵌入查找会丢失层级依赖关系。为此,SID-Coord 在相邻层级间构造组合SID:
- $s_v^{(1)}, s_v^{(2)}, s_v^{(3)}$:三个层级的离散语义ID,取值范围 $[0, 8191]$
- $B$:基数(base),设为10000(大于码本大小8192),保证组合后的唯一映射
- $s_v^{(1,2)}$:粗细粒度组合ID,如 $s_v^{(1)}=17, s_v^{(2)}=5301 \Rightarrow s_v^{(1,2)}=175301$
- 显式编码细化关系:$s_v^{(1,2)}$ 在粗粒度 $s_v^{(1)}$ 基础上细化,避免跨层级组合(如 $s_v^{(1,3)}$)导致的过度碎片化
- 保持层级局部性:相同 $s_v^{(1)}$ 的物品在嵌入空间中共享粗语义
- 参数效率:避免全深度组合 $s_v^{(1,2,3)}$ 导致的参数爆炸
场景:一个篮球教学视频
- 第1级(粗):$s_v^{(1)}=17$,表示"体育类视频"
- 第2级(中):$s_v^{(2)}=5301$,表示"篮球相关"
- 第3级(细):$s_v^{(3)}=1205$,表示"运球教学"
组合SID:
- $s_v^{(1,2)} = 10000 \times 17 + 5301 = 175301$,细化为"体育-篮球"
- $s_v^{(2,3)} = 10000 \times 5301 + 1205 = 53011205$,细化为"篮球-运球教学"
直觉:层级组合像地址系统,先定位到省(粗),再细化到市(中),再到区(细),每一级都在父节点内部细分。
注意力融合
组合后,每个视频有5个SID:$\{s_v^{(1)}, s_v^{(2)}, s_v^{(3)}, s_v^{(1,2)}, s_v^{(2,3)}\}$,映射为嵌入 $\{e_v^{(1)}, \ldots, e_v^{(2,3)}\}$。不同物品需要不同粒度的语义:
- 长尾物品:交互稀疏,粗粒度SID($s_v^{(1)}$)可跨物品共享统计信号
- 头部物品:交互充足,细粒度SID($s_v^{(3)}$)提供精准区分
SID-Coord 引入注意力机制自适应选择粒度:
- $e_v^{(i)}$:第 $i$ 个分辨率级别的SID嵌入
- $w_i$:可学习的查询向量,用于计算注意力权重
- $\alpha_i$:归一化后的注意力权重,表示对第 $i$ 级语义的重视程度
- $e_v^{sid}$:最终融合后的语义表示
5个粒度级别:
- $\alpha_1$:第1级SID(最粗,如"体育类")
- $\alpha_2$:第2级SID(中等,如"篮球")
- $\alpha_3$:第3级SID(最细,如"运球教学")
- $\alpha_4$:组合 $s_v^{(1,2)}$(粗+中)
- $\alpha_5$:组合 $s_v^{(2,3)}$(中+细)
场景1:长尾物品(曝光 < 100次)
- 注意力权重:$\alpha_1=0.45$(最粗粒度高),$\alpha_3=0.10$(最细粒度低)
- 原因:细粒度SID训练不充分,粗粒度可跨物品共享统计信号
场景2:头部物品(曝光 > 1M次)
- 注意力权重:$\alpha_1=0.15$,$\alpha_3=0.55$(最细粒度高)
- 原因:交互充足,细粒度可精准区分相似物品
直觉:像学生做题,不熟悉的题型用通用方法(粗粒度 $s^{(1)}$),熟悉的题型用精准技巧(细粒度 $s^{(3)}$)。
2.2 目标感知HID-SID门控
HID和SID具有互补性:
- HID:从大规模稀疏交互中捕获记忆信号(哪些用户点击过)
- SID:从多模态内容中提供泛化信号(语义相似物品可共享)
核心问题:如何根据物品流行度自适应平衡两者?
SID-Coord 引入目标感知门控,使用目标物品的历史统计特征(曝光、点击、点赞、分享、评论次数)预测门控权重:
- $n_{exp}, n_{click}, \ldots$:目标物品的历史统计特征(曝光次数、点击次数等)
- $\sigma(\cdot)$:Sigmoid激活函数,将输出压缩到 $[0, 1]$
- $g$:门控权重,接近1时偏向HID记忆,接近0时偏向SID泛化
- $e_v^{hid}$:哈希ID嵌入(传统方式)
- $e_v^{sid}$:融合后的语义ID嵌入(来自2.1节)
- $e_v^{shid}$:最终目标物品表示
实验验证:门控网络成功学习到流行度感知协调策略——
- 头部物品(曝光多):$g \approx 0.7$,主要依赖HID记忆
- 长尾物品(曝光少):$g \approx 0.3$,主要依赖SID泛化
场景1:头部物品(爆款视频,曝光1亿+)
- 门控网络输入:$[n_{exp}=100000000, n_{click}=5000000, \ldots]$
- 门控输出:$g=0.72$
- 融合表示:$e_v^{shid} = 0.72 \cdot e_v^{hid} + 0.28 \cdot e_v^{sid}$
- 直觉:交互信号充足,优先使用HID记忆
场景2:长尾物品(新视频,曝光50次)
- 门控网络输入:$[n_{exp}=50, n_{click}=3, \ldots]$
- 门控输出:$g=0.25$
- 融合表示:$e_v^{shid} = 0.25 \cdot e_v^{hid} + 0.75 \cdot e_v^{sid}$
- 直觉:交互稀疏,HID不可靠,依赖SID泛化
2.3 用户-物品语义对齐
传统用户行为建模只使用具体ID(照片ID、作者ID),无法感知内容层面的相关性。SID-Coord 利用SID增强用户侧建模:
输入:用户历史 $H_u = \{v_1, \ldots, v_T\}$,候选物品 $v$
计算:
- $\text{sim}(\cdot)$:余弦相似度,衡量候选与历史物品的语义接近程度
- $S$:长度为 $T$ 的相似度向量,表示候选与每个历史物品的语义匹配度
变换:直接使用 $S$ 会丢失分布信息。SID-Coord 应用 AutoDis(自动离散化)将相似度转换为分布感知表示:
- $\text{MaxPool}(S)$:提取最强语义匹配(最相关的历史物品)
- $\text{AvgPool}(S)$:提取整体语义一致性(平均匹配程度)
- $h_{align}$:拼接后的对齐特征,作为额外输入送入排序模型
原始余弦相似度是连续值,直接使用会忽略相似度的分布特性(如长尾分布、多峰分布)。AutoDis通过自动分桶+嵌入查找,将相似度离散化为分布感知表示,捕获更高阶语义兴趣模式。
用户历史:
- $v_1$:篮球教学视频($e_{v_1}^{sid}$)
- $v_2$:足球比赛集锦($e_{v_2}^{sid}$)
- $v_3$:舞蹈教学($e_{v_3}^{sid}$)
候选物品:$v$ = 篮球过人技巧
相似度计算:
- $\text{sim}(e_v^{sid}, e_{v_1}^{sid}) = 0.89$(篮球相关,高度相似)
- $\text{sim}(e_v^{sid}, e_{v_2}^{sid}) = 0.45$(体育相关,中度相似)
- $\text{sim}(e_v^{sid}, e_{v_3}^{sid}) = 0.12$(不相关,低相似)
对齐特征:
- $\text{MaxPool} = 0.89$(最强匹配:篮球教学)
- $\text{AvgPool} = 0.49$(平均相似度)
直觉:模型知道候选与用户篮球兴趣高度匹配,且用户有体育消费习惯,提升排序得分。
2.4 训练与推理
训练流程:
- SID生成:离线用RQ-KMeans为所有视频生成三级SID(码本大小8192)
- 特征构建:HID(哈希ID)+ SID + 用户特征 + 上下文特征
- 前向传播:通过三大组件计算目标物品表示 $e_v^{shid}$ 和对齐特征 $h_{align}$
- 损失函数:二分类交叉熵(点击/长播预测)
$$\mathcal{L} = -\frac{1}{N}\sum_{i=1}^{N} \left[ y_i \log \hat{y}_i + (1-y_i) \log (1-\hat{y}_i) \right]$$
- 端到端优化:SID嵌入和门控网络随排序目标联合训练
推理流程:
- 查询 $q$ → 召回候选集 $V$(数百个视频)
- 对每个候选 $v$:
- 查找HID嵌入 $e_v^{hid}$
- 多分辨率融合得到 $e_v^{sid}$
- 门控融合得到 $e_v^{shid}$
- 计算兴趣对齐特征 $h_{align}$
- 拼接所有特征 → MLP → 预测分数
- 按分数降序排列,返回Top-K
- 轻量级:门控网络仅两层MLP,计算开销可忽略
- 无侵入:不修改骨干排序模型,可插拔集成
- 延迟可控:在线A/B测试显示延迟变化仅 +0.005%
3.1 实验设置
📦 数据规模
- 训练集:~45亿样本
- 测试集:~1.3亿样本
- 物品数:数千万级
⚙️ SID配置
- 码本:3级 × 8192
- 生成方式:RQ-KMeans
- 基数B:10000
3.2 整体性能对比
| 方法 | 整体AUC | 长尾AUC | 长尾UAUC |
|---|---|---|---|
| Production Baseline | 基准 | 基准 | 基准 |
| Prefix-Ngram | +0.15% | +0.18% | +0.42% |
| Ngram | +0.19% | +0.23% | +0.51% |
| SPM-SID | +0.21% | +0.26% | +0.58% |
| DAS | +0.25% | +0.31% | +0.72% |
| SID-Coord(本文) | +0.33% | +0.42% | +0.93% |
- 所有SID方法都优于生产基线,验证语义信号的引入有效
- SID-Coord在所有指标上最佳,尤其在长尾UAUC上提升+0.93%
- 长尾收益显著:长尾AUC提升(+0.42%)大于整体(+0.33%)
3.3 消融实验
| 变体 | 整体AUC变化 | 长尾AUC变化 | 结论 |
|---|---|---|---|
| Full w/o I(去掉多分辨率SID) | -0.22% | -0.26% | 自适应粒度对长尾关键 |
| Full w/o II(去掉门控机制) | -0.13% | -0.14% | 流行度自适应平衡必要 |
| Full w/o III(去掉兴趣对齐) | -0.16% | -0.19% | 用户-物品匹配提供额外信号 |
3.4 在线A/B测试
| 指标 | 提升 | 95%置信区间 | 显著性 |
|---|---|---|---|
| 搜索观看时长 | +0.369% | [0.05%, 0.69%] | ✅ 显著 |
| 搜索播放数 | +0.472% | [0.17%, 0.77%] | ✅ 显著 |
| 长播率 | +0.664% (绝对+0.226pp) | [0.49%, 0.84%] | ✅ 显著 |
| 搜索延迟 | +0.005% | [-0.08%, 0.09%] | ❌ 不显著 |
- 业务指标全面显著提升:观看时长、播放数、长播率均有显著增益
- 延迟无显著增加:置信区间包含0,验证轻量级设计有效
- 收益稳定:7天实验期间效果持续
4.1 本文核心贡献
🎯 问题重构
将SID集成从"特征工程"问题重新定义为"协调问题"——显式平衡记忆与泛化
🏗️ 技术创新
三级协调机制:粒度协调(多分辨率)、信号协调(门控)、兴趣协调(对齐)
🏭 工业验证
在快手生产系统完成大规模A/B测试,验证有效性和可用性
4.2 与相关工作对比
| 工作 | SID使用方式 | 层级利用 | 流行度自适应 | 用户-物品对齐 |
|---|---|---|---|---|
| SPM / Prefix-Ngram | 静态特征 | ❌ | ❌ | ❌ |
| DAS | 匹配统计 | 部分 | ❌ | ✅ |
| SID-Coord(本文) | 可训练标识符 | ✅ 多分辨率 | ✅ 目标感知门控 | ✅ 分布级对齐 |
4.3 个人理解
- 多分辨率融合:类似多尺度特征金字塔,不同粒度适配不同数据密度
- 流行度门控:相当于动态集成两个专家模型(HID专家和SID专家)
- 兴趣对齐:显式建模"用户是否对这类内容感兴趣",而非仅依赖隐式序列建模
- SID质量依赖离线量化,无法实时更新
- 门控网络需要足够的历史统计特征,冷启动物品仍有挑战
- 仅验证排序场景,召回场景效果待探索
4.4 可借鉴点
📖 学术启发
- SID可训练的设计思想可推广到其他离散标识符
- 流行度自适应策略可应用于更多长尾问题
- 多分辨率融合思路可借鉴到其他层级编码场景
🛠️ 工程启示
- 轻量级门控设计确保工业可用性
- SID离线生成降低在线开销
- 无侵入设计便于灰度发布和回滚
SID-Coord 提出了"协调"的新视角:不是简单引入语义信息,而是系统性协调语义泛化与ID记忆,通过多分辨率建模、流行度感知门控、兴趣对齐三大机制,在快手搜索排序系统中实现了显著且稳定的业务收益,为工业级排序系统的语义化升级提供了可行方案。
✅ 优势
- 长尾效果显著提升
- 工业友好、延迟可控
- 端到端可训练
⚠️ 局限
- SID离线生成,实时性受限
- 冷启动仍有挑战
- 仅验证排序场景
🔮 展望
- 在线更新SID
- 推广到召回/推荐
- 探索变长SID