← 返回论文列表
📄 SIGIR 2026 · 短视频搜索 · 排序系统

SID-Coord:协调语义ID与哈希ID的短视频搜索排序

SID-Coord: Coordinating Semantic IDs for ID-based Ranking in Short-Video Search

核心问题
如何在工业排序系统中协调语义泛化与ID记忆?
技术方案
多分辨率SID融合 + 目标感知门控 + 兴趣对齐
应用场景
快手短视频搜索排序(4.5B训练样本)
在线收益
长播率 +0.664%,播放时长 +0.369%
💬
一句话总结
SID-Coord 把语义ID(SID)当作可训练的结构化标识符,而非静态特征,通过多分辨率融合捕获粗细粒度语义、流行度感知门控平衡记忆与泛化、兴趣对齐建模用户历史相似性,在快手搜索排序系统中显著提升了长尾物品的效果。
📌
§1 背景与动机

1.1 工业排序系统的核心矛盾

在快手等短视频搜索排序系统中,主流方案是基于稀疏ID的判别式模型

✅ HID(哈希ID)的优势

  • 高效记忆频繁交互(曝光-点击-观看)
  • 推理延迟低,满足工业级实时性要求
  • 训练稳定,收敛快

❌ HID的局限

  • 对内容语义完全无感知
  • 长尾物品泛化极差(曝光稀疏)
  • 无法利用视频的多模态信息
⚠️ 记忆-泛化权衡难题

HID擅长记忆头部物品,但泛化差;语义embedding泛化好,但引入serving开销且任务适应性差。 如何在工业约束下协调这两者,是本文要解决的核心问题。

1.2 现有方案的不足

方案类型代表工作核心做法局限
稠密语义特征 SimTier, MOON, MUSE, DMF 将多模态embedding作为辅助输入 serving开销大;任务适应性有限;与ID-based架构松耦合
SID作为静态特征 SPM, Prefix-Ngram SID视为item-side特征直接输入 未利用层级结构;未根据流行度自适应;记忆-泛化未显式协调
🔑 本文核心洞察

关键不是引入语义表示,而是如何利用SID的多层级语义粒度,并根据物品流行度系统性协调语义泛化与ID记忆。SID不应只是静态特征,而应是可训练的结构化标识符,在判别式排序目标下端到端优化。

1.3 问题定义

输入:用户查询 $q$、用户历史行为 $H_u=\{v_1,\ldots,v_T\}$、候选视频集合 $V$

输出:对每个候选视频 $v$ 预测点击/观看概率 $P(y=1|q, H_u, v)$

约束:排序延迟 < 50ms(工业级实时性要求)

📄 论文链接
🏗️
§2 方法详解

SID-Coord 的整体框架包含三个核心组件:

SID-Coord 三大组件
I. 多分辨率SID建模
层级SID组合 + 注意力融合
II. 目标感知HID-SID门控
流行度自适应平衡记忆与泛化
III. 用户-物品语义对齐
候选与历史相似性分布建模
Figure 1: SID-Coord框架概览
Figure 1(论文原图):SID-Coord 整体框架 — 三大组件协同作用,在统一的ID-based排序架构内协调语义泛化与ID记忆

2.1 多分辨率SID建模

SID-Coord 通过残差量化(Residual Quantization, RQ)为每个视频生成三级语义ID,每级对应一个8192大小的码本,语义粒度从粗到细递进。

层级SID组合

直接使用 $\{s_v^{(1)}, s_v^{(2)}, s_v^{(3)}\}$ 作为嵌入查找会丢失层级依赖关系。为此,SID-Coord 在相邻层级间构造组合SID

$$s_v^{(1,2)} = B \cdot s_v^{(1)} + s_v^{(2)}, \quad s_v^{(2,3)} = B \cdot s_v^{(2)} + s_v^{(3)}$$
符号说明
  • $s_v^{(1)}, s_v^{(2)}, s_v^{(3)}$:三个层级的离散语义ID,取值范围 $[0, 8191]$
  • $B$:基数(base),设为10000(大于码本大小8192),保证组合后的唯一映射
  • $s_v^{(1,2)}$:粗细粒度组合ID,如 $s_v^{(1)}=17, s_v^{(2)}=5301 \Rightarrow s_v^{(1,2)}=175301$
📌 设计动机
  • 显式编码细化关系:$s_v^{(1,2)}$ 在粗粒度 $s_v^{(1)}$ 基础上细化,避免跨层级组合(如 $s_v^{(1,3)}$)导致的过度碎片化
  • 保持层级局部性:相同 $s_v^{(1)}$ 的物品在嵌入空间中共享粗语义
  • 参数效率:避免全深度组合 $s_v^{(1,2,3)}$ 导致的参数爆炸
💡 举例:层级SID组合

场景:一个篮球教学视频

  • 第1级(粗):$s_v^{(1)}=17$,表示"体育类视频"
  • 第2级(中):$s_v^{(2)}=5301$,表示"篮球相关"
  • 第3级(细):$s_v^{(3)}=1205$,表示"运球教学"

组合SID

  • $s_v^{(1,2)} = 10000 \times 17 + 5301 = 175301$,细化为"体育-篮球"
  • $s_v^{(2,3)} = 10000 \times 5301 + 1205 = 53011205$,细化为"篮球-运球教学"

直觉:层级组合像地址系统,先定位到省(粗),再细化到市(中),再到区(细),每一级都在父节点内部细分。

注意力融合

组合后,每个视频有5个SID:$\{s_v^{(1)}, s_v^{(2)}, s_v^{(3)}, s_v^{(1,2)}, s_v^{(2,3)}\}$,映射为嵌入 $\{e_v^{(1)}, \ldots, e_v^{(2,3)}\}$。不同物品需要不同粒度的语义:

  • 长尾物品:交互稀疏,粗粒度SID($s_v^{(1)}$)可跨物品共享统计信号
  • 头部物品:交互充足,细粒度SID($s_v^{(3)}$)提供精准区分

SID-Coord 引入注意力机制自适应选择粒度:

$$e_v^{sid} = \sum_{i=1}^{5} \alpha_i \cdot e_v^{(i)}, \quad \alpha_i = \frac{\exp(w_i^\top e_v^{(i)})}{\sum_{j=1}^{5} \exp(w_j^\top e_v^{(j)})}$$
符号说明
  • $e_v^{(i)}$:第 $i$ 个分辨率级别的SID嵌入
  • $w_i$:可学习的查询向量,用于计算注意力权重
  • $\alpha_i$:归一化后的注意力权重,表示对第 $i$ 级语义的重视程度
  • $e_v^{sid}$:最终融合后的语义表示
Figure 2: SID多级注意力融合机制
Figure 2(论文原图):SID多级注意力融合机制 — 自适应选择最有效的语义粒度
💡 举例:注意力融合的粒度选择

5个粒度级别

  • $\alpha_1$:第1级SID(最粗,如"体育类")
  • $\alpha_2$:第2级SID(中等,如"篮球")
  • $\alpha_3$:第3级SID(最细,如"运球教学")
  • $\alpha_4$:组合 $s_v^{(1,2)}$(粗+中)
  • $\alpha_5$:组合 $s_v^{(2,3)}$(中+细)

场景1:长尾物品(曝光 < 100次)

  • 注意力权重:$\alpha_1=0.45$(最粗粒度高),$\alpha_3=0.10$(最细粒度低)
  • 原因:细粒度SID训练不充分,粗粒度可跨物品共享统计信号

场景2:头部物品(曝光 > 1M次)

  • 注意力权重:$\alpha_1=0.15$,$\alpha_3=0.55$(最细粒度高)
  • 原因:交互充足,细粒度可精准区分相似物品

直觉:像学生做题,不熟悉的题型用通用方法(粗粒度 $s^{(1)}$),熟悉的题型用精准技巧(细粒度 $s^{(3)}$)。

2.2 目标感知HID-SID门控

HID和SID具有互补性:

  • HID:从大规模稀疏交互中捕获记忆信号(哪些用户点击过)
  • SID:从多模态内容中提供泛化信号(语义相似物品可共享)

核心问题:如何根据物品流行度自适应平衡两者?

SID-Coord 引入目标感知门控,使用目标物品的历史统计特征(曝光、点击、点赞、分享、评论次数)预测门控权重:

$$g = \sigma(\text{MLP}([n_{exp}, n_{click}, n_{like}, n_{share}, n_{comment}]))$$
$$e_v^{shid} = g \cdot e_v^{hid} + (1 - g) \cdot e_v^{sid}$$
符号说明
  • $n_{exp}, n_{click}, \ldots$:目标物品的历史统计特征(曝光次数、点击次数等)
  • $\sigma(\cdot)$:Sigmoid激活函数,将输出压缩到 $[0, 1]$
  • $g$:门控权重,接近1时偏向HID记忆,接近0时偏向SID泛化
  • $e_v^{hid}$:哈希ID嵌入(传统方式)
  • $e_v^{sid}$:融合后的语义ID嵌入(来自2.1节)
  • $e_v^{shid}$:最终目标物品表示
Figure 3: 流行度感知协调分析
Figure 3(论文原图):门控权重 $g$ 随物品流行度的变化 — 头部物品更依赖HID记忆,长尾物品更依赖SID泛化
🔑 关键发现

实验验证:门控网络成功学习到流行度感知协调策略——

  • 头部物品(曝光多):$g \approx 0.7$,主要依赖HID记忆
  • 长尾物品(曝光少):$g \approx 0.3$,主要依赖SID泛化
💡 举例:门控机制的工作流程

场景1:头部物品(爆款视频,曝光1亿+)

  • 门控网络输入:$[n_{exp}=100000000, n_{click}=5000000, \ldots]$
  • 门控输出:$g=0.72$
  • 融合表示:$e_v^{shid} = 0.72 \cdot e_v^{hid} + 0.28 \cdot e_v^{sid}$
  • 直觉:交互信号充足,优先使用HID记忆

场景2:长尾物品(新视频,曝光50次)

  • 门控网络输入:$[n_{exp}=50, n_{click}=3, \ldots]$
  • 门控输出:$g=0.25$
  • 融合表示:$e_v^{shid} = 0.25 \cdot e_v^{hid} + 0.75 \cdot e_v^{sid}$
  • 直觉:交互稀疏,HID不可靠,依赖SID泛化

2.3 用户-物品语义对齐

传统用户行为建模只使用具体ID(照片ID、作者ID),无法感知内容层面的相关性。SID-Coord 利用SID增强用户侧建模:

输入:用户历史 $H_u = \{v_1, \ldots, v_T\}$,候选物品 $v$

计算

$$S = [\text{sim}(e_v^{sid}, e_{v_1}^{sid}), \ldots, \text{sim}(e_v^{sid}, e_{v_T}^{sid})]$$
符号说明
  • $\text{sim}(\cdot)$:余弦相似度,衡量候选与历史物品的语义接近程度
  • $S$:长度为 $T$ 的相似度向量,表示候选与每个历史物品的语义匹配度

变换:直接使用 $S$ 会丢失分布信息。SID-Coord 应用 AutoDis(自动离散化)将相似度转换为分布感知表示:

$$h_{align} = [\text{MaxPool}(S), \text{AvgPool}(S)]$$
符号说明
  • $\text{MaxPool}(S)$:提取最强语义匹配(最相关的历史物品)
  • $\text{AvgPool}(S)$:提取整体语义一致性(平均匹配程度)
  • $h_{align}$:拼接后的对齐特征,作为额外输入送入排序模型
📌 为什么用AutoDis?

原始余弦相似度是连续值,直接使用会忽略相似度的分布特性(如长尾分布、多峰分布)。AutoDis通过自动分桶+嵌入查找,将相似度离散化为分布感知表示,捕获更高阶语义兴趣模式。

💡 举例:兴趣对齐的计算流程

用户历史

  • $v_1$:篮球教学视频($e_{v_1}^{sid}$)
  • $v_2$:足球比赛集锦($e_{v_2}^{sid}$)
  • $v_3$:舞蹈教学($e_{v_3}^{sid}$)

候选物品:$v$ = 篮球过人技巧

相似度计算

  • $\text{sim}(e_v^{sid}, e_{v_1}^{sid}) = 0.89$(篮球相关,高度相似)
  • $\text{sim}(e_v^{sid}, e_{v_2}^{sid}) = 0.45$(体育相关,中度相似)
  • $\text{sim}(e_v^{sid}, e_{v_3}^{sid}) = 0.12$(不相关,低相似)

对齐特征

  • $\text{MaxPool} = 0.89$(最强匹配:篮球教学)
  • $\text{AvgPool} = 0.49$(平均相似度)

直觉:模型知道候选与用户篮球兴趣高度匹配,且用户有体育消费习惯,提升排序得分。

2.4 训练与推理

训练流程

  1. SID生成:离线用RQ-KMeans为所有视频生成三级SID(码本大小8192)
  2. 特征构建:HID(哈希ID)+ SID + 用户特征 + 上下文特征
  3. 前向传播:通过三大组件计算目标物品表示 $e_v^{shid}$ 和对齐特征 $h_{align}$
  4. 损失函数:二分类交叉熵(点击/长播预测)
    $$\mathcal{L} = -\frac{1}{N}\sum_{i=1}^{N} \left[ y_i \log \hat{y}_i + (1-y_i) \log (1-\hat{y}_i) \right]$$
  5. 端到端优化:SID嵌入和门控网络随排序目标联合训练

推理流程

  1. 查询 $q$ → 召回候选集 $V$(数百个视频)
  2. 对每个候选 $v$:
    • 查找HID嵌入 $e_v^{hid}$
    • 多分辨率融合得到 $e_v^{sid}$
    • 门控融合得到 $e_v^{shid}$
    • 计算兴趣对齐特征 $h_{align}$
    • 拼接所有特征 → MLP → 预测分数
  3. 按分数降序排列,返回Top-K
✅ 工业友好设计
  • 轻量级:门控网络仅两层MLP,计算开销可忽略
  • 无侵入:不修改骨干排序模型,可插拔集成
  • 延迟可控:在线A/B测试显示延迟变化仅 +0.005%
📊
§3 实验结果

3.1 实验设置

📦 数据规模

  • 训练集:~45亿样本
  • 测试集:~1.3亿样本
  • 物品数:数千万级

⚙️ SID配置

  • 码本:3级 × 8192
  • 生成方式:RQ-KMeans
  • 基数B:10000

3.2 整体性能对比

方法整体AUC长尾AUC长尾UAUC
Production Baseline 基准 基准 基准
Prefix-Ngram +0.15% +0.18% +0.42%
Ngram +0.19% +0.23% +0.51%
SPM-SID +0.21% +0.26% +0.58%
DAS +0.25% +0.31% +0.72%
SID-Coord(本文) +0.33% +0.42% +0.93%
🔑 核心发现
  • 所有SID方法都优于生产基线,验证语义信号的引入有效
  • SID-Coord在所有指标上最佳,尤其在长尾UAUC上提升+0.93%
  • 长尾收益显著:长尾AUC提升(+0.42%)大于整体(+0.33%)

3.3 消融实验

变体整体AUC变化长尾AUC变化结论
Full w/o I(去掉多分辨率SID) -0.22% -0.26% 自适应粒度对长尾关键
Full w/o II(去掉门控机制) -0.13% -0.14% 流行度自适应平衡必要
Full w/o III(去掉兴趣对齐) -0.16% -0.19% 用户-物品匹配提供额外信号

3.4 在线A/B测试

🧪 真实流量实验(7天A/B,10%流量)
指标提升95%置信区间显著性
搜索观看时长 +0.369% [0.05%, 0.69%] ✅ 显著
搜索播放数 +0.472% [0.17%, 0.77%] ✅ 显著
长播率 +0.664% (绝对+0.226pp) [0.49%, 0.84%] ✅ 显著
搜索延迟 +0.005% [-0.08%, 0.09%] ❌ 不显著
✅ 工业验证成功
  • 业务指标全面显著提升:观看时长、播放数、长播率均有显著增益
  • 延迟无显著增加:置信区间包含0,验证轻量级设计有效
  • 收益稳定:7天实验期间效果持续
💡
§4 理解与启发

4.1 本文核心贡献

🎯 问题重构

将SID集成从"特征工程"问题重新定义为"协调问题"——显式平衡记忆与泛化

🏗️ 技术创新

三级协调机制:粒度协调(多分辨率)、信号协调(门控)、兴趣协调(对齐)

🏭 工业验证

在快手生产系统完成大规模A/B测试,验证有效性和可用性

4.2 与相关工作对比

工作SID使用方式层级利用流行度自适应用户-物品对齐
SPM / Prefix-Ngram 静态特征
DAS 匹配统计 部分
SID-Coord(本文) 可训练标识符 ✅ 多分辨率 ✅ 目标感知门控 ✅ 分布级对齐

4.3 个人理解

💡 为什么这样设计有效?
  1. 多分辨率融合:类似多尺度特征金字塔,不同粒度适配不同数据密度
  2. 流行度门控:相当于动态集成两个专家模型(HID专家和SID专家)
  3. 兴趣对齐:显式建模"用户是否对这类内容感兴趣",而非仅依赖隐式序列建模
⚠️ 潜在局限
  • SID质量依赖离线量化,无法实时更新
  • 门控网络需要足够的历史统计特征,冷启动物品仍有挑战
  • 仅验证排序场景,召回场景效果待探索

4.4 可借鉴点

📖 学术启发

  • SID可训练的设计思想可推广到其他离散标识符
  • 流行度自适应策略可应用于更多长尾问题
  • 多分辨率融合思路可借鉴到其他层级编码场景

🛠️ 工程启示

  • 轻量级门控设计确保工业可用性
  • SID离线生成降低在线开销
  • 无侵入设计便于灰度发布和回滚
🗺️
§5 总结
SID-Coord 提出了"协调"的新视角:不是简单引入语义信息,而是系统性协调语义泛化与ID记忆,通过多分辨率建模、流行度感知门控、兴趣对齐三大机制,在快手搜索排序系统中实现了显著且稳定的业务收益,为工业级排序系统的语义化升级提供了可行方案。

✅ 优势

  • 长尾效果显著提升
  • 工业友好、延迟可控
  • 端到端可训练

⚠️ 局限

  • SID离线生成,实时性受限
  • 冷启动仍有挑战
  • 仅验证排序场景

🔮 展望

  • 在线更新SID
  • 推广到召回/推荐
  • 探索变长SID