设想一个评测场景:我们需要评估几个视频生成模型或 LLM 的输出质量。让人类标注员直接打绝对分数(比如 8.5 分或 9.2 分),不仅主观差异极大,且标准难以统一。但如果每次只展示两个模型的输出,让人类选择“哪一个更好”,判断就会轻松且稳定得多。LMSYS Chatbot Arena 等主流大模型盲测平台均采用了这种机制。

Bradley-Terry (BT) 模型的核心作用,正是将海量离散的“二选一”比较结果,逆向推导并转化为每个对象连续的、客观的内在评分。

核心直觉与数学表达

BT 模型的思想非常朴素:如果 A 赢 B 的概率很大,说明 A 的潜在实力远高于 B;如果两者实力相当,胜率应该接近 50%。

模型假设每个对象i都有一个大于零的潜在“实力值”p_i。当对象i与对象j进行比较时,i胜出(被偏好)的概率,等于它的实力值在两人总实力值中所占的比例:

这个公式直观且符合常理。但在机器学习中,我们更习惯使用实数空间。经过简单的代数代换,概率公式可以转化为深度学习中最常见的 Sigmoid 函数形式:

此时结论变得极其优雅:两个对象比较时的胜率,完全取决于它们隐式得分的差值。 得分差值越大,胜率无限逼近 100%;差值为 0 时,胜率正好是 50%。

在 AI 偏好对齐中的关键角色

在当前的大模型后训练(Post-training)阶段,无论是 RLHF 还是 DPO,BT 模型都是不可或缺的基础假设。

在训练奖励模型(Reward Model)时,由于无法获得高质量的绝对分数标签,我们转而收集人类的偏好数据。给定一个提示词,模型生成较好的回答y_w和较差的回答y_l。我们将神经网络拟合的标量输出r_\theta(x,y)s。

根据 BT 模型,人类偏好y_w胜过y_l的理论概率为。为了让神经网络的预测逼近真实的人类选择,我们直接最大化这个概率,即最小化其负对数似然损失。这便构成了 Reward Model 训练的标准交叉熵损失函数。

参数估计与直观计算

如果在实际工程中(例如维护一个算法内部的 Leaderboard),我们收集到了一批两两比较的胜负频次,如何求解各自的隐式得分s_i?

通常我们构建一个对决矩阵,记录两两之间的胜出次数。

模型对比模型A模型B模型C
A 胜出次数-158
B 胜出次数5-12
C 胜出次数28-

通过将上述频次代入 BT 模型的似然函数,我们会发现它是一个严格的凹函数,这意味着它有唯一的全局最优解。利用基础的梯度下降法或者经典的 MM(Minorize-Maximization)算法,即可快速迭代收敛,求得每个模型的相对得分。需要注意的是,由于模型仅依赖得分差值,我们需要固定一个基准点(例如令模型 A 的得分为 0)来消除平移不变性,从而获得确定的分数分布。