AIHOT 共识分
先用全部真实成对结果估计潜在能力,再计算该能力相对 18 个冻结锚点模型的平均预测胜率,映射到 0—100 分。它不是来源分数的算术平均,也不是当期模型百分位。
综合分不是把不同排行榜的分数直接平均,而是从固定权重的真实共同参评结果中,估计每个模型在同一能力尺度上的位置。
一张榜没有收录某个模型时,这张榜对它不产生任何胜、负或平局。空缺预算不转给其他来源,只减少证据并提高不确定性。
先用全部真实成对结果估计潜在能力,再计算该能力相对 18 个冻结锚点模型的平均预测胜率,映射到 0—100 分。它不是来源分数的算术平均,也不是当期模型百分位。
首页百分比是模型实际拿到的证据预算:逐项计算“来源组固定权重 × 榜单组内份额 × 已评子项目份额”后求和。一张榜单只测到部分子项目,只计对应份额,不会再被显示为整张跑满;完整度本身不作为扣分项。
先把来源别名归到中央型号目录;日期、Preview、Beta 等版本标记保留,推理档位、Harness、Scaffold 等评测配置必须分离。身份证据冲突或配置仍混入型号主键时,整张快照拒绝入榜,不猜测合并。
同一来源、指标和基础模型只选一条代表配置,选择规则在读取成绩前确定。Agent/脚手架明细保留,但成绩归到基础模型。
同一指标里共同出现的两款模型才形成结果;严格高低记胜负,原榜置信区间重叠或原始成绩相同记平局。
当前 10 个独立来源组各占 10%。同一运营方有多张榜单时只在组内平分预算;来源包含多项指标时再拆分自己的份额,长榜也不会因为榜单多或对手多而放大影响。
正则化 Bradley–Terry 模型寻找一组最符合全部加权胜负的能力值。零中心弱先验只在证据少时抑制不合理的极端估计。
共识分相对冻结锚点计算,排名按未舍入的潜在能力排序;页面显示的一位小数不参与排序,首页只截取前 30 名。
完整覆盖模型的有效比较预算是 84。例如完整覆盖 8 个各自只有一张榜单的独立来源组时,已取得 80% 的证据预算,即 84 × 80%=67.2;不会把这 8 组放大成完整的 100%。
yᵢⱼ ∈ {0,0.5,1}分别表示模型 i 负、平、胜。只有共同参评才会产生 yᵢⱼ。
w=84 × 来源预算 × 指标份额 ÷(参评数 − 1)除以参评数减一,使一张长榜和一张短榜对单个模型拥有相同的总来源预算。
Coverageᵢ=100% × Σₘ I(i 有 m 成绩)× 来源预算 × 指标份额I 只取 0 或 1。它按实际观测的子项目累计证据预算,不进入能力估计的得分项。
P(i 胜 j)=1 ÷(1+e⁻⁽ˢⁱ⁻ˢʲ⁾)s 是待估计的潜在能力。算法用全部加权结果联合求解,而不是逐来源先算平均分。
Scoreᵢ=100/|A| × Σₐ∈A P(i 胜 a)A 是当前连通分量里的固定锚点集合;锚点只定义尺子,不增加额外胜场或来源权重。
优化目标是加权 Bradley–Terry 对数损失加零中心高斯弱先验。相同快照、目录和版本输入会得到完全相同的排序;不使用当期最高分、最低分或百分位重新拉伸刻度。
使用完整目标函数 Hessian 的 Laplace 近似,并通过 delta method 把能力方差传播到 0—100 分尺:SE=√(gᵀH⁻¹g)。它同时考虑目标模型与全部锚点的相关不确定性,不是简单的来源标准差。
高:至少 5 个证据家族、加权覆盖率不低于 50%、分数标准误不高于 4;中:标准误不高于 8;其余为低。置信等级只描述稳定性,不直接改变排名。
全部来源组预算总和为 100%,每个独立来源组固定占 10%;Arena Text 与 WebDev 各占 5%,llm2014 Agent 与推理各占 5%。同一证据家族当前总占比不超过 30%,避免相关榜单以不同名称重复控制结果。
Agent、工具调用、脚手架和推理档位是评测配置,不是新的基础模型。来源选择出的代表配置成绩统一归到对应裸模,配置名称和原始分继续保留在详情页供审计。
配置优先级由第一方身份、推理档位和来源控制方式预先确定。同一来源和指标中只允许一条配置进入正式比较,其他配置不会重复增加模型的胜场。
排名必须按潜在能力中心估计排出先后,但相邻模型的分差可能远小于各自不确定度。这种情况下只能说中心估计略高,不能据此断言前一名显著强于后一名。
缺失也可能不是随机的:如果一个模型只参加擅长的评测,任何拒绝虚构分数的算法都无法完全消除选择性参赛风险。AIHOT 选择公开完整度与不确定度,而不是用不可验证的矩阵补全偷偷猜分。
模型详情里的来源换算位置只帮助核对原榜,不参与算术平均复算;正式总分始终来自同一套加权成对网络。