榜首模型在竞标里输给了榜上查无此模型的一家——聊聊榜单为什么越来越不靠谱

📅 发布时间:2026/10/10 0:33:01
榜首模型在竞标里输给了榜上查无此模型的一家——聊聊榜单为什么越来越不靠谱
上个月帮朋友公司评一个智能客服的标两家供应商一家推的是当月 Arena 榜Chatbot Arena让两个模型匿名对战、用户盲选谁答得好的众包评测榜单前十的模型另一家用的是个榜单上查无此牌的微调版本。结果甲方业务方盲测了三天选了后者——榜首那家被淘汰的理由写在反馈单上回答得太漂亮了像发言稿客户是打工人要的是话术能落地的。这事搁三年前我会觉得离谱现在见多了。榜单排名和生产环境表现脱节已经快成行业公开的秘密但为什么脱节值得把账摊开算一算。先交代背景。主流榜单的玩法大概两条路一条是 Arena 这种真人盲选一条是 MMLU、GPQA 这类固定题库的自动评分。前者的问题出在评分者身上——用户在几千字的正常回答里投给格式漂亮、语气讨喜、列表排得整齐的那一个英语用户的票还占大头。Cohere 团队去年发过一篇叫 The Leaderboard Illusion 的论文把 Arena 的老底翻了一遍闭源厂商能拿到约两倍于对手的私密测试数据还能对着榜单独享变体静默测分、不合适就撤回论文的统计里某开源系家族挂了 44 个变体有个竞争对手只挂了 3 个。等于别人开卷、你闭卷还得跟一个家族的几十个分身抢排名。固定题库那条路的毛病更老生常谈——数据污染评测题早就混进了训练数据模型不是会做题是背过题。所以现在看榜单我的姿势变了不少。风格类榜单基本不看了只当个大概的风向标代码、数学这类硬任务我会盯着官方技术报告里的我们筛掉了污染数据那一段读——OpenAI 自己就披露过 GPQA 的公开版本有污染所以后来搞代码评测转用了 SWE-bench Verified两千多道原始题里靠人工核验筛出五百来道宁可题少也要题干净。去年还有个更刺激的Epoch AI 发现其委托的 FrontierMath 数学题集六成以上被训练过而披露方正是 OpenAIEpoch 事先并不知情。连出题人都能被绕进去你说这游戏水多深。真要选型我现在更信两类难刷的信号。一类是 METR 提出的时间跨度time horizon给模型发任务统计它能有五成把握独立完成的任务长度对应的人类专家需要多久。这个指标有意思的地方在于它没法靠背——题是现编的。而且它的推论直接戳中选型场景按这几年的数据模型能搞定的人类任务长度大约每七个月翻一倍GPT-4 时代是五分钟的活到 o3 已经能干两小时上下的活到最新一代的旗舰四小时往上。模型/时期50% 完成率的任务长度METR 口径GPT-42023 年初约 5 分钟2024 年中的前沿模型约 20 分钟o32025 年约 2 小时另一类信号是自己攒题。我在团队里维护着一个二三十条的长上下文测试集全是真实工单里捞出来的刁钻问题答案只有业务方知道从不外流。上季度用它测模型榜首那个在 Arena 上封神的模型测试集上的差评率反而是三个候选里最高的——业务问题要的是从四万字的合同里找出违约条款并给出依据不是把八股文写得漂亮。顺便说个坑自建测试集千万别只测答对没要连该说不知道的时候说了不知道一起测不然你会挑出最会胡编的那一个。这个坑我在置信度那篇文章里写过这里不展开。把镜头拉远一点我判断榜单的参考价值还会继续跌。原因有两个一个是老问题的加剧各家都在用可验证奖励的强化学习RLVR用答案对不对直接当奖励信号训练模型模型的应试能力会跟真实能力越拉越开固定题库的区分度只会更差另一个是任务形态变了Agent 干活的成败在于几十步工具调用里哪一步没接住一个总分根本盖不住这种长尾失败非要量化就得给每个环节的失败单独记账——这活儿没有现成榜单干得了。Live 类的动态题库、真实工作流的通过率大概率是评测的下一站。当然话说回来榜单也不是一无是处它好歹是个粗糙的海选工具帮你把几百个模型筛到三五个再细测。要警惕的不是看榜是把榜首当答案。回到开头那场竞标。落选的榜首模型委屈吗不委屈它只是考了一辈子试头一回遇到不按考纲出题的甲方。你们团队现在选模型还看榜单吗还是已经攒了自己的测试集评论区聊聊你的验证姿势——说不定你踩过的题正好是别人要绕的坑。