比较大模型,过去常像只看考试总分:你知道谁高几分,却不知道它错在知识、推理、格式,还是评分规则。lm-eval-ledger 是一套评测脚手架——自动运行题集、记录输出并计算指标的程序。它把结果写入 SQLite 数据库,再用网页逐题展示系统提示、模型回答、标准答案、停止原因等信息,还能并排比较两个模型。
这类细节会改变人们对排行榜的理解。作者在单张 5090 上测试三款模型时发现,Qwen3.5-9B 在 GPQA Diamond 得分最高,为 0.717,但耗时也最长;到了 LiveCodeBench,它耗时 22 小时 57 分,得分却最低,为 0.713。换句话说,“想得更久”并不总能换来更好结果。工具还会找出多次评测中始终答对或始终答错的题,方便开发者定位失败模式和版本退步。上述结果均来自作者自述,供稿未提供独立复核。