JevBench:给只输出选项的模型做一份加权榜单
一个面向“输出选项和概率”模型的公开基准:534 道英文决策题,把猜测修正后的准确率、校准、速度和成本合成一个分数,并公开计分代码与逐题结果。
输出不是段落,而是一个选择
JevBench 评测的模型不写文章。这类被作者称为 Jev-class 的模型,回答方式是在有限选项里挑一个,并给出概率。输入仍然是文本;作者的判断是,它们在这些文本上的智能程度与 LLM 相当,但更快、更便宜。后半句是主张,不是给定条件——benchmark 的意义正是让这类主张可以被别人检验。
工具本身做的事不复杂:跑 534 道英文决策题,把准确率、延迟和价格放在一起看。三项不是分开列表,而是加权合成一个分数,权重可以自己调。同一批原始数据,按“我更在意便宜”或“我更在意快”会排出不同次序。所以看到一张榜单截图,先问它用的是哪套权重。
分数由四块拼起来
v1.3 的分数来自四个部分:经过猜测修正的 intelligence、calibration、speed 和 cost。猜测修正值得单独说一句——选项空间小的时候蒙对的概率不低,不做修正会给出虚高的准确率。calibration 入分同样合理:模型说“70% 概率”时命中率是否真在 70% 附近,决定了它的概率输出能不能直接接到下游流程里,而一个自信但答错的模型比一个保守的模型更麻烦。速度与成本是实测项,不是估算,不过延迟这一项有下面的保留条件。
当前前五名,以及它们的保留条件
榜单目前是这样:
- #1 Jev 74.4
- #2 SemIf 73.1
- #3 djev 73.0
- #4 Winnow-12B Q8 71.2
- #5 reflex 4B 70.3
第一名和第二名差 1.3 分,第二名和第三名只差 0.1 分,第四和第五差 0.9 分。
引用这些数字前,有两件事该先摆在桌面上。第一,JevBench 出自 Jev 的支持者之手:提交帖开篇就是“Jev kicks ass”,作者做这个评测的动机是看看“正经开源项目和仿冒项目”到底谁更能打,而榜首正是 Jev。这不等于作弊,但评测方与被评方的关系是排名的一部分语境。第二,作者自己列了限制:题目只有英文;延迟来自一台德国服务器;本地与演示环境的延迟要乘 2 再加 150 毫秒,作者称这是一个有依据的假设而非实测值;留出的提示词仍会送到被评测的服务;大约 1 分的差距可能只是噪声。按最后一条,第二名与第三名之间那 0.1 分不构成结论,第四名与第五名之间 0.9 分的距离也在边界上。
复现路径
MIT 许可的评测框架、公开题目、冻结产物、计分代码和逐题结果都在 github.com/fstandhartinger/jevbench,另外有两个免注册的在线演示。对一个自建自评的项目来说,这是基本正确的披露姿态:它不终结争论,但把争论变成可以动手复核的事。Hacker News 上的讨论帖目前是 97 分、24 条评论。
来源:Show HN: JevBench, a reproducible benchmark for typed decision models(Hacker News RSS)