主 题:做了一个每日自动更新的大模型排行榜,把 Arena 分数和 API 价格放到了一起
发 布 者:强东
标签分类: 技术
时 间:2026-09-20 10:27:41
内容预览:平时选模型总在两个地方来回切:看 Arena 榜知道谁强,看定价页知道谁便宜,但「又强又便宜」的那个往往得自己算。所以做了这个:每天自动拉 LMArena 的 Arena 分数 + OpenRouter 的公开定价,算出「按预算选」:每档价格里给一个最强的模型,并标出它比榜首差多少分。几个自己觉得有用的点:每个名次都带 95% 置信区间。分数接近时区间会重叠,这时名次差其实没有意义—— 榜上直接标出来,不装作很精确。历史快照按天存,可以 diff 任意两天的变化。全是 Markdown + JSON,不用跑任何东西,打开就能看。数据源只用了 LMArena(CC-BY-4.0)和 OpenRouter 公开定价。Artificial Analysis 的条款明确禁止再分发,所以没有纳入。仓库:https://github.com/AmigaMeow/llm-leaderboard-data在线版:https://17nas.com/llm-leaderboard.php
直达链接: https://www.nodeseek.com/post-938107-1
发 布 者:强东
标签分类: 技术
时 间:2026-09-20 10:27:41
内容预览:平时选模型总在两个地方来回切:看 Arena 榜知道谁强,看定价页知道谁便宜,但「又强又便宜」的那个往往得自己算。所以做了这个:每天自动拉 LMArena 的 Arena 分数 + OpenRouter 的公开定价,算出「按预算选」:每档价格里给一个最强的模型,并标出它比榜首差多少分。几个自己觉得有用的点:每个名次都带 95% 置信区间。分数接近时区间会重叠,这时名次差其实没有意义—— 榜上直接标出来,不装作很精确。历史快照按天存,可以 diff 任意两天的变化。全是 Markdown + JSON,不用跑任何东西,打开就能看。数据源只用了 LMArena(CC-BY-4.0)和 OpenRouter 公开定价。Artificial Analysis 的条款明确禁止再分发,所以没有纳入。仓库:https://github.com/AmigaMeow/llm-leaderboard-data在线版:https://17nas.com/llm-leaderboard.php
直达链接: https://www.nodeseek.com/post-938107-1