网站简介
Arena是供用户对两个匿名大模型的回答进行并排比较和投票、并据此形成人类偏好排名的公开评测平台。
它对应的痛点是跑分好看、聊起来却不一定顺手。同一条问题下直接看两段回答,用众人的选择代替厂商自己挑例子。做选型、写评测或只是想知道差距从哪来,都比收藏一串参数更有参照。
品牌与平台背景
公开论文与社区讨论里,这类盲测与LMSYS相关研究者推动的Chatbot Arena是同一路方法:2023年前后,他们把“真人在匿名条件下选出更好的回答”做成可累积的评测,用来补静态考题和日常对话之间的空隙。
痛点在于基准题可能被针对训练,宣传材料又往往只留顺手的示范。平台靠用户自愿对战和投票运转,而不是由某一家模型厂商给自己打分。受众主要是研究人员、应用开发者和想自己体会差距的普通用户。它的位置是人类偏好的公共参照,不能代替安全审查、隐私评估,也不能代替你在自己业务数据上的实测。
网站核心特点以及功能
- 同一提示并排给出两段回答,便于直接看完整度、语气和有没有跑题。
- 对战过程中模型名称通常先隐藏,投票后再揭晓,减轻只认牌子的偏差。
- 大量用户的选择被汇总成相对排名,用来看谁更常被真人偏好。
- 场上既有闭源服务也有开源模型,具体名单会随接入情况变动。
- 题目来自人们真的在问的内容,而不是只反复刷同一套公开考题。
- 排名随新投票更新,适合回看一段时间内的升降,不宜当成永远不变的名次。
用户群体
常来的包括需要人类偏好材料的研究者,给产品挑底层模型、担心演示很强落地发飘的工程师,以及并不写代码、只想知道最近哪几家聊天更顺的普通用户。做课程作业的学生,也会拿对战记录体会评测偏差是怎么来的。
若你的场景强依赖行业数据、合规和私有流程,这里只适合先缩小候选,不能当成唯一采购结论。
常见问题FAQ
盲测时能不能先看到是哪两个模型?
通常是先看回答、投票后再揭晓名称,用来减少品牌印象。若页面提示有调整,以当时规则为准。
排行榜分数能不能当成考试成绩?
它表示社区偏好下的相对位置,会随新投票变化,也不等于数学、代码或安全等单项能力已经满分。
为什么有时要等,或抽不到想比的模型?
热门模型对战更集中,采样还会照顾对比次数还不够的新模型。等一会儿或换个问题再试,是使用里常见的情况。
看完榜单还要自己试吗?
要。榜单适合缩小范围,你的语言、行业词和格式要求仍可能把名次反过来,最好拿几条真实任务再比一次。
数据统计
相关导航
Seedance 2.0 视频生成模型现已全面接入豆包,现在登录即可免费使用!豆包 是你的 AI 聊天智能对话问答助手,写作文案翻译编程工具。豆包为你答疑解惑,提供灵感,辅助创作,也可以和你畅聊任何你感兴趣的话题
新zcode-switch
一款用于在VS Code与Cursor等编辑器之间快速切换项目配置的工具,简化多环境开发流程。
新Narra Image
Narra Image 是一款潮流感AI生图工作台,支持内置渠道与自填 OpenAI 兼容渠道,帮助创作者高效生成叙事性图像。
新l0veyou AI助手
l0veyou是在线AI智能助手,提供对话问答与文本生成,帮用户快速解决写作、学习与日常疑问。

就想找个地方看各家模型谁更像正常人说话,这个盲测榜挺对得上。
匿名两边一起答,投票比自己来回切换窗口省事,热门的有时要等一下。
我盯的是写代码会不会瞎编步骤,投完票才揭晓名字,感觉没那么容易被牌子带跑。