并排模型对比
用户可以与模型对话,将回复并排比较,然后投票选出他们认为更好的答案。这把日常提示词变成了一个公开评测流程。
Arena 是一个公开的 AI 模型对比与排名平台,可聊天对比模型、投票输出,并浏览按任务分类的排行榜,帮助评估文本、视觉、代码、搜索、视频和智能体任务中的前沿模型。
Arena 是一个公开的 AI 模型对比与排名平台。它允许人们与前沿模型聊天、比较回复、投票选出更好的答案,并帮助塑造大型语言模型、图像模型、代码模型以及其他按任务划分的 arena 的社区排行榜。
该网站将自己定位为一个用于在真实世界评测场景中对模型进行基准测试的官方排行榜。专门的排行榜页面涵盖文本、视觉、文档理解、图像生成与编辑、网页开发、搜索、文生视频、图生视频、视频编辑以及智能体任务。
用户可以与模型对话,将回复并排比较,然后投票选出他们认为更好的答案。这把日常提示词变成了一个公开评测流程。
Arena 维护多个 arena 的排行榜视图,包括文本、视觉、文档、图像生成、图像编辑、网页开发、搜索和视频任务。每个视图都会显示排名模型和分数差距。
Agent Arena 页面会使用工具可靠性、任务完成度和可控性等信号,对模型在真实世界智能体任务中的表现进行排名。这使它不仅适合评估对话质量,也适合评估编排能力。
网站包含一个可搜索的聊天历史区域,用于查看过往对话,并提供 Agent、Battles、Search、Code、Image、Video 和 Archived 聊天标签页。这有助于回溯之前的评测和示例。
排行榜页面提供高层概览和更深入视图的链接,因此用户可以先快速浏览,再在需要时深入到某个特定 arena。
比较多个前沿模型的回复,判断哪一个输出对特定提示词最有用。这是评估通用聊天质量的人群的核心工作流。
在为视觉、文档理解、搜索、网页开发或视频生成工作选择模型时,查看按任务划分的排名。专门的 arena 让同类比较更容易。
使用 Agent Arena 排行榜查看模型在需要编排工具并完成多步工作的场景中的表现。该排名强调可靠性、完成度和可控性。
搜索过去的对话和对战记录,回看示例、比较之前的提示词,或跟踪不同类别中的历史评测。
Arena 允许你开始对话、比较模型回复,并投票选出你认为更好的答案。该网站还提供已保存聊天的搜索功能,以及针对智能体、文本、图像和其他模型类别的专用排行榜。
公开网站显示了排行榜页面和聊天界面,但 `/pricing` 下的定价页面目前返回 404。根据现有来源,那里未公布定价详情。
渲染后的首页提示,输入会由第三方 AI 处理,且对话和某些个人信息可能会被披露给 AI 提供方,并且可能以其他方式公开披露。系统会提醒用户不要提交自己不希望公开的信息。
排行榜页面按任务类型组织,包括文本、网页开发、视觉、文档、文生图、图像编辑、图像转网页开发、搜索、文生视频、图生视频和视频编辑。智能体排行榜重点展示工具使用、任务完成度、可靠性和可控性表现。