并排模型对比
用户可以与模型对话,将回复并排比较,然后投票选出他们认为更好的答案。这把日常提示词变成了一个公开评测流程。
Arena 是一个公开的 AI 模型对比与排名平台。它允许人们与前沿模型聊天、比较回复、投票选出更好的答案,并帮助塑造大型语言模型、图像模型、代码模型以及其他按任务划分的 arena 的社区排行榜。
该网站将自己定位为一个用于在真实世界评测场景中对模型进行基准测试的官方排行榜。专门的排行榜页面涵盖文本、视觉、文档理解、图像生成与编辑、网页开发、搜索、文生视频、图生视频、视频编辑以及智能体任务。
用户可以与模型对话,将回复并排比较,然后投票选出他们认为更好的答案。这把日常提示词变成了一个公开评测流程。
Arena 维护多个 arena 的排行榜视图,包括文本、视觉、文档、图像生成、图像编辑、网页开发、搜索和视频任务。每个视图都会显示排名模型和分数差距。
Agent Arena 页面会使用工具可靠性、任务完成度和可控性等信号,对模型在真实世界智能体任务中的表现进行排名。这使它不仅适合评估对话质量,也适合评估编排能力。
网站包含一个可搜索的聊天历史区域,用于查看过往对话,并提供 Agent、Battles、Search、Code、Image、Video 和 Archived 聊天标签页。这有助于回溯之前的评测和示例。
排行榜页面提供高层概览和更深入视图的链接,因此用户可以先快速浏览,再在需要时深入到某个特定 arena。
比较多个前沿模型的回复,判断哪一个输出对特定提示词最有用。这是评估通用聊天质量的人群的核心工作流。
在为视觉、文档理解、搜索、网页开发或视频生成工作选择模型时,查看按任务划分的排名。专门的 arena 让同类比较更容易。
使用 Agent Arena 排行榜查看模型在需要编排工具并完成多步工作的场景中的表现。该排名强调可靠性、完成度和可控性。
搜索过去的对话和对战记录,回看示例、比较之前的提示词,或跟踪不同类别中的历史评测。
Arena 允许你开始对话、比较模型回复,并投票选出你认为更好的答案。该网站还提供已保存聊天的搜索功能,以及针对智能体、文本、图像和其他模型类别的专用排行榜。
公开网站显示了排行榜页面和聊天界面,但 `/pricing` 下的定价页面目前返回 404。根据现有来源,那里未公布定价详情。
渲染后的首页提示,输入会由第三方 AI 处理,且对话和某些个人信息可能会被披露给 AI 提供方,并且可能以其他方式公开披露。系统会提醒用户不要提交自己不希望公开的信息。
排行榜页面按任务类型组织,包括文本、网页开发、视觉、文档、文生图、图像编辑、图像转网页开发、搜索、文生视频、图生视频和视频编辑。智能体排行榜重点展示工具使用、任务完成度、可靠性和可控性表现。
书生是通用大模型体系,覆盖语言、多模态、气象海洋、工业设计、三维空间、金融与科学发现等场景,提供模型与平台能力;官网未公开价格、部署步骤或接入文档。
OpenAI 是一家 AI 研究与部署公司,聚焦 ChatGPT、API、Platform 工具和 Codex。适合个人、开发者和企业探索对话式 AI、构建模型应用并了解产品与研究更新。
小艺是华为自主研发的 AI 智慧助手,支持知识问答、AI 写作、文档阅读、代码辅助与识图,适合日常查询、内容处理和鸿蒙开发场景,并支持文件拖放输入。
AI Magicx 是一体化 AI 工作区,集聊天、图片、视频、语音、音乐、邮件和开发任务于一处,帮助创作者、团队和开发者集中使用多种模型,无需在多个工具和订阅间切换。
Hypertype 是面向工业领域支持团队的 AI agent,可减少重复性前线工作,兼容现有工具,并在企业咨询式上线流程中使用客户选定的数据。
Bible.ai is a Christian AI app for scripture-based conversations, faith questions, and biblical guidance through voice or text. It is positioned for believers and the Christian community rather than general-purpose AI use.