聊天并对比模型
在一个界面中并排发起聊天并比较模型回复,通过投票为社区排名流程提供反馈。
Arena 是一个基于真实用户评测的公开 AI 模型排行榜与对比平台。它允许用户与多个模型聊天、比较它们的回答,并通过投票帮助塑造大型语言模型、图像系统、代码模型和智能体工具的排名。
该网站将模型表现组织到专门的竞技场中,包括文本、视觉、网页开发、搜索、视频、图像编辑和智能体任务。这使它既适合随手比较,也适合想快速了解前沿模型在不同工作类型中表现的读者。
在一个界面中并排发起聊天并比较模型回复,通过投票为社区排名流程提供反馈。
使用 Battle Mode 通过直接的一对一交互评估前沿模型,而不只是依赖静态基准表。
浏览覆盖文本、网页开发、视觉、文档、图像、搜索、视频和视频编辑任务的广泛排行榜。
查看独立的智能体排名,重点关注真实智能体工作中的工具使用、任务完成度、可靠性和可控性。
查看带有分数展示和不确定性范围的模型排名列表,在可用时提供比单纯排序列表更多的上下文。
在 Arena 界面中搜索聊天历史,查找更早的对话和过去的交互。
测试不同前沿模型如何回答同一个提示词,然后对结果投票,帮助公开排名更贴近真实比较。
当你想快速了解某个特定任务类别中哪些模型领先时,查看文本、视觉、网页开发、图像、搜索或视频竞技场。
使用智能体排行榜评估模型在编排工具和完成真实智能体任务方面的表现。
当你需要回看自己聊天历史中的先前提示词或输出时,在 Arena 中搜索早期对话。
Arena 是一个公开的 AI 模型排行榜与对比网站。用户可以与模型聊天、比较回复、投票,并查看涵盖文本、视觉、网页开发、图像、视频、搜索和智能体任务等领域的排名。
这个网站以直接的模型对比和公开评测为核心,而不是传统的软件套件。首页突出展示了 Battle Mode,排行榜页面则按任务领域组织模型,并基于真实世界的评测信号进行排序。
来源没有显示可用的定价页面。/pricing URL 当前返回 404 页面,因此无法从所提供的证据中确认任何套餐、试用或计费详情。
该网站包含一个用于聊天历史的搜索页面,这表明用户可以搜索过去的对话。除此之外,所提供的来源并未确认账户、团队、API 或工作区功能。