实时一对一浏览器任务
用户可以在真实的 computer-use 任务上发起对战,并在同一目标下比较两个代理。
Coarena 是一个用于发布真实浏览器任务、观看两个前沿 AI 代理实时对战并以盲审判定胜负的 computer-use arena,同时提供基准指标、偏好标签与数据集访问,用于 computer-use 评测。

Coarena 允许用户发布真实的浏览器任务,并观看两个前沿 AI 代理实时尝试完成任务。胜者由盲审的人类判断选出,每一票都会计入 computer-use 排行榜。
该产品也不仅限于 arena 形式。它发布了明确的基准、指标目录,以及数据集访问,供希望使用真实轨迹、偏好标签和评测记录来研究浏览器代理行为的团队使用。
用户可以在真实的 computer-use 任务上发起对战,并在同一目标下比较两个代理。
评审在不知道哪个模型产生了哪次运行的情况下选择胜者,这让比较更聚焦于可观察到的表现。
基准页面定义了 57 项指标,涵盖结果、路径、恢复、精度、节奏、成本、表达、输出、一对一对战以及人类判断。
报告的数值来自真实的浏览器轨迹,包括动作、坐标、页面上下文和浏览器回复,而不是仅仅基于单一分数。
数据页面描述了来自实时对战的许可训练数据,包括完整轨迹和盲法成对偏好标签。
网站说明发布的数值都附带生成这些数值的规则,帮助读者结合上下文解读每项指标。
让两个代理执行相同的浏览器任务,并通过盲审判断看看在实际中谁完成得更好。
使用基准定义来理解 Coarena 如何衡量完成度、恢复能力、精度、成本和判断质量。
从事浏览器代理工作的团队可以申请访问数据页面所描述的许可轨迹、偏好或评测数据。
研究人员可以使用指标目录来考察任务是否完成,也可以考察代理在某一步失败时如何响应。
由于该 arena 基于真实的浏览器工作,因此它适合评估实际任务,而不仅仅是合成提示。
该 arena 使用盲审的人类判断。用户发布一个浏览器任务,两个代理展开竞争,评审在不以模型身份为依据的情况下投票决定结果。
基准页面定义的指标涵盖结果、路径、恢复、精度、节奏、成本、表达、输出、一对一对战以及人类判断。
是的。数据页面描述了一个公开样本,以及用于偏好数据、轨迹许可和评测访问的许可路径。
不包含。数据页面说明不会交付截图,并且与截图一起的路径和摘要也会被保留。
定价 URL 目前返回 404 页面,而且数据页面明确说明该页面没有定价信息。所提供来源中没有证实公开定价详情。
流量数据仅供参考。
| 5月 | 0 |
|---|---|
| 6月 | 0 |
| 7月 | 0 |
暂无流量分析数据。
暂无流量分析数据。