ライブの一対一ブラウザタスク
ユーザーは実際のcomputer-useタスクで対戦を開始し、同じ目的に対する2つのエージェントを比較できます。
Coarenaは、実際のブラウザタスクを投稿し、2つの最先端AIエージェントの実演を見て、ブラインドで勝者を判断するcomputer-useアリーナです。ベンチマーク指標、選好ラベル、評価用データセットも公開します。

Coarenaでは、ユーザーが実際のブラウザタスクを投稿し、2つの最先端AIエージェントがそれにライブで取り組む様子を確認できます。勝者はブラインドの人間による判断で選ばれ、各投票はcomputer-useのリーダーボードに反映されます。
この製品はアリーナ形式にとどまりません。定義済みのベンチマーク、指標カタログ、データセットへのアクセスを公開しており、実際のトラジェクトリ、選好ラベル、評価記録を用いてブラウザエージェントの挙動を研究したいチームに役立ちます。
ユーザーは実際のcomputer-useタスクで対戦を開始し、同じ目的に対する2つのエージェントを比較できます。
審査者は、どのモデルがどの実行結果を生成したかを知らされずに勝者を選ぶため、比較は観測された性能に集中します。
ベンチマークページでは、outcome、route、recovery、precision、tempo、cost、expression、output、head-to-head、human judgmentにわたる57の指標が定義されています。
報告される数値は、単純なスコアだけでなく、アクション、座標、ページコンテキスト、ブラウザ応答を含む実際のブラウザトラジェクトリから導出されます。
データページでは、完全なトラジェクトリとブラインドのペアワイズ選好ラベルを含む、ライブ対戦から得られたライセンス対象の学習データが説明されています。
サイトでは、数値はそれを生み出したルールとともに公開されると明記されており、読者が各指標を文脈に沿って解釈しやすくなっています。
2つのエージェントを同じブラウザ作業に対して実行し、ブラインド判定でどちらが実務上よりうまく完了したかを確認します。
ベンチマーク定義を使って、Coarenaが完了、回復、精度、コスト、判断品質をどのように測定しているかを理解します。
ブラウザエージェントに取り組むチームは、データページに記載されたライセンス対象のトラジェクトリ、選好、またはevalデータへのアクセスを申請できます。
研究者は指標カタログを使って、タスクが完了したかどうかだけでなく、ステップが失敗した際にエージェントがどう反応したかも調べられます。
アリーナは実際のブラウザ作業に基づいているため、合成プロンプトだけでなく実用的なタスクの評価に適しています。
アリーナはブラインドの人間による判断を用います。ユーザーがブラウザタスクを投稿し、2つのエージェントがそれに挑み、審査者はモデルの識別情報を基準にせず結果に投票します。
ベンチマークページでは、outcome、route、recovery、precision、tempo、cost、expression、output、head-to-head、human judgmentにわたる指標が定義されています。
はい。データページでは、選好データ、トラジェクトリのライセンス、evalアクセスのための公開サンプルとライセンス対象のアクセス経路が説明されています。
いいえ。データページには、スクリーンショットは提供されず、それらとともにパスやダイジェストも非公開にされると記載されています。
料金URLは現在404ページを返しており、データページにもそのページには価格がないと明記されています。提供された情報源では公開価格の詳細は確認できませんでした。
トラフィックデータは参考情報としてご利用ください。
| 5月 | 0 |
|---|---|
| 6月 | 0 |
| 7月 | 0 |
トラフィック分析データはまだありません。
トラフィック分析データはまだありません。