即時一對一瀏覽器任務
使用者可以在真實的電腦使用任務上發起對戰,並比較兩個代理在同一目標上的表現。
Coarena 是一個電腦使用競技場,可發布真實瀏覽器任務、即時觀看兩個前沿 AI 代理對戰,並以盲測方式評選勝者;同時提供電腦使用評測指標、偏好標籤與資料集存取。

Coarena 讓使用者發布一個真實的瀏覽器任務,並即時觀看兩個前沿 AI 代理嘗試完成它。勝者由盲測的人類判定選出,而每一票都會貢獻到電腦使用排行榜。
這個產品也超越了競技場形式。本平台發布一個定義明確的基準、指標目錄,以及資料集存取,供團隊使用真實軌跡、偏好標籤與評估紀錄來研究瀏覽器代理行為。
使用者可以在真實的電腦使用任務上發起對戰,並比較兩個代理在同一目標上的表現。
評審在不知道哪個模型產生哪次執行的情況下選出勝者,讓比較聚焦於可觀察到的表現。
基準頁面定義了 57 項衡量指標,涵蓋結果、路徑、恢復、精度、節奏、成本、表達、輸出、一對一對戰與人類判定。
所回報的數值來自真實的瀏覽器軌跡,包括動作、座標、頁面內容與瀏覽器回應,而不只是單一分數。
資料頁面描述了來自即時對戰的授權訓練資料,包括完整軌跡與盲測成對偏好標籤。
網站聲明數值會連同產生它們的規則一起發布,幫助讀者在脈絡中理解每個指標。
讓兩個代理處理同一個瀏覽器工作,並透過盲測判定來查看實務上哪一個完成得更好。
使用基準定義來了解 Coarena 如何衡量完成度、恢復能力、精確度、成本與判定品質。
從事瀏覽器代理開發的團隊可以申請存取資料頁面所描述的授權軌跡、偏好或評估資料。
研究人員可以利用指標目錄,不只查看任務是否完成,也能分析代理在步驟失敗時如何回應。
由於競技場建立在實際的瀏覽器工作之上,因此適合評估實務任務,而不只是合成提示詞。
競技場採用盲測的人類判定。使用者發布瀏覽器任務,兩個代理同場競速,而評審在不以模型身份作為判定依據的情況下對結果投票。
基準頁面定義了涵蓋結果、路徑、恢復、精度、節奏、成本、表達、輸出、一對一對戰與人類判定的指標。
是。資料頁面描述了公開樣本,以及偏好資料、軌跡授權和評估存取的授權途徑。
沒有。資料頁面說明不會提供截圖,且與截圖相關的路徑與摘要也會一併隱藏。
價格網址目前回傳 404 頁面,而且資料頁面也明確表示該頁沒有價格。根據所提供的來源,未能證實公開的價格細節。
流量數據僅供參考。
| 5月 | 0 |
|---|---|
| 6月 | 0 |
| 7月 | 0 |
尚無流量分析數據。
尚無流量分析數據。