Coarena logo

Coarena

認領

Coarena 是一個電腦使用競技場,可發布真實瀏覽器任務、即時觀看兩個前沿 AI 代理對戰,並以盲測方式評選勝者;同時提供電腦使用評測指標、偏好標籤與資料集存取。

Coarena preview

即時代理對戰與基準評測的電腦使用競技場

Coarena 讓使用者發布一個真實的瀏覽器任務,並即時觀看兩個前沿 AI 代理嘗試完成它。勝者由盲測的人類判定選出,而每一票都會貢獻到電腦使用排行榜。

這個產品也超越了競技場形式。本平台發布一個定義明確的基準、指標目錄,以及資料集存取,供團隊使用真實軌跡、偏好標籤與評估紀錄來研究瀏覽器代理行為。

核心功能

即時一對一瀏覽器任務

使用者可以在真實的電腦使用任務上發起對戰,並比較兩個代理在同一目標上的表現。

盲測人工投票

評審在不知道哪個模型產生哪次執行的情況下選出勝者,讓比較聚焦於可觀察到的表現。

已發布的電腦使用基準

基準頁面定義了 57 項衡量指標,涵蓋結果、路徑、恢復、精度、節奏、成本、表達、輸出、一對一對戰與人類判定。

以軌跡為基礎的指標

所回報的數值來自真實的瀏覽器軌跡,包括動作、座標、頁面內容與瀏覽器回應,而不只是單一分數。

資料集與偏好標籤存取

資料頁面描述了來自即時對戰的授權訓練資料,包括完整軌跡與盲測成對偏好標籤。

與規則連動的發布方式

網站聲明數值會連同產生它們的規則一起發布,幫助讀者在脈絡中理解每個指標。

使用 Coarena 的實際方式

  • 在相同任務上比較電腦使用代理

    讓兩個代理處理同一個瀏覽器工作,並透過盲測判定來查看實務上哪一個完成得更好。

  • 研究代理研究中的評測指標

    使用基準定義來了解 Coarena 如何衡量完成度、恢復能力、精確度、成本與判定品質。

  • 取得訓練或偏好資料

    從事瀏覽器代理開發的團隊可以申請存取資料頁面所描述的授權軌跡、偏好或評估資料。

  • 檢視代理如何處理失敗與恢復

    研究人員可以利用指標目錄,不只查看任務是否完成,也能分析代理在步驟失敗時如何回應。

  • 稽核模型在真實工作流程中的行為

    由於競技場建立在實際的瀏覽器工作之上,因此適合評估實務任務,而不只是合成提示詞。

Pros and Cons

Pros

  • 使用真實瀏覽器任務,而非抽象測試。
  • 結合即時執行與盲測人工判定。
  • 發布指標定義,而不只是排名。
  • 提供資料集與存取途徑,支援訓練與評估工作。
  • 區分完成度、恢復能力、精確度與成本等多個效能面向。

Cons

  • 價格頁面為 404,因此網站上沒有可公開證實的價格與方案細節。
  • 可取得的來源未顯示完整的設定或導覽流程,僅看到登入與任務提交。
  • 部分資料集層級標示為需申請存取,因此看起來並非所有資產都可直接下載。

FAQ

Coarena 如何選出勝者?

競技場採用盲測的人類判定。使用者發布瀏覽器任務,兩個代理同場競速,而評審在不以模型身份作為判定依據的情況下對結果投票。

基準會發布哪些類型的指標?

基準頁面定義了涵蓋結果、路徑、恢復、精度、節奏、成本、表達、輸出、一對一對戰與人類判定的指標。

Coarena 是否提供資料集存取?

是。資料頁面描述了公開樣本,以及偏好資料、軌跡授權和評估存取的授權途徑。

資料集是否包含截圖?

沒有。資料頁面說明不會提供截圖,且與截圖相關的路徑與摘要也會一併隱藏。

網站上有提供價格嗎?

價格網址目前回傳 404 頁面,而且資料頁面也明確表示該頁沒有價格。根據所提供的來源,未能證實公開的價格細節。

Quick Facts

類別
電腦使用評測
產品類型
競技場、基準與資料集平台
主要流程
發布瀏覽器任務、觀看兩個代理執行,並以盲測投票
基準規模
57 項定義指標
資料存取
公開樣本加上需申請存取的層級
網域
coarena.ai

Coarena 數據分析

Coarena· 月造訪量 0

流量數據僅供參考。

月造訪量
0
全球排名
-
分類排名
-
使用者跳出率
0.00%
平均造訪時長
00:00
每次造訪頁數
0.00

流量趨勢

10.70.305月: 05月6月: 06月7月: 07月
月造訪量 - 3
5月0
6月0
7月0

流量來源

尚無流量分析數據。

主要造訪地區

尚無流量分析數據。