モデルをチャットで比較する
横並びのチャットを実行して、1つのインターフェースでモデルの回答を比較し、コミュニティのランキング作成に反映される投票も行えます。
Arenaは、実ユーザーによる評価を中心に構築された、公開AIモデルランキング・比較プラットフォームです。ユーザーは複数のモデルと会話し、回答を比較し、大規模言語モデル、画像システム、コードモデル、エージェント系ツールのランキング形成に役立つ結果に投票できます。
このサイトは、テキスト、ビジョン、Web開発、検索、動画、画像編集、エージェントタスクなど、専用のアリーナに分けてモデル性能を整理しています。そのため、気軽な比較にも、最先端モデルがさまざまな作業でどのような性能を示しているかを素早く把握したい読者にも役立ちます。
横並びのチャットを実行して、1つのインターフェースでモデルの回答を比較し、コミュニティのランキング作成に反映される投票も行えます。
静的なベンチマーク表だけに頼らず、Battle Mode を使ってフロンティアモデルを直接の対決形式で評価できます。
テキスト、Web開発、ビジョン、ドキュメント、画像、検索、動画、動画編集タスクにまたがる幅広いランキングを閲覧できます。
実際のエージェント型タスクにおけるツール使用、タスク完了、信頼性、制御しやすさを重視した、別個のエージェントランキングを確認できます。
利用可能な場合はスコア表示や不確実性の範囲を備えた順位付きモデル一覧を確認でき、単純な順序リストよりも多くの文脈が得られます。
Arena のインターフェースからチャット履歴を検索して、以前の会話や過去のやり取りを見つけられます。
異なる最先端モデルが同じプロンプトにどう答えるかを試し、その結果に投票して公開ランキングが実際の比較を反映するようにします。
特定のタスク分野でどのモデルが上位かを素早く把握したいときに、テキスト、ビジョン、Web開発、画像、検索、動画の各アリーナを確認します。
エージェントのランキングを使って、モデルがツールをどれだけうまく連携させ、実世界のエージェント型タスクを完了できるかを評価します。
自分のチャット履歴から以前のプロンプトや出力を見直したいときに、Arena で過去の会話を検索します。
Arenaは、AIモデル向けの公開ランキングと比較サイトです。ユーザーはモデルと会話し、回答を比較し、投票し、テキスト、ビジョン、Web開発、画像、動画、検索、エージェントの各タスクにわたる順位を確認できます。
このサイトは、従来のソフトウェアスイートというより、モデル同士の直接比較と公開評価を中心に設計されています。ホームページではBattle Modeが強調されており、ランキングページではタスク領域ごとにモデルを整理し、実世界の評価シグナルに基づいて順位づけしています。
提供元の情報には、公開されている料金ページはありません。/pricing URL は現在 404 ページを返しているため、提示された証拠からはプラン、試用版、請求情報は確認できません。
このサイトにはチャット履歴用の検索ページがあり、過去の会話を検索できるようです。それ以外については、提供されたソースではアカウント、チーム、API、ワークスペース機能は確認できません。