RL環境とエージェント
単一ターンの応答ではなく、複数ステップの行動、計画、根拠性、ツール使用を要する強化学習環境とエージェント課題を作成します。
Surge AIは、先進AIシステムの学習と評価のためのデータ、評価、RL環境製品を提供。専門家判断、多言語データ、多モーダル信号、難しい評価に対応。
Surge AIは、ポストトレーニングとエージェント開発のためのデータおよび評価製品を構築しています。サイトでは、その取り組みを「品質を何よりも重視する」という単一の原則に基づいて位置づけており、RL環境とエージェント、ルーブリックと検証器、RLHFデータ、教師ありデモンストレーション、人手評価、専門分野データ、国際化、多モーダルデータセット、すぐに使える既製データなどを提供しています。
同社が掲げる使命は、人間の知能の豊かさを通じてAGIを高めることです。実際には、エリートな人間の専門知識とスケーラブルな監督のためのツールを組み合わせ、モデルが静的なベンチマークだけでなく、デモンストレーション、選好、専門家の判断、現実的なタスク環境から学べるようにすることを意味します。
単一ターンの応答ではなく、複数ステップの行動、計画、根拠性、ツール使用を要する強化学習環境とエージェント課題を作成します。
微妙な差異が重要で、標準的なベンチマークでは不十分なケースを含め、評価用のスコアカードと専門家向けルーブリックを設計します。
強化学習における人間のフィードバックからの学習のために、微妙な品質差を捉える選好ベースの学習データを生成します。
コンピュータの操作、ウェブの閲覧、例からの推論などのタスクに対するデモンストレーションでモデルの能力を立ち上げます。
自動指標では不十分な場合に、有用性、安全性、繊細さ、機知、感情的品質について人手評価を提供します。
専門分野、多言語理解、多モーダル理解、事前構築済みのオフ・ザ・シェルフ用途向けの特殊データセットを作成します。
モデルが計画し、適応し、ツールを使い、特定分野の作業を完了する必要がある場合に特に、エージェント学習向けの現実的な複数ステップ環境を作成するためにSurge AIを使用します。
標準的なベンチマークが簡単に攻略できたり、品質・安全性・正確性の細かな差異を捉えるには浅すぎる場合に、ルーブリックベースの評価を使用します。
強化学習の前後で、モデルに望ましい振る舞い、基礎スキル、タスク手順を教えるために、RLHFと教師ありデモンストレーションを使用します。
医学、法学、数学、コンピュータサイエンス、その他の専門分野において、専門家協力者を用いてデータを生成またはレビューします。
タスクに異なる言語、文化的文脈、画像、音声、動画、または混合形式の推論が含まれる場合に、多言語・多モーダルデータセットを使用します。
Surge AIは、先進的なAIシステムの学習向けに、データ、評価、RL環境の製品を提供しています。ページでは、RL環境とエージェント、ルーブリックと検証器、RLHF、SFT、人手評価、専門分野データ、多言語化、多モーダルデータ、オフ・ザ・シェルフのデータセットなどのポストトレーニング作業が強調されています。
サイトでは、70以上の言語にわたる作業が説明されており、言語学者が各言語の文法、慣用表現、世界観を反映するデータを設計しているとしています。また、医学、法学、数学、コンピュータサイエンス、人文科学などの分野の専門家協力者も強調しています。
研究ページでは、専門家向けルーブリック、根拠に基づくマルチモーダル推論、科学的レビュー、研究レベルの数学、企業向けRL環境、マルチモーダル報酬評価に関するベンチマークや共同研究が示されています。
提供されたページには、製品統合は記載されていません。ただし、サイトではSurge AIがOpenAI、Anthropic、Meta、Googleなどの企業と提携していると述べています。