音声 AI ツールキット
Hume は、音声システムに感情知能を追加することを目的としたオープンソースのモデル、データセット、評価 API を提供しています。
Hume AIは、表現力のある音声システム構築向けに、モデル、データセット、評価APIを提供する音声・感情プラットフォームです。
Hume AI は、表現力のある音声を解釈し生成できるシステムを構築するためのモデル、データセット、評価 API を組み合わせた音声・感情プラットフォームです。サイトでは、この製品を「Voice AI のための感情知能ラボ」と位置づけ、テキスト読み上げ、音声対音声、トレーニングデータ、人による評価に向けた研究ベースのツールを提供しています。
アーキテクチャのページでは、同期されたテキストと音声の TTS を実現する TADA、共感的な音声対音声インタラクションのための EVI、音声設計と表現制御を備えた低レイテンシ TTS の Octave という 3 つの主要な製品領域が強調されています。データと評価のページは、このツールキットを、研究グレードのデータセットと、人々にとって音声がどのように聞こえるかをテストするための Human Feedback API で拡張しています。
Hume は、音声システムに感情知能を追加することを目的としたオープンソースのモデル、データセット、評価 API を提供しています。
TADA は、トークンレベルの幻覚を減らし、レイテンシを改善するために、テキストと音声を 1 つのストリームで同期するテキスト読み上げシステムとして紹介されています。
EVI は、韻律理解、ネイティブ言語生成、音声設計、ツール使用、コンテキスト注入を備えた音声対音声システムとして説明されています。
Octave は Hume の低レイテンシ TTS システムで、音声設計、音声クローン、音声変換、表現モジュレーション、複数話者合成を備えています。
トレーニングデータのページでは、会話音声、感情再現、多言語音声、音声のリアリズム、表現分析向けのデータセットが説明されています。
Human Feedback API を使うと、チームは調査を実施し、人による評価を収集し、迅速なターンアラウンドで音声モデルを評価できます。
テキストと音声が同期し、レイテンシが低く、出力と一緒に書き起こしが必要な場合は TADA を使用します。
韻律理解、ツール使用、コンテキスト注入、自然なターンテイキングが必要な会話型音声エージェントには EVI を使用します。
表現豊かな音声生成のために、音声設計、音声クローン、音声変換、表現モジュレーションが必要な場合は Octave を使用します。
会話音声、感情音声、多言語音声データ、または表現分析向けのモデルを構築・改善している場合は、トレーニングデータライブラリを使用します。
音声モデル評価のために、聞き取りやすさ、音質、滑らかさについて人による評価が必要な場合は Human Feedback API を使用します。
Hume は、感情的な手がかりを理解する音声 AI を構築するためのオープンソースモデル、データセット、評価 API を備えた、音声と感情のための AI ツールキットとしてこの製品を位置づけています。
ソースには、無料プランから Business までの料金プランに加え、カスタム価格と営業窓口を含む Enterprise オプションが示されています。
Hume のサイトでは、テキスト読み上げ向けの TADA、音声対音声のやり取り向けの EVI、低レイテンシ TTS 向けの Octave、音声と表現モデル向けのトレーニングデータ、そしてモデル評価向けの Human Feedback API が紹介されています。
サイトには API と研究グレードのデータセットの説明はありますが、提供されたソースには完全な開発者向けセットアップガイドや統合一覧は表示されていません。