並列ディフュージョン生成
トークンを1つずつではなく並列で生成するため、サイトでは商用 NVIDIA GPU で毎秒1,000トークン超を実現できると説明しています。
InceptionのMercuryブランドは、推論向けのMercury 2とコード編集向けのMercury Edit 2を提供。API連携の高速で制御しやすいLLMを求める開発チーム、音声、エージェント、検索に最適。
Inception は Mercury と呼ばれる拡散ベースの大規模言語モデルを開発しています。サイトでは、従来の自己回帰型 LLM に対するより高速で効率的な代替として位置づけており、同じような API スタイルのワークフローを持ちながら、生成の仕組みは異なると説明しています。
Mercury 2 は同社の最速の推論モデルであり、最初の推論 dLLM と説明されています。一方、Mercury Edit 2 はコード編集や開発ワークフローのほかのレイテンシ重視の領域に焦点を当てた小型モデルです。公開サイトでは、制御された出力、マルチモーダルな方向性、エンタープライズ向けデプロイオプションも強調されています。
トークンを1つずつではなく並列で生成するため、サイトでは商用 NVIDIA GPU で毎秒1,000トークン超を実現できると説明しています。
構造化出力ときめ細かな制御をサポートし、応答がスキーマや意味的制約に従えるようにします。
複雑なアプリケーション向けの推論モデルと、レイテンシに敏感な編集タスク向けの小型のコーディング特化モデルを提供します。
OpenAI 互換として説明されており、AISuite、LiteLLM、LangChain などのツールやライブラリで利用できます。
Mercury 2 は 128K コンテキストウィンドウ、Mercury Edit 2 は 32K コンテキストウィンドウを備えています。
Inception API、AWS Bedrock、Azure Foundry、OpenRouter や Models.dev などのモデルルーターを通じたデプロイ経路を提供します。
レイテンシが重要な複雑なアシスタント、分析、その他の対話型アプリケーションなど、複数ステップの推論が必要な作業に Mercury 2 を使います。
応答時間が重要なコーディングワークフローにおけるコード編集、オートコンプリート、その他の小さなターンに Mercury Edit 2 を使います。
製品に高速な往復応答が必要なリアルタイム音声や顧客向けエージェントに、これらのモデルを使います。
企業ナレッジ全体にわたる迅速な検索型インタラクションが必要なエンタープライズ検索や社内アシスタントに Mercury を使います。
チームが本番利用のために、管理された API アクセス、クラウド調達オプション、またはデプロイ制御を必要とする場合に、エンタープライズ向けデプロイ経路を使います。
Mercury 2 は同社の最速の推論モデルとして位置づけられており、性能と速度の両方が重要な複雑なアプリケーション向けです。Mercury Edit 2 は、コード編集やそのほかのレイテンシに敏感な工程向けの、より小さなコード特化モデルです。
サイトでは、Inception は OpenAI 互換で、AISuite、LiteLLM、LangChain などのライブラリをサポートしていると説明されています。表示されている例では、`https://api.inceptionlabs.ai/v1/chat/completions` の Inception API を使用しています。
models ページに表示されている公開価格情報では、Mercury 2 と Mercury Edit 2 のトークン単価が示されており、新規 API キーには 1,000 万の無料トークンが含まれる無料アカウントの流れも案内されています。別の `/pricing` ページは現在、ページが見つからないというメッセージを返します。
enterprise ページでは、該当する場合はプロンプトのログ保存や保持を行わないモード、プライベートネットワーク、専有キャパシティまたはスループット保証、セキュリティ・法務・調達向けのカスタム条件などのデプロイオプションが利用できると説明されています。
Mercury は、高速なコーディング、リアルタイム音声、即時応答のエージェント、エンタープライズ検索、そして低レイテンシと制御された出力が役立つその他のワークフロー向けに有用だと説明されています。