以擴散式推理
Mercury 2 使用擴散式生成,而非由左至右的 token 解碼,會在少量步驟中以平行方式細化輸出。
Mercury 2 是 Inception 的擴散式推理語言模型,適用於需要低延遲、OpenAI API 相容性與結構化輸出的生產級 AI 工作流程,特別適合程式碼、代理、語音與檢索密集型應用。
Mercury 2 是 Inception 速度最快的推理語言模型,建立在擴散式而非自回歸解碼之上。它被定位為一款以生產環境為導向的 LLM,適合需要在嚴格延遲預算內仍保有推理等級品質的團隊。
此產品適用於延遲會在多步驟流程中累積的工作,例如程式碼助手、代理迴圈、語音介面與檢索管線。Inception 表示 Mercury 2 目前可透過其 API 與聊天體驗使用,並且與 OpenAI API 相容,便於在既有技術堆疊中更容易導入。
Mercury 2 使用擴散式生成,而非由左至右的 token 解碼,會在少量步驟中以平行方式細化輸出。
模型頁面將 Mercury 2 描述為可在商用 NVIDIA GPU 上以每秒 1,000+ tokens 的速度執行,而發表文章則引用其在 NVIDIA Blackwell GPU 上達到每秒 1,009 tokens。
此模型被定位為與 OpenAI API 相容,可作為既有 LLM 工作流程的直接替代方案。
Inception 列出可調整推理、128K 上下文視窗、原生工具使用,以及與結構化 JSON 對齊的輸出,供生產工作流程使用。
發表文章指出,Mercury 2 的設計目標是在高併發下維持 p95 延遲、逐輪行為與吞吐量穩定。
Inception 將 Mercury 2 定位為其最強大的模型,適用於同時重視效能與速度的複雜應用。
用於自動完成、下一步編輯建議、重構與互動式程式設計代理時,Mercury 2 的定位是提供足夠即時的建議,讓開發者維持在工作流中。
對於會串接多次推理呼叫的工作流程,例如子代理或活動最佳化,較低的單次呼叫延遲可改變實際可執行的步驟數。
對於語音介面與即時對話系統,Inception 將 Mercury 2 視為可讓文字生成更貼近自然語音節奏的方法。
對於多跳檢索、重排序與摘要管線,Mercury 2 可以加入推理能力,而不會讓端到端延遲超出實用範圍。
Mercury 2 目前可透過 Inception 的 API 與聊天介面使用。網站也說明它與 OpenAI API 相容,因此可直接嵌入既有技術堆疊而無需重寫。
Inception 將 Mercury 2 定位於延遲敏感的工作,例如程式碼與編輯、代理工作流程、即時語音與互動,以及搜尋或 RAG 管線。
產品頁面列出可調整推理、128K 上下文視窗、原生工具使用,以及與結構化 JSON 對齊的輸出。頁面也強調透過擴散式平行細化實現快速生成。
網站上的定價頁面無法使用,但模型頁面顯示 Free、Developer 與 Enterprise 存取路徑。Free 包含所有模型與 1,000 萬免費 tokens;Developer 採用按使用量計費;Enterprise 則包含自訂速率限制、SLA 保證、安全與隱私,以及依量定價。
來源素材未列出正式的整合目錄。不過,資料指出 Mercury 2 與 OpenAI API 相容,並可透過 AISuite、LiteLLM 與 LangChain 等函式庫支援。
流量數據僅供參考。
| 3月 | 434118 |
|---|---|
| 4月 | 241507 |
| 5月 | 183593 |