平行 diffusion 生成
以平行方式生成 token,而非一次生成一個;網站表示這可在商用 NVIDIA GPU 上達到每秒超過 1,000 個 token。
Inception 以 Mercury 品牌打造 diffusion-based LLM,包括用於推理的 Mercury 2 與用於程式碼編輯的 Mercury Edit 2,適合 API、開發流程、語音、agents 與搜尋應用。
Inception 建立名為 Mercury 的 diffusion-based 大型語言模型。網站將其定位為比傳統 auto-regressive LLM 更快、更高效的替代方案,並具備相同的 API 式一般工作流程,但生成機制不同。
Mercury 2 被描述為公司最快的推理模型,也是首個推理 dLLM;Mercury Edit 2 則是較小的模型,專注於程式碼編輯與其他開發流程中對延遲敏感的部分。公開網站也強調可控輸出、多模態方向與企業部署選項。
以平行方式生成 token,而非一次生成一個;網站表示這可在商用 NVIDIA GPU 上達到每秒超過 1,000 個 token。
支援結構化輸出與細緻控制,使回應能符合 schema 與語意限制。
提供適用於不同工作負載的推理模型與較小的、以程式碼為主的模型,滿足對延遲敏感的編輯任務。
被描述為與 OpenAI 相容,並可搭配包括 AISuite、LiteLLM 與 LangChain 在內的工具與函式庫使用。
包含 Mercury 2 的 128K context window 與 Mercury Edit 2 的 32K context window。
可透過 Inception API、AWS Bedrock、Azure Foundry,以及 OpenRouter 和 Models.dev 等模型路由器進行部署。
將 Mercury 2 用於多步驟推理工作,當延遲很重要時,例如複雜助理、分析或其他互動式應用。
將 Mercury Edit 2 用於程式碼編輯、自動補全,以及程式開發流程中其他對回應時間至關重要的小步驟。
在產品需要快速來回回應時,將這些模型用於即時語音或面向客戶的 agents。
將 Mercury 用於企業搜尋或內部助理,適合需要跨公司知識進行快速檢索式互動的情境。
當團隊需要受管的 API 存取、雲端採購選項或生產環境部署控制時,使用企業部署途徑。
Mercury 2 是該公司的最快推理模型,定位於需要同時兼顧效能與速度的複雜應用。Mercury Edit 2 則是較小的、以程式碼為主的模型,適合程式碼編輯與其他對延遲敏感的步驟。
網站說 Inception 與 OpenAI 相容,並支援包括 AISuite、LiteLLM 和 LangChain 在內的函式庫。所示範例使用的 Inception API 為 `https://api.inceptionlabs.ai/v1/chat/completions`。
模型頁面上顯示的公開定價資訊列出 Mercury 2 與 Mercury Edit 2 的每 token 價格,並提供新 API 金鑰可獲得 1,000 萬個免費 token 的免費帳號流程。另一個單獨的 `/pricing` 頁面目前則回傳頁面找不到訊息。
企業頁面說明,部署選項在適用情況下可包含不記錄或保留提示詞、私有網路、專用容量或吞吐量保證,以及針對安全、法務與採購的自訂條款。
Mercury 被定位為適合快速程式開發、即時語音、即時 agents、企業搜尋,以及其他能從低延遲與受控輸出受益的工作流程。