基于扩散的推理
Mercury 2 使用基于扩散的生成,而不是从左到右的 token 解码,在少量步骤内并行细化输出。
Mercury 2 是 Inception 基于扩散的推理语言模型,面向需要低延迟、OpenAI API 兼容性和结构化输出支持的生产级 AI 工作流,适用于编程、智能体、语音与检索密集型应用。
Mercury 2 是 Inception 速度最快的推理语言模型,基于扩散而非自回归解码构建。它被定位为面向生产的 LLM,适合那些需要在严格延迟预算内获得推理级质量的团队。
该产品面向延迟会在多步骤流程中累积的工作流,例如编程助手、智能体循环、语音界面和检索流水线。Inception 表示,Mercury 2 现已可通过其 API 和聊天体验使用,并且兼容 OpenAI API,便于在现有技术栈中更轻松地采用。
Mercury 2 使用基于扩散的生成,而不是从左到右的 token 解码,在少量步骤内并行细化输出。
模型页面将 Mercury 2 描述为可在商用 NVIDIA GPU 上以每秒 1,000+ 个 token 的速度运行,而发布文章则引用了在 NVIDIA Blackwell GPU 上每秒 1,009 个 token 的表现。
该模型被定位为兼容 OpenAI API,并可作为现有 LLM 工作流的直接替代方案使用。
Inception 列出了可调推理、128K 上下文窗口、原生工具使用,以及用于生产工作流的与 schema 对齐的 JSON 输出。
发布文章称 Mercury 2 的设计目标是在高并发下保持 p95 延迟、轮次间行为和吞吐量稳定。
Inception 将 Mercury 2 定位为其最强大的模型,适用于性能与速度都很重要的复杂应用。
对于自动补全、下一步编辑建议、重构和交互式编程智能体,Mercury 2 的定位是让建议足够响应,以保持开发者的工作流连贯。
对于将多个推理调用串联起来的工作流,例如子智能体或活动优化,更低的单次调用延迟会改变实际可运行的步骤数量。
对于语音界面和实时对话系统,Inception 将 Mercury 2 描述为一种让文本生成与自然语速保持一致的方法。
对于多跳检索、重排序和摘要流水线,Mercury 2 可以在不把端到端延迟推离可用范围的情况下增加推理能力。
Mercury 2 现已可通过 Inception 的 API 和聊天界面使用。网站还说明它兼容 OpenAI API,因此可以无需重写直接接入现有技术栈。
Inception 将 Mercury 2 定位于对延迟敏感的工作,例如编程与编辑、智能体工作流、实时语音与交互,以及搜索或 RAG 流水线。
产品页面列出了可调推理、128K 上下文窗口、原生工具使用,以及与 schema 对齐的 JSON 输出。它还强调了通过基于扩散的并行细化实现快速生成。
网站上的定价页面不可用,但模型页面显示了 Free、Developer 和 Enterprise 三种访问路径。Free 包括访问所有模型和 1,000 万免费 token;Developer 按用量计费;Enterprise 提供自定义速率限制、SLA 保证、安全与隐私,以及基于用量的定价。
来源材料未列出正式的集成目录。不过其中说明 Mercury 2 兼容 OpenAI API,并且可通过包括 AISuite、LiteLLM 和 LangChain 在内的库进行支持。
流量数据仅供参考。
| 3月 | 434118 |
|---|---|
| 4月 | 241507 |
| 5月 | 183593 |