并行扩散生成
按并行方式生成 token,而不是一次生成一个,网站称这使其在商用 NVIDIA GPU 上可实现每秒超过 1,000 个 token。
Inception 旗下 Mercury 系列大模型,包含用于推理的 Mercury 2 和用于代码编辑的 Mercury Edit 2,适合 API 驱动应用、开发工作流、语音、智能体与搜索。
Inception 构建名为 Mercury 的基于扩散的大语言模型。网站将其定位为比传统自回归 LLM 更快、更高效的替代方案,具有相同的通用 API 式工作流程,但生成机制不同。
Mercury 2 被描述为公司的最快推理模型,也是首个推理 dLLM;Mercury Edit 2 则是一款更小的模型,专注于代码编辑和开发工作流中其他对延迟敏感的部分。公开网站还强调了可控输出、多模态方向以及企业部署选项。
按并行方式生成 token,而不是一次生成一个,网站称这使其在商用 NVIDIA GPU 上可实现每秒超过 1,000 个 token。
支持结构化输出和细粒度控制,使响应能够遵循 schema 和语义约束。
提供适用于不同工作负载的推理模型和更小的、面向编码的模型,以满足对延迟敏感的编辑任务。
被描述为兼容 OpenAI,并可与 AISuite、LiteLLM 和 LangChain 等工具及库配合使用。
Mercury 2 的上下文窗口为 128K,Mercury Edit 2 的上下文窗口为 32K。
提供通过 Inception API、AWS Bedrock、Azure Foundry,以及 OpenRouter 和 Models.dev 等模型路由器的部署路径。
将 Mercury 2 用于多步推理工作,适合对延迟有要求的复杂助手、分析或其他交互式应用。
将 Mercury Edit 2 用于代码编辑、自动补全,以及编码工作流中其他对响应时间至关重要的小步骤。
在产品需要快速来回响应时,将这些模型用于实时语音或面向客户的智能体体验。
将 Mercury 用于企业搜索或内部助手,适合需要在公司知识库中进行快速检索式交互的场景。
当团队需要受管的 API 访问、云采购选项或生产环境部署控制时,使用企业部署路径。
Mercury 2 是该公司的最快推理模型,适用于对性能和速度都很重要的复杂应用。Mercury Edit 2 是一款更小、以编码为重点的模型,适合代码编辑和其他对延迟敏感的步骤。
网站说明 Inception 兼容 OpenAI,并支持包括 AISuite、LiteLLM 和 LangChain 在内的库。示例中使用的 Inception API 为 `https://api.inceptionlabs.ai/v1/chat/completions`。
模型页面上显示的公开定价信息列出了 Mercury 2 和 Mercury Edit 2 的按 token 计费价格,同时还提供一个免费账户流程,新 API 密钥可获得 1000 万免费 tokens。单独的 `/pricing` 页面目前返回页面未找到信息。
企业页面说明,在适用情况下,部署选项可包括不记录或保留提示词的模式、私有网络、专用容量或吞吐量保障,以及用于安全、法律和采购的自定义条款。
Mercury 被定位为适用于快速编码、实时语音、即时智能体、企业搜索以及其他受益于低延迟和可控输出的工作流。