基于 LPU 的推理架构
Groq 的 LPU 是一款为确定性、基于 token 的执行而设计的定制推理芯片。架构页面称,这种设计消除了传统软件复杂性,并旨在保持性能可预测。
Groq is an inference platform for developers and teams that need fast, low-cost model serving through the Groq LPU and GroqCloud. It offers OpenAI-compatible API access, on-demand model pricing, prompt caching, batch processing, and an enterprise path for larger deployments.
Groq 是一个围绕 Groq LPU 构建的推理平台,Groq LPU 是一款定制芯片和软件栈,专注于以快速且可预测的成本运行 AI 模型。网站将 GroqCloud 定位为面向开发者的服务,用于访问模型和推理,支持 OpenAI 兼容 API,并可基于现有代码快速上手。
该产品面向需要低延迟模型响应、可扩展推理以及被描述为线性且可预测的定价的开发者和团队。定价页面展示了对公开可用模型的按需访问、提示缓存、用于复合系统的内置工具,以及用于大规模工作负载的 Batch API;企业页面则为更大规模组织提供部署选择和专属支持。
Groq 的 LPU 是一款为确定性、基于 token 的执行而设计的定制推理芯片。架构页面称,这种设计消除了传统软件复杂性,并旨在保持性能可预测。
定价页面展示了对多个公开可用模型的按需访问,包括 GPT-OSS、Llama、Qwen、Kimi 和 Whisper 变体,并按模型提供 token 级定价。
Groq 文档说明了提示缓存,并分别列出缓存和未缓存输入 token 的价格。页面注明缓存功能本身不收取额外费用,折扣会在缓存命中时生效。
复合 AI 系统可使用内置工具,例如网络搜索、访问网站、代码执行和浏览器自动化。定价会按底层模型和服务器端工具进行转嫁。
Batch API 支持异步的大规模请求处理,官方称成本降低 50%,不影响标准速率限制,处理窗口为 24 小时到 7 天。
网站说明 Groq 的 API 与 OpenAI 兼容,只需使用 Groq 基础 URL 和 API 密钥即可通过几行代码开始使用。
构建聊天或助手产品的团队可以使用 GroqCloud 以低延迟和可预测的按 token 定价提供模型响应,尤其适用于响应时间会影响用户体验的场景。
已经使用 OpenAI 风格客户端库的开发者只需更改基础 URL 并使用 Groq API 密钥即可切换到 Groq,从而降低迁移成本。
需要检索、网络查询或代码执行的产品,可以使用带有网络搜索、访问网站和代码执行等内置工具的复合 AI 系统。
运行大规模任务的组织可以使用 Batch API 以更低成本异步处理请求,同时不影响标准速率限制。
有定制容量、部署或支持需求的企业,可以通过 Enterprise API Solutions 流程进行更大规模的推理规划。
Groq 为需要快速、低成本模型服务的开发者和团队提供推理基础设施。网站展示了 OpenAI 兼容访问,并支持仅通过对 Groq API 基础 URL 做少量代码修改即可开始使用。
定价页面列出了核心模型访问、仅限企业的模型、提示缓存、内置工具以及 Batch API 处理。首页也将 GroqCloud 指向开发者用于推理的地方。
定价页面展示了对若干公开可用模型的按需定价,并说明还可根据特定客户需求提供其他模型,包括微调模型。
有。企业页面提供面向更大规模部署、定制解决方案和专属支持的 Enterprise API Solutions 流程,同时也提到部署选择。
网站说明你可以免费开始,并随着需求增长进行升级;定价页面还提供了企业 API 解决方案或本地部署的联系路径。