基於 LPU 的推論架構
Groq 的 LPU 是一款自訂推論晶片,專為可決定性的、以 token 為基礎的執行而設計。架構頁面指出,此設計移除了傳統軟體複雜度,並旨在維持可預測的效能。
Groq 是為開發者與團隊打造的推論平台,透過 Groq LPU 與 GroqCloud 提供快速、低成本的模型服務。支援 OpenAI 相容 API、按需模型計費、提示快取、批次處理與企業級部署方案。
Groq 是一個以 Groq LPU 為核心打造的推論平台,這是一套專為快速且以可預測成本執行 AI 模型而設計的客製晶片與軟體堆疊。網站將 GroqCloud 定位為讓開發者存取模型與推論的服務,提供 OpenAI 相容 API,並支援從既有程式碼快速開始使用。
此產品的目標對象是需要低延遲模型回應、可擴充推論,以及被描述為線性且可預測的定價的開發者與團隊。定價頁面顯示可按需存取公開可用模型、提示快取、供複合系統使用的內建工具,以及用於大型工作負載的 Batch API;而企業頁面則為較大型組織提供部署彈性與專屬支援。
Groq 的 LPU 是一款自訂推論晶片,專為可決定性的、以 token 為基礎的執行而設計。架構頁面指出,此設計移除了傳統軟體複雜度,並旨在維持可預測的效能。
定價頁面顯示可按需存取多種公開可用模型,包括 GPT-OSS、Llama、Qwen、Kimi 與 Whisper 變體,並提供依模型而定的 token 計價。
Groq 說明了提示快取,並分別列出已快取與未快取的輸入 token 價格。頁面註明快取功能本身不收取額外費用,折扣則在快取命中時適用。
複合 AI 系統可使用內建工具,例如網頁搜尋、造訪網站、程式碼執行與瀏覽器自動化。費用會依底層模型與伺服器端工具的成本轉嫁。
Batch API 支援非同步的大規模請求處理,並標示可降低 50% 成本、不影響標準速率限制,以及 24 小時到 7 天的處理窗口。
網站指出 Groq 的 API 與 OpenAI 相容,只需使用 Groq 的 base URL 與 API key,再搭配幾行程式碼即可開始。
打造聊天或助理產品的團隊,可使用 GroqCloud 以低延遲與可預測的每 token 計價來提供模型回應,特別適合回應時間會影響使用體驗的情境。
已使用 OpenAI 風格用戶端函式庫的開發者,只要更改 base URL 並使用 Groq API key,就能切換到 Groq,降低遷移阻力。
需要檢索、網路查詢或程式碼執行的產品,可使用具備內建工具的複合 AI 系統,例如網頁搜尋、造訪網站與程式碼執行。
執行大型工作的組織可使用 Batch API,以較低成本非同步處理請求,且不影響標準速率限制。
具有自訂容量、部署或支援需求的企業,可透過 Enterprise API Solutions 流程進行更大規模的推論規劃。
Groq 為需要快速、低成本模型服務的開發者與團隊提供推論基礎架構。網站顯示其支援 OpenAI 相容存取,並可透過變更 Groq API base URL 以少量程式碼開始使用。
定價頁面列出核心模型存取、僅限企業的模型、提示快取、內建工具與批次 API 處理。首頁也將 GroqCloud 指向作為開發者進行推論的地方。
定價頁面顯示多個公開可用模型的按需定價,並指出另有其他模型可依特定客戶需求提供,包括微調模型。
有。企業頁面提供 Enterprise API Solutions 流程,適用於更大型的部署、自訂解決方案與專屬支援,並提及部署彈性。
網站表示你可以免費開始使用,並在需求成長時升級;定價頁面也提供企業 API 解決方案或 on-prem 部署的聯絡途徑。