多模型统一接入与路由
对 OpenAI 兼容接口和主流大模型服务提供统一入口,屏蔽不同厂商的鉴权与接口差异,便于在不同模型之间切换和做多活部署。支持模型负载均衡与 Fallback。
Higress 是面向 AI 场景的云原生网关,用于统一接入大模型 API、MCP Server 和 Agent,并提供路由、鉴权、限流、内容安全与观测能力。它适合需要集中管理多模型调用和工具接入的团队。
Higress 是一个面向 AI 场景的网关产品,定位为 AI Gateway / AI Native API Gateway。它基于开源 Istio + Envoy 构建,并延续了阿里内部两年多的 Envoy Gateway 实践,用于把大模型 API、MCP Server、Agent 和相关工具统一接入到一个网关层。
从产品页和文档来看,它的核心任务不是单纯转发流量,而是把模型接入、协议转换、路由调度、鉴权、限流、内容安全和可观测性放在同一层治理。对于需要同时管理多个模型供应商、MCP 工具服务和 AI 应用调用额度的团队,它提供了一个集中管理入口。
对 OpenAI 兼容接口和主流大模型服务提供统一入口,屏蔽不同厂商的鉴权与接口差异,便于在不同模型之间切换和做多活部署。支持模型负载均衡与 Fallback。
支持 HTTP 到 MCP 的协议转换,也支持原生 MCP 服务代理,把分散的工具能力收敛到统一入口,减少多团队、多环境的接入成本。
除传统 QPS 限流外,还支持基于 Token 消耗的配额管理与限流,并结合 API Key 池轮询和消费者鉴权机制管理调用额度。
支持提示词攻击检测、敏感内容识别等内容安全能力,可对输入到外部模型的数据做隐私保护,并对输出内容进行过滤。
通过插件快速接入 RAG、向量库、日志观测、缓存等 AI 生态组件,也支持自定义插件开发,适配更复杂的业务逻辑。
控制台支持 AI 服务提供者和 AI 路由管理,可配置域名、模型匹配、降级、消费者、鉴权、限流、RAG、Prompt 模板和语义缓存等策略。
将多个大模型供应商统一接到同一个入口,按模型名称、域名或策略路由到不同后端,并在失败时自动降级到备用模型。
把 HTTP 服务或原生 MCP 服务纳入统一管理,减少工具接入分散带来的维护成本,并通过协议转换对外提供标准入口。
在模型调用过程中按 Token 消耗做配额、限流和消费者管理,适合需要控制调用成本和用户额度的 AI 应用。
为提示词攻击、敏感内容和外部模型数据交互建立保护层,适合对输入输出内容都有安全审查要求的业务。
通过监控面板跟踪每秒输入输出 Token、各模型使用量和时延表现,用于评估模型效果、对比供应商并优化调用策略。
Higress 提供本地 Docker 一键部署方式,文档说明只需执行安装脚本即可在本地控制台完成部署验证;如果需要其他形态,也可参考标准 Kubernetes、本地 Kubernetes 等部署方式文档。
它面向 AI 场景,统一代理大模型 API 与 MCP Server,适合需要集中接入模型、工具和 Agent,并进行路由、鉴权、限流和观测的团队。
文档明确写到它支持 OpenAI 兼容接口以及阿里云、DeepSeek、Azure OpenAI、OpenAI、豆包等已集成供应商,并支持 100+ 主流大模型的统一接入与协议转换。
可以。控制台的 AI 路由管理支持配置不同路由的域名、模型匹配方式、降级配置、请求消费者,以及认证鉴权和限流策略。
可以通过 AI 监控面板查看每秒输入输出 Token、各供应商/模型 Token 使用量等指标,用于比较模型调用情况和时延。