
很多人第一次听到 AI 网关,会把它理解成一个大模型中转站。用户把请求交给网关,网关再转给 OpenAI、Anthropic 或国内模型厂商,中间收一点差价。这个理解没有错,只是只看到了最容易被替代的那一层。
我把能找到的官方定价和产品文档对了一遍,发现这门生意的核心越来越清楚。网关真正卖的,是企业对模型调用的控制权。模型选哪一家、谁可以调用、一次调用花多少钱、出了故障切到哪里、这笔费用算在谁头上,都由它来处理。
最早的一笔钱,来自统一入口
企业一旦接入多家模型,开发团队就要面对不同的鉴权方式、请求格式、流式返回和错误码。把这些差异藏在一个统一 API 后面,能省掉一部分适配工作。
托管平台通常有两种收钱方法。一种是在模型成本上加平台费,另一种是模型价格尽量按供应商传递,再对充值、请求量或高级功能收费。OpenRouter的官方 FAQ 说明,它把基础模型价格按供应商价格传递,并在购买 credits 时收取平台费用。Cloudflare的 AI Gateway 也采用了类似的思路,核心分析、缓存和限流功能可以免费使用,Unified Billing 购买 credits 时收取 5% 费用。
这种模式的好处是容易开始。用户不需要先买一套复杂软件,也不用为每个模型单独做财务流程。平台只要把模型接入、余额、密钥和账单做顺,收入就随着调用量增长。
它的毛利却很容易被看穿。用户可以把同一个请求直接发给模型供应商,平台若只负责转发,价格、延迟和稳定性都可能被比较。只靠 Token 差价,最后很容易变成低毛利的流量生意。
第二笔钱,来自省下来的工程人力
AI 网关开始变得有价值,是它替企业接手了长期维护的杂事。重试和故障切换要看错误类型,限流要同时看请求数和 Token,缓存要判断相同问题能不能复用,日志还要记录模型、延迟、输入输出 Token 和费用。
这些功能每一项都能写出来,难的是一起稳定运行。模型供应商改一次协议,网关要跟着改。价格表变一次,账单要跟着改。一个上游在高峰期变慢,路由和告警要能及时反应。
LiteLLM的商业路径很典型。开源版免费自托管,已经提供多供应商接入、虚拟密钥、用量追踪、预算和回退。企业版再出售 SSO、审计日志、密钥轮换、多区域控制面、支持和 SLA,而且官方明确说企业版按年度网关请求容量、部署架构和支持需求定价,不按 Token 定价。
Portkey的公开价格也说明了这个变化。它有免费开发者层,生产层从每月 49 美元起,并把记录日志量、保留时间、路由、回退、密钥管理和可观测能力分层。客户付钱购买的是团队共同使用的控制台,以及它背后的持续维护。

成本优化能带来收入,也能带来信任
网关可以把简单任务送到便宜模型,把复杂推理留给贵模型。它也可以对重复问题做精确缓存或语义缓存,减少真正发给上游的请求。
Kong的官方文档把这件事写得很直白。AI Gateway可以按语义路由、语义缓存、提示词压缩和成本限流组合起来,还能按输入、输出和系统 Token 设计价格计划,再接 Stripe 或 ERP 做计费。Higress的文档则把模型统一代理、Token级限流、语义缓存、内容安全和可观测放在同一套 AI Gateway 里。
这里有一个容易被忽略的商业关系。网关帮客户少花模型费,自己却未必少赚钱。客户愿意付的是节省后的总成本,而不是某个 Token 的最高加价。如果一次路由策略让客户少买 GPU、少雇几个人处理账单,网关就有空间收取订阅费、服务费或按规模报价。
不过,成本优化不能只看账面。语义相似不等于答案相同,带权限、实时状态和金融数据的问题不适合粗暴缓存。低价模型也可能让人工复核次数上升。网关若只展示节省了多少 Token,却不跟踪答案质量,最后会把成本从 API 账单转移到业务团队。
推理网关卖的是 GPU 的使用率
当企业自己部署模型,网关的客户就从模型调用者变成了算力平台团队。Kubernetes的 Gateway API Inference Extension把模型感知路由、服务优先级和实时端点指标纳入推理网关,调度器可以根据成本和性能选择更合适的推理端点。
这会产生另一种收费逻辑。平台可以按集群规模、GPU 数量、请求容量和 SLA 收费,也可以把部署、调度策略、监控和故障演练打包成项目。客户购买的是一套能让 GPU 少空转、让高优先级请求先得到服务的系统。
这条路的技术门槛比普通 API 聚合高,销售周期也更长。它需要理解显存、批处理、模型加载、队列长度和 P95 延迟,还要在客户自己的网络和合规边界里运行。对小团队来说,托管 API 网关更容易成交;对有大量自有算力的企业,推理网关的单客价值更高。

Agent 时代,权限会成为新的计费单位
Agent让网关面对的不再只是模型请求。一个 Agent 可能连续调用搜索、数据库、财务系统和代码执行环境。MCP 网关把身份映射、凭证代理、工具授权和审计放在 Agent 与工具之间,企业买到的是一条可追责的行动链。
这类产品可以按 Agent 数量、工具连接数、调用量、审计保留时间和安全策略收费,也可以作为 API 管理、身份系统或云平台的高级模块。Kong把部分 AI 限流能力放在企业授权中,Higress则把 MCP Server 和 LLM API 放进统一代理的产品定位里,说明传统 API 网关和新一代 Agent 治理正在汇合。
我的判断是,AI 网关最稳的收入不会长期来自“我帮你多接了几个模型”。模型接入会越来越标准,开源项目也会覆盖越来越多供应商。能留下来的价值集中在三件事上。企业敢不敢让它接触数据,财务能不能用它解释每一笔费用,业务能不能在模型和算力变化时继续稳定运行。
这个判断只适用于有真实调用量、合规要求或自有算力的客户。个人开发者和低频项目完全可以用开源网关,甚至直接调用模型。网关只有在它替客户承担了持续发生的复杂性时,才值得收取持续费用。
所以,AI 网关的生意可以这样看。入口层赚服务费,治理层赚订阅费,私有化赚项目费,推理和 Agent 层赚高价值的基础设施费。Token 差价可能是最先出现的收入,却未必是最后留下的利润。