Tom's Blog

DNS、数据面与 AI 网关


  • 首页

  • 分类

  • 关于

  • 归档

  • English

  • 搜索

TypeSafe Jev 接不进 AI 网关:为什么,以及它的最优用法

发表于 2026-09-20 | 分类于 AI-Gateway

cover

阅读全文 »

AI 和程序的比例怎么分:别问几几开,问这一步的不确定性归谁

发表于 2026-09-17 | 分类于 AI-Agent

AI 和程序不是一个旋钮,而是一排要逐点拨的小闸门

阅读全文 »

Tom-Autodev、AIFlow、LangGraph 与 Langfuse,四种 AI 工程工具怎么分工

发表于 2026-09-11 | 分类于 AI Agent

Tom-Autodev、AIFlow、LangGraph 与 Langfuse 的分工

阅读全文 »

自己搭建一套推理集群:从单机到多节点的可复现实践

发表于 2026-09-09 | 分类于 AI-Agent

自己搭建一套推理集群:从单机到多节点的可复现实践

阅读全文 »

自托管 K8s 推理栈怎么选:从 Ingress 到 GPU 的四层

发表于 2026-09-08 | 分类于 AI-Gateway
API 网关、AI 网关、推理网关、推理引擎不是四个采购项,是一条链。四层里只有一层真正收敛了
阅读全文 »

tom-autodev 与 Roma Workspace,谁在管什么

发表于 2026-09-03 | 分类于 AI-Agent

tom-autodev 与 Roma Workspace

阅读全文 »

跨会话消息:Claude Code 的会话之间只能递一张纸条

发表于 2026-09-03 | 分类于 AI-Agent
两个工具、一根本机 socket、一段纯文本。它不搬历史也不搬授权,最容易踩的坑是「送到」不等于「读到」——开着 bypassPermissions 的那个会话默认把消息全扣住等你点
阅读全文 »

A2A 的 agent 发现:路径钉死在 /.well-known/agent-card.json

发表于 2026-09-02 | 分类于 AI-Agent
A2A 把 agent 发现压成了一次 GET。路径由 RFC 8615 的 well-known 前缀钉死,知道域名就够了,不用先问目录。但它只覆盖了一半
阅读全文 »

各家把发版周期压到一个月,coding 天花板却在另一条曲线上

发表于 2026-09-02 | 分类于 AI-Agent
Anthropic 的发版间隔三年对折两次到 30.5 天。同期 Veracode 测了 150 多个模型,安全通过率从 55% 走到 55%。发得快和能力涨,是两条曲线
阅读全文 »

tom-autodev vs LangGraph,领域工作流和编排引擎该怎样分工

发表于 2026-09-01 | 分类于 AI-Agent
tom-autodev 已经有状态机、SQLite、审批和恢复能力。它还要不要迁到 LangGraph,答案取决于两者分别负责什么。
阅读全文 »

LangGraph 的前世今生、竞争对手和它正在收窄的价值区间

发表于 2026-08-30 | 分类于 AI-Agent
star 被 Agno 反超,下载量被 Pydantic AI 拉开 1.9 倍,1.0 发布在 HN 只拿到 1 分。但真正在切走它地盘的是上下两层,不是同层对手
阅读全文 »

AI 网关到底包含哪几层:模型网关、工具网关,以及 Agent 网关该合还是该分

发表于 2026-08-28 | 分类于 AI-Gateway
AI 网关是个总称,底下至少有四类能力。真正有争议的只有一个问题:Agent 编排要不要放进网关
阅读全文 »

两个 harness 设置让 ARC-AGI-3 分数翻三倍:保留推理链与上下文压缩

发表于 2026-08-26 | 分类于 AI-Agent
同一个未改动的模型,换 harness 分数从 13.3% 到 38.3%,输出 token 还降了六倍。这两个机制到底在补什么漏
阅读全文 »

DPDK DNS 怎样接住 TCP 请求

发表于 2026-08-24 | 分类于 DNS

DPDK DNS TCP 封面

阅读全文 »

AI 网关里的批处理,其实是三个不同的东西

发表于 2026-08-24 | 分类于 AI-Gateway
离线 Batch API、连续批处理、网关侧请求合并,三者层次不同、换取的东西也不同
阅读全文 »

AI 网关兼容协议的真相,不是多加几个端点

发表于 2026-08-20 | 分类于 AI-Gateway
从 OpenAI、Anthropic 到 One API,入口、内部抽象和后端适配其实是三件事
阅读全文 »

AI 网关的生意,究竟靠什么赚钱

发表于 2026-08-14 | 分类于 AI-Gateway
从 Token 转发到企业治理,网关卖的是可计量的控制权
阅读全文 »

Gryphon 给超大规模网关加了一层 DPU

发表于 2026-08-13 | 分类于 AI-Gateway
把交换芯片的线速、DPU 的大容量状态和软件的灵活性放进同一条分层数据路径
阅读全文 »

上下文越长,为什么越需要压缩

发表于 2026-08-12 | 分类于 AI-Gateway
从摘要、检索、token 裁剪到服务端 compaction,算清它省下的钱和带来的新风险
阅读全文 »

哪些接口才算 AI 原生

发表于 2026-08-11 | 分类于 AI-Gateway
LUI 负责表达意图,MCP 连接工具,A2A 组织协作,模型是否进入核心执行循环才是分界线
阅读全文 »

AI 流量调度为什么不能照搬传统负载均衡

发表于 2026-08-10 | 分类于 AI-Gateway
从 Round Robin、Least Load 到 CHWBL,算法开始同时计算负载与 KV Cache
阅读全文 »

推理路径上的三层缓存,省下的钱远小于价目表暗示的倍数

发表于 2026-08-09 | 分类于 AI-Gateway
从 DeepSeek 的 50 倍价差到生产环境 1.7 倍的首 token 改善,缓存降本的真实幅度由提示词结构决定
阅读全文 »

BFE 的 AI 网关补齐了出口治理,推理调度那层还没有地方放数据

发表于 2026-08-09 | 分类于 AI-Gateway
逐行核对开源 BFE 到 v1.8.4,三个 ai 模块、SSE 逐帧计量,以及一套被动触发的健康检查
阅读全文 »

推理网关里那个 EPP,替代了什么,又替代不了什么

发表于 2026-08-08 | 分类于 AI-Gateway
prefix cache 命中属于请求与实例的配对属性,endpoint 权重机制在结构上装不下它,所以这类调度只能落成每请求同步问一次外部进程
阅读全文 »

多 region 推理部署,前端到底要不要挂一个跨机房的七层调度器

发表于 2026-08-07 | 分类于 AI-Gateway
主流开源与厂商的答案是把调度切成两层,全球层按容量选 region,机房内才按 KV cache 和队列深度选实例
阅读全文 »

OmniRoute 把 290 家模型商塞进一个端点

发表于 2026-08-06 | 分类于 AI-Gateway
免费额度聚合很诱人,真正值钱的是把切换成本压到一次路由决策
阅读全文 »

AI 网关如何做健康检查

发表于 2026-08-05 | 分类于 AI-Gateway
从端口探活走向模型可服务性判断,三层信号决定流量该不该继续送
阅读全文 »

AI 网关与推理网关分层后,推理网关怎么选?

发表于 2026-08-03 | 分类于 AI-Gateway
从跨 Region 到跨 Pod:六类开源方案、三层路由和一套可落地的调度算法
阅读全文 »

OneAPI、LiteLLM、Bifrost:AI 网关横评,先选问题再选产品

发表于 2026-08-03 | 分类于 AI-Gateway
三者都能统一模型调用,但分别把控制面、兼容性和数据路径放在了不同位置
阅读全文 »

十二个 PR 比五份榜单更能说明自托管 AI 网关的成色

发表于 2026-08-02 | 分类于 AI-Gateway
7 月 31 日 LiteLLM 的一个 dev 版里,改的全是计量、限流并发、流式检查和工具身份边界——没有一条是关于支持更多模型的
阅读全文 »
1 2 … 4
ZhaoTao

ZhaoTao

赵涛(ZhaoTao)的技术博客。DNS 10 年、四层网关与 DPDK 数据面,以及 AI 网关与推理网关的观察。

105 日志
8 分类
98 标签
RSS
GitHub
© 2021 - 2026 ZhaoTao
由 Jekyll 强力驱动
主题 - NexT.Muse