生活分享

Cloudflare 推出 AI Gateway Auto Router 公开测试版:自动为每个请求挑选 AI 模型

Cloudflare 于 2026 年 9 月 30 日宣布推出 Auto Router 公开测试版,声称可根据任务难度自动选择 AI 模型,以降低在内部使用 AI 的企业的支出。本文介绍它的运作方式、Cloudflare 自家测试数据,以及对企业和员工的影响。

阅读时间约 6 分钟

Cloudflare 推出 AI Gateway Auto Router 公开测试版:自动为每个请求挑选 AI 模型
图片:Mokaair (Original editorial artwork)

发生了什么

Cloudflare 于 2026 年 9 月 30 日在官方博客宣布,通过旗下 AI Gateway 以公开测试版形式推出 Auto Router。按 Cloudflare 的定位,AI Gateway 是企业在内部部署 AI 时的“控制中枢”:用户、智能代理和各种工具发出的每个 AI 请求都会经过它。根据 Cloudflare 的说明,开发者只要将模型设置为 cloudflare/auto,Auto Router 就会把每个请求自动路由(即自动转发)到足以胜任该任务的模型,终端用户无需自行判断该用哪个模型。

Cloudflare 解释了推出原因:在 OpenCode、Claude Code、Codex 等许多工具中,用户仍需手动选择模型,结果常常用了对工作而言过于强大的模型。Cloudflare 表示,其通过 OpenCode 在内部使用的早期结果显示,与只使用 OpenAI Sol、Anthropic Claude Opus 等前沿模型(即目前能力最强的顶尖模型)相比,成本最多可节省 30%。Cloudflare 还表示,Auto Router 在测试期间免费。

Cloudflare 推出 AI Gateway Auto Router 公开测试版:自动为每个请求挑选 AI 模型
Mokaair 编辑核查流程 · 图片:Mokaair (Original editorial artwork)
阅读完整文字说明

消息会先收集来源、独立核查,再交由 Jev 判断。

Cloudflare 公布的测试数据

Cloudflare 以其内部的通用知识工作基准测试,比较了 cloudflare/auto、OpenAI GPT-6 Sol 与 Anthropic Claude Opus 5.5。据 Cloudflare 介绍,该测试使用模拟的工作区工具,涵盖电子邮件、日历、Slack、文件、差旅与财务等日常流程,共 97 项任务,每个模型每项任务采样三次。下表括号中的数字是 95% 置信区间,表示成功率可能上下浮动的范围。

数据来源:Cloudflare 官方博客公布的内部基准测试结果,非独立测试。
模型成功次数成功率(95% 置信区间)总成本每次成功成本
cloudflare/auto252/29186.6%(+6.2/−6.9 个百分点)2.10 美元0.0084 美元
Anthropic Claude Opus 5.5281/29196.6%(+2.7/−3.8 个百分点)5.91 美元0.0210 美元
OpenAI GPT-6 Sol245/29184.2%(+6.5/−6.9 个百分点)2.64 美元0.0108 美元

Cloudflare 称 Auto Router 的成本约为 Sol 的 80%、Opus 的 35%。从同一张表也可以看到,Claude Opus 5.5 的成功率在三者中最高,Auto Router 的优势主要在于成本。Cloudflare 另外指出,token(AI 模型处理文字和计费的基本单位)单价较低不一定意味着整体成本较低,因为看似便宜的模型可能要消耗更多 token 才能完成任务。

Auto Router 如何运作

根据 Cloudflare 的说明,流程大致分为以下几步:

  1. 建立模型池:AI Gateway 排除不支持请求格式或执行模式的模型,并考虑凭证、计费设置、访问控制策略与支出上限;故障期间也会排除不健康的供应商或模型。
  2. 分类请求:对话被发送到在 Workers AI(Cloudflare 部署在其边缘网络 GPU 上的 AI 运行服务)上运行的多头分类模型,这种模型可以同时给出多项判断。它会判断请求属于 14 个任务类别的概率,并以一到五分评估复杂度、模糊度、重要性及对先前上下文的依赖程度。
  3. 计算效用:Cloudflare 表示,路由器以“效用 = 预期质量 − 自适应成本惩罚”来选择模型;简单请求中价格权重较高,难度提高时成本惩罚降低。
  4. 考虑缓存成本:缓存是模型为当前对话暂存的内容,换模型就得重新写入。因此同一轮次内倾向沿用同一模型,跨轮次则施加随上下文 token 数增加而提高的切换惩罚。
  5. 备援:路由器返回排序列表,若首选模型的供应商无法处理请求,AI Gateway 可改用其他符合条件的模型。

Cloudflare 表示,新模型推出时无需重新训练,只需把其基准测试权重加入评分矩阵。

对普通读者与企业的实际影响

对普通上班族而言,这类工具的意义在于:未来公司内部的 AI 助手,可能不再由你自己决定用哪个模型,而是由系统根据任务难度自动分配。整理邮件等简单工作可能交给较小的模型,复杂工作仍可使用较强的模型。对负责 AI 预算的企业来说,Cloudflare 的主张是在不限制员工使用高端模型的前提下,自动减少不必要的支出。但成效仍取决于各组织的实际工作内容,目前也只有 Cloudflare 的自述数据。

接下来的计划

  • 扩充 cloudflare/auto 可用的模型
  • 筛选模型时纳入零数据保留要求
  • 选择模型时考虑供应商容量
  • 为每个请求选择合适的推理级别
  • 全面支持 Responses API 与 WebSockets
  • 探索以结构化决策模型作为第一层分类器
  • 推出只追求最高预期质量、不考虑成本取舍的 cloudflare/auto-best

常见问题

Auto Router 是什么?

据 Cloudflare 介绍,它是 AI Gateway 的一项功能,把模型设为 cloudflare/auto 后,会自动把每个请求路由到足以胜任该任务的模型。

真的能省 30% 吗?

Cloudflare 表示,其内部早期结果显示与只用前沿模型相比最多可节省 30%。这是厂商自述的上限数字,未经独立验证,实际效果因使用场景而异。

自动选模型会不会降低质量?

在 Cloudflare 公布的测试中,Auto Router 成功率为 86.6%,高于 GPT-6 Sol 的 84.2%,但低于 Claude Opus 5.5 的 96.6%。Cloudflare 还计划推出不考虑成本、只追求最高质量的 cloudflare/auto-best。

现在需要付费吗?

Cloudflare 表示,Auto Router 在测试期间免费。测试结束后的收费方式,Cloudflare 在该文中未作说明。

切换模型会不会浪费成本?

Cloudflare 表示,Auto Router 会计入缓存读写成本:同一轮次内倾向沿用同一模型,跨轮次则根据对话长度提高切换门槛。

查看同分类最新消息

最新旅游情报攻略

资料来源

生活分享