라이프스타일

Cloudflare, AI Gateway Auto Router 공개 베타 출시: 요청마다 AI 모델을 자동 선택

Cloudflare는 2026년 9월 30일 Auto Router 공개 베타를 발표했다. 작업 난이도에 따라 AI 모델을 자동으로 골라 기업의 AI 지출을 줄일 수 있다고 밝혔다. 이 글에서는 작동 방식과 Cloudflare 자체 테스트 데이터를 정리하고, AI를 업무에 쓰는 기업과 직원에게 어떤 의미가 있는지 살펴본다.

읽는 데 약 7분

Cloudflare, AI Gateway Auto Router 공개 베타 출시: 요청마다 AI 모델을 자동 선택
사진: Mokaair (Original editorial artwork)

무슨 일이 있었나

Cloudflare는 2026년 9월 30일 공식 블로그에서 자사 AI Gateway에 Auto Router를 공개 베타로 출시한다고 발표했다. AI Gateway는 조직 안의 사용자, 에이전트, 도구가 보내는 AI 요청이 모두 거쳐 가는 Cloudflare의 관리 창구다. Cloudflare의 설명에 따르면 개발자가 모델을 cloudflare/auto로 설정하기만 하면 된다. 그러면 Auto Router가 각 요청을 해당 작업을 감당할 수 있는 모델로 자동 연결하므로, 최종 사용자가 어떤 모델을 쓸지 직접 판단할 필요가 없다.

Cloudflare는 출시 배경을 이렇게 설명했다. OpenCode, Claude Code, Codex 등 많은 도구에서는 사용자가 여전히 모델을 직접 골라야 한다. 그 결과 작업에 비해 지나치게 강력한 모델을 쓰는 경우가 많다는 것이다. Cloudflare는 OpenCode를 통한 내부 초기 사용 결과를 근거로 들었다. OpenAI Sol이나 Anthropic Claude Opus 같은 프런티어 모델(현재 가장 성능이 높은 최상위 모델)만 쓸 때보다 비용을 최대 30% 줄일 수 있었다고 한다. 또한 Auto Router는 베타 기간 동안 무료라고 밝혔다.

Cloudflare, AI Gateway Auto Router 공개 베타 출시: 요청마다 AI 모델을 자동 선택
Mokaair 편집 검증 절차 · 사진: Mokaair (Original editorial artwork)
자세한 설명 보기

출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.

Cloudflare가 공개한 테스트 데이터

Cloudflare는 내부 범용 지식 업무 벤치마크(성능 비교 시험)로 cloudflare/auto, OpenAI GPT-6 Sol, Anthropic Claude Opus 5.5를 비교했다. Cloudflare에 따르면 이 테스트는 모의 워크스페이스 도구를 사용했으며, 이메일, 캘린더, Slack, 파일, 출장, 재무 등 일상 업무 흐름을 다뤘다. 작업은 총 97개였고, 모델별로 작업당 세 번씩 실행했다.

자료 출처: Cloudflare 공식 블로그에 공개된 내부 벤치마크 결과이며, 독립 테스트가 아니다. 괄호 안 값은 실제 성공률이 있을 것으로 추정되는 범위(%p는 퍼센트포인트)다.
모델성공 횟수성공률(95% 신뢰구간)총비용성공 1회당 비용
cloudflare/auto252/29186.6%(+6.2/−6.9%p)2.10달러0.0084달러
Anthropic Claude Opus 5.5281/29196.6%(+2.7/−3.8%p)5.91달러0.0210달러
OpenAI GPT-6 Sol245/29184.2%(+6.5/−6.9%p)2.64달러0.0108달러

Cloudflare는 Auto Router의 비용이 Sol의 약 80%, Opus의 약 35% 수준이라고 밝혔다. 같은 표에서 볼 수 있듯이 성공률은 Claude Opus 5.5가 세 모델 중 가장 높고, Auto Router의 강점은 주로 비용에 있다. Cloudflare는 토큰(AI가 글을 처리하는 단위로, 사용료 계산의 기준) 단가가 낮다고 해서 전체 비용도 반드시 낮은 것은 아니라고 지적했다. 저렴해 보이는 모델이 작업을 끝내기 위해 더 많은 토큰을 소모할 수 있기 때문이다.

Auto Router의 작동 방식

Cloudflare의 설명에 따르면 처리 과정은 대략 다음 단계로 나뉜다.

  1. 모델 풀 구성: AI Gateway는 먼저 요청 형식이나 실행 모드를 지원하지 않는 모델을 제외한다. 이때 자격 증명, 과금 설정, 접근 제어 정책, 지출 한도도 함께 고려한다. 장애가 발생하면 상태가 좋지 않은 공급자나 모델도 제외한다.
  2. 요청 분류: 대화 내용을 Workers AI에서 실행되는 분류 모델로 보낸다. 이 모델은 요청이 14개 작업 범주 각각에 속할 확률을 판단한다. 또 복잡도, 모호성, 중요도, 이전 맥락 의존도를 각각 1~5점으로 평가한다.
  3. 효용 계산: Cloudflare는 라우터가 '효용 = 예상 품질 − 적응형 비용 페널티'라는 기준으로 모델을 고른다고 밝혔다. 단순한 요청에서는 가격을 더 중시하고, 난이도가 올라갈수록 비용 페널티를 낮춘다.
  4. 캐시 비용 고려: 캐시는 이미 처리한 대화 내용을 저장해 두고 더 싸게 다시 읽는 방식이다. 턴(사용자 입력 한 번에 대한 처리 과정) 안에서는 같은 모델을 계속 쓰는 경향이 있다. 턴을 넘어갈 때는 대화에 쌓인 토큰이 많을수록 커지는 전환 페널티를 적용한다.
  5. 폴백(대체 처리): 라우터는 후보 모델의 순위 목록을 반환한다. 1순위 모델의 공급자가 요청을 처리할 수 없으면 AI Gateway가 조건에 맞는 다른 모델로 전환할 수 있다.

Cloudflare는 새 모델이 나와도 재학습이 필요 없다고 밝혔다. 해당 모델의 벤치마크 가중치를 평가 매트릭스에 추가하기만 하면 된다는 설명이다.

일반 독자와 기업에 미치는 실제 영향

일반 직장인에게는 회사 내부 AI 어시스턴트의 모델을 앞으로 본인이 고르지 않게 될 수 있다는 의미가 있다. 대신 시스템이 작업 난이도에 따라 자동으로 모델을 배정한다. 메일 정리 같은 단순한 작업은 더 작은 모델에 맡기고, 복잡한 작업에는 여전히 더 강력한 모델을 쓸 수 있다. AI 예산을 책임지는 기업에게 Cloudflare가 내세우는 장점은 직원의 고성능 모델 사용을 막지 않으면서도 불필요한 지출을 자동으로 줄일 수 있다는 것이다. 다만 성과는 조직마다 실제 업무 내용에 따라 달라지며, 현재로서는 Cloudflare가 자체 발표한 데이터만 있다.

향후 계획

  • cloudflare/auto에서 사용할 수 있는 모델 확대
  • 모델을 고를 때 데이터 무보존(zero data retention) 요건 반영
  • 모델 선택 시 공급자의 처리 용량 고려
  • 요청마다 적절한 추론 수준 선택
  • Responses API와 WebSockets 완전 지원
  • 구조화된 의사결정 모델을 1단계 분류기로 활용하는 방안 탐색
  • 비용과의 절충 없이 최고의 예상 품질만 추구하는 cloudflare/auto-best 출시

자주 묻는 질문

Auto Router란 무엇인가요?

Cloudflare에 따르면 AI Gateway의 기능 중 하나입니다. 모델을 cloudflare/auto로 설정하면 각 요청을 해당 작업을 감당할 수 있는 모델로 자동 연결합니다.

정말 30%를 절약할 수 있나요?

Cloudflare는 내부 초기 결과, 프런티어 모델만 쓸 때보다 비용을 최대 30% 줄일 수 있었다고 밝혔습니다. 이는 업체가 스스로 밝힌 최대치로 독립적으로 검증되지 않았으며, 실제 효과는 사용 환경에 따라 다릅니다.

모델을 자동으로 고르면 품질이 떨어지지 않나요?

Cloudflare가 공개한 테스트에서 Auto Router의 성공률은 86.6%였습니다. GPT-6 Sol의 84.2%보다는 높았지만 Claude Opus 5.5의 96.6%보다는 낮았습니다. Cloudflare는 비용을 고려하지 않고 최고 품질만 추구하는 cloudflare/auto-best도 출시할 계획입니다.

지금 비용을 내야 하나요?

Cloudflare는 Auto Router가 베타 기간 동안 무료라고 밝혔습니다. 베타가 끝난 뒤의 과금 방식은 해당 글에서 설명하지 않았습니다.

모델을 전환하면 비용이 낭비되지 않나요?

Cloudflare는 Auto Router가 캐시 읽기·쓰기 비용을 계산에 반영한다고 밝혔습니다. 같은 턴 안에서는 같은 모델을 계속 쓰는 경향이 있습니다. 턴을 넘어갈 때는 대화가 길어질수록 모델을 바꾸는 기준을 높입니다.

이 주제의 최신 뉴스 보기

최신 여행 소식·가이드

출처

라이프스타일