Andre Bellafronte

Como o Auto Router do AI Gateway Roteia Requisições

Em harnesses como Claude Code, Codex e OpenCode, a escolha do modelo fica com o usuário, que tende a usar sempre o mais caro disponível. O Auto Router do AI Gateway entrou em beta pública em 30 de setembro de 2026 com a proposta de tirar essa decisão do usuário. Basta definir o modelo da requisição como cloudflare/auto e o roteamento acontece antes de a chamada sair.

Os resultados iniciais são medições internas da própria Cloudflare, com até 30% de economia frente ao uso exclusivo de modelos de fronteira. A ideia vem depois de duas peças já publicadas do AI Gateway, os limites de gasto e a análise por identidade, que mostra quem consome o quê dentro da organização.

Um Classificador Decide a Rota da Requisição

Quando a requisição chega, o gateway primeiro monta o pool de modelos capaz de atender aquele formato de chamada. Ficam de fora modelos sem suporte ao modo de execução, credenciais ausentes, políticas de acesso e limites de gasto da conta. Provedores fora do ar também saem da lista e voltam ao pool depois que a indisponibilidade termina.

Para os candidatos restantes, o roteador olha uma visão compacta da conversa e prioriza os turnos mais recentes. Esse trecho vai para um classificador multi-head que roda no Workers AI, em GPUs distribuídas na borda. Ele devolve 14 categorias de tarefa, como código, planejamento e análise de dados. Junto vêm quatro notas de 1 a 5: complexidade, ambiguidade, risco e dependência do contexto anterior.

Uma matriz de pontuação cruza esses sinais com os resultados de benchmark de cada modelo. A decisão final junta qualidade esperada e preço de tokens, e em tarefas simples o preço pesa mais. Na fórmula descrita na documentação, o roteador escolhe pelo maior utility = expected quality - adaptive cost penalty.

O Custo por Sucesso no Benchmark Interno

A avaliação usou um benchmark de trabalho geral com ferramentas simuladas de email, calendário, Slack, arquivos, viagens e finanças. São 97 tarefas, com três amostras por modelo e 291 execuções no total. O cloudflare/auto acertou 252 de 291 tentativas, uma taxa de 86,6%, com custo total de US$ 2,10 e US$ 0,0084 por sucesso.

O Claude Opus 5.5 ficou em 281 de 291, ou 96,6%, mas custou US$ 5,91 no total e US$ 0,0210 por sucesso. O GPT-6 Sol ficou em 245 de 291, 84,2%, com US$ 2,64 e US$ 0,0108 por sucesso. Em custo, o roteador ficou em 80% do valor do Sol e 35% do valor do Opus nesse recorte.

Cache Quente Muda a Conta em Sessões Longas

Em sessões longas de agente, o custo real não vem do preço de lista do modelo, mas das leituras de cache, que crescem com o tamanho da sessão. Trocar de modelo joga o cache fora e obriga o novo modelo a reescrever todo o contexto. Dentro de um turno, com o cache quente, a troca raramente se paga, então manter o mesmo modelo sai mais barato.

Entre turnos, o Auto Router aplica uma penalidade de troca que cresce com o número de tokens já em contexto. Um modelo que ainda tem cache vivo para a sessão é precificado pela taxa de cache-read mais baixa. Os outros candidatos pagam o custo cheio de reescrever o contexto, e quanto mais funda a conversa, mais a troca precisa se justificar. Há ainda um detalhe: modelos não leem os reasoning tokens uns dos outros, então uma troca pode obrigar a refazer raciocínio a preço de output.

O Que Ainda Está no Roteiro

A lista de próximos passos inclui ampliar os modelos disponíveis no cloudflare/auto e filtrar candidatos por requisitos de retenção zero de dados. Também estão previstos o uso da capacidade do provedor na escolha, a seleção do nível de reasoning por requisição e suporte completo à Responses API e a WebSockets. Um segundo perfil de roteamento, cloudflare/auto-best, deve usar a mesma classificação e o mesmo pool, mas sem aplicar o tradeoff de custo.

O desenho em dois estágios tem uma consequência prática: a decisão fica auditável, porque dá para inspecionar a categoria e a complexidade previstas para cada tarefa. Adicionar um modelo novo não exige retreinar nada, apenas incluir os pesos derivados do benchmark na matriz de pontuação. O mesmo classificador serve a perfis diferentes de roteamento, o que explica o plano do cloudflare/auto-best.

Conclusão

O ponto técnico do Auto Router é deslocar a escolha de modelo do usuário para o gateway, usando classificação de tarefa e penalidade de custo variável. O benchmark interno mede o tradeoff real: 86,6% de acerto contra 96,6% do Opus 5.5, com custo por sucesso quatro vezes menor. Vale acompanhar quando o filtro de retenção zero de dados entrar, porque isso muda o pool elegível para quem tem requisito de compliance.

Fonte: https://blog.cloudflare.com/auto-router/

Sair da versão mobile