Pular para o conteúdo
Inteligência Artificial 8 min de leitura 🎯 Intermediate Cloudflare AI Gateway, Workers AI, Wrangler 3.x, Node.js 22+ Verificado

Cloudflare AI Gateway: Controle Total dos Custos de LLM

Gastos descontrolados com APIs de IA são o novo shadow IT. O Cloudflare AI Gateway oferece um plano de controle único para cada chamada LLM da sua aplicação — com cache, analytics e guardrails integrados.


Principais pontos
  1. O AI Gateway requer apenas uma mudança de URL para ser ativado — sem reescritas de SDK ou middlewares customizados.
  2. O cache de respostas pode reduzir chamadas de API redundantes a zero para prompts repetidos, cortando latência e custo.
  3. O painel de Analytics expõe contagens de tokens por provedor, custos estimados e taxas de erro em tempo real.
  4. O roteamento dinâmico permite definir modelos de fallback quando o provedor primário está indisponível.
  5. Os Guardrails analisam prompts e respostas em busca de conteúdo prejudicial sem necessidade de serviços terceiros.

Resumo Direto: A maioria das equipes constrói recursos de IA chamando APIs de provedores LLM diretamente — e paga por isso duas vezes: uma em tokens e outra em tempo de depuração quando um provedor cai. O Cloudflare AI Gateway é um proxy de URL única que adiciona cache, analytics, rate limiting e fallbacks automáticos a cada chamada LLM que sua aplicação faz. Você muda uma linha. Você ganha um plano de controle.

O Problema de Custo do “Vibe Coding”

Quando sua equipe começa a lançar recursos de IA rapidamente, surge um padrão que a própria equipe de engenharia da Cloudflare chama de “histórias de terror” — gastos descontrolados com tokens sem visibilidade de qual aplicação, equipe ou funcionalidade está gerando esse custo. De acordo com a Pesquisa de Desenvolvedores do Stack Overflow 2025, 82% dos desenvolvedores usam ferramentas de IA regularmente, mas menos de 30% trabalham em organizações que rastreiam custos de APIs de IA por funcionalidade.

O resultado é o que parece shadow IT, mas denominado em tokens. Uma equipe roteia cada resumo de log pelo GPT-4o. Outra usa Claude Sonnet para validação de entrada que poderia rodar em um modelo de $0,0001 por milhão de tokens. Ninguém sabe até a fatura chegar.

O Cloudflare AI Gateway resolve isso com uma arquitetura de proxy: todo o seu tráfego de IA é roteado por um endpoint de gateway que você controla, e a Cloudflare captura cada requisição — contagens de tokens, latência, códigos de erro e estimativas de custo — antes de chegar a qualquer provedor.

O Que o AI Gateway Faz de Fato

O AI Gateway fica entre sua aplicação e qualquer provedor de LLM. A arquitetura é simples:

main
src/ index.plaintext
--:--
Sua App → Cloudflare AI Gateway → OpenAI / Anthropic / Workers AI / etc.

O formato da URL do gateway é:

main
src/ index.plaintext
--:--
https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/{provider}/v1

Cada requisição que passa por ele recebe cinco capacidades automaticamente:

| Recurso | O que faz | | ----------------------- | ----------------------------------------------------------------------------------------------------- | | Analytics | Contagens de tokens, estimativas de custo, latência, taxas de erro — por provedor e por modelo | | Cache | Serve prompts idênticos a partir da borda da Cloudflare. Redução de latência de até 90% em cache hits | | Rate limiting | Limites de janela fixa ou deslizante para evitar abusos e estouros de orçamento | | Roteamento dinâmico | Retry automático contra um modelo de fallback em erros 5xx do provedor | | Guardrails | Moderação de conteúdo em tempo real em prompts e respostas |

Como Matthew Prince, CEO da Cloudflare, disse: “O objetivo da nossa plataforma de desenvolvedores Workers sempre foi abstrair as complexidades de infraestrutura para que os desenvolvedores possam focar no que mais importa — construir e entregar produtos incríveis.” O AI Gateway aplica esse mesmo princípio à camada de API de IA.

Configuração: Uma Mudança de URL

Você não precisa refatorar sua aplicação. O gateway expõe uma interface compatível com OpenAI, então a integração é uma única mudança de configuração na forma como você inicializa seu cliente SDK.

Passo 1: Criar um Gateway

main
src/ Painel Cloudflare
--:--

Navegue até: dash.cloudflare.com → AI → AI Gateway → Create Gateway # Dê um

nome (ex: “production”), então copie a URL gerada

Passo 2: Atualizar Seu Cliente SDK

Aqui está o antes e depois para os três SDKs mais comuns:

Vercel AI SDK (pacote ai):

main
src/ index.typescript
--:--
// Antes — chamada direta ao provedor
import { createOpenAI } from "@ai-sdk/openai";
const openai = createOpenAI({ apiKey: process.env.OPENAI_API_KEY });

// Depois — roteado pelo AI Gateway
import { createOpenAI } from "@ai-sdk/openai";
const openai = createOpenAI({
  apiKey: process.env.OPENAI_API_KEY,
  baseURL: `https://gateway.ai.cloudflare.com/v1/${process.env.CF_ACCOUNT_ID}/${process.env.CF_GATEWAY_NAME}/openai/v1`,
});

OpenAI Node SDK:

main
src/ index.typescript
--:--
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.OPENAI_API_KEY,
  baseURL: `https://gateway.ai.cloudflare.com/v1/${CF_ACCOUNT_ID}/${CF_GATEWAY_NAME}/openai/v1`,
});

Anthropic SDK:

main
src/ index.typescript
--:--
import Anthropic from "@anthropic-ai/sdk";

const client = new Anthropic({
  apiKey: process.env.ANTHROPIC_API_KEY,
  baseURL: `https://gateway.ai.cloudflare.com/v1/${CF_ACCOUNT_ID}/${CF_GATEWAY_NAME}/anthropic`,
});

Essa é toda a integração para roteamento básico e analytics. Cada requisição subsequente agora passa pelo seu gateway.

Passo 3: Ativar o Cache

No painel de Configurações do gateway, ative o Response Caching e defina um TTL. A chave de cache é derivada do corpo completo da requisição, então prompts idênticos — mesmo modelo, mesmo array de mensagens, mesmos parâmetros — são servidos a partir da borda da Cloudflare sem tocar o provedor.

Para aplicações com prompts repetidos ou baseados em templates (resumos de relatórios, explicações de código, lookups de FAQ), isso elimina a maioria das chamadas de API. A equipe Cloudflare reporta redução de latência de até 90% em respostas cacheadas.

Passo 4: Adicionar um Fallback

Em Configurações avançadas → Fallbacks, defina um modelo secundário para retry quando o provedor primário retornar um erro 5xx. Uma configuração típica de produção:

main
src/ index.plaintext
--:--
Primário:  openai/gpt-4o-mini
Fallback: workers-ai/@cf/meta/llama-3.1-8b-instruct

Isso torna sua aplicação resistente a interrupções de provedor sem nenhum código de tratamento de erro do seu lado.

Integração com Workers AI (Bindings)

Se você está executando inferência de IA dentro do Cloudflare Workers, o gateway se integra através do binding de AI no wrangler.toml:

main
src/ index.toml
--:--
# wrangler.toml
[ai]
binding = "AI"

Então no seu worker, passe o ID do gateway para a chamada:

main
src/ index.typescript
--:--
export default {
  async fetch(request: Request, env: Env): Promise<Response> {
    const response = await env.AI.run("@cf/meta/llama-3.1-8b-instruct", {
      prompt: "Explique o Cloudflare AI Gateway em uma frase.",
      gateway: {
        id: "production", // nome do seu gateway
        skipCache: false,
        cacheTtl: 3600,
      },
    });
    return Response.json(response);
  },
};
main
src/ Fazer deploy do Worker com binding de AI
--:--

wrangler deploy

Todas as chamadas de inferência do worker agora aparecem no painel de Analytics do gateway junto com quaisquer chamadas de provedores externos — dando a você uma visão única de toda a sua stack de IA.

Lendo o Painel de Analytics

A aba Analytics oferece três painéis que valem a pena monitorar:

  • Volume de requisições por provedor — qual provedor está lidando com seu tráfego e a que taxa
  • Distribuição de tokens — tokens de entrada vs. saída por modelo (tokens de saída custam mais; altas proporções de saída indicam respostas longas que valem ser cacheadas)
  • Taxa de acerto do cache — se estiver abaixo de 40% para um app conversacional, revise se você está enviando variação desnecessária nos system prompts que está quebrando a chave de cache

Uma alavanca de custo não-óbvia: a visão de analytics frequentemente revela que um pequeno conjunto de prompts (lookups de documentação, explicações de boilerplate) representa uma grande parcela do gasto com tokens. Mover esses para um modelo menor e cacheado (como llama-3.1-8b-instruct via Workers AI) enquanto roteia raciocínio complexo para modelos frontier é a otimização com maior retorno disponível.

Guardrails: Moderação de Conteúdo Sem Serviço Terceiro

O Cloudflare AI Gateway inclui moderação integrada de prompts e respostas em Configurações → Guardrails. Ele roda na borda da Cloudflare antes e depois da chamada ao provedor e pode:

  • Bloquear prompts que violam políticas de conteúdo (dano, violência, PII)
  • Remover dados sensíveis de respostas (modo Data Loss Prevention)
  • Registrar requisições sinalizadas sem bloqueá-las (modo somente auditoria)

Isso é importante para equipes que constroem recursos de IA voltados ao cliente que precisam demonstrar conformidade sem integrar um serviço de moderação separado.

Resumo e Próximos Passos

O Cloudflare AI Gateway converte sua camada de API de IA de uma caixa preta em um componente de infraestrutura monitorado, cacheado e com rate limiting. O custo de integração é uma mudança de URL. O ganho operacional — visibilidade de custo, cache, fallbacks, moderação — é imediato.

  • Comece aqui: Documentação do Cloudflare AI Gateway — leva 10 minutos para criar um gateway e rotear sua primeira requisição
  • Combine com Workers AI: se você está no Cloudflare Workers, você obtém inferência gratuita em modelos Llama, Mistral e Flux com o AI binding — sem provedor externo necessário para muitos casos de uso
  • Perspectiva alternativa: o cache do AI Gateway funciona melhor para aplicações com prompts determinísticos ou baseados em templates. Para aplicações puramente conversacionais onde cada mensagem é única, as taxas de acerto do cache serão baixas e o valor principal é analytics + fallbacks, não redução de custo
Henrique Bonfim

Autor

Henrique Bonfim

Senior Software Engineer

Senior Software Engineer with extensive experience building production web systems. Creator of ZettaBytes. Contributor to open-source Astro tooling. Specializes in edge-first architectures, AI integration, and web performance.

Artigos relacionados