Índice
- O que realmente custa em IA
- Modelos de custo: API vs modelo próprio
- Custo de API: tokens explicados
- Infraestrutura: o que você precisa hospedar
- Desenvolvimento: gente e tempo
- Manutenção e custos recorrentes
- Tabela consolidada de custos
- Calculando o ROI
- Custos escondidos que ninguém conta
- Como reduzir custos sem perder qualidade
- Erros comuns
O que realmente custa em IA {#o-que-custa}
Quando alguém fala "vamos colocar IA na empresa", a primeira pergunta do financeiro é sempre a mesma: quanto isso vai custar?. A resposta honesta é "depende", mas depende de coisas que dá para enumerar. Neste guia vamos abrir em quatro grandes blocos o que entra no orçamento de um projeto de inteligência artificial: API (o uso do modelo), infraestrutura (onde roda), desenvolvimento (quem constrói) e manutenção (quem cuida depois).
Pense em IA como montar uma cozinha profissional. O modelo (o "chef") é só uma parte. Você também precisa do fogão (infraestrutura), de quem projeta o cardápio (desenvolvimento) e de quem mantém tudo limpo e funcionando (manutenção). Ignorar qualquer um desses blocos é a receita certa para um projeto que estoura o orçamento.
Um modelo de linguagem (LLM, de Large Language Model) é um modelo de IA treinado para entender e gerar texto — o ChatGPT é o exemplo mais conhecido. Você não compra um LLM; você o aluga por uso (via API) ou o hospeda você mesmo. Essa escolha muda tudo no orçamento, então vamos por partes.
Modelos de custo: API vs modelo próprio {#modelos-de-custo}
Existem duas formas principais de usar um modelo de IA, e elas têm perfis de custo completamente diferentes.
Caminho 1: API de um provedor
Você chama o modelo pela internet, igual chama qualquer API. Paga por uso (medido em tokens, que explicamos adiante). O provedor (OpenAI, Anthropic, Google, Cohere) cuida de tudo: servidores, atualizações, escala.
Analogia: é como pedir comida no iFood. Você não tem cozinha, não tem chef, paga pelo que consome. Ótimo para começar, péssimo se você serve 10.000 pratos por dia.
- Pró: custo quase zero para começar, escala sozinho, sempre atualizado
- Contra: custo cresce linearmente com o uso, dependência de terceiro, dados saem da sua infraestrutura
Caminho 2: Modelo open source hospedado por você
Você pega um modelo de código aberto (Llama, Mistral, Qwen) e roda na sua própria infraestrutura. Paga pela máquina (GPU/CPU), independentemente de quantas chamadas faz.
Analogia: é como abrir seu próprio restaurante. Investimento alto no começo, mas o custo por prato cai drasticamente quando você tem volume.
- Pró: custo previsível, dados ficam com você, sem dependência
- Contra: precisa de gente especializada, investimento inicial alto, você cuida da atualização
Quando cada um vale?
| Cenário | Recomendação | Por quê |
|---|---|---|
| Até ~50k tokens/dia | API | Custo baixo, zero infra |
| 50k–500k tokens/dia | API, mas monitorar | Ainda vale a pena, acompanhe a curva |
| 500k–2M tokens/dia | Avaliar modelo próprio | Ponto de equilíbrio aparece |
| Acima de 2M tokens/dia | Modelo próprio | Economia mensal significativa |
| Dados sensíveis/regulados | Modelo próprio | Compliance exige dado interno |
| Protótipo / POC | API | Velocidade acima de custo |
Regra prática: comece com API. Só migre para modelo próprio quando a conta de API passar de R$ 8–12 mil/mês — esse é o ponto onde o custo de uma instância com GPU costuma se pagar.
Custo de API: tokens explicados {#custo-api}
O conceito central para entender o custo de API é o token. Token é o pedacinho de texto que o modelo processa — grosso modo, 1 token equivale a ~0,75 palavra em inglês ou ~0,5 palavra em português (nossa língua usa mais tokens por palavra por causa dos acentos e conjugações).
Toda chamada de API cobra duas coisas:
- Input tokens: o texto que você envia (pergunta + contexto + instrução)
- Output tokens: o texto que o modelo gera de volta
O output costuma custar de 3 a 5 vezes mais que o input. Por isso, mandar pouco contexto e gerar respostas curtas economiza muito.
Tabela de preços de API (referência 2026)
| Modelo | Input (por 1M tokens) | Output (por 1M tokens) | Contexto | Uso típico |
|---|---|---|---|---|
| GPT-4o-mini | ~$0,15 | ~$0,60 | 128k | Atendimento, classificação |
| GPT-4o | ~$2,50 | ~$10,00 | 128k | Tarefas complexas, raciocínio |
| Claude 3.5 Haiku | ~$0,80 | ~$4,00 | 200k | Rápido e barato, bom em PT-BR |
| Claude 3.5 Sonnet | ~$3,00 | ~$15,00 | 200k | Melhor custo-benefício geral |
| Gemini 1.5 Flash | ~$0,075 | ~$0,30 | 1M | Volume alto, contexto gigante |
| Gemini 1.5 Pro | ~$1,25 | ~$5,00 | 2M | Contexto enorme |
Preços em USD, sujeitos a mudança. Consulte a página oficial do provedor antes de fechar orçamento.
Exemplo de cálculo real
Imagine um assistente de atendimento que recebe 1.000 perguntas por dia. Cada pergunta envia, em média:
- Prompt do sistema: 300 tokens
- Contexto recuperado (RAG): 800 tokens
- Pergunta do usuário: 50 tokens
- Total input: ~1.150 tokens
- Resposta gerada: ~300 tokens
Custo por query com GPT-4o-mini:
- Input: 1.150 × $0,15/1M = $0,00017
- Output: 300 × $0,60/1M = $0,00018
- Total por query: ~$0,00035
Por mês (30 dias × 1.000):
- 30.000.000 tokens input → $4,50
- 9.000.000 tokens output → $5,40
- Total: ~$10 USD/mês (≈ R$ 55)
Esse é o ponto que costuma surpreender: para volume pequeno/médio, o custo de API é quase irrelevante. O que pesa no orçamento é o desenvolvimento.
Código: medir tokens antes de pagar
import tiktoken
# tiktoken é a biblioteca oficial da OpenAI para contar tokens
# Instale com: pip install tiktoken
enc = tiktoken.encoding_for_model("gpt-4o-mini")
def contar_tokens(texto: str) -> int:
"""Retorna quantos tokens o texto vai consumir na API."""
return len(enc.encode(texto))
# Antes de chamar a API, estime o custo
def estimar_custo(input_tokens: int, output_tokens: int,
preco_in: float = 0.15, preco_out: float = 0.60) -> float:
"""Estima custo em USD. Preços por 1M tokens."""
return (input_tokens / 1_000_000 * preco_in) + \
(output_tokens / 1_000_000 * preco_out)
# Exemplo
prompt = "Resuma o contrato abaixo em 5 bullet points: ..."
print(f"Tokens do prompt: {contar_tokens(prompt)}")
print(f"Custo estimado: ${estimar_custo(contar_tokens(prompt), 300):.5f}")
Comentários explicam cada passo: primeiro contamos tokens, depois multiplicamos pelo preço por milhão. Rodar isso antes de mandar volume para produção evita surpresas no fim do mês.
Infraestrutura: o que você precisa hospedar {#infraestrutura}
Mesmo no caminho da API (sem hospedar modelo), você precisa de infraestrutura para a aplicação que orquestra tudo. No caminho do modelo próprio, a infraestrutura fica bem mais cara por causa de GPU.
Caminho API — infra mínima
| Componente | O que é | Custo/mês |
|---|---|---|
| API backend (FastAPI) | Recebe chamadas, chama a API do LLM | $5–20 |
| Banco vetorial (pgvector) | Guarda embeddings para RAG | $10–30 |
| Cache (Redis) | Evita chamadas repetidas à API | $5–15 |
| Monitoramento | Latência, erros, custo por query | $0–20 |
| Total | $20–85/mês |
Serviços como Railway, Fly.io, Render ou AWS ECS Fargate cobram nessa faixa para uma aplicação pequena. Se você já tem um PostgreSQL, o pgvector é uma extensão gratuita — então o banco vetorial pode custar zero adicional.
Caminho modelo próprio — infra com GPU
Aqui o custo muda de figura. Um modelo como Llama 3.1 8B roda em uma GPU T4 (16GB), enquanto um modelo de 70B precisa de uma A100 (80GB) — e o preço pula de ~$0,50/hora para ~$4/hora.
| Configuração | Hardware | Custo/hora (spot) | Custo/mês (24×30) |
|---|---|---|---|
| Llama 3.1 8B | 1× T4 16GB | ~$0,30 | ~$216 |
| Llama 3.1 8B | 1× A10G 24GB | ~$0,75 | ~$540 |
| Llama 3.1 70B | 2× A100 80GB | ~$8,00 | ~$5.760 |
| Mixtral 8x7B | 1× A100 80GB | ~$4,00 | ~$2.880 |
GPU spot (preço mais barato, máquina pode ser interrompida) é viável para ambientes de dev/teste. Para produção, use GPU sob demanda ou reservada — mais cara, mas estável.
Dica de ouro: para volume médio, use inferência serverless (serviços como Together AI, Fireworks, Groq) que cobram por token mas rodam modelos open source. Você pega o melhor dos dois mundos: preço de API, sem dependência dos grandes provedores, e modelos que você escolhe.
Desenvolvimento: gente e tempo {#desenvolvimento}
Aqui está o maior custo de um projeto de IA pequeno e médio — e o que mais subestimado. Não é o modelo, não é a infra: é o tempo de gente especializada para construir a solução.
Um projeto típico de assistente com RAG (o caso mais comum) tem estas fases:
| Fase | Duração | Quem | Custo (freela BR) |
|---|---|---|---|
| Discovery / levantamento | 1–2 semanas | Tech lead + PM | R$ 4–10k |
| Protótipo (POC) | 2–3 semanas | 1 dev IA | R$ 6–15k |
| Desenvolvimento completo | 4–8 semanas | 1–2 devs + tech lead | R$ 20–60k |
| QA e testes | 1–2 semanas | QA + dev | R$ 4–10k |
| Deploy + observabilidade | 1 semana | DevOps + dev | R$ 5–12k |
| Total | 10–16 semanas | R$ 40–110k |
Valores para desenvolvedores/freelancers no Brasil em 2026. Consultoria especializada em IA (não dev genérico) cobra entre R$ 80–200/hora. Uma boutique como a Inicialize Tec costuma trabalhar com proposta fechada por projeto, nessa faixa.
O que influencia o custo de desenvolvimento
- Complexidade do RAG: dados limpos e bem estruturados = 2 semanas. Dados espalhados em PDFs, e-mails e planilhas = 6 semanas.
- Integrações: conectar com o sistema atual (ERP, CRM, helpdesk) adiciona 1–3 semanas por integração.
- Qualidade exigida: um protótipo "funciona mais ou menos" custa 1/3 de uma solução com 95% de acerto validado.
- Interface: um endpoint de API é rápido. Um chat com UI rica, histórico, feedback do usuário, dobra o esforço.
Custos de gente além do código
Não esqueça de:
- Curadoria de dados: alguém que entende do negócio precisa revisar e organizar a base de conhecimento (R$ 3–8k para um projeto médio)
- Testes com usuários reais: tempo da equipe de atendimento validando respostas antes de abrir para clientes
- Treinamento da equipe: quem vai usar precisa aprender (R$ 2–5k)
Manutenção e custos recorrentes {#manutencao}
IA não é "faça uma vez e esqueça". Modelos mudam, dados envelhecem, prompts quebram. Separe entre 15% e 25% do custo de desenvolvimento por ano como manutenção.
O que entra na manutenção
| Item | Frequência | Custo/mês |
|---|---|---|
| Ajuste de prompt (drift de qualidade) | Mensal | R$ 1–3k |
| Atualização da base de conhecimento | Semanal/mensal | R$ 1–4k |
| Monitoramento e alertas | Contínuo | $20–100 (ferramentas) |
| Re-treino de embeddings (quando dados mudam muito) | Trimestral | $10–80 (API) |
| Bug fix e melhorias | Contínuo | R$ 2–6k |
| Atualização de versão do modelo | Semestral | R$ 3–8k (migração) |
Por que a qualidade decai com o tempo
Dois motivos principais:
- Atualização dos modelos: provedores mudam o GPT-4o, e o prompt que funcionava para de funcionar. Precisa revalidar.
- Drift dos dados: sua base de conhecimento muda (novos produtos, novas políticas), e o RAG passa a recuperar contexto desatualizado.
Por isso, monitoramento não é opcional. Se você não mede a qualidade das respostas ao longo do tempo, descobre o problema só quando o cliente reclama.
Tabela consolidada de custos {#tabela-consolidada}
Para um assistente de atendimento com RAG, 1.000 queries/dia, usando API:
| Bloco | Custo inicial | Custo mensal recorrente |
|---|---|---|
| API (GPT-4o-mini) | $0 | ~$10 USD (R$ 55) |
| Infraestrutura | $0–50 (setup) | ~$30–85 USD (R$ 165–470) |
| Desenvolvimento | R$ 40–110k (único) | — |
| Curadoria de dados | R$ 3–8k (único) | — |
| Manutenção | — | R$ 3–15k |
| Monitoramento | — | $20–100 USD (R$ 110–550) |
| Total 1º ano | R$ 45–120k | R$ 4–16k/mês |
No primeiro ano, o desenvolvimento domina. Do segundo ano em diante, só rodam os custos recorrentes — e aí o ROI aparece com força.
Calculando o ROI {#roi}
A matemática do ROI em IA é simples quando você para de pensar em "custo de IA" e passa a pensar em custo do processo atual.
Exemplo: atendimento ao cliente
Uma empresa tem 3 atendentes, cada um custa R$ 3.500/mês (salário + encargos) = R$ 10.500/mês. Eles respondem 1.000 tickets/mês, sendo 60% tier 1 (perguntas repetitivas).
Com um assistente de IA cobrindo os tickets tier 1:
- 600 tickets/mês resolvidos pela IA (60% do volume)
- Cada atendente agora faz ~130 tickets/mês (em vez de 333)
- Redução de 2 atendentes: economia de R$ 7.000/mês
Custo da solução de IA: R$ 4–16k/mês (incluindo manutenção). Mesmo no pior caso, payback em 2–3 meses. No melhor caso, economia líquida desde o mês 1.
Fórmula prática
ROI = (Economia mensal - Custo mensal IA) / Custo mensal IA × 100
Payback (meses) = Custo de desenvolvimento / (Economia mensal - Custo mensal IA)
Economia mensal pode ser:
- Redução de headcount
- Aumento de produtividade (mais casos resolvidos com o mesmo time)
- Redução de tempo de resposta (impacto em satisfação e retenção)
- Novas receitas (IA que gera leads, por exemplo)
Custos escondidos que ninguém conta {#escondidos}
- Custo de token inesperado em loops: um agente que chama o LLM em loop pode consumir 50× o orçamento previsto em poucas horas. Sempre coloque limite (max iterations) e alerta de custo.
- Reprocessamento de embeddings: cada vez que você muda o modelo de embedding (ex: saiu uma versão melhor), todos os embeddings precisam ser recalculados. Para uma base de 100k documentos, isso custa $5–20 em API, mas dá trabalho.
- Custo de saída de dados da API: alguns provedores cobram por transferência de dados. Para volumes altos de contexto (2M tokens de input por query), a banda também pesa.
- Custo de compliance: LGPD exige Auditoria de Dados Pessoais (DPA), contrato com o provedor e, às vezes, consultoria jurídica. R$ 5–20k para um projeto médio.
- Custo de vendor lock-in: se você constrói tudo acoplado à API da OpenAI e ela dobra o preço, você troca de provedor — mas isso custa 1–3 semanas de refatoração. Sempre abstraia o provedor.
- Custo de erro de IA: uma resposta errada que gera processo ou perda de cliente não entra na planilha, mas é real. Para casos sensíveis (jurídico, médico, financeiro), sempre tenha humano na revisão.
Como reduzir custos sem perder qualidade {#reduzir}
- Use modelos pequenos quando dá: GPT-4o-mini resolve 80% dos casos que GPT-4o resolve, por 1/15 do preço. Use o grande só quando o pequeno não basta.
- Cache de respostas: perguntas repetidas (FAQ) não precisam ir ao LLM toda vez. Cache em Redis por 24h economiza 30–60% em atendimento.
- Roteamento inteligente: um classificador barato decide se a pergunta vai para o modelo pequeno ou o grande. Economia de 50%+ mantendo qualidade.
- Comprima o contexto: em vez de mandar 10 documentos inteiros, mande só os 3 mais relevantes (top-k menor). Reduz input tokens drasticamente.
- Batch API: alguns provedores oferecem desconto de 50% para chamadas assíncronas em lote. Vale para processamentos noturnos.
- Misture API + modelo próprio: use API para volume baixo e switches para modelo próprio nos picos. Estratégia híbrida maximiza economia.
Erros comuns {#erros}
- Orçar só a API, esquecer desenvolvimento: o erro mais comum. "Ah, a IA custa R$ 50/mês". Sim, mas construir custou R$ 80k. Separe CapEx (desenvolvimento) de OpEx (recorrente).
- Começar pelo modelo mais caro: GPT-4o em tudo. Na maioria dos casos, o mini resolve. Comece barato, escale qualidade só onde precisa.
- Não provisionar para pico: orçar pela média mensal e quebrar no Black Friday. Custeie pela média do pior dia, não do dia comum.
- Ignorar manutenção no orçamento: "já construímos, acabou". No mês 4 a qualidade cai, ninguém sabe por quê, e a solução morre. Reserve 20% do desenvolvimento para manutenção do ano.
- Não medir custo por query: sem essa métrica, você não sabe se está gastando demais. Implemente logging de custo desde o dia 1.
- Confiar em estimativa de token "no olho": sempre conte tokens com biblioteca (tiktoken). Em português, o número de tokens surpreende — sempre mais alto que se imagina.
- Subestimar curadoria de dados: "vamos jogar todos os PDFs no RAG". Dados sujos = respostas ruins = projeto fracassa. Invista em limpar antes.
- Não ter plano B quando a API cai: provedores caem. Sem fallback (resposta degradada, fila, retry), sua operação para. Sempre planeje resiliência.
Quer colocar IA na sua empresa sem surpresas no orçamento? A Inicialize Tec faz o diagnóstico, estima custos reais para o seu caso e implementa do protótipo ao deploy. Entre em contato e montamos uma proposta com números que fecham.