Índice

  1. O que realmente custa em IA
  2. Modelos de custo: API vs modelo próprio
  3. Custo de API: tokens explicados
  4. Infraestrutura: o que você precisa hospedar
  5. Desenvolvimento: gente e tempo
  6. Manutenção e custos recorrentes
  7. Tabela consolidada de custos
  8. Calculando o ROI
  9. Custos escondidos que ninguém conta
  10. Como reduzir custos sem perder qualidade
  11. Erros comuns

O que realmente custa em IA {#o-que-custa}

Quando alguém fala "vamos colocar IA na empresa", a primeira pergunta do financeiro é sempre a mesma: quanto isso vai custar?. A resposta honesta é "depende", mas depende de coisas que dá para enumerar. Neste guia vamos abrir em quatro grandes blocos o que entra no orçamento de um projeto de inteligência artificial: API (o uso do modelo), infraestrutura (onde roda), desenvolvimento (quem constrói) e manutenção (quem cuida depois).

Pense em IA como montar uma cozinha profissional. O modelo (o "chef") é só uma parte. Você também precisa do fogão (infraestrutura), de quem projeta o cardápio (desenvolvimento) e de quem mantém tudo limpo e funcionando (manutenção). Ignorar qualquer um desses blocos é a receita certa para um projeto que estoura o orçamento.

Um modelo de linguagem (LLM, de Large Language Model) é um modelo de IA treinado para entender e gerar texto — o ChatGPT é o exemplo mais conhecido. Você não compra um LLM; você o aluga por uso (via API) ou o hospeda você mesmo. Essa escolha muda tudo no orçamento, então vamos por partes.

Modelos de custo: API vs modelo próprio {#modelos-de-custo}

Existem duas formas principais de usar um modelo de IA, e elas têm perfis de custo completamente diferentes.

Caminho 1: API de um provedor

Você chama o modelo pela internet, igual chama qualquer API. Paga por uso (medido em tokens, que explicamos adiante). O provedor (OpenAI, Anthropic, Google, Cohere) cuida de tudo: servidores, atualizações, escala.

Analogia: é como pedir comida no iFood. Você não tem cozinha, não tem chef, paga pelo que consome. Ótimo para começar, péssimo se você serve 10.000 pratos por dia.

  • Pró: custo quase zero para começar, escala sozinho, sempre atualizado
  • Contra: custo cresce linearmente com o uso, dependência de terceiro, dados saem da sua infraestrutura

Caminho 2: Modelo open source hospedado por você

Você pega um modelo de código aberto (Llama, Mistral, Qwen) e roda na sua própria infraestrutura. Paga pela máquina (GPU/CPU), independentemente de quantas chamadas faz.

Analogia: é como abrir seu próprio restaurante. Investimento alto no começo, mas o custo por prato cai drasticamente quando você tem volume.

  • Pró: custo previsível, dados ficam com você, sem dependência
  • Contra: precisa de gente especializada, investimento inicial alto, você cuida da atualização

Quando cada um vale?

CenárioRecomendaçãoPor quê
Até ~50k tokens/diaAPICusto baixo, zero infra
50k–500k tokens/diaAPI, mas monitorarAinda vale a pena, acompanhe a curva
500k–2M tokens/diaAvaliar modelo próprioPonto de equilíbrio aparece
Acima de 2M tokens/diaModelo próprioEconomia mensal significativa
Dados sensíveis/reguladosModelo próprioCompliance exige dado interno
Protótipo / POCAPIVelocidade acima de custo

Regra prática: comece com API. Só migre para modelo próprio quando a conta de API passar de R$ 8–12 mil/mês — esse é o ponto onde o custo de uma instância com GPU costuma se pagar.

Custo de API: tokens explicados {#custo-api}

O conceito central para entender o custo de API é o token. Token é o pedacinho de texto que o modelo processa — grosso modo, 1 token equivale a ~0,75 palavra em inglês ou ~0,5 palavra em português (nossa língua usa mais tokens por palavra por causa dos acentos e conjugações).

Toda chamada de API cobra duas coisas:

  • Input tokens: o texto que você envia (pergunta + contexto + instrução)
  • Output tokens: o texto que o modelo gera de volta

O output costuma custar de 3 a 5 vezes mais que o input. Por isso, mandar pouco contexto e gerar respostas curtas economiza muito.

Tabela de preços de API (referência 2026)

ModeloInput (por 1M tokens)Output (por 1M tokens)ContextoUso típico
GPT-4o-mini~$0,15~$0,60128kAtendimento, classificação
GPT-4o~$2,50~$10,00128kTarefas complexas, raciocínio
Claude 3.5 Haiku~$0,80~$4,00200kRápido e barato, bom em PT-BR
Claude 3.5 Sonnet~$3,00~$15,00200kMelhor custo-benefício geral
Gemini 1.5 Flash~$0,075~$0,301MVolume alto, contexto gigante
Gemini 1.5 Pro~$1,25~$5,002MContexto enorme

Preços em USD, sujeitos a mudança. Consulte a página oficial do provedor antes de fechar orçamento.

Exemplo de cálculo real

Imagine um assistente de atendimento que recebe 1.000 perguntas por dia. Cada pergunta envia, em média:

  • Prompt do sistema: 300 tokens
  • Contexto recuperado (RAG): 800 tokens
  • Pergunta do usuário: 50 tokens
  • Total input: ~1.150 tokens
  • Resposta gerada: ~300 tokens

Custo por query com GPT-4o-mini:

  • Input: 1.150 × $0,15/1M = $0,00017
  • Output: 300 × $0,60/1M = $0,00018
  • Total por query: ~$0,00035

Por mês (30 dias × 1.000):

  • 30.000.000 tokens input → $4,50
  • 9.000.000 tokens output → $5,40
  • Total: ~$10 USD/mês (≈ R$ 55)

Esse é o ponto que costuma surpreender: para volume pequeno/médio, o custo de API é quase irrelevante. O que pesa no orçamento é o desenvolvimento.

Código: medir tokens antes de pagar

import tiktoken

# tiktoken é a biblioteca oficial da OpenAI para contar tokens
# Instale com: pip install tiktoken

enc = tiktoken.encoding_for_model("gpt-4o-mini")

def contar_tokens(texto: str) -> int:
    """Retorna quantos tokens o texto vai consumir na API."""
    return len(enc.encode(texto))

# Antes de chamar a API, estime o custo
def estimar_custo(input_tokens: int, output_tokens: int,
                  preco_in: float = 0.15, preco_out: float = 0.60) -> float:
    """Estima custo em USD. Preços por 1M tokens."""
    return (input_tokens / 1_000_000 * preco_in) + \
           (output_tokens / 1_000_000 * preco_out)

# Exemplo
prompt = "Resuma o contrato abaixo em 5 bullet points: ..."
print(f"Tokens do prompt: {contar_tokens(prompt)}")
print(f"Custo estimado: ${estimar_custo(contar_tokens(prompt), 300):.5f}")

Comentários explicam cada passo: primeiro contamos tokens, depois multiplicamos pelo preço por milhão. Rodar isso antes de mandar volume para produção evita surpresas no fim do mês.

Infraestrutura: o que você precisa hospedar {#infraestrutura}

Mesmo no caminho da API (sem hospedar modelo), você precisa de infraestrutura para a aplicação que orquestra tudo. No caminho do modelo próprio, a infraestrutura fica bem mais cara por causa de GPU.

Caminho API — infra mínima

ComponenteO que éCusto/mês
API backend (FastAPI)Recebe chamadas, chama a API do LLM$5–20
Banco vetorial (pgvector)Guarda embeddings para RAG$10–30
Cache (Redis)Evita chamadas repetidas à API$5–15
MonitoramentoLatência, erros, custo por query$0–20
Total$20–85/mês

Serviços como Railway, Fly.io, Render ou AWS ECS Fargate cobram nessa faixa para uma aplicação pequena. Se você já tem um PostgreSQL, o pgvector é uma extensão gratuita — então o banco vetorial pode custar zero adicional.

Caminho modelo próprio — infra com GPU

Aqui o custo muda de figura. Um modelo como Llama 3.1 8B roda em uma GPU T4 (16GB), enquanto um modelo de 70B precisa de uma A100 (80GB) — e o preço pula de ~$0,50/hora para ~$4/hora.

ConfiguraçãoHardwareCusto/hora (spot)Custo/mês (24×30)
Llama 3.1 8B1× T4 16GB~$0,30~$216
Llama 3.1 8B1× A10G 24GB~$0,75~$540
Llama 3.1 70B2× A100 80GB~$8,00~$5.760
Mixtral 8x7B1× A100 80GB~$4,00~$2.880

GPU spot (preço mais barato, máquina pode ser interrompida) é viável para ambientes de dev/teste. Para produção, use GPU sob demanda ou reservada — mais cara, mas estável.

Dica de ouro: para volume médio, use inferência serverless (serviços como Together AI, Fireworks, Groq) que cobram por token mas rodam modelos open source. Você pega o melhor dos dois mundos: preço de API, sem dependência dos grandes provedores, e modelos que você escolhe.

Desenvolvimento: gente e tempo {#desenvolvimento}

Aqui está o maior custo de um projeto de IA pequeno e médio — e o que mais subestimado. Não é o modelo, não é a infra: é o tempo de gente especializada para construir a solução.

Um projeto típico de assistente com RAG (o caso mais comum) tem estas fases:

FaseDuraçãoQuemCusto (freela BR)
Discovery / levantamento1–2 semanasTech lead + PMR$ 4–10k
Protótipo (POC)2–3 semanas1 dev IAR$ 6–15k
Desenvolvimento completo4–8 semanas1–2 devs + tech leadR$ 20–60k
QA e testes1–2 semanasQA + devR$ 4–10k
Deploy + observabilidade1 semanaDevOps + devR$ 5–12k
Total10–16 semanasR$ 40–110k

Valores para desenvolvedores/freelancers no Brasil em 2026. Consultoria especializada em IA (não dev genérico) cobra entre R$ 80–200/hora. Uma boutique como a Inicialize Tec costuma trabalhar com proposta fechada por projeto, nessa faixa.

O que influencia o custo de desenvolvimento

  • Complexidade do RAG: dados limpos e bem estruturados = 2 semanas. Dados espalhados em PDFs, e-mails e planilhas = 6 semanas.
  • Integrações: conectar com o sistema atual (ERP, CRM, helpdesk) adiciona 1–3 semanas por integração.
  • Qualidade exigida: um protótipo "funciona mais ou menos" custa 1/3 de uma solução com 95% de acerto validado.
  • Interface: um endpoint de API é rápido. Um chat com UI rica, histórico, feedback do usuário, dobra o esforço.

Custos de gente além do código

Não esqueça de:

  • Curadoria de dados: alguém que entende do negócio precisa revisar e organizar a base de conhecimento (R$ 3–8k para um projeto médio)
  • Testes com usuários reais: tempo da equipe de atendimento validando respostas antes de abrir para clientes
  • Treinamento da equipe: quem vai usar precisa aprender (R$ 2–5k)

Manutenção e custos recorrentes {#manutencao}

IA não é "faça uma vez e esqueça". Modelos mudam, dados envelhecem, prompts quebram. Separe entre 15% e 25% do custo de desenvolvimento por ano como manutenção.

O que entra na manutenção

ItemFrequênciaCusto/mês
Ajuste de prompt (drift de qualidade)MensalR$ 1–3k
Atualização da base de conhecimentoSemanal/mensalR$ 1–4k
Monitoramento e alertasContínuo$20–100 (ferramentas)
Re-treino de embeddings (quando dados mudam muito)Trimestral$10–80 (API)
Bug fix e melhoriasContínuoR$ 2–6k
Atualização de versão do modeloSemestralR$ 3–8k (migração)

Por que a qualidade decai com o tempo

Dois motivos principais:

  1. Atualização dos modelos: provedores mudam o GPT-4o, e o prompt que funcionava para de funcionar. Precisa revalidar.
  2. Drift dos dados: sua base de conhecimento muda (novos produtos, novas políticas), e o RAG passa a recuperar contexto desatualizado.

Por isso, monitoramento não é opcional. Se você não mede a qualidade das respostas ao longo do tempo, descobre o problema só quando o cliente reclama.

Tabela consolidada de custos {#tabela-consolidada}

Para um assistente de atendimento com RAG, 1.000 queries/dia, usando API:

BlocoCusto inicialCusto mensal recorrente
API (GPT-4o-mini)$0~$10 USD (R$ 55)
Infraestrutura$0–50 (setup)~$30–85 USD (R$ 165–470)
DesenvolvimentoR$ 40–110k (único)
Curadoria de dadosR$ 3–8k (único)
ManutençãoR$ 3–15k
Monitoramento$20–100 USD (R$ 110–550)
Total 1º anoR$ 45–120kR$ 4–16k/mês

No primeiro ano, o desenvolvimento domina. Do segundo ano em diante, só rodam os custos recorrentes — e aí o ROI aparece com força.

Calculando o ROI {#roi}

A matemática do ROI em IA é simples quando você para de pensar em "custo de IA" e passa a pensar em custo do processo atual.

Exemplo: atendimento ao cliente

Uma empresa tem 3 atendentes, cada um custa R$ 3.500/mês (salário + encargos) = R$ 10.500/mês. Eles respondem 1.000 tickets/mês, sendo 60% tier 1 (perguntas repetitivas).

Com um assistente de IA cobrindo os tickets tier 1:

  • 600 tickets/mês resolvidos pela IA (60% do volume)
  • Cada atendente agora faz ~130 tickets/mês (em vez de 333)
  • Redução de 2 atendentes: economia de R$ 7.000/mês

Custo da solução de IA: R$ 4–16k/mês (incluindo manutenção). Mesmo no pior caso, payback em 2–3 meses. No melhor caso, economia líquida desde o mês 1.

Fórmula prática

ROI = (Economia mensal - Custo mensal IA) / Custo mensal IA × 100

Payback (meses) = Custo de desenvolvimento / (Economia mensal - Custo mensal IA)

Economia mensal pode ser:

  • Redução de headcount
  • Aumento de produtividade (mais casos resolvidos com o mesmo time)
  • Redução de tempo de resposta (impacto em satisfação e retenção)
  • Novas receitas (IA que gera leads, por exemplo)

Custos escondidos que ninguém conta {#escondidos}

  1. Custo de token inesperado em loops: um agente que chama o LLM em loop pode consumir 50× o orçamento previsto em poucas horas. Sempre coloque limite (max iterations) e alerta de custo.
  2. Reprocessamento de embeddings: cada vez que você muda o modelo de embedding (ex: saiu uma versão melhor), todos os embeddings precisam ser recalculados. Para uma base de 100k documentos, isso custa $5–20 em API, mas dá trabalho.
  3. Custo de saída de dados da API: alguns provedores cobram por transferência de dados. Para volumes altos de contexto (2M tokens de input por query), a banda também pesa.
  4. Custo de compliance: LGPD exige Auditoria de Dados Pessoais (DPA), contrato com o provedor e, às vezes, consultoria jurídica. R$ 5–20k para um projeto médio.
  5. Custo de vendor lock-in: se você constrói tudo acoplado à API da OpenAI e ela dobra o preço, você troca de provedor — mas isso custa 1–3 semanas de refatoração. Sempre abstraia o provedor.
  6. Custo de erro de IA: uma resposta errada que gera processo ou perda de cliente não entra na planilha, mas é real. Para casos sensíveis (jurídico, médico, financeiro), sempre tenha humano na revisão.

Como reduzir custos sem perder qualidade {#reduzir}

  • Use modelos pequenos quando dá: GPT-4o-mini resolve 80% dos casos que GPT-4o resolve, por 1/15 do preço. Use o grande só quando o pequeno não basta.
  • Cache de respostas: perguntas repetidas (FAQ) não precisam ir ao LLM toda vez. Cache em Redis por 24h economiza 30–60% em atendimento.
  • Roteamento inteligente: um classificador barato decide se a pergunta vai para o modelo pequeno ou o grande. Economia de 50%+ mantendo qualidade.
  • Comprima o contexto: em vez de mandar 10 documentos inteiros, mande só os 3 mais relevantes (top-k menor). Reduz input tokens drasticamente.
  • Batch API: alguns provedores oferecem desconto de 50% para chamadas assíncronas em lote. Vale para processamentos noturnos.
  • Misture API + modelo próprio: use API para volume baixo e switches para modelo próprio nos picos. Estratégia híbrida maximiza economia.

Erros comuns {#erros}

  1. Orçar só a API, esquecer desenvolvimento: o erro mais comum. "Ah, a IA custa R$ 50/mês". Sim, mas construir custou R$ 80k. Separe CapEx (desenvolvimento) de OpEx (recorrente).
  2. Começar pelo modelo mais caro: GPT-4o em tudo. Na maioria dos casos, o mini resolve. Comece barato, escale qualidade só onde precisa.
  3. Não provisionar para pico: orçar pela média mensal e quebrar no Black Friday. Custeie pela média do pior dia, não do dia comum.
  4. Ignorar manutenção no orçamento: "já construímos, acabou". No mês 4 a qualidade cai, ninguém sabe por quê, e a solução morre. Reserve 20% do desenvolvimento para manutenção do ano.
  5. Não medir custo por query: sem essa métrica, você não sabe se está gastando demais. Implemente logging de custo desde o dia 1.
  6. Confiar em estimativa de token "no olho": sempre conte tokens com biblioteca (tiktoken). Em português, o número de tokens surpreende — sempre mais alto que se imagina.
  7. Subestimar curadoria de dados: "vamos jogar todos os PDFs no RAG". Dados sujos = respostas ruins = projeto fracassa. Invista em limpar antes.
  8. Não ter plano B quando a API cai: provedores caem. Sem fallback (resposta degradada, fila, retry), sua operação para. Sempre planeje resiliência.

Quer colocar IA na sua empresa sem surpresas no orçamento? A Inicialize Tec faz o diagnóstico, estima custos reais para o seu caso e implementa do protótipo ao deploy. Entre em contato e montamos uma proposta com números que fecham.