Última atualização: julho de 2026
Resumo rápido
Se já implementou um chatbot com IA e percebeu que os custos reais ficaram acima da estimativa, então já sabe algo importante: a utilização de IA é mais dinâmica do que qualquer calculadora consegue captar por completo à partida. Essa variabilidade faz parte da natureza das conversas reais, e compreendê-la é o primeiro passo para a controlar de facto. Este mês fomos além da teoria: executámos a mesma conversa de cliente com 8 mensagens, com uma marcação num calendário em direto e encaminhamento para um humano, em três modelos de IA, em assistentes por outro lado idênticos, e registámos cada cêntimo. Foi um teste prático rápido, não um benchmark formal, e esse é precisamente o ponto: é o tipo de verificação que qualquer empresário pode fazer no seu próprio assistente em menos de uma hora, e este guia mostra-lhe como. E, quer lhe chame chatbot, assistente de IA ou agente de IA, a mecânica dos tokens que determina o custo é exatamente a mesma.
"A coisa mais cara na IA não é o modelo. São os tokens que não se apercebeu de que estava a enviar."
G.H.
1. O que os estimadores acertam (e quais são os seus limites)
As calculadoras de custo perguntam: mensagens diárias e modelo de IA. Multiplicam um custo típico por mensagem pelo volume.
Nas plataformas com preços baseados na utilização, as mensagens são cobradas por utilização em frações de cêntimo, e o seletor de modelo mostra normalmente uma estimativa por mensagem antes de se comprometer com um. Deliberadamente, não vamos publicar preços atuais num artigo de blog: os preços evoluem (historicamente, para baixo), e um artigo não é uma página de preços. Para os valores reais de hoje, a página de preços da sua plataforma é a fonte de verdade (aqui está a nossa, com a documentação detalhada).
E a razão honesta pela qual nenhum artigo pode publicar "o seu custo por mensagem" é que ele varia com praticamente tudo o que configurar:
- O modelo, e, quando usa Auto, que modelo é escolhido para essa mensagem específica
- As instruções: o seu comprimento e a forma como estão escritas. Vão em todas as mensagens, sem exceção, e a eficiência da linguagem natural determina o seu peso: as mesmas regras escritas uma vez, em linhas declarativas curtas, podem custar uma fração da versão mais inchada (o Pilar 1 abaixo mostra como)
- O conhecimento recuperado para essa pergunta em particular, e quantas pesquisas foram necessárias
- O comprimento da conversa, já que o histórico acompanha cada nova mensagem
- O estado da cache: uma conversa já quente custa menos do que a primeira mensagem ou a primeira mensagem após uma pausa longa
- As ações acionadas: verificações de calendário, atualizações no CRM e links de pagamento são cobrados quando são invocados
- Os conteúdos multimédia processados: notas de voz, imagens e documentos têm o seu próprio peso em tokens
- As capacidades em segundo plano que ativou: pontuação de CSAT, memória, follow-ups automáticos
- O comprimento da resposta que a pergunta exige: "quais são os vossos horários?" e "compare estes três anúncios" pedem respostas diferentes
- Os padrões de tráfego: um dia viral multiplica o volume, mesmo quando todas as tarifas por mensagem permanecem idênticas
Cada um destes fatores é uma alavanca que controla, e o resto deste guia percorre aquelas que mais importam.
Estimativas como estas são honestas. Nos nossos testes, a estimativa do seletor de modelo para um dos modelos ficou a menos de 3% do custo observado numa pergunta típica baseada em conhecimento. O que as estimativas não conseguem prever é como se vão comportar as suas conversas reais: quanto tempo duram, que funcionalidades estão ativas, se a cache está quente ou se vai ter picos de tráfego. Essa é simplesmente a diferença entre uma estimativa e um ambiente real, e o resto deste guia é sobre as alavancas que a controlam.
A regra subjacente é simples: tudo o que acrescenta ao seu assistente segue junto sob a forma de tokens. Um bloco de instruções mais longo, mais um documento de conhecimento, uma capacidade extra: cada acrescento pesa em todas as mensagens, e a estimativa do seletor para uma mensagem típica não consegue saber o que irá construir por cima. O nosso assistente de teste levava consigo cerca de 9.000 a 10.000 tokens de instruções e conhecimento por mensagem, e o que cada modelo efetivamente cobrou por esse peso reduziu-se a uma coisa: quanto desse volume a cache absorveu. No nosso teste, a cache de um dos modelos cobriu quase todo o contexto, outro cobrava tarifas completas nos arranques a frio mas ficava muito mais barato quando a conversa já estava quente, e a tarifa de cache de um terceiro quase não oferecia desconto. A tabela comparativa mais adiante neste guia mostra os números observados. A estimativa é o mapa; a sua configuração é o terreno.
2. Como o contexto determina os custos
Primeiro, a unidade em que tudo é medido: um token é a pequena unidade de texto que um modelo de IA lê e escreve, equivalente a cerca de três quartos de uma palavra em inglês. Os modelos são cobrados em tokens da mesma forma que a eletricidade é cobrada em quilowatt-hora: o importante não é o número em si, mas saber o que faz o contador andar.
O modelo relê todo o contexto da conversa em cada mensagem a que responde.
Cada resposta inclui:
- Prompt de sistema (instruções)
- Conteúdo da base de conhecimento / FAQ
- Histórico completo da conversa
- Nova mensagem do utilizador
Esta janela de contexto cresce rapidamente. Nos nossos testes de julho, uma pergunta de cliente com quatro palavras seguia juntamente com cerca de 19.000 tokens de contexto. A pergunta nunca é o custo; o contexto é que o é.
Exemplo real: uma resposta que analisámos tinha apenas algumas frases curtas, mas produzi-la custou cerca de 45x mais do que a estimativa assumia. A resposta não era a despesa. Para a escrever, o assistente releu as suas instruções, o conhecimento recuperado e toda a conversa até àquele momento, e cada um desses tokens é cobrado como os visíveis.
Modelo mental: acrescentar uma página a um documento, mas reimprimir o documento inteiro de cada vez.
A boa notícia: as plataformas modernas já não reimprimem o documento inteiro ao preço total. Esse é o tema da próxima secção, e altera a matemática mais do que qualquer outro fator isolado.
3. Prompt caching: a metade moderna da história
Cada mensagem volta a enviar as suas instruções, o contexto de conhecimento e o histórico. Prompt caching significa que o fornecedor do modelo armazena esse prefixo repetido: a primeira mensagem de uma conversa paga um pequeno prémio para escrever a cache, e as mensagens seguintes leem-na de volta por uma fração do preço de input (a Anthropic documenta a mecânica, e os principais fornecedores funcionam todos de forma semelhante). No Invent, isto está ativado automaticamente em todos os modelos compatíveis; não há nada para configurar.
O que observámos quando o medimos:
- As conversas ficam mais baratas à medida que continuam. Nos nossos testes, o custo por mensagem do mesmo assistente desceu 35% a 64% quando a conversa já estava quente, em comparação com a sua primeira mensagem a frio.
- Os preços da cache variam enormemente entre modelos. As tarifas de tokens em cache que observámos variaram cerca de 30x entre o modelo mais favorável e o menos favorável no nosso teste único (os números completos estão na tabela abaixo). Dois modelos com preços de tabela semelhantes podem gerar faturas muito diferentes apenas por causa do comportamento da cache.
- As caches expiram durante as pausas. Quando um cliente responde após um intervalo longo, a mensagem seguinte volta a pagar tarifas de arranque a frio. No nosso teste, uma pausa durante a noite fez com que a mensagem seguinte de um dos modelos voltasse a quase o preço total de input. Conversas longas ficam baratas enquanto estão ativas, mas todas as conversas reais têm pausas para café; inclua no orçamento o reaquecimento.
As regras práticas: mantenha a conversa de um cliente numa única thread, em vez de a dispersar por novos chats; mantenha o seu bloco de instruções estável (cada edição reescreve a cache); e espere que a primeira mensagem após qualquer pausa longa custe como uma primeira mensagem.
4. Executámos a mesma conversa em três modelos. Eis o que vimos.
Como testámos, e o que isto não é. Uma tarde, uma conversa, uma passagem por modelo, no Invent Playground às tarifas de julho de 2026. Isto é uma observação de campo, não um estudo de benchmark: uma comparação rigorosa exigiria muitas execuções, conversas variadas e controlos estatísticos. Partilhamos os números porque a mecânica que ilustram (cache, peso do contexto, custos de ações) é generalizável, mesmo quando os valores exatos não o forem. Os seus modelos, o seu conhecimento e os seus clientes produzirão números diferentes, e a melhor parte é que pode produzi-los: todo este teste demora cerca de uma hora a replicar no seu próprio assistente.
Para passar da mecânica ao dinheiro, criámos uma empresa de teste realista (um pequeno agente imobiliário de Miami), demos a três assistentes instruções de 200 palavras idênticas , os mesmos dois documentos de conhecimento, a mesma ação de marcação em calendário em direto e as mesmas capacidades avançadas (CSAT automático, follow-up automático, transferência para humano), e executámos a mesma conversa de cliente com 8 mensagens em cada um: perguntas sobre disponibilidade, uma marcação, uma mudança urgente, um pedido de informação de um vendedor e uma escalada. Um dos modelos, o Muse Spark 1.1 da Meta, foi testado no dia do seu lançamento.

Muse Spark 1.1, disponível no Invent, a lidar com uma escalada com a sua análise de utilização em direto. Os valores a verde são preços apenas do Playground; a faturação em produção não tem linha de desconto.
Para quem só passa os olhos e para os motores de resposta, aqui ficam os mesmos números observados em texto:
- Muse Spark 1.1 (Meta): primeira mensagem a frio $0.0097, mensagem quente na mesma thread $0.0051 (uma descida de 48%), média de $0.0090 por mensagem, $0.072 para a conversa completa de 8 mensagens.
- Gemini Flash 3 (Google): primeira mensagem a frio $0.0184, mensagem quente na mesma thread $0.0060 (uma descida de 64%), média de $0.0118 por mensagem, total de $0.095.
- Grok 4.3 (xAI): primeira mensagem a frio $0.0520, mensagem quente na mesma thread $0.0337 (uma descida de 35%), média de $0.0332 por mensagem, total de $0.266.
Uma passagem por cada um, assistentes idênticos, observações no Playground às tarifas de julho de 2026. A definição Auto selecionou Gemini Flash 3 durante toda a nossa janela de teste, pelo que a sua lógica económica coincidiu com essa linha.
O que os números nos ensinaram:
- Todos os modelos acertaram em todas as respostas nesta execução. Oito em oito, os três, incluindo excluir corretamente um anúncio pendente e executar uma transferência real para um humano. Na nossa única passagem, a qualidade não foi o fator diferenciador; a economia foi.
- A diferença total foi de 3,7x no nosso teste entre a execução mais barata e a mais cara da mesma conversa. O múltiplo exato variará; a razão não: comportamento da cache e tarifas por token a interagir com o peso do contexto, nada disso visível numa página de preços.
- Uma nota sobre a definição Auto. O Auto escolhe um modelo para cada mensagem em vez de o fixar a um só; durante a nossa janela de teste selecionou consistentemente Gemini Flash 3, por isso não o avaliámos como um quarto concorrente. O seu caso de uso corresponde precisamente à lógica económica de toda esta secção: pagar tarifas premium apenas nas mensagens que exigem raciocínio premium e deixar as perguntas rotineiras seguir na camada mais eficiente.
- As ações são os melhores tokens que vai comprar. No nosso teste, a mensagem de marcação custou cerca de 2,4x o custo de uma simples mensagem de perguntas e respostas e, em troca, o assistente verificou um calendário real e apresentou horários disponíveis ao sábado em direto. Uma mensagem com ação substitui todo um ciclo de telefonemas falhados.
- A transferência funcionou como um colega, não como um ticket. Na mensagem de escalada, os assistentes transferiram para um humano com um resumo escrito da situação, incluindo contexto de mensagens anteriores da conversa, e depois retiraram-se. O humano retoma já informado, na mesma thread.
E um caso de alerta que ainda bem que apanhámos nos testes. Numa das execuções, um assistente afirmou algo falso no início da conversa. Todas as respostas posteriores nessa thread permaneceram consistentes com o próprio erro, mesmo quando a informação correta podia ser recuperada, e a mesma pergunta feita numa conversa nova foi respondida na perfeição. A thread contaminada também custou cerca de 2,5x a thread limpa. Daqui saem duas regras: quando um assistente disser algo errado, não discuta com ele nessa thread; corrija a fonte e depois reinicie a conversa ou transfira para um humano. E acrescente uma linha clarificadora às suas instruções para que a ambiguidade nunca se acumule, por exemplo: "O conteúdo da base de conhecimento é informação pública; quando um cliente perguntar o que está disponível, liste os itens correspondentes."
Mais um pequeno detalhe que vale a pena partilhar: o nosso calendário de teste oferecia uma vaga ao domingo, enquanto a política escrita dizia que as visitas decorriam de segunda-feira a sábado. O assistente acreditou no calendário. O que a sua ferramenta de marcação indicar é o que o seu assistente vai oferecer, por isso mantenha os calendários e as políticas escritas em conformidade.
5. Princípios de engenharia de contexto
Modelos mais baratos ajudam. Mas a engenharia de contexto, isto é, moldar deliberadamente o que entra na janela de contexto, traz os maiores ganhos. Os tokens de input dominam os custos, e o input está nas suas mãos.
Pilar 1: Instruções enxutas, enviadas em todas as chamadas, para sempre
O seu bloco de instruções acompanha todas as mensagens, sem exceção, por isso cada palavra nele é um custo recorrente. Escrever de forma enxuta é uma competência:
- Diga cada regra uma vez. A repetição não faz o modelo obedecer mais; faz cada mensagem custar mais. "Seja sempre caloroso, seja sempre educado, nunca seja rude, mantenha um tom amigável" cabe numa palavra: caloroso.
- Comportamento nas instruções, factos no conhecimento. Preços, horários, políticas e catálogos pertencem à base de conhecimento, sendo recuperados apenas quando uma pergunta o exige. As instruções levam apenas a forma de agir.
- Pontos declarativos curtos ganham a parágrafos. "Mencione a política de cancelamento de 24 horas ao fazer uma marcação" não precisa de qualquer explicação sobre a importância dessa política.
- Corte o enchimento de personalidade e os padrões do modelo. Os modelos já são educados e já respondem a perguntas; declare apenas os desvios que realmente pretende.
- Estrutura sem inchaço. Um esqueleto de Função / Persona / Restrições / Diretrizes / Fluxo de comunicação custa apenas alguns tokens em cabeçalhos e compensa-os sempre que precisar de editar um comportamento sem andar à procura em texto corrido.
- Prefira regras de acionamento planas a árvores de cenários. Uma linha por sinal ("urgência mencionada: oferecer os horários mais próximos e sinalizar um agente") generaliza para formulações que nunca previu; ramificações de cenários com letras crescem de forma combinatória e continuam a falhar inputs reais. Nos nossos testes, um bloco de instruções de 200 palavras com cinco sinais de uma linha executou corretamente nos três modelos.
- O teste dos 30%. Corte um terço, volte a executar as suas perguntas de avaliação padrão e continue a cortar até a qualidade cair; depois recue uma versão. Ser enxuto é empírico, não estético.
Objetivo: menos de 500 tokens para assistentes simples; menos de 1.500 para os complexos.
Pilar 2: Recuperação inteligente de conhecimento (RAG)
Despejar FAQs completas em todas as chamadas é a abordagem ingénua. A recuperação envia apenas as secções relevantes para cada pergunta específica e, no Invent, pesquisas idênticas ficam em cache gratuitamente durante duas horas em toda a sua organização, por isso as suas perguntas mais comuns tornam-se mais baratas por si só.
Duas práticas retiradas dos nossos testes: dividir os documentos de acordo com o que muda (um documento de anúncios atualizado semanalmente ao lado de um documento de políticas estável significa que as atualizações tocam num único ficheiro pequeno), e verificar com uma pergunta de controlo antes de entrar em produção. Depois de cada carregamento de conhecimento, faça ao assistente uma pergunta cuja resposta esteja no novo documento. Trinta segundos de verificação protegem-no de um assistente que responde com confiança usando apenas metade do cérebro.
Pilar 3: Gestão do histórico da conversa
- Janela deslizante: apenas as últimas 8 a 10 mensagens
- Resumo: comprimir o histórico antigo em factos-chave
- Memória seletiva: manter apenas o contexto relevante
- Reinício da sessão: novo começo após a resolução e, sempre, depois de uma afirmação errada
Pilar 4: Colocar cada elemento no seu devido lugar
A questão de arquitetura por detrás da maioria dos prompts excessivamente longos: o comportamento vai em Instructions, os factos vão em Knowledge, as ações vão em Actions, os dados pessoais vão em Contact properties.
- Instructions acompanha todas as mensagens: é a camada mais pequena e serve apenas para o comportamento.
- Knowledge é recuperado quando necessário: é aqui que vivem os factos, e uma alteração de preço significa trocar um documento, não editar o cérebro do assistente.
- Actions só têm custo quando são invocadas, e têm de estar ligadas, não descritas. Texto como "pode marcar consultas" leva o modelo a falar sobre marcações; uma ação de calendário conectada leva-o a marcar. O mesmo aplica-se ao escalonamento: nomeie a capacidade de forma imperativa nas suas instruções ("transfira a conversa para a equipa") em vez de descrever o resultado, para que o modelo associe as suas palavras à ferramenta real.
- Contact properties guarda quem é o cliente: nome, segmento, preferências, atualizados pela AI ou pela sua equipa à medida que as conversas acontecem.
Tudo no seu lugar, e cada mensagem funciona de forma enxuta: factos enfiados nas instruções são cobrados em cada "a que horas fecham?", enquanto os mesmos factos em knowledge só são cobrados quando alguém realmente pergunta.

Comportamento, factos, ações e pessoas: os quatro lugares do conteúdo do assistente e o que cada um cobra.
6. A sua lista de ações
- Audite o seu bloco de instruções e corte-lhe um terço. Teste a qualidade. Normalmente vai ficar surpreendido.
- Mova todos os factos para fora das instruções e para knowledge. Recupere, não injete.
- Ligue actions para as coisas que o seu assistente deve fazer, e nomeie-as explicitamente nas instruções.
- Depois de cada carregamento de knowledge, faça uma pergunta de controlo antes de entrar em produção.
- Mantenha a conversa de cada cliente numa única thread; espere que a primeira mensagem após uma pausa longa custe como uma primeira mensagem.
- Se o assistente afirmar algo falso: corrija a fonte, depois reinicie a conversa ou faça handoff. Não discuta com ele dentro da thread.
- Mantenha os seus calendários de marcação e as políticas escritas em concordância; o assistente acredita no calendário.
- Encaminhe perguntas totalmente estáticas (horário, morada) para botões em destaque com respostas pré-definidas: custo quase nulo, sem qualquer chamada ao modelo.
- Ajuste o modelo à tarefa ou deixe o Auto escolher por mensagem. Limite o histórico, desative funcionalidades em segundo plano nas quais não age e condicione o processamento de media.
- Verifique semanalmente o seu painel de utilização por tipo de evento; para os preços atuais, a calculadora em tempo real tem sempre os valores de hoje.

Os seis hábitos que os nossos testes continuaram a confirmar, num só cartão.
Perguntas frequentes
O que são tokens de AI e como funcionam?
Um token é a unidade que os modelos de AI usam para ler e escrever texto, aproximadamente três quartos de uma palavra em inglês: 100 palavras correspondem a cerca de 130 tokens, 1.000 tokens são aproximadamente uma página e meia, e 10.000 tokens rondam as 15 páginas. A utilização de AI é cobrada por token, tanto pelo que o modelo lê (a sua mensagem mais todo o respetivo contexto) como pelo que escreve de volta. É por isso que uma pergunta curta pode ainda assim ter um custo real: do lado da leitura entram as instruções, o conhecimento e o histórico da conversa, não apenas as palavras que o cliente escreveu.
Como são calculados os custos dos tokens de AI?
Por token, em três categorias: tokens de entrada (tudo o que o modelo lê: a sua mensagem, instruções, conhecimento, histórico), tokens de saída (o que escreve de volta) e tokens em cache (contexto repetido relido a uma tarifa com desconto). Cada categoria tem o seu próprio preço por milhão de tokens, que varia consoante o modelo e o fornecedor, e o custo da sua mensagem é a soma das três. Na prática, a entrada domina na maioria dos assistentes empresariais, e é por isso que reduzir o contexto poupa mais do que encurtar as respostas.
Como posso reduzir o uso de tokens no meu chatbot de AI sem prejudicar a qualidade das respostas?
Ajustar o modelo de AI certo a cada tarefa traz os maiores ganhos. Os modelos premium destacam-se em raciocínio complexo, análise em várias etapas ou conversas sensíveis, mas os modelos mais rápidos e baratos lidam igualmente bem com perguntas e respostas simples. Nos nossos testes de julho, todos os modelos que experimentámos responderam corretamente a uma pergunta de knowledge bem fundamentada; os custos diferiram muito mais do que a qualidade.
O que é context engineering para chatbots de AI e porque é importante?
Context engineering significa controlar intencionalmente o que entra na janela de contexto da AI em cada mensagem: system prompt + base de conhecimento + histórico da conversa. Estes elementos determinam a grande maioria dos custos de tokens de entrada, que controla totalmente. Encurtar prompts, recuperar conhecimento em vez de o injetar e limitar o histórico são escolhas de design que qualquer pessoa pode implementar hoje.
O que é prompt caching e como funciona?
Prompt caching armazena a parte repetida do seu contexto (instruções, conhecimento, histórico) para que as mensagens consecutivas numa conversa a releiam por uma fração do preço de entrada, em vez de voltarem a pagar por ela. Poupa dinheiro? No nosso teste, as mensagens subsequentes dentro da mesma thread ficaram entre 35% e 64% mais baratas do que as mensagens frias, por isso sim, e não precisa de configurar nada no Invent: está ativado automaticamente em todos os modelos compatíveis. Duas coisas a saber: a cache funciona dentro de uma conversa ativa e desvanece-se após pausas longas, e o preço dos tokens em cache difere significativamente entre modelos, razão pela qual dois modelos com preços semelhantes podem gerar faturas reais diferentes.
Porque é que o meu custo por mensagem é diferente da estimativa do seletor de modelos?
O seletor mostra uma estimativa típica por mensagem; a sua mensagem real traz o seu contexto específico: comprimento das instruções, conhecimento recuperado, histórico da conversa, estado da cache e quaisquer actions acionadas. Nos nossos testes, a estimativa ficou a poucos pontos percentuais da realidade numa pergunta típica com cache, e desviou-se mais quando a cache estava fria ou a conversa era longa. A estimativa é o mapa; o seu contexto é o território.
Devo desativar a pontuação CSAT e as funcionalidades de memória para poupar custos de AI?
Desative apenas os processos de AI em segundo plano que não está a utilizar ativamente.
Qual é a forma mais rápida de reduzir já os custos de tokens do meu chatbot de AI?
Audite e reduza o seu bloco de instruções. Este texto único é enviado em todas as chamadas de AI, para sempre, em todas as conversas. Corte instruções verbosas, elimine duplicações, use bullets em vez de parágrafos, teste a versão mais curta. Verá a diferença em poucas horas, muitas vezes com uma clareza melhor.
Os custos dos chatbots de AI vão ficar mais baratos automaticamente à medida que os modelos melhoram?
Sim, e compreender a mecânica dos tokens dá-lhe uma vantagem duradoura. Os modelos tornam-se mais eficientes, as plataformas adicionam otimizações automáticas como prompt caching e os preços descem de forma constante. Quem cria e domina context engineering e a seleção de modelos ficará sempre à frente de quem depende apenas das melhorias dos fornecedores.
O novo modelo mental
As estimativas dão direção com base em médias, e isso é genuinamente útil. As conversas reais são mais longas, mais ricas, com funcionalidades em segundo plano ativas e com uma cache que recompensa a continuidade. Quando entende os fatores que pesam, tamanho do contexto, caching, preços dos modelos, processos em segundo plano, passa a ter alavancas reais para mexer, e pode medir em apenas uma hora até onde elas se movem no seu próprio assistente, como nós fizemos: mesma conversa, mesmas instruções, modelos diferentes, e observar a fatura. Na nossa tarde, a diferença foi de 3,7x antes de qualquer otimização. A sua tarde vai mostrar-lhe onde está a sua.
As agências e os criadores que dominam isto operam uma AI conversacional mais eficiente, explicam os custos com confiança aos clientes e escalam de forma previsível.
Comece a criar de forma mais inteligente, experimente o Invent gratuitamente hoje.








