Quanto cada conversa gasta de IA
Nível: Intermediário Tempo de leitura: 5 min
Por que isso existe
Você usa a sua própria chave de IA, então o provedor cobra você direto pelo que os agentes consomem. A fatura chega no fim do mês com um número só, sem dizer qual conversa, qual agente ou qual modelo puxou o gasto.
O contador de consumo resolve isso. Ele mostra quantos tokens cada resposta do agente gastou, quanto a conversa inteira custou e quanto a organização consumiu no mês, separado por modelo.
Serve para três decisões práticas: descobrir se vale trocar de modelo, entender se o prompt está grande demais e saber quais agentes concentram o gasto.
O que é um token
Token é o pedaço de texto que os modelos de IA contam para cobrar. Uma palavra comum em português costuma valer entre um e três tokens. Tudo que entra e sai da IA é medido assim.
O consumo aparece dividido em quatro partes:
| Parte | O que é |
|---|---|
| Entrada | Tudo que o agente leu para responder: prompt do agente, histórico da conversa, trechos da base de conhecimento e a mensagem do cliente. |
| Saída | O texto que o agente escreveu. Custa bem mais caro por token que a entrada, em todos os provedores. |
| Lido do cache | Parte da entrada que o provedor já tinha guardado de uma chamada anterior. Custa uma fração do preço normal. |
| Gravado no cache | Parte da entrada que o provedor guardou para reaproveitar depois. |
Uma resposta quase sempre custa mais de uma chamada de IA. Buscar na base de conhecimento é uma chamada, cada ferramenta que o agente usa gera outra, e a resposta final é mais uma. O contador soma todas elas.
Por que a primeira resposta custa mais que as seguintes
A Wevichat guarda em cache a parte da conversa que não muda: o prompt do agente e o histórico já trocado. Na primeira resposta esse conteúdo é gravado no cache, o que custa um pouco mais caro que o normal. Da segunda em diante ele é lido de volta por cerca de um décimo do preço.
Por isso o contador de uma conversa costuma ter esta cara: a primeira resposta aparece com bastante token em "gravado no cache" e as seguintes trocam isso por "lido do cache", com a entrada cheia caindo quase a zero. Numa conversa de seis mensagens a economia passa da metade.
O cache dura uma hora. Conversa que fica parada mais que isso recomeça do zero na próxima mensagem, o que é normal e não exige nenhuma configuração sua. Agentes com prompt muito curto não usam cache, porque os provedores exigem um tamanho mínimo, e nesse caso as duas linhas ficam zeradas.
Onde ver
Em cada resposta do agente
No Inbox, abaixo de cada resposta do agente aparece uma linha discreta com a entrada e a saída daquela resposta. Clique nela para abrir o detalhe: entrada, cache, saída, quantas chamadas de IA foram feitas e qual modelo respondeu.
No total da conversa
Abra o painel lateral da conversa, no ícone de dados do usuário. No fim do painel tem o bloco Consumo de IA com o total da conversa inteira, incluindo o que rodou nos bastidores: busca na base de conhecimento, análise de sentimento, agente observador e copiloto do atendente.
No mês da organização
Vá em Configurações → Uso. O card Consumo de IA este mês mostra o total gasto e a quebra por modelo, com tokens de entrada, de saída e o custo de cada um.
Quem vê o quê
O consumo é informação sensível, então segue os papéis e permissões da organização:
| Papel | Tokens | Custo em dinheiro |
|---|---|---|
| Administrador | Vê | Vê |
| Financeiro | Vê | Vê |
| Editor | Vê | Não vê |
| Atendente | Não vê | Não vê |
O atendente não vê nenhum contador. O editor vê a contagem de tokens para ajustar prompt e base de conhecimento, mas o valor em dinheiro fica com quem cuida do financeiro.
Sobre o valor mostrado
O custo aparece em dólar, porque é a moeda em que Anthropic, OpenAI e Google cobram.
O cálculo usa o preço público de cada modelo no momento da chamada, então ele fica congelado: se o provedor reajustar o preço amanhã, o custo das conversas antigas continua sendo o que foi cobrado de fato.
Trate o número como uma estimativa muito próxima, não como a fatura. Se o seu contrato com o provedor tem desconto por volume ou crédito pré-pago, o valor real que você paga é menor. A fatura oficial é sempre a do painel do provedor.
Quando aparece o sinal ≥ antes do valor, é porque alguma chamada usou um modelo que ainda não tem preço cadastrado na Wevi. Nesse caso os tokens estão certos e o custo real é um pouco maior que o mostrado.
Como usar isso para gastar menos
Olhe a entrada antes da saída. Na maioria das conversas a entrada é dez a vinte vezes maior que a saída, porque o agente relê o prompt e o histórico inteiro a cada mensagem. Um prompt de sistema enxuto economiza em toda mensagem trocada, para sempre.
Veja quantas chamadas cada resposta usou. Se uma resposta simples gastou cinco chamadas, o agente provavelmente está indo e voltando em ferramentas sem necessidade. Revise as ações ativadas e as instruções sobre quando usar cada uma.
Compare modelos com dados, não com achismo. Rode o mesmo tipo de conversa em dois modelos e compare o custo por conversa junto com a qualidade da resposta. Muitas operações de atendimento rodam bem em modelo intermediário e economizam bastante. Veja quais modelos estão disponíveis.
Cuide do tamanho dos trechos da base. Cada trecho recuperado entra na entrada da chamada. Reduzir a quantidade de chunks no contexto, em parâmetros de IA, derruba o custo por mensagem. Só cuidado para não cortar contexto que o agente precisa.
Corte o que roda em segundo plano e você não usa. Análise de sentimento, agente observador e copiloto também consomem a sua chave. Se não estiver usando, desligue.