Central de Ajuda Quanto cada conversa gasta de IA

Quanto cada conversa gasta de IA

Nível: Intermediário Tempo de leitura: 5 min


Por que isso existe

Você usa a sua própria chave de IA, então o provedor cobra você direto pelo que os agentes consomem. A fatura chega no fim do mês com um número só, sem dizer qual conversa, qual agente ou qual modelo puxou o gasto.

O contador de consumo resolve isso. Ele mostra quantos tokens cada resposta do agente gastou, quanto a conversa inteira custou e quanto a organização consumiu no mês, separado por modelo.

Serve para três decisões práticas: descobrir se vale trocar de modelo, entender se o prompt está grande demais e saber quais agentes concentram o gasto.


O que é um token

Token é o pedaço de texto que os modelos de IA contam para cobrar. Uma palavra comum em português costuma valer entre um e três tokens. Tudo que entra e sai da IA é medido assim.

O consumo aparece dividido em quatro partes:

Parte O que é
Entrada Tudo que o agente leu para responder: prompt do agente, histórico da conversa, trechos da base de conhecimento e a mensagem do cliente.
Saída O texto que o agente escreveu. Custa bem mais caro por token que a entrada, em todos os provedores.
Lido do cache Parte da entrada que o provedor já tinha guardado de uma chamada anterior. Custa uma fração do preço normal.
Gravado no cache Parte da entrada que o provedor guardou para reaproveitar depois.

Uma resposta quase sempre custa mais de uma chamada de IA. Buscar na base de conhecimento é uma chamada, cada ferramenta que o agente usa gera outra, e a resposta final é mais uma. O contador soma todas elas.


Por que a primeira resposta custa mais que as seguintes

A Wevichat guarda em cache a parte da conversa que não muda: o prompt do agente e o histórico já trocado. Na primeira resposta esse conteúdo é gravado no cache, o que custa um pouco mais caro que o normal. Da segunda em diante ele é lido de volta por cerca de um décimo do preço.

Por isso o contador de uma conversa costuma ter esta cara: a primeira resposta aparece com bastante token em "gravado no cache" e as seguintes trocam isso por "lido do cache", com a entrada cheia caindo quase a zero. Numa conversa de seis mensagens a economia passa da metade.

O cache dura uma hora. Conversa que fica parada mais que isso recomeça do zero na próxima mensagem, o que é normal e não exige nenhuma configuração sua. Agentes com prompt muito curto não usam cache, porque os provedores exigem um tamanho mínimo, e nesse caso as duas linhas ficam zeradas.


Onde ver

Em cada resposta do agente

No Inbox, abaixo de cada resposta do agente aparece uma linha discreta com a entrada e a saída daquela resposta. Clique nela para abrir o detalhe: entrada, cache, saída, quantas chamadas de IA foram feitas e qual modelo respondeu.

No total da conversa

Abra o painel lateral da conversa, no ícone de dados do usuário. No fim do painel tem o bloco Consumo de IA com o total da conversa inteira, incluindo o que rodou nos bastidores: busca na base de conhecimento, análise de sentimento, agente observador e copiloto do atendente.

No mês da organização

Vá em Configurações → Uso. O card Consumo de IA este mês mostra o total gasto e a quebra por modelo, com tokens de entrada, de saída e o custo de cada um.


Quem vê o quê

O consumo é informação sensível, então segue os papéis e permissões da organização:

Papel Tokens Custo em dinheiro
Administrador
Financeiro
Editor Não vê
Atendente Não vê Não vê

O atendente não vê nenhum contador. O editor vê a contagem de tokens para ajustar prompt e base de conhecimento, mas o valor em dinheiro fica com quem cuida do financeiro.


Sobre o valor mostrado

O custo aparece em dólar, porque é a moeda em que Anthropic, OpenAI e Google cobram.

O cálculo usa o preço público de cada modelo no momento da chamada, então ele fica congelado: se o provedor reajustar o preço amanhã, o custo das conversas antigas continua sendo o que foi cobrado de fato.

Trate o número como uma estimativa muito próxima, não como a fatura. Se o seu contrato com o provedor tem desconto por volume ou crédito pré-pago, o valor real que você paga é menor. A fatura oficial é sempre a do painel do provedor.

Quando aparece o sinal antes do valor, é porque alguma chamada usou um modelo que ainda não tem preço cadastrado na Wevi. Nesse caso os tokens estão certos e o custo real é um pouco maior que o mostrado.


Como usar isso para gastar menos

Olhe a entrada antes da saída. Na maioria das conversas a entrada é dez a vinte vezes maior que a saída, porque o agente relê o prompt e o histórico inteiro a cada mensagem. Um prompt de sistema enxuto economiza em toda mensagem trocada, para sempre.

Veja quantas chamadas cada resposta usou. Se uma resposta simples gastou cinco chamadas, o agente provavelmente está indo e voltando em ferramentas sem necessidade. Revise as ações ativadas e as instruções sobre quando usar cada uma.

Compare modelos com dados, não com achismo. Rode o mesmo tipo de conversa em dois modelos e compare o custo por conversa junto com a qualidade da resposta. Muitas operações de atendimento rodam bem em modelo intermediário e economizam bastante. Veja quais modelos estão disponíveis.

Cuide do tamanho dos trechos da base. Cada trecho recuperado entra na entrada da chamada. Reduzir a quantidade de chunks no contexto, em parâmetros de IA, derruba o custo por mensagem. Só cuidado para não cortar contexto que o agente precisa.

Corte o que roda em segundo plano e você não usa. Análise de sentimento, agente observador e copiloto também consomem a sua chave. Se não estiver usando, desligue.


E depois?