Central de Ajuda Quais modelos de IA estão disponíveis e quando usar cada um

Quais modelos de IA estão disponíveis e quando usar cada um

Nível: Intermediário
Tempo de leitura: 8 min


Visão geral

A Wevi suporta os principais modelos de linguagem do mercado: família Claude (Anthropic), família GPT e O-series (OpenAI), família Gemini (Google) e, via OpenRouter, modelos como DeepSeek, Kimi, GLM, Qwen, Llama, Mistral e Grok. Cada modelo tem características diferentes em termos de inteligência, velocidade e custo.

A escolha do modelo afeta diretamente a qualidade das respostas, a velocidade de resposta e o custo por conversa. Não existe "o melhor modelo": existe o modelo certo para cada caso de uso.


Modelos disponíveis

Família Claude (Anthropic)

Modelo Inteligência Velocidade Custo Melhor para
Claude Opus 4.8 Muito alta Média Alto Tarefas complexas, raciocínio avançado
Claude Sonnet 5 Alta Rápida Médio Uso geral, excelente custo-benefício
Claude Haiku 4.5 Boa Muito rápida Baixo Alto volume, respostas simples
Claude Opus 4.6 Muito alta Média Alto Versão anterior do Opus, ainda disponível
Claude Sonnet 4.6 Alta Rápida Médio Versão anterior do Sonnet, ainda disponível

Claude Sonnet 5 é o modelo mais equilibrado da família e a escolha padrão na Wevi para a maioria dos casos. Oferece qualidade muito próxima ao Opus com velocidade e custo significativamente menores.

Claude Opus 4.8 brilha em situações que exigem raciocínio em múltiplas etapas, análise de documentos longos, ou respostas com alta complexidade analítica. Use quando a qualidade é crítica e o custo é secundário.

Claude Haiku 4.5 é ideal para triagem inicial de mensagens, perguntas simples de FAQ, ou qualquer cenário onde velocidade é mais importante que profundidade.

As versões anteriores Claude Opus 4.6 e Claude Sonnet 4.6 continuam disponíveis no seletor. Elas seguem funcionando bem, mas para novos agentes recomendamos as versões mais recentes.


Família GPT (OpenAI)

Modelo Inteligência Velocidade Custo Melhor para
GPT-5.6 Sol Muito alta Rápida Alto O mais capaz da OpenAI, trabalho profissional complexo
GPT-5.6 Terra Muito alta Rápida Médio Equilíbrio entre qualidade e custo
GPT-5.6 Luna Alta Muito rápida Muito baixo Alto volume, triagem e respostas simples
GPT-5.5 Muito alta Rápida Alto Geração anterior, mantido para agentes já configurados
GPT-5.4 Muito alta Média Alto Raciocínio avançado, multimodal
GPT-5.4 Mini Alta Rápida Médio Uso geral, boa relação qualidade/custo
GPT-5.4 Nano Boa Muito rápida Baixo Alto volume, respostas simples

GPT-5.6 Sol é o modelo mais capaz da OpenAI hoje, para os casos mais exigentes de raciocínio e produção de conteúdo complexo. Janela de contexto de 1 milhão de tokens.

GPT-5.6 Terra entrega qualidade próxima ao Sol por menos da metade do preço de entrada. É o ponto de partida recomendado para atendimento no ecossistema OpenAI.

GPT-5.6 Luna é o mais econômico da família, feito para volume alto. Custa uma fração do Terra e serve bem para triagem e perguntas simples.

GPT-5.5 continua disponível para quem já configurou agentes nele, mas o 5.6 Sol entrega mais pelo mesmo custo.

GPT-5.4 também é muito capaz e mais acessível que o 5.5. Excelente para casos que envolvem análise de imagens junto com texto (multimodal) ou raciocínio em cadeia complexo.

GPT-5.4 Mini entrega qualidade próxima ao GPT-5.4 com custo e latência muito menores. É uma boa alternativa ao Claude Sonnet para quem prefere o ecossistema OpenAI.

GPT-5.4 Nano é o modelo mais econômico da família GPT. Indicado para cenários de triagem e perguntas simples onde velocidade e custo são prioritários.


Família Gemini (Google)

Modelo Inteligência Velocidade Custo Melhor para
Gemini 3.5 Flash Muito alta Muito rápida Baixo Fluxos agênticos, ciclos de código, alto volume com qualidade
Gemini 3.1 Flash-Lite Boa Muito rápida Muito baixo Tradução, extração e triagem em grande escala
Gemini 2.5 Pro Muito alta Média Alto Janela de contexto longa, multimodal

Gemini 3.5 Flash entrega inteligência de ponta com velocidade alta e custo baixo. Foi pensado para a era agêntica: vai bem em fluxos de várias etapas, uso de sub-agentes e ciclos rápidos de código.

Gemini 3.1 Flash-Lite é a opção de menor custo e menor latência da família. Indicado para tarefas leves em grande volume, como tradução, transcrição, extração de dados e triagem.

Gemini 2.5 Pro se destaca pela janela de contexto extensa, útil quando o agente precisa processar documentos muito longos em uma única chamada.


Modelos via OpenRouter

A OpenRouter é um serviço que dá acesso a dezenas de modelos de vários laboratórios com uma única conta e uma única chave. Na Wevi, ela funciona como um quarto provedor: configure a sua chave da OpenRouter em Minha conta → Integrações de IA e os modelos abaixo aparecem no seletor de todos os agentes.

O catálogo é curado: só entram modelos que funcionam bem com as ferramentas dos agentes (agendamento, transbordo, webhooks, base de conhecimento).

Modelo Origem Inteligência Custo Lê imagens Melhor para
DeepSeek V4 Pro DeepSeek Muito alta Médio Não Uso geral com ótimo custo-benefício
DeepSeek V4 Flash DeepSeek Alta Muito baixo Não Alto volume, triagem
Kimi K2.6 Moonshot AI Alta Médio Sim Uso geral, bom com ferramentas
GLM 5.3 Z.ai Muito alta Médio Não Uso geral, fluxos com ferramentas
GLM 5.3 Flash Z.ai Alta Muito baixo Sim Alto volume, triagem
Qwen3.8 Max Qwen Muito alta Médio Sim Uso geral, bom em português
Muse Spark 1.2 Meta Muito alta Médio Sim Uso geral, geração atual da Meta
Llama 4 Maverick Meta Alta Baixo Sim Volume alto com qualidade
Mistral Medium 3.5 Mistral Alta Médio Sim Uso geral, respostas rápidas
Grok 4.6 xAI Muito alta Médio Sim Raciocínio, conversas longas

Os modelos marcados com "Não" aparecem com a tag Só texto no seletor. Se um cliente enviar uma foto para um agente nesses modelos, o agente avisa que não consegue ver a imagem e a conversa continua normalmente. Para agentes que recebem fotos com frequência (comprovantes, produtos, documentos), escolha um modelo que lê imagens. Os modelos da Anthropic, OpenAI e Google interpretam imagem em todas as variantes do catálogo.

O Muse Spark 1.2 exige uma confirmação de maioridade feita uma única vez na conta da OpenRouter. O passo a passo está em como confirmar a maioridade na OpenRouter.

Dois pontos importantes antes de escolher um modelo da OpenRouter:

  • A base de conhecimento continua exigindo uma chave OpenAI. A busca nos documentos gera os vetores pela OpenAI, independente do modelo que responde. Se o agente usa base de conhecimento, configure as duas chaves.
  • O trial não inclui a OpenRouter. Durante o período de teste, a Wevi libera as chaves da Anthropic, OpenAI e Google. Para usar os modelos da OpenRouter, configure a sua própria chave desde o início.

Para os três provedores nativos (Anthropic, OpenAI e Google), a chave direta no provedor costuma sair mais barato do que o mesmo modelo via OpenRouter, que cobra uma taxa na recarga de créditos. Use a OpenRouter para acessar os modelos que a Wevi não oferece de forma nativa.


Como escolher o modelo certo

Por tipo de tarefa

Atendimento ao cliente geral (FAQ, agendamentos, dúvidas) Recomendação: Claude Sonnet 5 ou GPT-5.4 Mini Por quê: bom equilíbrio entre qualidade e custo. Velocidade de resposta adequada para conversas em tempo real.

Qualificação de leads e vendas consultivas Recomendação: Claude Sonnet 5 ou GPT-5.4 Por quê: exige compreensão de nuances, persuasão bem calibrada e capacidade de adaptar argumentos.

Análise de documentos longos ou complexos Recomendação: Claude Opus 4.8 ou Gemini 2.5 Pro Por quê: janela de contexto extensa e raciocínio profundo para extrair insights de materiais densos.

Alto volume com perguntas simples Recomendação: Claude Haiku 4.5 ou Gemini 3.1 Flash-Lite Por quê: resposta ultra-rápida e custo baixo para cenários onde a maioria das perguntas é previsível.

Triagem inicial antes de escalar para agente especialista Recomendação: Claude Haiku 4.5 ou Gemini 3.1 Flash-Lite Por quê: o agente orquestrador só precisa classificar a intenção, não responder com profundidade.


Fluxos com várias ações e eventos no mesmo turno

Quando o agente precisa, ao final do fluxo, emitir múltiplos eventos de conversão, executar webhooks (ações) e ainda gerar uma resposta longa (HTML rico, lista grande, JSON estruturado) tudo no mesmo turno, a robustez do modelo importa tanto quanto a velocidade.

Modelos pequenos como Claude Haiku, GPT-5.4 Nano e Gemini 3.1 Flash-Lite às vezes esquecem de emitir um evento, pulam a chamada de webhook ou cortam a resposta no meio. Em prompts longos (acima de 10 mil tokens) o efeito fica mais visível: a atenção do modelo se dilui e instruções sobre o que executar ficam para trás.

Recomendação:

  • Use Sonnet 5, GPT-5.4 Mini ou Gemini 2.5 Pro para agentes com 3 ou mais eventos de conversão configurados
  • Use um desses três quando o final do fluxo precisa coordenar evento + webhook + HTML em uma única resposta
  • Considere Opus 4.8 ou GPT-5.4 se o prompt do sistema passa de 15 mil tokens

Sintomas de modelo subdimensionado para o fluxo:

  • Eventos de conversão configurados que não disparam, mesmo com a descrição correta
  • Action de webhook documentada no prompt mas que não chega ao endpoint
  • Resposta longa cortada no meio (geralmente quando o agente está renderizando HTML grande)
  • O agente diz que vai executar uma ação e termina o turno sem executar

Quando notar esses sintomas, a primeira tentativa de correção é trocar o modelo do agente por um da mesma família mas mais robusto (Haiku para Sonnet, Nano para Mini, Flash para Pro). Faça isso antes de reescrever o prompt: muitas vezes não é o prompt que está errado, é o modelo que não dá conta da complexidade.

Veja também: Como rastrear eventos de conversão e Como configurar o prompt do agente.


Por volume esperado

Volume mensal de mensagens Recomendação
Até 1.000 Qualquer modelo (o custo não é relevante)
1.000 a 10.000 Claude Sonnet ou GPT-5.4 Mini
10.000 a 100.000 Claude Haiku, GPT-5.4 Nano ou Gemini 3.1 Flash-Lite para triagem; Sonnet para resolução
Acima de 100.000 Arquitetura multi-agentes com modelos mistos

Usando sua própria chave de IA

Em todos os planos, você pode usar sua própria chave de IA de qualquer provedor suportado. Isso permite:

  • Usar contratos corporativos que você já tem com OpenAI ou Anthropic
  • Ter controle total do custo por token
  • Aplicar limites e monitoramento diretamente no provedor

Veja mais em: Como usar sua própria chave de IA →


Mudando o modelo de um agente existente

Você pode trocar o modelo de qualquer agente a qualquer momento:

  1. Acesse o agente
  2. Abra a aba Inteligência
  3. Selecione o novo modelo na seção Modelo de IA
  4. Clique em "Salvar"

A mudança é imediata. Conversas em andamento continuam com o modelo anterior; novas conversas usam o novo.

Dica: ao trocar de modelo, faça alguns testes com perguntas reais antes de liberar para clientes. Cada modelo tem nuances diferentes de tom e comportamento que podem exigir ajustes no prompt.


Próximos passos