Benchmark de Modelos de IA

Cenários reais de atendimento ao cliente em e-commerce, avaliação cega por múltiplos juízes de IA

Este benchmark compara ChatGPT, Claude, Gemini e Grok em perguntas reais de atendimento ao cliente em e-commerce. Foi desenvolvido para equipes que buscam o melhor modelo de IA para chat de suporte, automação de help desk e fluxos de assistente de vendas com IA.

Líder atual: Grok 4.1 Fast com pontuação média de 65,2 em 45 perguntas compartilhadas e 540 avaliações cegas.

45 perguntas avaliadas 540 avaliações realizadas Última atualização: Ago 30, 2026

Classificação geral entre todos os snapshots

Média ponderada entre 4 snapshots. Modelos com mais avaliações pesam mais.

Classificação por média ponderada entre snapshots; a coluna "rodadas" mostra de quantos snapshots cada modelo participou.
# Modelo Provedor Pontuação Geral Rodadas Avaliações totais
4 Claude Sonnet 5 Anthropic
63,6
1/4 45
10 ChatGPT 4.1 mini OpenAI
62,5
4/4 263
13 ChatGPT 4.1 OpenAI
60,4
4/4 263
14 Grok 4.1 Fast xAI
60,3
2/4 157
17 Claude Haiku 4.5 Anthropic
59,3
4/4 263
18 Gemini 3.1 Pro Preview Google
57,9
3/4 137
19 Gemini 3.5 Flash-Lite Google
56,8
1/4 45

Última rodada — Ago 30, 2026

Ranking de modelos de IA classificados por pontuação de avaliação cega em perguntas compartilhadas de atendimento ao cliente em e-commerce.
# Modelo Provedor Pontuação Geral Resposta Média
4 Grok 4.1 Fast xAI
65,2
2.2s
5 Claude Haiku 4.5 Anthropic
65,1
4.0s
6 ChatGPT 4.1 mini OpenAI
63,9
2.9s
7 Claude Sonnet 5 Anthropic
63,6
7.8s
11 ChatGPT 4.1 OpenAI
61,2
2.3s
12 Gemini 3.5 Flash-Lite Google
56,8
1.3s

Detalhamento da Pontuação

Pontuações do benchmark por critério mostrando o desempenho de cada modelo em precisão, relevância, completude, utilidade, tom e concisão.
Modelo Precisão (30%) Relevância (20%) Completude (15%) Utilidade (15%) Tom (10%) Concisão (10%)
Grok 4.1 Fast 49,0 78,2 64,8 55,9 82,1 85,2
Claude Haiku 4.5 45,7 79,8 68,6 57,2 85,4 80,2
ChatGPT 4.1 mini 41,6 80,0 68,3 55,0 85,2 84,6
Claude Sonnet 5 40,3 77,8 72,1 58,4 85,9 77,9
ChatGPT 4.1 34,4 81,2 68,3 51,2 85,3 81,3
Gemini 3.5 Flash-Lite 32,8 73,4 64,7 46,4 81,3 74,4

Como Funciona

Perguntas Reais

Selecionadas de conversas reais de atendimento ao cliente em e-commerce em produção.

Mesmo Prompt

Todos os modelos recebem o mesmo prompt de sistema, base de conhecimento e pergunta.

Avaliação Cega

Os avaliadores veem apenas 'Resposta A', 'Resposta B' — eles não sabem qual modelo escreveu.

Avaliação Cruzada

Modelos de primeira linha de cada provedor avaliam as respostas. Nenhum modelo julga sua própria resposta.

Critérios de Pontuação

Cada resposta recebe uma nota de 0 a 100 em seis critérios com os seguintes pesos:

Precisão 30%
Relevância 20%
Completude 15%
Utilidade 15%
Tom 10%
Concisão 10%

Para manter a comparação justa, as pontuações públicas são calculadas apenas a partir de perguntas respondidas por todos os modelos incluídos no conjunto de comparação selecionado. Isso evita que modelos mais novos ou descontinuados se beneficiem de um conjunto de perguntas mais fácil.

Results over time

Each round uses a different set of questions, so trends are indicative, not a controlled comparison.

Round-by-round average scores (all models)
Modelo Round 1Round 2Round 3Round 4
Claude Haiku 4.5 64,349,153,565,1
Claude Opus 4.6 63,0———
Claude Opus 4.7 65,051,156,4—
Claude Opus 5 ———61,2
Claude Sonnet 4.6 66,754,561,0—
Claude Sonnet 5 ———63,6
Gemini 3 Flash 54,2———
Gemini 3.1 Flash-Lite —53,455,5—
Gemini 3.1 Flash-Lite 60,2———
Gemini 3.1 Pro Preview 61,251,953,1—
Gemini 3.5 Flash —43,850,5—
Gemini 3.5 Flash-Lite ———56,8
Gemini 3.7 Flash ———63,6
ChatGPT 4.1 63,257,157,261,2
ChatGPT 4.1 mini 62,660,862,763,9
ChatGPT 5.4 69,548,752,2—
ChatGPT 5.4 mini 65,960,659,9—
ChatGPT 5.5 —53,958,3—
ChatGPT 5.6 Luna ———69,8
ChatGPT 5.6 Sol ———71,7
ChatGPT 5.6 Terra ———69,7
Grok 4 59,6———
Grok 4.1 Fast 58,4——65,2
Grok 4.20 55,5———
Grok 4.3 —51,257,7—
Grok 4.6 ———63,0

Perguntas Frequentes

Este benchmark mede o desempenho dos principais modelos de IA em tarefas reais de atendimento ao cliente para lojas online. O foco está na qualidade prática do suporte — precisão, utilidade, tom e concisão — e não em testes de programação, matemática ou raciocínio genérico.

O melhor modelo depende da sua loja, combinação de idiomas, complexidade dos produtos e requisitos de velocidade. Esta página mostra quais modelos têm o melhor desempenho atualmente em nosso benchmark cego, ajudando você a pré-selecionar candidatos para seus próprios testes ao vivo.

Cada provedor tem seus pontos fortes. Os modelos ChatGPT tendem a ser rápidos e amplamente suportados. Os modelos Claude geralmente se destacam em respostas detalhadas e ricas em contexto. Os modelos Gemini oferecem fortes capacidades multilíngues. Os modelos Grok proporcionam desempenho competitivo com menor latência. Confira o ranking acima para a comparação cega mais recente.

Todos os modelos recebem a mesma pergunta, prompt de sistema e base de conhecimento. Suas respostas são então rotuladas anonimamente (Resposta A, Resposta B, etc.) e avaliadas por juízes de IA de primeira linha de cada provedor — OpenAI, Anthropic, Google e xAI. Nenhum modelo avalia sua própria resposta, eliminando o viés de autoavaliação.

Sim. As perguntas vêm de conversas reais em produção em lojas online, incluindo Shopify, Shoptet, WooCommerce e outras. Use o ranking como ponto de partida e teste os melhores modelos com seu próprio catálogo de produtos e tom da marca antes de ir ao ar.

Use o ranking como auxílio na decisão, não como o único fator decisivo. Comece com os modelos mais bem classificados, depois teste-os com sua própria base de conhecimento, tom da marca e requisitos de velocidade de resposta antes de implementar em produção.

Adicionamos novos modelos conforme os provedores os lançam e expandimos periodicamente o conjunto de perguntas com novos cenários reais. Quando um novo modelo é adicionado, ele é testado nas mesmas perguntas compartilhadas de todos os modelos existentes para manter a comparação justa.

Copyright © Chaterimo

about-icon