Benchmark de modelos de IA

Escenarios reales de atención al cliente en e-commerce, evaluación ciega por múltiples jueces de IA

Este benchmark compara ChatGPT, Claude, Gemini y Grok en preguntas reales de atención al cliente en e-commerce. Está diseñado para equipos que buscan el mejor modelo de IA para chat de soporte, automatización de mesa de ayuda y flujos de asistente de ventas con IA.

Líder actual: Grok 4.1 Fast con una puntuación media de 65,2 en 45 preguntas compartidas y 540 evaluaciones ciegas.

45 preguntas evaluadas 540 evaluaciones realizadas Última actualización: Ago 30, 2026

Clasificación general entre todos los snapshots

Clasificación de media ponderada entre snapshots; la columna "rondas" muestra en cuántos snapshots ha participado cada modelo.
# Modelo Proveedor Puntuación general Rondas Evaluaciones totales
4 Claude Sonnet 5 Anthropic
63,6
1/4 45
10 ChatGPT 4.1 mini OpenAI
62,5
4/4 263
13 ChatGPT 4.1 OpenAI
60,4
4/4 263
14 Grok 4.1 Fast xAI
60,3
2/4 157
17 Claude Haiku 4.5 Anthropic
59,3
4/4 263
18 Gemini 3.1 Pro Preview Google
57,9
3/4 137
19 Gemini 3.5 Flash-Lite Google
56,8
1/4 45

Última ronda — Ago 30, 2026

Clasificación de modelos de IA ordenados por puntuaciones de evaluación ciega en preguntas compartidas de atención al cliente en e-commerce.
# Modelo Proveedor Puntuación general Respuesta media
4 Grok 4.1 Fast xAI
65,2
2.2s
5 Claude Haiku 4.5 Anthropic
65,1
4.0s
6 ChatGPT 4.1 mini OpenAI
63,9
2.9s
7 Claude Sonnet 5 Anthropic
63,6
7.8s
11 ChatGPT 4.1 OpenAI
61,2
2.3s
12 Gemini 3.5 Flash-Lite Google
56,8
1.3s

Desglose de puntuación

Puntuaciones del benchmark por criterio que muestran el rendimiento de cada modelo en precisión, relevancia, completitud, utilidad, tono y concisión.
Modelo Precisión (30%) Relevancia (20%) Completitud (15%) Utilidad (15%) Tono (10%) Concisión (10%)
Grok 4.1 Fast 49,0 78,2 64,8 55,9 82,1 85,2
Claude Haiku 4.5 45,7 79,8 68,6 57,2 85,4 80,2
ChatGPT 4.1 mini 41,6 80,0 68,3 55,0 85,2 84,6
Claude Sonnet 5 40,3 77,8 72,1 58,4 85,9 77,9
ChatGPT 4.1 34,4 81,2 68,3 51,2 85,3 81,3
Gemini 3.5 Flash-Lite 32,8 73,4 64,7 46,4 81,3 74,4

Cómo funciona

Preguntas reales

Seleccionadas de conversaciones reales de atención al cliente en producción en e-commerce.

Mismo prompt

Todos los modelos reciben el mismo prompt del sistema, base de conocimiento y pregunta.

Evaluación ciega

Los evaluadores solo ven 'Respuesta A', 'Respuesta B' — no saben qué modelo la escribió.

Evaluación cruzada

Modelos de primer nivel de cada proveedor evalúan las respuestas. Ningún modelo juzga su propia respuesta.

Criterios de puntuación

Cada respuesta se puntúa de 0 a 100 en seis criterios con los siguientes pesos:

Precisión 30%
Relevancia 20%
Completitud 15%
Utilidad 15%
Tono 10%
Concisión 10%

Para mantener la comparación justa, las puntuaciones públicas se calculan solo a partir de preguntas respondidas por todos los modelos incluidos en el conjunto de comparación seleccionado. Esto evita que modelos más nuevos o retirados se beneficien de una combinación de preguntas más fácil.

Results over time

Each round uses a different set of questions, so trends are indicative, not a controlled comparison.

Round-by-round average scores (all models)
Modelo Round 1Round 2Round 3Round 4
Claude Haiku 4.5 64,349,153,565,1
Claude Opus 4.6 63,0———
Claude Opus 4.7 65,051,156,4—
Claude Opus 5 ———61,2
Claude Sonnet 4.6 66,754,561,0—
Claude Sonnet 5 ———63,6
Gemini 3 Flash 54,2———
Gemini 3.1 Flash-Lite —53,455,5—
Gemini 3.1 Flash-Lite 60,2———
Gemini 3.1 Pro Preview 61,251,953,1—
Gemini 3.5 Flash —43,850,5—
Gemini 3.5 Flash-Lite ———56,8
Gemini 3.7 Flash ———63,6
ChatGPT 4.1 63,257,157,261,2
ChatGPT 4.1 mini 62,660,862,763,9
ChatGPT 5.4 69,548,752,2—
ChatGPT 5.4 mini 65,960,659,9—
ChatGPT 5.5 —53,958,3—
ChatGPT 5.6 Luna ———69,8
ChatGPT 5.6 Sol ———71,7
ChatGPT 5.6 Terra ———69,7
Grok 4 59,6———
Grok 4.1 Fast 58,4——65,2
Grok 4.20 55,5———
Grok 4.3 —51,257,7—
Grok 4.6 ———63,0

Preguntas frecuentes

Este benchmark mide cómo los principales modelos de IA gestionan tareas reales de atención al cliente en tiendas online. Se centra en la calidad práctica del soporte — precisión, utilidad, tono y concisión — en lugar de pruebas de programación, matemáticas o razonamiento genérico.

El mejor modelo depende de su tienda, combinación de idiomas, complejidad de productos y requisitos de velocidad. Esta página muestra qué modelos tienen mejor rendimiento actualmente en nuestro benchmark ciego, ayudándole a preseleccionar candidatos para sus propias pruebas en vivo.

Cada proveedor tiene sus fortalezas. Los modelos ChatGPT suelen ser rápidos y ampliamente compatibles. Los modelos Claude a menudo destacan en respuestas matizadas y con mucho contexto. Los modelos Gemini ofrecen sólidas capacidades multilingües. Los modelos Grok proporcionan un rendimiento competitivo con menor latencia. Consulte la clasificación anterior para la última comparación ciega.

Cada modelo recibe la misma pregunta, prompt del sistema y base de conocimiento. Sus respuestas se etiquetan de forma anónima (Respuesta A, Respuesta B, etc.) y son puntuadas por jueces de IA de primer nivel de cada proveedor — OpenAI, Anthropic, Google y xAI. Ningún modelo evalúa su propia respuesta, eliminando el sesgo de autoevaluación.

Sí. Las preguntas provienen de conversaciones reales en producción en tiendas online, incluyendo Shopify, Shoptet, WooCommerce y otras. Use la clasificación como punto de partida y luego pruebe los mejores modelos con su propio catálogo de productos y tono de marca antes de ponerlos en producción.

Use la clasificación como una ayuda para la decisión, no como el único factor decisivo. Comience con los modelos mejor clasificados y luego pruébelos con su propia base de conocimiento, tono de marca y requisitos de velocidad de respuesta antes de implementar en producción.

Añadimos nuevos modelos a medida que los proveedores los lanzan y ampliamos periódicamente el conjunto de preguntas con escenarios reales nuevos. Cuando se añade un nuevo modelo, se prueba con las mismas preguntas compartidas que todos los modelos existentes para mantener la comparación justa.

Copyright © Chaterimo

about-icon