Benchmark AI modelů

Reálné e-commerce scénáře zákaznického servisu, slepé hodnocení více AI porotci

Tento benchmark porovnává ChatGPT, Claude, Gemini a Grok na reálných e-commerce otázkách zákaznického servisu. Je navržen pro týmy, které vybírají nejlepší AI model pro chat podpory, automatizaci help desku a workflow AI prodejního asistenta.

Aktuální lídr: Grok 4.1 Fast s průměrným skóre 65,2 napříč 45 sdílenými otázkami a 540 slepými hodnoceními.

45 vyhodnocených otázek 540 provedených hodnocení Poslední aktualizace: Srp 30, 2026

Celkové pořadí napříč všemi snapshoty

Vážený průměr ze 4 snapshotů. Modely s více vyhodnoceními mají větší váhu.

Mezisnapshotový vážený průměr pořadí; sloupec "kola" ukazuje, kolika snapshotů se každý model zúčastnil.
# Model Poskytovatel Celkové skóre Kola Celkem vyhodnocení
4 Claude Sonnet 5 Anthropic
63,6
1/4 45
10 ChatGPT 4.1 mini OpenAI
62,5
4/4 263
13 ChatGPT 4.1 OpenAI
60,4
4/4 263
14 Grok 4.1 Fast xAI
60,3
2/4 157
17 Claude Haiku 4.5 Anthropic
59,3
4/4 263
18 Gemini 3.1 Pro Preview Google
57,9
3/4 137
19 Gemini 3.5 Flash-Lite Google
56,8
1/4 45

Poslední kolo — Srp 30, 2026

Žebříček AI modelů seřazených podle skóre slepého hodnocení na sdílených e-commerce otázkách zákaznického servisu.
# Model Poskytovatel Celkové skóre Prům. odpověď
4 Grok 4.1 Fast xAI
65,2
2.2s
5 Claude Haiku 4.5 Anthropic
65,1
4.0s
6 ChatGPT 4.1 mini OpenAI
63,9
2.9s
7 Claude Sonnet 5 Anthropic
63,6
7.8s
11 ChatGPT 4.1 OpenAI
61,2
2.3s
12 Gemini 3.5 Flash-Lite Google
56,8
1.3s

Rozpad skóre

Skóre benchmarku podle jednotlivých kritérií ukazující, jak si každý model vede v přesnosti, relevanci, úplnosti, užitečnosti, tónu a stručnosti.
Model Přesnost (30%) Relevance (20%) Úplnost (15%) Užitečnost (15%) Tón (10%) Stručnost (10%)
Grok 4.1 Fast 49,0 78,2 64,8 55,9 82,1 85,2
Claude Haiku 4.5 45,7 79,8 68,6 57,2 85,4 80,2
ChatGPT 4.1 mini 41,6 80,0 68,3 55,0 85,2 84,6
Claude Sonnet 5 40,3 77,8 72,1 58,4 85,9 77,9
ChatGPT 4.1 34,4 81,2 68,3 51,2 85,3 81,3
Gemini 3.5 Flash-Lite 32,8 73,4 64,7 46,4 81,3 74,4

Jak to funguje

Reálné otázky

Vybrané ze skutečných produkčních konverzací zákaznického servisu v e-commerce.

Stejný prompt

Všechny modely dostanou identický systémový prompt, znalostní bázi a otázku.

Slepé hodnocení

Hodnotitelé vidí pouze ‚Odpověď A', ‚Odpověď B' — nevědí, který model ji napsal.

Křížové hodnocení

Špičkové modely od každého poskytovatele hodnotí odpovědi. Žádný model nehodnotí svou vlastní odpověď.

Kritéria hodnocení

Každá odpověď je hodnocena 0–100 v šesti kritériích s následujícími váhami:

Přesnost 30%
Relevance 20%
Úplnost 15%
Užitečnost 15%
Tón 10%
Stručnost 10%

Pro zachování férovosti se veřejné skóre počítá pouze z otázek, na které odpověděly všechny modely zahrnuté ve vybrané srovnávací sadě. To brání tomu, aby novější nebo vyřazené modely těžily z jednoduššího mixu otázek.

Results over time

Each round uses a different set of questions, so trends are indicative, not a controlled comparison.

Round-by-round average scores (all models)
Model Round 1Round 2Round 3Round 4
Claude Haiku 4.5 64,349,153,565,1
Claude Opus 4.6 63,0———
Claude Opus 4.7 65,051,156,4—
Claude Opus 5 ———61,2
Claude Sonnet 4.6 66,754,561,0—
Claude Sonnet 5 ———63,6
Gemini 3 Flash 54,2———
Gemini 3.1 Flash-Lite —53,455,5—
Gemini 3.1 Flash-Lite 60,2———
Gemini 3.1 Pro Preview 61,251,953,1—
Gemini 3.5 Flash —43,850,5—
Gemini 3.5 Flash-Lite ———56,8
Gemini 3.7 Flash ———63,6
ChatGPT 4.1 63,257,157,261,2
ChatGPT 4.1 mini 62,660,862,763,9
ChatGPT 5.4 69,548,752,2—
ChatGPT 5.4 mini 65,960,659,9—
ChatGPT 5.5 —53,958,3—
ChatGPT 5.6 Luna ———69,8
ChatGPT 5.6 Sol ———71,7
ChatGPT 5.6 Terra ———69,7
Grok 4 59,6———
Grok 4.1 Fast 58,4——65,2
Grok 4.20 55,5———
Grok 4.3 —51,257,7—
Grok 4.6 ———63,0

Často kladené otázky

Tento benchmark měří, jak dobře si přední AI modely vedou v reálných úlohách zákaznického servisu pro online obchody. Zaměřuje se na praktickou kvalitu podpory — přesnost, užitečnost, tón a stručnost — nikoli na kódování, matematiku nebo obecné logické testy.

Nejlepší model závisí na vašem obchodě, jazykovém mixu, složitosti produktů a požadavcích na rychlost. Tato stránka ukazuje, které modely si aktuálně vedou nejlépe v našem slepém benchmarku, a pomůže vám zúžit výběr kandidátů pro vlastní testování.

Každý poskytovatel má své silné stránky. Modely ChatGPT bývají rychlé a široce podporované. Modely Claude často vynikají v nuancovaných odpovědích s bohatým kontextem. Modely Gemini nabízejí silné vícejazyčné schopnosti. Modely Grok poskytují konkurenceschopný výkon s nižší latencí. Podívejte se na žebříček výše pro nejnovější slepé porovnání.

Každý model dostane identickou otázku, systémový prompt a znalostní bázi. Odpovědi jsou poté anonymně označeny (Odpověď A, Odpověď B atd.) a hodnoceny špičkovými AI porotci od každého poskytovatele — OpenAI, Anthropic, Google a xAI. Žádný model nehodnotí svou vlastní odpověď, čímž se eliminuje zkreslení sebehodnocením.

Ano. Otázky pocházejí ze skutečných produkčních konverzací v online obchodech včetně Shopify, Shoptet, WooCommerce a dalších. Použijte žebříček jako výchozí bod a poté otestujte nejlepší modely s vlastním produktovým katalogem a tónem značky, než je nasadíte do provozu.

Používejte žebříček jako pomůcku při rozhodování, ne jako jediný rozhodující faktor. Začněte s nejlépe hodnocenými modely a poté je otestujte na vlastní znalostní bázi, tónu značky a požadavcích na rychlost odpovědí, než je nasadíte do produkce.

Nové modely přidáváme, jakmile je poskytovatelé vydají, a pravidelně rozšiřujeme sadu otázek o nové reálné scénáře. Když je přidán nový model, je testován na stejných sdílených otázkách jako všechny stávající modely, aby bylo srovnání férové.

Copyright © Chaterimo

about-icon