Empfehlen ChatGPT, Claude, Gemini, Perplexity und Grok dieselben Marken?
An der Spitze weitgehend, darunter deutlich weniger. Über 22 Software-Kategorien und 769 aufgezeichnete Antworten hinweg nannten alle fünf Engines in 21 von 22 Kategorien dieselbe führende Marke. Von einer typischen Top-20 wurden aber nur rund 33 % von allen fünf genannt, und zwei Engines überschnitten sich im Schnitt bei lediglich 60.7 % der Marken, die sie nannten.
Die wichtigsten Zahlen
- In 21 von 22 Kategorien gab es einen Spitzenreiter, den jede Engine nannte. Die Kategorieführerschaft in KI-Antworten ist bemerkenswert gefestigt.
- Nur 6.5 Marken aus einer typischen Rangliste mit 20 Marken wurden von allen fünf Engines genannt – rund 33 %.
- 60.7 % durchschnittliche Überschneidung zwischen zwei beliebigen Engines bei den Marken, die sie überhaupt nannten.
- 1.668 verschiedene Marken wurden über die 22 Kategorien hinweg genannt, im Schnitt 76 pro Kategorie.
- Nur 1.6 % der Ranglistenplätze gingen an eine Marke, die nur eine einzige Engine genannt hatte. Vollständige Abweichung ist selten, teilweise Abweichung ist die Regel.
Was das tatsächlich bedeutet
Die bequeme Geschichte für ein Unternehmen, das Reports über mehrere Engines verkauft, wäre: Die Engines widersprechen sich wild. Das sagen die Daten nicht, und wir tun nicht so, als ob. Wenn Ihre Frage lautet, wer Ihre Kategorie in KI-Antworten anführt, wird eine einzelne Engine sie in der Regel richtig beantworten.
Das Bild ändert sich, sobald die Frage einer bestimmten Marke gilt und nicht dem Spitzenreiter. Rund 67 % jeder Rangliste sind nicht einstimmig, und genau in diesem instabilen Bereich sitzt fast jede Marke, die nicht Kategorieführer ist. Eine Marke kann bei einer Engine gesund aussehen und bei einer anderen fehlen – deshalb fand unser Beispiel-Report eine einzelne Marke mit einer Erwähnungsrate zwischen 43 % und 86 % je nach Engine, am selben Tag. Beides stimmt gleichzeitig: oben stabil, überall sonst unruhig.
Nach Engine
Ranglistenplätze gibt an, zu wie vielen der bewerteten Markenpositionen über alle 22 Kategorien hinweg jede Engine beigetragen hat. Alleinnennungen sind Marken, die nur diese eine Engine genannt hat.
| Engine | Ranglistenplätze | Alleinnennungen | Kategorieführer genannt |
|---|---|---|---|
| ChatGPT | 333 | 0 | 22 of 22 |
| Claude | 287 | 3 | 21 of 22 |
| Gemini | 353 | 1 | 22 of 22 |
| Perplexity | 298 | 3 | 22 of 22 |
| Grok | 339 | 0 | 22 of 22 |
Keine Engine ist ein deutlicher Ausreißer. Der Abstand zwischen der ergiebigsten und der sparsamsten Engine ist klein, und jede Engine hat jeden Kategorieführer erkannt. Behauptungen, ein Assistent sei systematisch "besser" darin, Marken zu erinnern, stützt dieser Datensatz nicht.
Welche Engines miteinander übereinstimmen
| Paar | Überschneidung bei genannten Marken |
|---|---|
| ChatGPT vs Grok | 69.3% |
| Gemini vs Grok | 67.6% |
| Gemini vs Perplexity | 62.3% |
| ChatGPT vs Gemini | 62.2% |
| ChatGPT vs Perplexity | 60.2% |
| Claude vs Grok | 59.7% |
| ChatGPT vs Claude | 59.4% |
| Claude vs Gemini | 58.4% |
| Perplexity vs Grok | 56.9% |
| Claude vs Perplexity | 51.2% |
Die umkämpftesten und die gefestigtsten Kategorien
Kategorien, in denen nur wenige Marken von allen fünf Engines genannt wurden, sind die, in denen KI-Sichtbarkeit noch zu holen ist. Kategorien mit vielen einstimmigen Marken haben einen Konsens, in den schwerer einzubrechen ist.
Am umkämpftesten: Lagerverwaltungssoftware (1), Buchhaltungssoftware für kleine Unternehmen (3), Terminbuchungssoftware (4).
Am gefestigtsten: E-Commerce-Plattformen (11), SEO-Tools (10), Projektmanagement-Software (9).
Die Zahl in Klammern gibt an, wie viele Marken aus den Top 20 von allen fünf Engines genannt wurden.
Methode und Grenzen
Sieben Prompts mit Kaufabsicht pro Kategorie, jeder davon über die aktuellen schnellen Produktionsmodelle an ChatGPT, Claude, Gemini, Perplexity und Grok geschickt – das ergab 769 verwertbare Antworten aus 770 Versuchen. Marken wurden aus dem Rohtext der Antworten extrahiert und danach sortiert, wie viele Antworten sie genannt haben. Der vollständige Prompt-Satz und die Bewertungsregeln stehen auf der Methodik-Seite.
Grenzen, die genannt gehören. Sprachmodelle sind stochastisch, ein erneuter Lauf würde diese Zahlen also nicht exakt reproduzieren; der Effekt ist im hinteren Feld am größten, und genau dort berichten wir die geringste Übereinstimmung – behandeln Sie diese Werte daher als Richtung, nicht als Präzision. Die Kategorien sind Business-Software, gemessen auf Deutsch; die Ergebnisse lassen sich womöglich nicht auf Konsumgüter, lokale Dienstleistungen oder regulierte Märkte übertragen. Die Ranglisten sind auf die Top 20 Marken pro Kategorie begrenzt, "von allen fünf Engines genannt" wird also innerhalb dieser Grenze gemessen. Jede zugrunde liegende Kategorieseite ist mit eigenen Daten und eigenem Datum veröffentlicht, die Eingangsdaten sind also prüfbar und nicht bloß behauptet.
Diese Daten sind mit Quellenangabe frei nutzbar. Wenn Sie sie zitieren, genügt ein Link auf diese Seite.
Häufige Fragen
Empfehlen verschiedene KI-Engines dieselben Marken?
Teilweise. Über 22 am 20. August 2026 gemessene Software-Kategorien hinweg nannten alle fünf Engines in 21 von 22 Kategorien dieselbe Top-Marke. Aus der Top-20 jeder Kategorie wurden aber nur rund 33 Prozent von allen fünf genannt, und zwei Engines waren sich im Schnitt bei lediglich 60.7 Prozent der genannten Marken einig. Die Engines stimmen beim Spitzenreiter überein und gehen darunter auseinander.
Welche KI-Engine empfiehlt die meisten Marken?
Gemini belegte über die 22 Kategorien hinweg die meisten Ranglistenplätze, Claude die wenigsten. Der Abstand ist gering, keine Engine ist also dramatisch großzügiger oder sparsamer als die anderen.
Heißt das, eine KI-Engine zu prüfen reicht aus?
Nur wenn Sie fragen, wer eine Kategorie anführt. Wenn Sie fragen, ob Ihre eigene Marke empfohlen wird, reicht eine Engine nicht: Der Spitzenreiter ist stabil, der Rest der Liste nicht – und dort sitzen die meisten Marken. Unser Beispiel-Report fand eine Marke, deren Erwähnungsrate je nach Engine zwischen 43 und 86 Prozent lag, am selben Tag.
Wie wurde das gemessen?
Pro Kategorie gingen sieben Prompts mit Kaufabsicht an jede der fünf Engines, was 769 aufgezeichnete Antworten ergab. Jede im Rohtext der Antworten genannte Marke wurde extrahiert und bewertet. Die Prompts, die Bewertungsregeln und die bekannten Grenzen sind vollständig auf der Methodik-Seite veröffentlicht, und jede Kategorieseite zeigt ihre eigenen zugrunde liegenden Daten.