Studie · präregistrierte Vollerhebung
357 von 472 untersuchten Weltmarktführern aus Deutschland erscheinen in ChatGPT-Anbieterlisten
Am 4. Oktober 2026 hat das ChatGPT-Modell chat-latest bei verfügbarer Websuche 357 von 472 untersuchten Weltmarktführern mit Sitz in Deutschland (laut Weltmarktführer-Index) genannt. Das sind 76 Prozent, also rund drei von vier, mit einem 95-Prozent-Konfidenzintervall von 72 bis 79 Prozent (dieser Bereich berücksichtigt, dass die Antworten des Modells zufällig schwanken). Gefragt habe ich über die OpenAI-Schnittstelle nach den fünf weltweit führenden Anbietern im jeweiligen Marktsegment, ohne den Namen des gesuchten Unternehmens in der Frage vorzugeben. War die Websuche verfügbar, erhöhte das den Anteil gegenüber denselben Fragen ohne Websuche um 3,4 Prozentpunkte (95-Prozent-Intervall: 0,9 bis 5,9 Prozentpunkte).
Patrick Stolp · SEO-Experte · Lübeck
- Mit Websuche genannt
- 357 von 472
- Ohne Websuche genannt
- 341 von 472
- An erster Stelle
- 217 von 472
- Websuche genutzt
- 224 von 472
Von einer Lübecker Stichprobe zu 472 Weltmarktführern aus dem Index
Wer für den eigenen Betrieb einen spezialisierten Zulieferer sucht, kann inzwischen auch ChatGPT nach führenden Herstellern fragen und bekommt eine Liste von Firmennamen serviert. Für die genannten Unternehmen ist das erst einmal eine handfeste Chance, überhaupt in den Kreis möglicher Partner zu geraten. Mich beschäftigt dabei vor allem eine Frage: Wie treffsicher erfassen solche Listen eigentlich jene Unternehmen, die in ihrem Marktsegment wirtschaftlich den Ton angeben? Wenn eine Firma laut einer unabhängigen Referenz zu den Weltmarktführern zählt, sollte sie bei einer passenden Branchenfrage doch zumindest eine realistische Chance haben, unter den fünf genannten Namen aufzutauchen.
Im August habe ich genau diesen Zusammenhang schon einmal für eine kleine Gruppe aus Lübeck untersucht. Die Lübecker Untersuchung zu Weltmarktführern und KI-Sichtbarkeit hat damals gezeigt, dass ChatGPT spezialisierte Lübecker Unternehmen bei offenen Fragen nach führenden Anbietern seltener nannte als bekannte Vergleichsfirmen. Auch die Quellen unterschieden sich deutlich, je nachdem, ob ich direkt nach einer Firma oder offen nach führenden Anbietern gefragt hatte. Allerdings hatte ich die Firmen seinerzeit selbst ausgewählt, nur ein einziges Modell an drei Tagen beobachtet und ohne unabhängigen Zweitprüfer gearbeitet. Eine verlässliche Aussage über eine große, von außen sauber definierte Gruppe ließ sich daraus verständlicherweise noch nicht ableiten.
Für die neue Untersuchung habe ich deshalb auf den „wmfi.eu – Weltmarktführer-Index DACH (Prof. Dr. Christoph Müller, UEC gGmbH)“ als unabhängige Referenz zurückgegriffen. Dieser Index erfasst Unternehmen aus Deutschland, Österreich und der Schweiz und weist aus, in welchem Marktsegment sie weltweit führend sind. Für meine Auswertung waren die dort als „Champions“ geführten Weltmarktführer mit dem Ländereintrag Deutschland maßgeblich (nicht die ebenfalls verzeichneten „Future Champions“), einschließlich jener Firmen, die internationale Eigentümer haben. Laut den Auswahlkriterien des Weltmarktführer-Index belegt ein Champion in seinem Weltmarktsegment die erste oder zweite Position.
Aus diesem extern abgegrenzten Kreis habe ich alle 472 Unternehmen untersucht, deren Marktsegment sich nach den dokumentierten Regeln ohne Nennung des Firmennamens als neutrale Frage formulieren ließ. Die Studie steht methodisch auf eigenen Beinen. Die vorangegangene Lübecker Stichprobe war zwar der eigentliche Auslöser, ihre Zahlen lassen sich wegen der anderen Unternehmen, der abweichenden Fragestellungen, des anderen Modells und des veränderten Prüfverfahrens aber nicht unmittelbar mit den neuen Daten vergleichen.
Drei von vier Weltmarktführern schaffen es in die Fünferliste
Die zentrale Frage war für jedes einzelne Unternehmen nach demselben Muster aufgebaut: Welche fünf Unternehmen gehören weltweit zu den führenden Anbietern im jeweiligen Marktsegment? Das Segment habe ich dabei aus der Indexbeschreibung übernommen und nur Firmen-, Marken- und Produktnamen sowie Hinweise des Index gestrichen. Weder der gesuchte Firmenname noch Deutschland kamen im Fragetext vor, sodass ChatGPT die fünf Anbieter aus der ganzen Welt auswählen konnte. Gestellt habe ich die Frage allerdings auf Deutsch. Ob das die Nennung deutscher Unternehmen begünstigt, lässt sich mit dieser Messung nicht prüfen.
Tabelle 1Genannte Weltmarktführer je Messung, 472 Unternehmen
| Messung | Genannte Unternehmen | Anteil | 95-Prozent-Intervall |
|---|---|---|---|
| Websuche verfügbar | 357 von 472 | 76 Prozent | 72 bis 79 Prozent |
| Ohne Websuche | 341 von 472 | 72 Prozent | 68 bis 76 Prozent |
| An erster Listenposition, Websuche verfügbar | 217 von 472 | 46 Prozent | 42 bis 50 Prozent |
| Nur anhand des eigenen Firmennamens gezählt, Websuche verfügbar | 351 von 472 | 74 Prozent | 70 bis 78 Prozent |
Für die Hauptauswertung habe ich neben dem eigentlichen Firmennamen auch eigene Marken und Tochtergesellschaften gewertet, unter denen das Unternehmen im untersuchten Segment tatsächlich am Markt auftritt. Diese Zuordnungen standen bereits vor der Messung mit entsprechenden Belegen fest. Gerade bei Unternehmensgruppen ist das wichtig: Ein Einkäufer dürfte in der Praxis oft nach der etablierten Produktmarke suchen, während ihm der Name der Dachgesellschaft womöglich gar kein Begriff ist. Wer nur diesen Namen zählt, misst also eher, wie bekannt die Dachgesellschaft ist. Aber selbst beim engeren Abgleich, der nur den Firmennamen selbst und direkte Namensvarianten gelten ließ, kamen 351 von 472 Unternehmen in den Antworten vor, nur sechs weniger als in der Hauptauswertung.
Trotzdem fehlte immer noch rund jedes vierte Unternehmen in der Antwort auf seine Marktfrage. Dabei war das Messkriterium durchaus entgegenkommend: Ein Champion, der laut Index weltweit auf Rang eins oder zwei steht, musste lediglich irgendwo unter den fünf genannten Namen auftauchen. Obendrein waren viele Marktsegmente im Index sehr spitz und detailliert beschrieben, was passende Nennungen begünstigt.
Abbildung 1
Messung vom 4. Oktober 2026, Modell chat-latest über die OpenAI-Schnittstelle, Websuche verfügbar, 472 Unternehmen.
357 von 472 Weltmarktführern erscheinen in der Fünferliste
Jedes Quadrat steht für eines der 472 untersuchten Unternehmen. Gefragt war jeweils nach den fünf weltweit führenden Anbietern im Marktsegment, die Websuche war verfügbar.
Quadratraster mit 472 Feldern, eines je Unternehmen: 357 wurden genannt, 115 nicht. Das entspricht 76 Prozent, 95-Prozent-Intervall 72 bis 79 Prozent.
217 von 357 genannten Champions stehen direkt an erster Stelle
Bei verfügbarer Websuche landeten 217 von 472 Unternehmen auf dem ersten Platz der Antwortliste. Bezogen auf die gesamte Untersuchungsgruppe entspricht das 46 Prozent (95-Prozent-Intervall: 42 bis 50 Prozent). Unter den 357 genannten Weltmarktführern verteilten sich die Plätze so: 217 standen an erster, 56 an zweiter, 41 an dritter, 24 an vierter und 19 an fünfter Stelle. Wer überhaupt im Antworttext vorkam, wurde also meist gleich ganz oben aufgeführt.
Abbildung 2
Messung vom 4. Oktober 2026, Modell chat-latest über die OpenAI-Schnittstelle, Websuche verfügbar, 472 Unternehmen.
217 Unternehmen auf Platz 1, 140 auf den Plätzen zwei bis fünf
Listenplatz der genannten Unternehmen in der Fünferliste, dazu die nicht genannten. Die Balkenlänge bezieht sich auf alle 472 Unternehmen.
Balkendiagramm der Listenplätze in Unternehmen: Platz 1: 217, Platz 2: 56, Platz 3: 41, Platz 4: 24, Platz 5: 19, nicht genannt: 115, zusammen 472.
Diese Platzierung beschreibt allerdings nur die Reihenfolge im Antworttext. Ich habe ChatGPT um eine nummerierte Liste gebeten, nicht um eine Rangfolge nach Marktanteilen oder gar um eine Bewertung der Produktqualität. Der erste Listenplatz ist demnach weder ein belegter Spitzenrang im Weltmarkt noch eine Begründung dafür, warum ein Einkäufer ausgerechnet diesen Anbieter wählen sollte.
Verfügbare Websuche: 357 statt 341 genannte Weltmarktführer
Eine naheliegende Frage war natürlich, ob viele dieser Unternehmen erst durch den Zugriff auf das Internet in die Antworten geraten. Deshalb habe ich jedes Marktsegment einmal mit und einmal ohne verfügbare Websuche abgefragt. Beide Anfragen liefen im Messdurchgang unmittelbar hintereinander, wobei die Reihenfolge für jedes Unternehmen per Zufall bestimmt wurde. Verändert sich im Lauf der Messung etwas, trifft das so beide Bedingungen gleichermaßen, anders als wenn man erst alle Fragen ohne und Stunden später alle mit Websuche stellt.
Mit verfügbarer Websuche nannte das Modell 357 von 472 Unternehmen, ohne Websuche waren es 341 von 472. Das ist ein Unterschied von 3,4 Prozentpunkten, das 95-Prozent-Intervall reicht von 0,9 bis 5,9 Prozentpunkten. Da dieses Intervall die Null ausschließt, ist das nach dem vorab festgelegten Auswertungsplan ein Hinweis auf einen Unterschied zugunsten der Websuche.
Als Grenze für einen in der Praxis spürbaren Unterschied hatte ich nach den Testläufen und vor der Hauptmessung fünf Prozentpunkte festgelegt. Der gemessene Zuwachs liegt zwar darunter, die obere Intervallgrenze ragt jedoch darüber hinaus. Ob der Zuwachs diese Grenze tatsächlich erreicht, bleibt also offen. Für bedeutungslos erklären kann man die Websuche aber auch nicht, denn eine praktische Gleichwertigkeit beider Bedingungen ist damit ebenso wenig belegt.
Abbildung 3
Vergleiche bei denselben Unternehmen, Intervalle nach Newcombe, Lesart vorab festgelegt.
Alle vorab festgelegten Vergleiche: nur bei der Websuche ein Hinweis auf einen Unterschied
Unterschied im Anteil genannter Unternehmen in Prozentpunkten, jeweils erste minus zweite Bedingung, mit 95-Prozent-Intervall. Als Wirkung gedeutet wird nur der Vergleich mit und ohne Websuche, die übrigen Vergleiche sind beschreibend.
Intervalldiagramm der vorab festgelegten Vergleiche in Prozentpunkten: Websuche verfügbar gegen nicht verfügbar: +3,4, Intervall 0,9 bis 5,9, 472 Paare, Hinweis auf einen Unterschied; Einkäufer-Formulierung gegen Hauptfrage, ohne Websuche: +2,5, Intervall −0,2 bis 5,3, 472 Paare, nicht eindeutig; Einkäufer-Formulierung gegen Hauptfrage, mit Websuche: +4,0, Intervall −3,1 bis 11,2, 100 Paare, nicht eindeutig; Wiederholung gegen Hauptmessung: −1,0, Intervall −6,8 bis 4,7, 100 Paare, nicht eindeutig; App gegen Schnittstelle: −6,7, Intervall −19,0 bis 5,1, 30 Paare, nicht eindeutig. Die Relevanzgrenze liegt bei plus und minus fünf Prozentpunkten.
Wirklich aufschlussreich wird die Sache, wenn man sich dieselben Unternehmen unter beiden Bedingungen anschaut: 332 der 357 mit Websuche genannten Champions tauchten nämlich genauso ohne Websuche im Text auf. Lediglich 25 Firmen wurden ausschließlich bei verfügbarer Websuche genannt, neun dagegen nur ohne sie. Der weitaus größte Teil der Nennungen kam also auch ohne aktuellen Webzugriff zustande. Woher das Modell diese Unternehmen kennt, ob aus dem Index, aus davon abgeleiteten Listen oder aus anderen Texten in seinen Trainingsdaten, war nicht Gegenstand dieser Messung.
Abbildung 4
Hauptfrage mit und ohne Websuche, je 472 Antworten, Reihenfolge je Unternehmen zufällig.
332 Weltmarktführer werden mit und ohne Websuche genannt
Dieselben 472 Unternehmen in beiden Bedingungen. Die Balkenlänge bezieht sich auf alle 472.
Balkendiagramm für dieselben 472 Unternehmen: in beiden Bedingungen genannt: 332, nur mit verfügbarer Websuche: 25, nur ohne Websuche: 9, in keiner Bedingung: 106.
App und Schnittstelle stimmen bei 28 von 30 Fragen überein
Die Hauptuntersuchung lief über die Programmierschnittstelle von OpenAI, die sogenannte API. Über diesen Weg lassen sich Fragen und Einstellungen genau standardisieren und alle Antworten lückenlos protokollieren. Das ist für eine saubere wissenschaftliche Wiederholung ideal, führt aber direkt zur nächsten Frage: Entsprechen diese Ergebnisse überhaupt dem, was ein normaler Nutzer im Alltag in der ChatGPT-App auf dem Bildschirm sieht?
Um das zu prüfen, habe ich am selben Messtag 30 vorab gezogene Fragen von Hand in der ChatGPT-App eingegeben. Bei 28 von 30 Fragen kamen App und Schnittstelle zum selben Ergebnis darüber, ob das gesuchte Unternehmen genannt wurde oder nicht. Die App nannte 22, die Schnittstelle mit verfügbarer Websuche 24 der 30 Unternehmen. Der Unterschied von minus 6,7 Prozentpunkten (95-Prozent-Intervall: minus 19,0 bis 5,1 Prozentpunkte) ist nach dem vorab festgelegten Kriterium nicht eindeutig. Die kleine Stichprobe belegt also weder einen Unterschied noch eine Deckungsgleichheit von App und Schnittstelle.
Abbildung 5
30 vorab gezogene Fragen, ChatGPT-App mit Denkaufwand „Medium“ und Schnittstelle am 4. Oktober 2026.
App und Schnittstelle nennen 22 Unternehmen gemeinsam, die Schnittstelle zwei weitere
Ein Punkt je Frage. Verglichen wird, ob das gesuchte Unternehmen in der App und über die Schnittstelle mit verfügbarer Websuche genannt wurde.
Punktraster mit 30 Fragen: in App und Schnittstelle genannt: 22, nur über die Schnittstelle genannt: 2, nur in der App genannt: 0, in keiner genannt: 6. Gleiches Ergebnis bei 28 von 30 Fragen.
Hinzu kommt, dass die App anders gearbeitet hat: Bei allen 30 Fragen hat sie sichtbar im Web gesucht und Quellen oder Links angezeigt. Sie lief zudem in einem Arbeitsbereich-Konto mit der voreingestellten Stufe „Medium“ für den Denkaufwand, während über die Schnittstelle das Instant-Modell chat-latest antwortete (in der App ist „Instant“ die Stufe unterhalb von „Medium“). Der Abgleich vergleicht also auch unterschiedliche Modellmodi. Auf private Nutzerkonten oder andere Einstellungen lassen sich die Ergebnisse daher nicht ohne Weiteres übertragen.
Wikipedia, Reddit und Marktforscher führen die Quellenliste an
Dass eine Websuche technisch bereitsteht, heißt allerdings noch lange nicht, dass das Modell sie bei jeder Frage auch tatsächlich startet. Im Hauptdurchlauf über die Schnittstelle hat das Modell nur bei 224 von 472 Antworten überhaupt eine Websuche ausgelöst, das sind 47 Prozent (95-Prozent-Intervall: 43 bis 52 Prozent). Bei der knappen Mehrheit der Antworten blieb das angebotene Suchwerkzeug also ungenutzt. Der Vergleich mit und ohne Websuche zeigt folglich die Wirkung einer optionalen Websuche, bei der das Modell selbst entscheidet, ob es sucht.
Wurde tatsächlich gesucht, fanden sich unter den Quellen vor allem die deutsch- und englischsprachige Wikipedia, Reddit sowie Seiten kommerzieller Marktforschungsanbieter. Der Weltmarktführer-Index selbst tauchte bei gerade einmal zwei von 472 Antworten unter den Quellen auf. Andere Weltmarktführer-Listen markierte das Auswertungsskript bei acht von 472 Antworten, nach Prüfung von Hand blieben drei. Über die Websuche hatte das Modell also so gut wie keinen Kontakt zum Index.
Abbildung 6
Hauptbedingung, 224 von 472 Antworten mit Websuche, Messung vom 4. Oktober 2026.
Die deutschsprachige Wikipedia steht in 198 von 224 Antworten mit Websuche unter den Quellen
Die zehn häufigsten Quellendomains und der Index im Vergleich: Zahl der 224 Antworten mit tatsächlicher Websuche, in deren Quellen die Domain mindestens einmal vorkommt. Eine Antwort kann mehrere Domains enthalten.
Bei den anderen Weltmarktführer-Listen zählen nur die von Hand bestätigten Fälle, automatisch markiert waren acht.
Balkendiagramm der Quellendomains in 224 Antworten mit Websuche: de.wikipedia.org: 198, en.wikipedia.org: 168, reddit.com: 96, pdf.marketpublishers.com: 83, gminsights.com: 74, dataintelo.com: 74, indexbox.io: 73, researchandmarkets.com: 66, pmarketresearch.com: 66, mordorintelligence.com: 56. Zum Vergleich der Weltmarktführer-Index: 2, andere, von Hand bestätigte Weltmarktführer-Listen: 3.
Dieses Quellenspektrum zeigt zwar, welche Seiten bei der Websuche herangezogen wurden. Es erklärt jedoch nicht, warum ein bestimmtes Unternehmen letztlich in der Liste landete oder eben außen vor blieb. Daraus die Empfehlung abzuleiten, Unternehmen müssten auf Reddit oder Wikipedia aktiv werden, um in KI-Listen zu landen, wäre unbegründet. Zudem kann das Modell den Index oder vergleichbare Marktübersichten bereits aus seinen Trainingsdaten kennen; gemessen wurde hier nur der Kontakt über die Websuche.
Einzelne Nennungen bleiben weitgehend stabil, die Listen drumherum wechseln deutlich
Bei einem Kontrolldurchlauf mit 100 vorab gezogenen Unternehmen fiel die Entscheidung über die Nennung in 93 Fällen gleich aus. Der Anteil genannter Firmen lag im Wiederholungslauf um 1,0 Prozentpunkte niedriger (95-Prozent-Intervall: minus 6,8 bis 4,7 Prozentpunkte). Nach dem vorab festgelegten Kriterium ist das nicht eindeutig: Ein Unterschied ist damit nicht belegt, bei nur 100 Unternehmen aber auch keine Gleichwertigkeit. Die übrigen Namen der Fünferlisten wechselten dagegen deutlich häufiger: Im Schnitt stimmten zwei Listen zur selben Frage nur in etwa dreieinhalb von fünf Namen überein. Das Maß ist grob, denn schon eine andere Schreibweise desselben Anbieters zählt dabei als Unterschied. Eine vergleichsweise verlässliche Nennung des gesuchten Unternehmens bedeutet also noch lange keine stabile Gesamtliste.
Abbildung 7
100 vorab gezogene Unternehmen, Hauptmessung und Wiederholung am 4. Oktober 2026.
Bei 93 von 100 Unternehmen fällt die Nennung in der Wiederholung gleich aus
Ein Punkt je Unternehmen. Verglichen wird, ob das Unternehmen in der Hauptmessung und in der Wiederholung genannt wurde, beide Male mit verfügbarer Websuche.
Punktraster mit 100 Unternehmen: in beiden Messungen genannt: 72, nur in einer der beiden Messungen genannt: 7, in keiner genannt: 21. Gleiches Ergebnis bei 93 von 100.
Das deckt sich mit einer anderen aktuellen Untersuchung. Rand Fishkin, Mitgründer des US-Unternehmens SparkToro, und Patrick O’Donnell haben in ihrer im Januar 2026 veröffentlichten Studie zu Marken- und Produktempfehlungen von KI-Chatbots ebenfalls festgestellt, dass die vollständigen Empfehlungslisten stark schwanken, selbst wenn bestimmte Marken immer wieder auftauchen. Ihre Erhebung bezog sich auf andere Branchen und Fragen und neben ChatGPT auch auf Claude und die KI-Funktionen der Google-Suche. Als direkter Messvergleich taugt sie deshalb nicht, sie zeigt aber deutlich, warum man das bloße Erscheinen eines Namens und die Zusammensetzung der gesamten Liste getrennt voneinander bewerten muss.
Eine Nennung belegt weder Marktanteile noch eine Empfehlung
Was habe ich hier also eigentlich gemessen? Im Kern ging es darum, ob ChatGPT auf eine offene Branchenfrage hin ein Unternehmen auflistet, das der Weltmarktführer-Index genau diesem Markt zuordnet. Für drei von vier der untersuchten Unternehmen ist das der Fall. Eine bloße Übereinstimmung mit dieser Referenz belegt allerdings weder tatsächliche Marktanteile noch die Leistungsfähigkeit eines Unternehmens. Wie der Index die jeweiligen Marktpositionen im Einzelnen erhebt und prüft, ist öffentlich nicht einsehbar. Die Einstufung als Weltmarktführer habe ich unverändert aus dem Index übernommen.
Auch die Nennung an sich bedarf einer nüchternen Einordnung. Sie besagt erst einmal nur, dass ein Name in der geforderten Fünferliste steht. Ob das Modell das Unternehmen für ein konkretes Beschaffungsvorhaben tatsächlich empfehlen würde, ob es zu bestimmten Anforderungen passt oder was ChatGPT über das Unternehmen sagen würde, habe ich bewusst nicht untersucht (die Frage verlangte ausdrücklich keine Begründung). Auf genau diese Trennung zwischen einer bloßen Nennung und einer echten Empfehlung verweist auch Wil Reynolds, Gründer der US-Agentur Seer Interactive, in seinem Beitrag zur Messung von KI-Sichtbarkeit vom 2. Oktober 2026: Eine Marke kann in einer KI-Antwort auftauchen und trotzdem nicht empfohlen werden, im ungünstigsten Fall rät die Antwort sogar von ihr ab.
Genauso vorsichtig muss man bei den nicht genannten Firmen argumentieren. Die Daten belegen weder eine Benachteiligung deutscher Unternehmen, noch verraten sie, warum eine einzelne Firma durchs Raster fiel. Die Fragen waren zwar weltweit formuliert, orientierten sich aber eng an den teils sehr spezifischen Segmentbezeichnungen des Index. Echte Einkäufer dürften ihre Fragen oft breiter oder mit ganz anderen Begriffen formulieren, was zu anderen Antworten führen kann. Für betroffene Unternehmen sind diese Zahlen daher vor allem ein konkreter Anlass, selbst nachzuprüfen, bei welchen Fragen zu ihrer Branche sie in ChatGPT auftauchen und wie verlässlich diese Antworten bei mehrfacher Abfrage ausfallen.
Gemessen
- ob ChatGPT auf eine offene Branchenfrage ein Unternehmen nennt, das der Weltmarktführer-Index diesem Markt zuordnet
- an welcher Stelle der Fünferliste es steht
- ob das Modell im Web gesucht hat und welche Quellen dabei vorkamen
Nicht gemessen
- Marktanteile oder Leistungsfähigkeit eines Unternehmens
- ob ChatGPT das Unternehmen für einen konkreten Einkauf empfehlen würde oder ob es zu bestimmten Anforderungen passt
- was ChatGPT über das Unternehmen sagt
- warum ein Unternehmen genannt wurde oder fehlte
Der methodische Aufbau im Detail
Als Referenz diente ein Export des Weltmarktführer-Index mit Stand vom 1. Oktober 2026. Er enthielt 479 Champions mit dem Ländereintrag Deutschland. Nach der dokumentierten Bereinigung (zwei Einträge mit widersprüchlicher Länderangabe, eine doppelt geführte Firma, zwei Einträge ohne Segment) blieben 474 Unternehmen. Bei 472 davon ließ sich das Marktsegment ohne Firmennamen als neutrale Frage formulieren, bei zwei war das nicht möglich, weil das Segment über einen unternehmenseigenen Begriff beschrieben ist. Alle 472 habe ich in die Untersuchung aufgenommen, es handelt sich also um eine echte Vollerhebung dieser definierten Grundgesamtheit. Die beiden übrigen Unternehmen habe ich zusätzlich mit ihrem ursprünglichen Segment abgefragt: Mit Websuche wurde eines von ihnen genannt, ohne Websuche keines.
479 Champions mit Ländereintrag Deutschland → 474 nach Bereinigung → 472 mit neutral formulierbarem Segment
Firmennamen, Marken, Produktbezeichnungen und redaktionelle Hinweise des Index wurden vorab nach festen Regeln aus den Segmentbeschreibungen gestrichen. Diese Streichungen haben Claude und ich unabhängig voneinander vorgenommen und anschließend abgeglichen. Bei neun der 488 Segmentteile (manche Unternehmen führt der Index mit mehreren Segmenten) kannte ich Claudes Entscheidung jedoch vorab, in den übrigen 479 stimmten wir vollständig überein. Die 27 Tippfehlerkorrekturen hat Claude vorgeschlagen, ich habe jede einzeln bestätigt. Vorangegangene Testläufe mit Schweizer und österreichischen Champions haben Messung und Auswertung vorbereitet und fließen nicht in das Ergebnis ein.
Die zentrale Abfrage lautete für jeden Fall:
Welche fünf Unternehmen gehören weltweit zu den führenden Anbietern im Marktsegment „[SEGMENT]“? Nenne genau fünf Unternehmen als nummerierte Liste. Verwende keine allgemeine Branchenbeschreibung und begründe die Auswahl nicht.
Jede Anfrage wurde als eigener Durchlauf gestartet, ohne vorherigen Chatverlauf. Gemessen habe ich am 4. Oktober 2026 mit dem Modell chat-latest über die OpenAI-Schnittstelle. Wie aus der OpenAI-Dokumentation zu Chat Latest hervorgeht, verweist diese Kennung auf das Instant-Modell, das ChatGPT aktuell verwendet, und dieses Modell wird regelmäßig aktualisiert. Die Ergebnisse beschreiben daher den Stand dieses Tages. Tauscht OpenAI das Modell hinter der Kennung aus, lässt sich das am zurückgemeldeten Modellnamen nicht ablesen. Ein Bruch innerhalb des Messlaufs ist allerdings nicht erkennbar: Im ersten Drittel der zufälligen Abfragereihenfolge nannte das Modell mit verfügbarer Websuche 124 von 158 Unternehmen, im zweiten 117 von 157 und im dritten 116 von 157.
Alle Unternehmen wurden sowohl mit als auch ohne verfügbare Websuche abgefragt. War die Websuche verfügbar, durfte das Modell höchstens einen Suchaufruf je Antwort ausführen, mit knappem Suchkontext und Deutschland als ungefährem Standort. Zusätzlich waren eine Alternativformulierung aus der Perspektive eines Einkäufers, die Wiederholungsmessung sowie der App-Vergleich von vornherein im Prüfplan festgeschrieben. Insgesamt habe ich am Messtag über die Schnittstelle 1.620 Anfragen gestellt. Alle haben eine auswertbare Antwort mit fünf Listeneinträgen geliefert, fehlende Fälle gibt es also keine. Die Einkäufer-Formulierung lautete:
Ich suche einen Lieferanten im Bereich „[SEGMENT]“. Welche fünf Hersteller oder Anbieter sind weltweit führend? Antworte nur mit einer nummerierten Liste von fünf Unternehmensnamen.
Mit der Einkäufer-Formulierung nannte das Modell ohne Websuche 353 von 472 Unternehmen, 2,5 Prozentpunkte mehr als mit der Hauptfrage (95-Prozent-Intervall: minus 0,2 bis 5,3 Prozentpunkte). Bei 100 vorab gezogenen Unternehmen mit verfügbarer Websuche waren es 78 statt 74 (plus 4,0 Prozentpunkte, 95-Prozent-Intervall: minus 3,1 bis 11,2 Prozentpunkte). Beide Unterschiede sind nach dem vorab festgelegten Kriterium nicht eindeutig. Da die Einkäufer-Variante zeitlich immer nach der Hauptfrage lief, ließe sich ein etwaiger Unterschied ohnehin nicht sauber auf die Formulierung oder den späteren Messzeitpunkt zurückführen.
Ob ein Unternehmen als genannt galt, hat ein automatischer, deterministischer Namensabgleich ermittelt, der bei gleicher Eingabe stets dasselbe Ergebnis liefert: Ein Skript glich jede Antwort mit einer zuvor belegten Tabelle zulässiger Unternehmensnamen ab. Antworten, die das Skript als Zweifelsfall markiert hatte, haben Claude und ich unabhängig voneinander begutachtet, ohne dass die Prüfliste verriet, unter welcher Bedingung sie entstanden waren. Vollständig verblindet war das allerdings nicht: Quellenlinks in einer Antwort können auf die Websuche hinweisen, und die 30 App-Antworten kannte ich bereits. Zusätzlich haben wir eine Kontrollstichprobe von 48 Antworten ohne Zweifelshinweis geprüft, ohne das Ergebnis des Skripts zu kennen: Der programmierte Abgleich stimmte in allen 48 Fällen mit der manuellen Prüfung überein. Erst nach Abschluss dieser Qualitätskontrolle wurden überhaupt Quoten berechnet, was Befehlsprotokoll und Sitzungsverlauf belegen.
Der rein automatische Abgleich ergab ebenfalls 357 Nennungen, die Entscheidungen der Prüfer haben das Hauptergebnis also nicht verändert. Zuletzt haben wir alle 115 Antworten, in denen ein Champion fehlte, noch einmal gezielt auf Lücken in der Namenstabelle überprüft. Dabei fiel ein Fall auf, in dem eine nicht erfasste Tochtergesellschaft des Unternehmens genannt war. Nach dem vorab festgelegten Plan bleibt das Hauptergebnis davon unberührt, mit diesem Fall wären es 358 von 472. Alle vorab festgelegten Varianten der Auswertung, etwa ohne Segmentbeschreibungen mit Aufzählungen oder mit den beiden ausgeschlossenen Unternehmen, lagen zwischen 73 und 76 Prozent.
Die ausgewiesenen Konfidenzintervalle bilden die zufällige Schwankung der Modellantworten näherungsweise ab. Einen Stichprobenfehler bei der Auswahl der Unternehmen beschreiben sie nicht, da die definierte Gruppe vollständig erfasst wurde. Für die Anteile kam das Wilson-Verfahren zum Einsatz, für Unterschiede zwischen zwei Bedingungen bei denselben Unternehmen das Verfahren nach Newcombe. Was diese Intervalle nicht abbilden können, sind Abweichungen durch andere Fragen, spätere Modellversionen oder unentdeckte Fehler in der Indexreferenz und im Namensabgleich.
Prüfplan und Auswertungsregeln vorab registriert
Um methodisch sauber zu arbeiten, habe ich den gesamten Versuchsaufbau am 4. Oktober 2026 noch vor dem ersten Messaufruf auf der Plattform Open Science Framework (OSF) präregistriert, also verbindlich und mit Zeitstempel festgelegt. Dort waren alle Fragen, Versuchsbedingungen, Kennzahlen, Berechnungsregeln und der Auswertungscode unveränderlich hinterlegt. Kryptografische Prüfsummen (eine Art digitaler Fingerabdruck jeder Datei) sicherten die verwendeten Eingabedateien ab. Fest stand dabei von Beginn an: Die Ergebnisse werden veröffentlicht, ganz egal, ob ChatGPT am Ende viele oder nur eine Handvoll der Weltmarktführer nennt.
4. Oktober 2026, 08:48 Uhr
Präregistrierung auf OSF
Fragen, Versuchsbedingungen, Kennzahlen, Berechnungsregeln und Auswertungscode stehen fest.
4. Oktober 2026, 11:31 bis 12:28 Uhr
Messung
1.620 Anfragen über die Schnittstelle in fünf Läufen, alle mit auswertbarer Antwort.
5. Oktober 2026, 05:26 Uhr
Erste Berechnung einer Quote
Erst nach der Prüfung der Zweifelsfälle und der Qualitätskontrolle.
Alle Uhrzeiten in mitteleuropäischer Sommerzeit.
Dieses Vorgehen ist mir deshalb so wichtig, weil man bei solchen Auswertungen im Nachhinein nur allzu leicht der Versuchung erliegt, irgendein auffälliges Nebenergebnis zur eigentlichen Hauptstory aufzubauschen. Die Hauptfrage dieser Untersuchung war von Anfang an der Anteil genannter Weltmarktführer bei verfügbarer Websuche. Alle Vergleiche und die Analyse der Suchquellen ordnen diesen Wert lediglich ein. Der vollständige Prüfplan sowie alle zur Einsicht freigegebenen Dokumente sind über den Eintrag zur OSF-Präregistrierung der Weltmarktführer-Studie öffentlich zugänglich.
Abweichungen vom Protokoll
Inhaltlich bin ich vom registrierten Protokoll nicht abgewichen. Drei Verfahrensdetails weichen formal ab und sind im Entscheidungsprotokoll begründet: Die abgeschotteten Prüfsitzungen von Claude erhielten zusätzlich Regeltexte, auf die die Entscheidungsregeln verweisen, aber keine Daten. Eine Abweichung zwischen den beiden Prüfern in der Kontrollstichprobe haben wir über einen eigenen Vergleich geklärt, bevor der registrierte Abgleich mit dem automatischen Ergebnis lief. Und in einer ersten Fassung der Datei, die diese Klärung festhält, stand eine falsche Erstellungszeit; sie ist archiviert, das Ergebnis war gleich.
Finanzierung, eigene Interessen und KI-Einsatz
Ich bin beruflich im Bereich der Suchmaschinen- und KI-Sichtbarkeit tätig und biete dazu Beratungsleistungen an. Diese Untersuchung habe ich vollständig aus eigener Tasche finanziert; die reinen API-Kosten beliefen sich auf rund 21 US-Dollar. Es gab weder einen Auftraggeber noch eine finanzielle Unterstützung oder Einflussnahme durch OpenAI, Anthropic oder die untersuchten Unternehmen. Prof. Dr. Christoph Müller hat die Daten des Index zur Verfügung gestellt und der Veröffentlichung zusammengefasster Ergebnisse zugestimmt. An Planung, Messung und Auswertung war er nicht beteiligt.
Bei Konzeption, Programmierung, Durchführung und Auswertung der Messung kamen KI-Werkzeuge zum Einsatz: bis zum 31. August 2026 OpenAI Codex, seit dem 1. Oktober 2026 Anthropic Claude. Claude war zudem erster Prüfer bei der Bereinigung der Marktsegmente und bei unklaren Namenszuordnungen, woraufhin ich die Fälle unabhängig zweitgeprüft habe. Vor dem Start der Messungen haben Claude Fable und OpenAI Codex das methodische Design gegengeprüft. Offenlegen will ich dabei, dass Codex vom selben Hersteller stammt wie das untersuchte Modell chat-latest. Diese Vorabprüfung bezog sich jedoch nur auf die Methode, Ergebnisse gab es zu diesem Zeitpunkt noch keine. Claude wiederum stammt von Anthropic, einem Wettbewerber von OpenAI, und hat Messung und Auswertung technisch ausgeführt. Ob ein Unternehmen genannt wurde, hat dabei aber in aller Regel der deterministische Namensabgleich festgestellt, und sein rein automatisches Ergebnis stimmt mit dem Hauptergebnis überein.
Offenlegung und Grenzen der Nachprüfbarkeit
Das Studienprotokoll, die angewendeten Regelwerke, der Auswertungscode und die Prüfsummen sind über OSF öffentlich zugänglich. Die Nutzungserlaubnis für die Indexdaten deckt die Veröffentlichung zusammengefasster Kennzahlen ab. Nicht Teil dieser Veröffentlichung sind dagegen die Daten des Index, die vollständige Namenstabelle und die Rohantworten des Modells.
- Studienprotokollöffentlich auf OSF
- Regelwerkeöffentlich auf OSF
- Auswertungscodeöffentlich auf OSF
- Prüfsummenöffentlich auf OSF
- Daten des Indexnicht veröffentlicht
- Vollständige Namenstabellenicht veröffentlicht
- Rohantworten des Modellsnicht veröffentlicht
Interessierte können das methodische Vorgehen und die Auswertungslogik somit von außen im Detail nachvollziehen, den Namensabgleich anhand der Rohdaten jedoch nicht vollständig selbst nachrechnen. Über die Prüfsummen lässt sich immerhin belegen, dass die registrierten Dateien nachträglich nicht verändert wurden; eine offene Einsicht in die Rohdaten ersetzen sie aber nicht.
Zitierweise und Kontakt
Zitierweise
Stolp, Patrick (2026): 357 von 472 untersuchten Weltmarktführern aus Deutschland erscheinen in ChatGPT-Anbieterlisten. Präregistrierte Vollerhebung, Messtag 4. Oktober 2026. patrickstolp.de/chatgpt-weltmarktfuehrer-studie/. Präregistrierung: https://doi.org/10.17605/OSF.IO/89WEU
Kontakt für Redaktionen und untersuchte Unternehmen: kontakt@patrickstolp.de
