Ergebnisse · Welle A
Empfiehlt ChatGPT Lübeck als Weihnachtsstadt des Nordens?
Lübeck nennt sich „Weihnachtsstadt des Nordens“. Doch empfiehlt ChatGPT die Stadt ebenfalls, wenn Reisende offen nach einem Weihnachtsmarkt in Norddeutschland fragen?
Für die erste Messung habe ich vier typische Reisefragen auf Deutsch, Dänisch, Schwedisch und Englisch gestellt. ChatGPT erhielt keine Liste möglicher Städte. In 145 von 160 Antworten empfahl das System Lübeck zuerst.
Patrick Stolp · SEO-Experte · Lübeck
Ergebnis der Hauptmessung
90,6 %
95-%-Wilson-Konfidenzintervall: 85,1 % bis 94,2 %, n = 160
In 145 von 160 Antworten empfahl ChatGPT Lübeck zuerst. Bremen folgte mit elf Erstempfehlungen. Der Abstand blieb auch unter Berücksichtigung der statistischen Unsicherheit eindeutig.
- Wellen 5 von 5 abgeschlossen
- Gültige Antworten 240 von 240
- Erhoben bis 2026-08-19
- Nächste Aktualisierung nach Welle B, voraussichtlich Anfang Dezember 2026
Abschnitt 01
Kurzfassung
Wellen 5 von 5 · Sprachen 4 · Antworten 240 von 240
Empfiehlt ChatGPT Lübeck, wenn Reisende offen nach einem Weihnachtsmarkt in Norddeutschland fragen? In 145 von 160 Antworten der Hauptmessung stand Lübeck an erster Stelle. Bremen folgte mit elf Erstempfehlungen, Hamburg mit drei und Celle mit einer.
Besonders deutlich fiel das Ergebnis bei den Fragen auf Dänisch aus Kopenhagen und auf Schwedisch aus Malmö aus. Hier lag Lübeck in allen 80 Antworten vorn. Bei den deutschen Fragen aus Köln waren es 28 von 40 Antworten.
Auch die verwendeten Quellen zeigen ein klares Lübecker Muster. ChatGPT nutzte in allen 240 Antworten die Websuche und zitierte luebeck-tourismus.de in 162 Fällen häufiger als jede andere Domain.
Alle 240 geplanten Antworten wurden zwischen dem 15. und 19. August erhoben. Ende November wird dieselbe Messung während der geöffneten Weihnachtsmärkte wiederholt.
Studien-Steckbrief
- Typ
- Eigenständige Erhebung, nicht peer-reviewed
- Fassung
- 1.1 (Ergebnisse Welle A), 2026-08-30
- Erhebung
- Welle A: 2026-08-15 bis 2026-08-19, fünf Wellen an fünf Tagen. Nachmessung in der Adventssaison geplant.
- System
- OpenAI Responses API, gpt-5.6-luna mit Websuche, Herkunftsorte Köln, Kopenhagen, Malmö und London
- Vorab festgelegt
- Sechs Szenarien in vier Sprachen und die Auswertungsregeln vor Welle 1 eingefroren
- Interessenkonflikt
- Die Erhebung ist eigenfinanziert und entstand ohne Auftrag, Beteiligung oder Vorabkenntnis der genannten Organisationen.
- Nachnutzung
- Nachnutzung mit Quellenangabe und Wellennummer erwünscht
Alle 240 geplanten Antworten der Welle A liegen vor.
Zitiervorschlag
Stolp, Patrick (2026): Empfiehlt ChatGPT Lübeck als Weihnachtsstadt des Nordens? Ergebnisse der Welle A. patrickstolp.de/ki-weihnachtsstadt-luebeck/, Stand 2026-08-30.
Abschnitt 02
Lübeck liegt mit großem Abstand vorn
Hauptmessung n = 160 · Kontrollen n = 80 · Erhebung an fünf Tagen
90,6 %
95-%-Wilson-Konfidenzintervall: 85,1 % bis 94,2 %, n = 160
In 145 der 160 Antworten aus den vier Hauptszenarien empfiehlt ChatGPT Lübeck als erstes Ziel.
In jeder Kombination aus vier Reisefragen und vier Sprachfassungen stellte ich dieselbe Frage zehnmal. Alle 160 Antworten flossen mit demselben Gewicht in die Auswertung ein. Lübeck lag in 145 Fällen vorn. Bremen folgte elfmal, Hamburg dreimal und Celle einmal.
Erstempfehlung nach Stadt · Hauptmessung, n = 160 · Striche: 95-%-Intervall
Lübeck
90,6 %[85,1 bis 94,2]
Bremen
6,9 %[3,9 bis 11,9]
Hamburg
1,9 %[0,6 bis 5,4]
Celle
0,6 %[0,1 bis 3,5]
Rostock
0,0 %[0,0 bis 2,3]
| Stadt | Erstempfehlung | Als Ziel empfohlen |
|---|---|---|
| Lübeck | 90,6 % [85,1 % bis 94,2 %] | 95,6 % [91,2 % bis 97,9 %] |
| Bremen | 6,9 % [3,9 % bis 11,9 %] | 63,1 % [55,4 % bis 70,2 %] |
| Hamburg | 1,9 % [0,6 % bis 5,4 %] | 74,4 % [67,1 % bis 80,5 %] |
| Celle | 0,6 % [0,1 % bis 3,5 %] | 20,0 % [14,5 % bis 26,9 %] |
| Rostock | 0,0 % [0,0 % bis 2,3 %] | 31,9 % [25,2 % bis 39,4 %] |
Tabelle 1: Die fünf Städte mit den höchsten Erstempfehlungs- oder Empfehlungsquoten in der Hauptmessung S1 bis S4. Herkunftsorte, die lediglich als Ausgangspunkt einer Reise genannt wurden, sind nicht aufgeführt.
Hamburg wird demnach in fast drei Vierteln der Antworten als mögliches Ziel empfohlen, steht allerdings nur dreimal an erster Stelle. Rostock erscheint in knapp einem Drittel der Antworten als Empfehlung und erhält keine Erstempfehlung.
Aus Köln empfiehlt ChatGPT Lübeck seltener
Bei den deutschen Fragen war Köln als Ausgangsort angegeben. Die dänischen Fragen wurden mit Kopenhagen, die schwedischen mit Malmö und die englischen mit London verbunden.
Deutsch
aus Köln
70,0 %
[54,6 bis 81,9]
Dänisch
aus Kopenhagen
100,0 %
[91,2 bis 100,0]
Schwedisch
aus Malmö
100,0 %
[91,2 bis 100,0]
Englisch
aus London
92,5 %
[80,1 bis 97,4]
| Sprachfassung | Herkunftsort | Erstempfehlung Lübeck |
|---|---|---|
| Deutsch | Köln | 70,0 % [54,6 % bis 81,9 %] |
| Dänisch | Kopenhagen | 100,0 % [91,2 % bis 100,0 %] |
| Schwedisch | Malmö | 100,0 % [91,2 % bis 100,0 %] |
| Englisch | London | 92,5 % [80,1 % bis 97,4 %] |
Tabelle 2: Erstempfehlungsquote Lübecks nach Sprachfassung und festgelegtem Herkunftsort, jeweils n = 40.
Das Intervall der deutschen Bedingung überschneidet sich nicht mit den Intervallen der dänischen und schwedischen Bedingung. Dieser Unterschied ist damit anhand der berechneten Intervalle gestützt. Sprache und Herkunftsort wurden jedoch nicht unabhängig voneinander variiert. Aus der Messung lässt sich deswegen nicht bestimmen, ob die Sprache, der Herkunftsort oder ihr Zusammenspiel für den Unterschied verantwortlich ist.
Bei der Frage nach ganz Deutschland liegt Lübeck nicht vorn
Die Kontrollfrage K1 erweitert den Zielraum von Norddeutschland auf ganz Deutschland. Unter der deutschen Bedingung wird Lübeck in 0,0 % [0,0 % bis 27,8 %] und unter der englischen Bedingung ebenfalls in 0,0 % [0,0 % bis 27,8 %] der jeweils zehn Antworten zuerst empfohlen. Unter der dänischen Bedingung erreicht Lübeck 80,0 % [49,0 % bis 94,3 %], unter der schwedischen 90,0 % [59,6 % bis 98,2 %].
Ein gemeinsamer Wert über alle vier K1-Zellen würde Fragen aus Deutschland und aus dem Ausland vermischen. Er wird deshalb nicht als Gesamtergebnis berichtet. Für die deutsche bzw. englische Frage nach einem Weihnachtsmarkt in ganz Deutschland liegen andere Städte vorn.
luebeck-tourismus.de ist die meistzitierte Domain
In allen 240 Antworten nutzte ChatGPT die Websuche. Insgesamt wurden 266 Suchvorgänge ausgelöst. Die Domain luebeck-tourismus.de erschien in 162 Antworten, was 67,5 % [61,3 % bis 73,1 %] entspricht. visit-luebeck.com wurde in 72 Antworten bzw. 30,0 % [24,6 % bis 36,1 %] zitiert.
Zitierquote in den 240 Antworten
Für die touristische Kommunikation Lübecks ist diese Quellenverteilung relevant. Die offizielle Tourismusseite erschien in zwei Dritteln der Antworten auf Fragen, wie sie potentielle Gäste bei der Reiseplanung stellen könnten. Aus den Zitierquoten lässt sich allerdings nicht ableiten, dass eine einzelne Quelle die Erstempfehlung verursacht hat.
ChatGPT nennt mehr als den eigentlichen Weihnachtsmarkt
Die Direktfrage „Lohnt sich der Lübecker Weihnachtsmarkt?“ beantwortete ChatGPT in allen 40 Fällen positiv. In den Begründungen erschienen regelmäßig die historische Altstadt, mehrere Weihnachtsmärkte, Marzipan, Backsteingotik und kurze Wege. Die Antworten beschrieben damit, was Besucher während eines Adventswochenendes in Lübeck miteinander verbinden können.
Die Erstempfehlung wurde zusätzlich von Hand geprüft
Für 24 der 240 Antworten wurde vor der Einsicht in die automatische Auswertung jeweils eine Antwort aus jeder Szenario-Sprach-Kombination von Hand codiert. In allen 24 Fällen stimmte die automatisch bestimmte Erstempfehlung mit der Handcodierung überein.
Bei sekundären Ortsnennungen traten dagegen Abweichungen auf. Hierzu gehörten vor allem Herkunfts- und Transitorte, die der Extraktor im Antworttext erkannte, obwohl sie kein empfohlenes Reiseziel waren. Diese Orte werden in den veröffentlichten Städtetabellen nicht als Empfehlung behandelt.
Abschnitt 03
Wie der Titel geprüft wurde
Bezeichnung von Lübeck Management e.V. · konkurrierende Städte aus den Antworten · Belege archiviert am 15.08.2026
Lübeck Management e.V. verwendet seit Jahren die Bezeichnung „Lübeck. Weihnachtsstadt des Nordens“. Dieser Marketinganspruch bildet den Ausgangspunkt der Erhebung.
Auch andere norddeutsche Städte werben mit Superlativen rund um ihre Weihnachtsmärkte. Rostock bezeichnet seinen Weihnachtsmarkt beispielsweise als den größten Norddeutschlands. Inhaltlich ist das allerdings kein unmittelbarer Gegenanspruch zur „Weihnachtsstadt des Nordens“. Für die Messung wird Rostock deswegen auch nicht als festgelegter Konkurrent behandelt. Welche Städte mit Lübeck konkurrieren, ergibt sich ausschließlich aus den Antworten von ChatGPT.
Archivkopien der verwendeten Belege liegen seit dem 15.08.2026 in den Studienunterlagen.
Vor Beginn der Erhebung stand fest, was die Messung zeigen musste. Lübeck sollte häufiger als jede andere Stadt zuerst empfohlen werden. Außerdem sollte der statistische Unsicherheitsbereich Lübecks vollständig oberhalb des Zweitplatzierten liegen. Beide Bedingungen wurden in Welle A erfüllt. Dafür werden ausschließlich die vier Hauptszenarien verwendet. Die beiden Kontrollfragen gehen nicht in diese Einstufung ein.
| Stufe | Bedingung |
|---|---|
| Klar bestätigt | Lübeck hat die höchste Erstempfehlungsquote der Hauptmessung, und die Untergrenze seines Konfidenzintervalls liegt über der Obergrenze des Zweitplatzierten. |
| Bestätigt mit Vorbehalt | Lübeck hat die höchste Erstempfehlungsquote, die Konfidenzintervalle überschneiden sich jedoch. |
| Nicht bestätigt | Eine andere Stadt liegt vorn. |
Tabelle 3: Die dreistufige Auswertungsregel wurde vor Beginn der Erhebung festgelegt und eingefroren.
Was die Konfidenzintervalle zeigen
Alle Erstempfehlungsquoten werden mit 95-%-Wilson-Konfidenzintervallen ausgewiesen. Diese Bereiche machen sichtbar, wie groß die statistische Unsicherheit der gemessenen Anteile ist.
Dabei ist allerdings zu berücksichtigen, dass innerhalb derselben Szenario-Sprach-Kombination mehrere Antworten erhoben werden. Die Einzelantworten sind daher nicht ohne Weiteres mit einer vollständig unabhängigen Zufallsstichprobe gleichzusetzen. Die Wilson-Intervalle werden aus diesem Grund zusammen mit dem Untersuchungsdesign interpretiert und nicht als alleiniger Nachweis eines Unterschieds verstanden.
In Welle A sind die beiden Bereiche weit voneinander entfernt. Die Untergrenze für Lübeck liegt bei 85,1 %, die Obergrenze für Bremen bei 11,9 %. Damit ist die vorab festgelegte höchste Stufe erreicht.
Abschnitt 04
Die 24 Fragen im Wortlaut
Szenarien 6 · Sprachen 4 · Wiederholungen 10 je Kombination
Die Erhebung besteht aus sechs Szenarien. Vier gehören zur Hauptmessung und zwei dienen als Kontrolle. Jedes Szenario wird auf Deutsch, Dänisch, Schwedisch und Englisch abgefragt.
Bei der Formulierung der fremdsprachigen Varianten wurden reale Suchformulierungen aus den jeweiligen Märkten berücksichtigt. Als zusätzliche Grundlage dienten die Vervollständigungsvorschläge der Google-Suche vom 15.08.2026. Eine muttersprachliche Prüfung der dänischen und schwedischen Fassungen war allerdings nicht verfügbar. Diese Einschränkung gilt insbesondere dann, wenn später Unterschiede zwischen den Sprachversionen betrachtet werden.
| Szenario | Deutsch (Köln) | Dänisch (Kopenhagen) | Schwedisch (Malmö) | Englisch (London) |
|---|---|---|---|---|
| S1 · Offene Empfehlung | Welchen Weihnachtsmarkt in Norddeutschland lohnt es sich dieses Jahr zu besuchen? | Hvilket julemarked i Nordtyskland er værd at besøge i år? | Vilken julmarknad i norra Tyskland är värd att besöka i år? | Which Christmas market in northern Germany is worth visiting this year? |
| S2 · Wochenendreise | Plane mir ein Wochenende mit Weihnachtsmarkt-Besuch in Norddeutschland, mit einer Übernachtung. | Planlæg en weekendtur til et julemarked i Nordtyskland for mig, med én overnatning. | Planera en helgresa till en julmarknad i norra Tyskland åt mig, med en övernattning. | Plan a weekend trip to a Christmas market in northern Germany for me, with one overnight stay. |
| S3 · Familie | Wir möchten mit zwei Kindern (5 und 9) einen Weihnachtsmarkt in Norddeutschland besuchen. Welche Stadt eignet sich? | Vi vil gerne besøge et julemarked i Nordtyskland med to børn (5 og 9 år). Hvilken by er bedst? | Vi vill besöka en julmarknad i norra Tyskland med två barn (5 och 9 år). Vilken stad passar bäst? | We’d like to visit a Christmas market in northern Germany with two kids (5 and 9). Which city is best? |
| S4 · Superlativ | Was ist der schönste Weihnachtsmarkt in Norddeutschland? | Hvad er det bedste julemarked i Nordtyskland? | Vilken är den bästa julmarknaden i norra Tyskland? | What is the best Christmas market in northern Germany? |
| K1 · Nationaler Anker | Welchen Weihnachtsmarkt in Deutschland lohnt es sich dieses Jahr zu besuchen? | Hvilket julemarked i Tyskland er værd at besøge i år? | Vilken julmarknad i Tyskland är värd att besöka i år? | Which Christmas market in Germany is worth visiting this year? |
| K2 · Direktfrage Lübeck | Lohnt sich der Lübecker Weihnachtsmarkt? | Er julemarkedet i Lübeck et besøg værd? | Är julmarknaden i Lübeck värd ett besök? | Is the Lübeck Christmas market worth a visit? |
Tabelle 4: Alle 24 Wortlaute, wie sie über die OpenAI Responses API an GPT-5.6 Luna gingen. Jede Zelle wurde zehnmal abgefragt, verteilt über fünf Erhebungstage.
Die beiden Kontrollfragen werden getrennt von der Hauptmessung ausgewertet.
K1 erweitert die Frage von Norddeutschland auf ganz Deutschland. Damit lässt sich einordnen, ob Lübeck auch dann genannt wird, wenn ChatGPT aus einem wesentlich größeren Feld deutscher Weihnachtsmärkte auswählen kann. Die Antworten gehen nicht in die Erstempfehlungsquote der Hauptmessung ein.
K2 fragt direkt nach dem Lübecker Weihnachtsmarkt und kann deswegen ebenfalls nicht für einen Städtevergleich verwendet werden. Hier werden stattdessen die Gründe erfasst, mit denen ChatGPT eine Reise nach Lübeck empfiehlt oder davon abrät. Dazu können beispielsweise die Altstadt, Marzipan oder einzelne Weihnachtsmärkte gehören.
Abschnitt 05
So wird gemessen
Modell gpt-5.6-luna · Websuche an, Standort je Sprache · Eigener Systemprompt keiner
Übergreifende Methodik
Die Methodik des Lübecker KI-Monitors beschreibt die wiederkehrenden Grundsätze meiner Erhebungen, darunter API-Messung, Wiederholungen, Codierung, statistische Auswertung und Reproduzierbarkeit. Maßgeblich für die Durchführung dieser Untersuchung bleibt das hier dokumentierte Studienprotokoll, da die übergreifende Methodikseite erst am 21.08.2026 in Fassung 1.0 veröffentlicht wurde.
Warum wird nur ChatGPT untersucht?
Diese Erhebung untersucht bewusst ein einzelnes KI-System. Ein Vergleich zwischen ChatGPT, Gemini und weiteren Systemen würde eine zusätzliche Forschungsfrage eröffnen und die Zahl der notwendigen Abfragen erheblich erhöhen.
Die Ergebnisse gelten deswegen ausschließlich für das verwendete ChatGPT-Modell unter den dokumentierten Messbedingungen. Sie erlauben keine Aussage darüber, wie andere KI-Systeme dieselben Fragen beantworten würden.
Warum wird gpt-5.6-luna verwendet?
Die Messung soll eine typische private Reiseplanung über ChatGPT annähern. Verwendet wird deshalb gpt-5.6-luna mit aktivierter Websuche. Ein eigener Systemprompt oder eine Formatvorgabe werden nicht gesetzt.
Über die API lässt sich die öffentliche ChatGPT-Anwendung allerdings nicht vollständig reproduzieren. Unter anderem fehlen die dort verwendete Produktkonfiguration und mögliche Personalisierungen. Diese Einschränkung gilt für alle Ergebnisse der Erhebung.
Warum Köln, Kopenhagen, Malmö und London?
Für jede Sprache wurde vor Beginn der Erhebung ein Herkunftsort festgelegt. Köln steht für die deutsche, Kopenhagen für die dänische, Malmö für die schwedische und London für die englische Sprachfassung.
Die Orte liegen außerhalb des abgefragten Zielraums Norddeutschland. Dadurch wird vermieden, dass der gesetzte Standort selbst als naheliegendes Reiseziel innerhalb der untersuchten Region erscheint.
Warum zehn Wiederholungen an fünf Tagen?
Generative Sprachmodelle erzeugen ihre Antworten probabilistisch. Auch bei identischer Eingabe kann deshalb eine andere Stadt empfohlen oder die Reihenfolge der Vorschläge verändert werden.
Eine einzelne Antwort eignet sich damit nicht als Grundlage für eine Empfehlungsquote. Jede der 24 Kombinationen aus Szenario und Sprache wurde deswegen zehnmal abgefragt. Die Wiederholungen verteilen sich auf fünf Erhebungstage, sodass auch Schwankungen zwischen den Tagen sichtbar bleiben.
Wie werden aus den Antworten Daten?
ChatGPT antwortet als Fließtext. Für die quantitative Auswertung müssen daraus die genannten Städte, ihre Reihenfolge und die Art der Empfehlung bestimmt werden.
Dafür durchlaufen die Antworten einen zweiten, vom eigentlichen Messlauf getrennten Verarbeitungsschritt ohne Websuche. Der Extraktor ordnet die Textstellen anhand der vorab definierten Kategorien und speichert zu jeder Zuordnung ein wörtliches Zitat aus der ursprünglichen Antwort. Dadurch kann später nachvollzogen werden, weshalb eine Stadt auf eine bestimmte Weise codiert wurde.
Anschließend werden Schreibvarianten und einzelne Märkte auf Stadtebene zusammengeführt. Stadtteile werden der jeweiligen Stadt zugerechnet, Travemünde also beispielsweise Lübeck.
Für 10 Prozent der Antworten wurde die automatische Codierung zusätzlich blind von Hand geprüft. Die für das Hauptergebnis maßgebliche Erstempfehlung stimmte in allen 24 geprüften Antworten überein. Bei sekundären Ortsnennungen wurden dagegen Abweichungen festgestellt und vor der Veröffentlichung eingeordnet.
Szenarien und Messskripte wurden vorab eingefroren
Die sechs Szenarien, das Messskript und das Extraktionsskript standen vor Beginn der ersten Messwelle fest. Für alle drei Dateien wurden SHA-256-Prüfsummen gespeichert.
Mit diesen Prüfsummen lässt sich erkennen, ob eine der eingefrorenen Dateien später verändert wurde. Für notwendige Ergänzungen wurde ebenfalls vorab eine Regel festgelegt. Ergänzungen dürfen vorgenommen werden, wenn Datum und Grund dokumentiert werden. Die eingefrorenen Inhalte selbst werden nicht gestrichen oder umformuliert.
Von dieser Ergänzungsregel wurde am 17.08.2026 erstmals Gebrauch gemacht. Der entsprechende Eintrag steht im Erhebungstagebuch.
| Eingefrorene Datei | SHA-256-Prüfsumme |
|---|---|
| szenarien.json | 91DF24A17AA7F3A44D83196BC99243FEAF52FE221DE0571E47CAF8A7360B0172 |
| weihnachts-messung.mjs | 30DAF4C0429B68BA66DA8A284D694A1B75D8E343963BFD483357459FF13514FA |
| ziel-extraktion.mjs | E622A770E96369C381A21557785B23EA34B68CC6E8AC661C46219F58602B4EF1 |
Tabelle 5: Die drei eingefrorenen Dateien mit ihren Prüfsummen vom 15.08.2026. Sie werden der Veröffentlichung beigelegt.
Abschnitt 06
Grenzen der Aussagekraft
Die Erhebung bewertet keine Weihnachtsmärkte. Aus einer hohen Erstempfehlungsquote lässt sich weder ableiten, dass ein Markt objektiv schöner ist, noch dass Programm, Atmosphäre oder gastronomisches Angebot besser sind. Gemessen wird ausschließlich, welche Städte ChatGPT auf die untersuchten Fragen empfiehlt.
Die ergänzend geplante Prüfung vor Ort entfällt für Welle A. Sie sollte den Kontext erweitern, war jedoch kein Teil der ChatGPT-Messung. Die 240 Antworten und ihre Auswertung verändern sich dadurch nicht. Zur tatsächlichen Qualität der Weihnachtsmärkte macht diese Studie keine Aussage.
Alle Antworten wurden über die OpenAI-API erhoben. Die API-Konfiguration entspricht der öffentlichen ChatGPT-Anwendung nicht vollständig. Die Ergebnisse beschreiben deshalb das Verhalten des verwendeten Modells unter den dokumentierten Messbedingungen und lassen sich nicht wortgleich auf jede Nutzung von ChatGPT übertragen.
Die erste Messung fand außerdem im August und damit mehrere Monate vor Beginn der Weihnachtsmärkte statt. Zu diesem Zeitpunkt können Informationen zur Saison 2026 noch unvollständig sein oder ältere Angaben weiterhin im Web stehen. Ob und in welchem Umfang dies auch die Auswahl der empfohlenen Städte beeinflusst, lässt sich aus der Augustmessung allein nicht bestimmen. Deswegen wird dieselbe Messung Ende November während der laufenden Adventssaison wiederholt.
Für jede Sprach- und Herkunftsbedingung stehen in der Hauptmessung 40 Antworten zur Verfügung. Unterschiede werden daher vorsichtig interpretiert. Da jede Sprache an einen Herkunftsort gekoppelt ist, lassen sich Sprach- und Standorteffekte nicht voneinander trennen. Hinzu kommt, dass die dänischen und schwedischen Prompts nicht von Muttersprachlern geprüft wurden.
Auch die wiederholten Abfragen innerhalb derselben Szenario-Sprach-Kombination sind bei der statistischen Interpretation zu berücksichtigen. Die 160 Antworten der Hauptmessung bilden keine einfache Zufallsstichprobe aus 160 vollständig unabhängigen Beobachtungen.
Ausgewertet werden Städte, weil sie die Untersuchungseinheiten der Studie sind. Einzelne Buden, Cafés, Hotels oder andere Betriebe, die ChatGPT innerhalb einer Antwort erwähnt, werden dagegen nicht bewertet oder öffentlich als Negativbeispiele herausgestellt.
Schließlich gelten sämtliche Ergebnisse für das untersuchte Modell und den dokumentierten Erhebungszeitraum. Aus ihnen folgt keine allgemeine Aussage über alle Antworten von ChatGPT oder über OpenAI als Unternehmen.
Abschnitt 07
Erhebungstagebuch
Einträge 5 · Neuester 2026-08-30
Dieses Protokoll dokumentiert die Messungen und Änderungen während der Erhebung. Der neueste Eintrag steht oben.
-
2026-08-30 · Auswertung und Handcodierung abgeschlossen
Ergebnisse der Welle A veröffentlicht
Die Auswertung nach den vorab festgelegten Regeln ergibt für Lübeck eine Erstempfehlungsquote von 90,6 % [85,1 % bis 94,2 %]. Bremen folgt mit 6,9 % [3,9 % bis 11,9 %]. Der statistische Unsicherheitsbereich Lübecks liegt vollständig über dem Bremer Bereich. Damit ist die höchste Stufe der Auswertungsregel erreicht.
In der blind handcodierten Stichprobe stimmte die Erstempfehlung in allen 24 Antworten mit der automatischen Extraktion überein. Bei sekundären Ortsnennungen wurden vor allem Herkunfts- und Transitorte zusätzlich erkannt.
Durch die Handcodierung fiel außerdem auf, dass der Name „Rathausmarkt“ in der Normalisierung pauschal Hamburg zugeordnet war, obwohl er in mehreren Antworten den Lübecker Rathausmarkt bezeichnete. Die globale Zuordnung wurde entfernt und die Auswertung neu gerechnet. Die Erstempfehlungsquoten und die Einstufung des Anspruchs blieben unverändert.
-
2026-08-19 · Welle 5 abgeschlossen, 240 von 240 Antworten gültig
Erhebung der Welle A abgeschlossen
Mit der fünften Welle ist die erste Messung vollständig. Alle 240 geplanten Abfragen haben eine gültige Antwort geliefert.
In jeder dieser Antworten wurde die Websuche mindestens einmal verwendet. Insgesamt wurden dabei 266 Suchvorgänge ausgelöst. Damit steht fest, dass sämtliche gemessenen Antworten unter Einbezug der Websuche entstanden sind. Daraus lässt sich allerdings nicht ableiten, welchen Anteil abgerufene Quellen und internes Modellwissen jeweils an der erzeugten Antwort hatten.
Die reine API-Erhebung hat 3,23 Euro gekostet.
Nach Abschluss der Erhebung wurden die Antworten nach den vorab festgelegten Regeln in einzelne Städte, ihre Reihenfolge und die Art der Empfehlung zerlegt. Für 10 Prozent der Antworten wurde anschließend geprüft, wie häufig die automatische Codierung mit einer manuellen Zuordnung übereinstimmt.
Zusätzlich wurde ausgewertet, welche Quellen bzw. Domains in den Antworten verwendet oder zitiert werden.
-
2026-08-17 · Ergänzung nach der Änderungsregel, Prüfsummen erneut bestätigt
Vorprüfung der Wellenzählung ergänzt
Seit dem 17.08.2026 prüft ein zusätzlicher Schritt vor jedem Messlauf, ob bereits angelegte Wellenordner tatsächlich Antworten enthalten.
Der Grund dafür ist technisch: Bricht ein Lauf vor der ersten gespeicherten Antwort ab, könnte ein leerer Ordner bei der automatischen Zählung trotzdem als abgeschlossene Welle erkannt werden. Die Erhebung hätte dadurch vorzeitig enden können.
Die drei vor Beginn der Erhebung eingefrorenen Dateien wurden dafür nicht verändert. Ihre SHA-256-Prüfsummen wurden nach der Ergänzung erneut geprüft und stimmen weiterhin mit den am 15.08.2026 gespeicherten Werten überein.
-
2026-08-15 · Kalibrierung bestanden, Präregistrierung eingefroren, Welle 1 erhoben
Erhebung gestartet
Vor der ersten Messwelle lief ein Kalibrierungstest mit 24 Abfragen, also einer Abfrage je Kombination aus Szenario und Sprache.
Geprüft wurde unter anderem, ob ChatGPT in der vorgesehenen Sprache antwortet und den jeweils gesetzten Herkunftsort verarbeitet. Die dänischen Antworten erschienen auf Dänisch, die schwedischen auf Schwedisch und einzelne Antworten nahmen ausdrücklich Bezug auf den gesetzten Standort, beispielsweise mit „från Malmö“.
Der Kalibrierlauf kostete 0,31 Euro. Anschließend wurden Szenarien, Messskript und Extraktionsskript mit ihren SHA-256-Prüfsummen eingefroren. Noch am selben Tag folgte die erste reguläre Welle mit 48 von 48 gültigen Antworten.
-
2026-08-15 · vor dem Einfrieren
Prüfung von Terminen aus dem Design gestrichen
In einer frühen Fassung sollte zusätzlich geprüft werden, ob ChatGPT für die Weihnachtsmärkte korrekte Termine nennt.
Parallel läuft allerdings bereits eine eigene Untersuchung, in der ich die Faktentreue von ChatGPT bei Lübecker Reiseplänen prüfe. Um diese beiden Fragestellungen getrennt zu halten, wurde die Terminprüfung noch vor dem Einfrieren aus dem Design entfernt.
Die Weihnachtsstadt-Erhebung konzentriert sich damit auf die Auswahl und Reihenfolge der empfohlenen Städte sowie auf die Begründungen der Empfehlungen.
Kontakt und Nachnutzung
Rückfragen zur Methodik beantworte ich gern.
Die Erhebung ist eigenfinanziert und entstand ohne Auftrag, Beteiligung oder Vorabkenntnis von Lübeck Management e.V., der Lübeck und Travemünde Marketing GmbH, der Hansestadt Lübeck oder anderen genannten Organisationen.
© 2026 Patrick Stolp
