Erhebung abgeschlossen · Auswertung läuft

Empfiehlt ChatGPT Lübeck als Weihnachtsstadt des Nordens?

Lübeck Management e.V. verwendet für Lübeck seit Jahren die Bezeichnung „Weihnachtsstadt des Nordens“. In dieser Erhebung prüfe ich, ob sich dieser Marketinganspruch auch in offenen Empfehlungen von ChatGPT wiederfindet.

Dafür frage ich auf Deutsch, Dänisch, Schwedisch und Englisch nach einem Weihnachtsmarkt in Norddeutschland. ChatGPT erhält keine Liste möglicher Städte. Ausgewertet wird, welche Städte das System selbst nennt und welche es zuerst oder ausdrücklich als Favoriten empfiehlt.

Die erste Messung ist abgeschlossen. Alle 240 geplanten Antworten liegen vor und werden derzeit nach den vorab festgelegten Regeln ausgewertet.

Patrick Stolp · SEO-Experte · Lübeck

Typ
Eigenständige Erhebung, nicht peer-reviewed
Fassung
0.1 (Erhebung Welle A vollständig), 2026-08-19
Erhebung
Welle A: 2026-08-15 bis 2026-08-19, fünf Wellen an fünf Tagen. Nachmessung in der Adventssaison geplant.
System
ChatGPT, gpt-5.6-luna mit Websuche, Herkunftsorte Köln, Kopenhagen, Malmö und London
Vorab festgelegt
Sechs Szenarien in vier Sprachen und die Auswertungsregeln vor Welle 1 eingefroren
Interessenkonflikt
Die Erhebung ist eigenfinanziert und entstand ohne Auftrag, Beteiligung oder Vorabkenntnis der genannten Organisationen.
Nachnutzung
Nachnutzung mit Quellenangabe und Wellennummer erwünscht
Wellen
5 von 5 abgeschlossen
Gültige Antworten
240 von 240
Erhoben bis
2026-08-19
Nächste Aktualisierung
mit den ersten Auswertungsergebnissen, voraussichtlich Anfang September 2026

Alle 240 geplanten Antworten der Welle A liegen vor.

Stolp, Patrick (2026): Empfiehlt ChatGPT Lübeck als Weihnachtsstadt des Nordens? Laufende Erhebung. patrickstolp.de/ki-weihnachtsstadt-luebeck/, Welle A, Stand 2026-08-19.

Kurzfassung

Die Erhebung prüft, wie häufig ChatGPT Lübeck zuerst empfiehlt, wenn offen nach einem Weihnachtsmarkt in Norddeutschland gefragt wird. Zielgröße ist die Erstempfehlungsquote. Sie gibt den Anteil der Antworten an, in denen Lübeck ausdrücklich als Favorit oder, wenn eine solche Markierung fehlt, als erstes empfohlenes Ziel erscheint.

Die vier Hauptszenarien werden auf Deutsch, Dänisch, Schwedisch und Englisch abgefragt. Für jede Sprachfassung ist ein Herkunftsort gesetzt: Köln, Kopenhagen, Malmö und London. Hinzu kommen zwei Kontrollfragen, die getrennt von der Hauptmessung ausgewertet werden.

Alle 240 geplanten Antworten wurden zwischen dem 15. und 19. August erhoben. Die Auswertung erfolgt nach den vor Beginn der Messung festgelegten Regeln. Ende November wird dieselbe Messung in der laufenden Adventssaison wiederholt.

240gültige Antworten, alle mit aktivierter Websuche
4Sprachen mit jeweils festgelegtem Herkunftsort
6vorab eingefrorene Szenarien, davon zwei Kontrollfragen
5Erhebungstage, damit Schwankungen zwischen den Antworten in die Messung eingehen

Der geprüfte Anspruch

Lübeck Management e.V. verwendet seit Jahren die Bezeichnung „Lübeck. Weihnachtsstadt des Nordens“. Dieser Marketinganspruch bildet den Ausgangspunkt der Erhebung.

Auch andere norddeutsche Städte werben mit Superlativen rund um ihre Weihnachtsmärkte. Rostock bezeichnet seinen Weihnachtsmarkt beispielsweise als den größten Norddeutschlands. Inhaltlich ist das allerdings kein unmittelbarer Gegenanspruch zur „Weihnachtsstadt des Nordens“. Für die Messung wird Rostock deswegen auch nicht als festgelegter Konkurrent behandelt. Welche Städte mit Lübeck konkurrieren, ergibt sich ausschließlich aus den Antworten von ChatGPT.

Archivkopien der verwendeten Belege liegen seit dem 15.08.2026 in den Studienunterlagen.

Vor Beginn der Erhebung habe ich außerdem festgelegt, unter welchen Bedingungen der untersuchte Anspruch innerhalb dieser Messung als bestätigt gilt. Dafür werden ausschließlich die vier Hauptszenarien verwendet. Die beiden Kontrollfragen gehen nicht in diese Einstufung ein.

StufeBedingung
Klar bestätigtLübeck hat die höchste Erstempfehlungsquote der Hauptmessung, und die Untergrenze seines Konfidenzintervalls liegt über der Obergrenze des Zweitplatzierten.
Bestätigt mit VorbehaltLübeck hat die höchste Erstempfehlungsquote, die Konfidenzintervalle überschneiden sich jedoch.
Nicht bestätigtEine andere Stadt liegt vorn.

Tabelle 1: Das dreistufige Anspruchskriterium, festgelegt und eingefroren vor Beginn der Erhebung.

Hinweis zu den Konfidenzintervallen

Alle Erstempfehlungsquoten werden mit 95-%-Wilson-Konfidenzintervallen ausgewiesen. Die Intervalle machen sichtbar, wie groß die statistische Unsicherheit der gemessenen Anteile ist.

Dabei ist allerdings zu berücksichtigen, dass innerhalb derselben Szenario-Sprach-Kombination mehrere Antworten erhoben werden. Die Einzelantworten sind daher nicht ohne Weiteres mit einer vollständig unabhängigen Zufallsstichprobe gleichzusetzen. Die Wilson-Intervalle werden aus diesem Grund zusammen mit dem Untersuchungsdesign interpretiert und nicht als alleiniger Nachweis eines Unterschieds verstanden.

Solange die vollständige Auswertung läuft, veröffentlicht diese Seite keine Zwischenquoten.

Die 24 Fragen im Wortlaut

Die Erhebung besteht aus sechs Szenarien. Vier gehören zur Hauptmessung und zwei dienen als Kontrolle. Jedes Szenario wird auf Deutsch, Dänisch, Schwedisch und Englisch abgefragt.

Bei der Formulierung der fremdsprachigen Varianten wurden reale Suchformulierungen aus den jeweiligen Märkten berücksichtigt. Als zusätzliche Grundlage dienten die Vervollständigungsvorschläge der Google-Suche vom 15.08.2026. Eine muttersprachliche Prüfung der dänischen und schwedischen Fassungen war allerdings nicht verfügbar. Diese Einschränkung gilt insbesondere dann, wenn später Unterschiede zwischen den Sprachversionen betrachtet werden.

SzenarioDeutsch (Köln)Dänisch (Kopenhagen)Schwedisch (Malmö)Englisch (London)
S1 · Offene EmpfehlungWelchen Weihnachtsmarkt in Norddeutschland lohnt es sich dieses Jahr zu besuchen?Hvilket julemarked i Nordtyskland er værd at besøge i år?Vilken julmarknad i norra Tyskland är värd att besöka i år?Which Christmas market in northern Germany is worth visiting this year?
S2 · WochenendreisePlane mir ein Wochenende mit Weihnachtsmarkt-Besuch in Norddeutschland, mit einer Übernachtung.Planlæg en weekendtur til et julemarked i Nordtyskland for mig, med én overnatning.Planera en helgresa till en julmarknad i norra Tyskland åt mig, med en övernattning.Plan a weekend trip to a Christmas market in northern Germany for me, with one overnight stay.
S3 · FamilieWir möchten mit zwei Kindern (5 und 9) einen Weihnachtsmarkt in Norddeutschland besuchen. Welche Stadt eignet sich?Vi vil gerne besøge et julemarked i Nordtyskland med to børn (5 og 9 år). Hvilken by er bedst?Vi vill besöka en julmarknad i norra Tyskland med två barn (5 och 9 år). Vilken stad passar bäst?We’d like to visit a Christmas market in northern Germany with two kids (5 and 9). Which city is best?
S4 · SuperlativWas ist der schönste Weihnachtsmarkt in Norddeutschland?Hvad er det bedste julemarked i Nordtyskland?Vilken är den bästa julmarknaden i norra Tyskland?What is the best Christmas market in northern Germany?
K1 · Nationaler AnkerWelchen Weihnachtsmarkt in Deutschland lohnt es sich dieses Jahr zu besuchen?Hvilket julemarked i Tyskland er værd at besøge i år?Vilken julmarknad i Tyskland är värd att besöka i år?Which Christmas market in Germany is worth visiting this year?
K2 · Direktfrage LübeckLohnt sich der Lübecker Weihnachtsmarkt?Er julemarkedet i Lübeck et besøg værd?Är julmarknaden i Lübeck värd ett besök?Is the Lübeck Christmas market worth a visit?

Tabelle 2: Alle 24 Wortlaute, wie sie über die OpenAI Responses API an GPT-5.6 Luna gingen. Jede Zelle wurde zehnmal abgefragt, verteilt über fünf Erhebungstage.

Die beiden Kontrollfragen werden getrennt von der Hauptmessung ausgewertet.

K1 erweitert die Frage von Norddeutschland auf ganz Deutschland. Damit lässt sich einordnen, ob Lübeck auch dann genannt wird, wenn ChatGPT aus einem wesentlich größeren Feld deutscher Weihnachtsmärkte auswählen kann. Die Antworten gehen nicht in die Erstempfehlungsquote der Hauptmessung ein.

K2 fragt direkt nach dem Lübecker Weihnachtsmarkt und kann deswegen ebenfalls nicht für einen Städtevergleich verwendet werden. Hier werden stattdessen die Gründe erfasst, mit denen ChatGPT eine Reise nach Lübeck empfiehlt oder davon abrät. Dazu können beispielsweise die Altstadt, Marzipan oder einzelne Weihnachtsmärkte gehören.

So wird gemessen

Warum wird nur ChatGPT untersucht?

Diese Erhebung untersucht bewusst ein einzelnes KI-System. Ein Vergleich zwischen ChatGPT, Gemini und weiteren Systemen würde eine zusätzliche Forschungsfrage eröffnen und die Zahl der notwendigen Abfragen erheblich erhöhen.

Die Ergebnisse gelten deswegen ausschließlich für das verwendete ChatGPT-Modell unter den dokumentierten Messbedingungen. Sie erlauben keine Aussage darüber, wie andere KI-Systeme dieselben Fragen beantworten würden.

Warum wird gpt-5.6-luna verwendet?

Die Messung soll eine typische private Reiseplanung über ChatGPT möglichst nah abbilden. Verwendet wird deshalb gpt-5.6-luna mit aktivierter Websuche. Ein eigener Systemprompt oder eine Formatvorgabe werden nicht gesetzt.

Über die API lässt sich die öffentliche ChatGPT-Anwendung allerdings nicht vollständig reproduzieren. Unter anderem fehlen die dort verwendete Produktkonfiguration und mögliche Personalisierungen. Diese Einschränkung gilt für alle Ergebnisse der Erhebung.

Warum Köln, Kopenhagen, Malmö und London?

Für jede Sprache wurde vor Beginn der Erhebung ein Herkunftsort festgelegt. Köln steht für die deutsche, Kopenhagen für die dänische, Malmö für die schwedische und London für die englische Sprachfassung.

Die Orte liegen außerhalb des abgefragten Zielraums Norddeutschland. Dadurch wird vermieden, dass der gesetzte Standort selbst als naheliegendes Reiseziel innerhalb der untersuchten Region erscheint.

Warum zehn Wiederholungen an fünf Tagen?

Generative Sprachmodelle erzeugen ihre Antworten probabilistisch. Auch bei identischer Eingabe kann deshalb eine andere Stadt empfohlen oder die Reihenfolge der Vorschläge verändert werden.

Eine einzelne Antwort eignet sich damit nicht als Grundlage für eine Empfehlungsquote. Jede der 24 Kombinationen aus Szenario und Sprache wurde deswegen zehnmal abgefragt. Die Wiederholungen verteilen sich auf fünf Erhebungstage, sodass auch Schwankungen zwischen den Tagen sichtbar bleiben.

Wie werden aus den Antworten Daten?

ChatGPT antwortet als Fließtext. Für die quantitative Auswertung müssen daraus die genannten Städte, ihre Reihenfolge und die Art der Empfehlung bestimmt werden.

Dafür durchlaufen die Antworten einen zweiten, vom eigentlichen Messlauf getrennten Verarbeitungsschritt ohne Websuche. Der Extraktor ordnet die Textstellen anhand der vorab definierten Kategorien und speichert zu jeder Zuordnung ein wörtliches Zitat aus der ursprünglichen Antwort. Dadurch kann später nachvollzogen werden, weshalb eine Stadt auf eine bestimmte Weise codiert wurde.

Anschließend werden Schreibvarianten und einzelne Märkte auf Stadtebene zusammengeführt. Stadtteile werden der jeweiligen Stadt zugerechnet, Travemünde also beispielsweise Lübeck.

Für 10 Prozent der Antworten wird die automatische Codierung zusätzlich manuell geprüft. Damit lässt sich feststellen, wie häufig automatische und manuelle Zuordnung übereinstimmen.

Szenarien und Messskripte wurden vorab eingefroren

Die sechs Szenarien, das Messskript und das Extraktionsskript standen vor Beginn der ersten Messwelle fest. Für alle drei Dateien wurden SHA-256-Prüfsummen gespeichert.

Mit diesen Prüfsummen lässt sich erkennen, ob eine der eingefrorenen Dateien später verändert wurde. Für notwendige Ergänzungen wurde ebenfalls vorab eine Regel festgelegt. Ergänzungen dürfen vorgenommen werden, wenn Datum und Grund dokumentiert werden. Die eingefrorenen Inhalte selbst werden nicht gestrichen oder umformuliert.

Von dieser Ergänzungsregel wurde am 17.08.2026 erstmals Gebrauch gemacht. Der entsprechende Eintrag steht im Erhebungstagebuch.

Eingefrorene DateiSHA-256-Prüfsumme
szenarien.json91DF24A17AA7F3A44D83196BC99243FEAF52FE221DE0571E47CAF8A7360B0172
weihnachts-messung.mjs30DAF4C0429B68BA66DA8A284D694A1B75D8E343963BFD483357459FF13514FA
ziel-extraktion.mjsE622A770E96369C381A21557785B23EA34B68CC6E8AC661C46219F58602B4EF1

Tabelle 3: Die drei eingefrorenen Dateien mit ihren Prüfsummen vom 15.08.2026. Sie werden der Veröffentlichung beigelegt.

Grenzen der Aussagekraft

Die Erhebung bewertet keine Weihnachtsmärkte. Aus einer hohen Erstempfehlungsquote lässt sich weder ableiten, dass ein Markt objektiv schöner ist, noch dass Programm, Atmosphäre oder gastronomisches Angebot besser sind. Gemessen wird ausschließlich, welche Städte ChatGPT auf die untersuchten Fragen empfiehlt.

Alle Antworten wurden über die OpenAI-API erhoben. Die API-Konfiguration entspricht der öffentlichen ChatGPT-Anwendung nicht vollständig. Die Ergebnisse beschreiben deshalb das Verhalten des verwendeten Modells unter den dokumentierten Messbedingungen und lassen sich nicht wortgleich auf jede Nutzung von ChatGPT übertragen.

Die erste Messung fand außerdem im August und damit mehrere Monate vor Beginn der Weihnachtsmärkte statt. Zu diesem Zeitpunkt können Informationen zur Saison 2026 noch unvollständig sein oder ältere Angaben weiterhin im Web stehen. Ob und in welchem Umfang dies auch die Auswahl der empfohlenen Städte beeinflusst, lässt sich aus der Augustmessung allein nicht bestimmen. Deswegen wird dieselbe Messung Ende November während der laufenden Adventssaison wiederholt.

Für jede Sprache stehen in der Hauptmessung 40 Antworten zur Verfügung. Unterschiede zwischen einzelnen Sprachversionen werden daher vorsichtig interpretiert. Hinzu kommt, dass die dänischen und schwedischen Prompts nicht von Muttersprachlern geprüft wurden.

Auch die wiederholten Abfragen innerhalb derselben Szenario-Sprach-Kombination sind bei der statistischen Interpretation zu berücksichtigen. Die 160 Antworten der Hauptmessung bilden keine einfache Zufallsstichprobe aus 160 vollständig unabhängigen Beobachtungen.

Ausgewertet werden Städte, weil sie die Untersuchungseinheiten der Studie sind. Einzelne Buden, Cafés, Hotels oder andere Betriebe, die ChatGPT innerhalb einer Antwort erwähnt, werden dagegen nicht bewertet oder öffentlich als Negativbeispiele herausgestellt.

Schließlich gelten sämtliche Ergebnisse für das untersuchte Modell und den dokumentierten Erhebungszeitraum. Aus ihnen folgt keine allgemeine Aussage über alle Antworten von ChatGPT oder über OpenAI als Unternehmen.

Erhebungstagebuch

Dieses Protokoll dokumentiert die Messungen und Änderungen während der Erhebung. Der neueste Eintrag steht oben.

  • 2026-08-19 · Welle 5 abgeschlossen, 240 von 240 Antworten gültig

    Erhebung der Welle A abgeschlossen

    Mit der fünften Welle ist die erste Messung vollständig. Alle 240 geplanten Abfragen haben eine gültige Antwort geliefert.

    In jeder dieser Antworten wurde die Websuche mindestens einmal verwendet. Insgesamt wurden dabei 266 Suchvorgänge ausgelöst. Damit steht fest, dass sämtliche gemessenen Antworten unter Einbezug der Websuche entstanden sind. Daraus lässt sich allerdings nicht ableiten, welchen Anteil abgerufene Quellen und internes Modellwissen jeweils an der erzeugten Antwort hatten.

    Die reine API-Erhebung hat rund 3,20 Euro gekostet.

    Als Nächstes werden die Antworten nach den vorab festgelegten Regeln in einzelne Städte, ihre Reihenfolge und die Art der Empfehlung zerlegt. Für 10 Prozent der Antworten wird anschließend geprüft, wie häufig die automatische Codierung mit einer manuellen Zuordnung übereinstimmt.

    In der weiteren Auswertung wird außerdem untersucht, welche Quellen bzw. Domains in den Antworten verwendet oder zitiert werden.

  • 2026-08-17 · Ergänzung nach der Änderungsregel, Prüfsummen erneut bestätigt

    Vorprüfung der Wellenzählung ergänzt

    Seit dem 17.08.2026 prüft ein zusätzlicher Schritt vor jedem Messlauf, ob bereits angelegte Wellenordner tatsächlich Antworten enthalten.

    Der Grund dafür ist technisch: Bricht ein Lauf vor der ersten gespeicherten Antwort ab, könnte ein leerer Ordner bei der automatischen Zählung trotzdem als abgeschlossene Welle erkannt werden. Die Erhebung hätte dadurch vorzeitig enden können.

    Die drei vor Beginn der Erhebung eingefrorenen Dateien wurden dafür nicht verändert. Ihre SHA-256-Prüfsummen wurden nach der Ergänzung erneut geprüft und stimmen weiterhin mit den am 15.08.2026 gespeicherten Werten überein.

  • 2026-08-15 · Kalibrierung bestanden, Präregistrierung eingefroren, Welle 1 erhoben

    Erhebung gestartet

    Vor der ersten Messwelle lief ein Kalibrierungstest mit 24 Abfragen, also einer Abfrage je Kombination aus Szenario und Sprache.

    Geprüft wurde unter anderem, ob ChatGPT in der vorgesehenen Sprache antwortet und den jeweils gesetzten Herkunftsort verarbeitet. Die dänischen Antworten erschienen auf Dänisch, die schwedischen auf Schwedisch und einzelne Antworten nahmen ausdrücklich Bezug auf den gesetzten Standort, beispielsweise mit „från Malmö“.

    Der Kalibrierlauf kostete 0,31 Euro. Anschließend wurden Szenarien, Messskript und Extraktionsskript mit ihren SHA-256-Prüfsummen eingefroren. Noch am selben Tag folgte die erste reguläre Welle mit 48 von 48 gültigen Antworten.

  • 2026-08-15 · vor dem Einfrieren

    Prüfung von Terminen aus dem Design gestrichen

    In einer frühen Fassung sollte zusätzlich geprüft werden, ob ChatGPT für die Weihnachtsmärkte korrekte Termine nennt.

    Parallel läuft allerdings bereits eine eigene Untersuchung, in der ich die Faktentreue von ChatGPT bei Lübecker Reiseplänen prüfe. Um diese beiden Fragestellungen getrennt zu halten, wurde die Terminprüfung noch vor dem Einfrieren aus dem Design entfernt.

    Die Weihnachtsstadt-Erhebung konzentriert sich damit auf die Auswahl und Reihenfolge der empfohlenen Städte sowie auf die Begründungen der Empfehlungen.

Kontakt und Nachnutzung

Rückfragen zur Methodik beantworte ich gern.

Die Erhebung ist eigenfinanziert und entstand ohne Auftrag, Beteiligung oder Vorabkenntnis von Lübeck Management e.V., der Lübeck und Travemünde Marketing GmbH, der Hansestadt Lübeck oder anderen genannten Organisationen.

© 2026 Patrick Stolp