Ergebnisse · Welle A

Empfiehlt ChatGPT Lübeck als Weihnachtsstadt des Nordens?

Lübeck nennt sich „Weihnachtsstadt des Nordens“. Doch empfiehlt ChatGPT die Stadt ebenfalls, wenn Reisende offen nach einem Weihnachtsmarkt in Norddeutschland fragen?

Für die erste Messung habe ich vier typische Reisefragen auf Deutsch, Dänisch, Schwedisch und Englisch gestellt. ChatGPT erhielt keine Liste möglicher Städte. In 145 von 160 Antworten empfahl das System Lübeck zuerst.

Patrick Stolp · SEO-Experte · Lübeck

Ergebnis der Hauptmessung

90,6 %

95-%-Wilson-Konfidenzintervall: 85,1 % bis 94,2 %, n = 160

In 145 von 160 Antworten empfahl ChatGPT Lübeck zuerst. Bremen folgte mit elf Erstempfehlungen. Der Abstand blieb auch unter Berücksichtigung der statistischen Unsicherheit eindeutig.

  • Wellen 5 von 5 abgeschlossen
  • Gültige Antworten 240 von 240
  • Erhoben bis 2026-08-19
  • Nächste Aktualisierung nach Welle B, voraussichtlich Anfang Dezember 2026

Abschnitt 01

Kurzfassung

Wellen 5 von 5 · Sprachen 4 · Antworten 240 von 240

Empfiehlt ChatGPT Lübeck, wenn Reisende offen nach einem Weihnachtsmarkt in Norddeutschland fragen? In 145 von 160 Antworten der Hauptmessung stand Lübeck an erster Stelle. Bremen folgte mit elf Erstempfehlungen, Hamburg mit drei und Celle mit einer.

Besonders deutlich fiel das Ergebnis bei den Fragen auf Dänisch aus Kopenhagen und auf Schwedisch aus Malmö aus. Hier lag Lübeck in allen 80 Antworten vorn. Bei den deutschen Fragen aus Köln waren es 28 von 40 Antworten.

Auch die verwendeten Quellen zeigen ein klares Lübecker Muster. ChatGPT nutzte in allen 240 Antworten die Websuche und zitierte luebeck-tourismus.de in 162 Fällen häufiger als jede andere Domain.

Alle 240 geplanten Antworten wurden zwischen dem 15. und 19. August erhoben. Ende November wird dieselbe Messung während der geöffneten Weihnachtsmärkte wiederholt.

90,6 %Erstempfehlung Lübeck in der Hauptmessung [85,1 % bis 94,2 %]
6,9 %Erstempfehlung Bremen auf Platz zwei [3,9 % bis 11,9 %]
67,5 %Antworten mit Zitat von luebeck-tourismus.de [61,3 % bis 73,1 %]
24/24korrekte Erstempfehlungen in der blind handcodierten Stichprobe
240gültige Antworten aus Hauptmessung und Kontrollfragen

Studien-Steckbrief

Typ
Eigenständige Erhebung, nicht peer-reviewed
Fassung
1.1 (Ergebnisse Welle A), 2026-08-30
Erhebung
Welle A: 2026-08-15 bis 2026-08-19, fünf Wellen an fünf Tagen. Nachmessung in der Adventssaison geplant.
System
OpenAI Responses API, gpt-5.6-luna mit Websuche, Herkunftsorte Köln, Kopenhagen, Malmö und London
Vorab festgelegt
Sechs Szenarien in vier Sprachen und die Auswertungsregeln vor Welle 1 eingefroren
Interessenkonflikt
Die Erhebung ist eigenfinanziert und entstand ohne Auftrag, Beteiligung oder Vorabkenntnis der genannten Organisationen.
Nachnutzung
Nachnutzung mit Quellenangabe und Wellennummer erwünscht

Alle 240 geplanten Antworten der Welle A liegen vor.

Zitiervorschlag

Stolp, Patrick (2026): Empfiehlt ChatGPT Lübeck als Weihnachtsstadt des Nordens? Ergebnisse der Welle A. patrickstolp.de/ki-weihnachtsstadt-luebeck/, Stand 2026-08-30.

Abschnitt 02

Lübeck liegt mit großem Abstand vorn

Hauptmessung n = 160 · Kontrollen n = 80 · Erhebung an fünf Tagen

90,6 %

95-%-Wilson-Konfidenzintervall: 85,1 % bis 94,2 %, n = 160

In 145 der 160 Antworten aus den vier Hauptszenarien empfiehlt ChatGPT Lübeck als erstes Ziel.

In jeder Kombination aus vier Reisefragen und vier Sprachfassungen stellte ich dieselbe Frage zehnmal. Alle 160 Antworten flossen mit demselben Gewicht in die Auswertung ein. Lübeck lag in 145 Fällen vorn. Bremen folgte elfmal, Hamburg dreimal und Celle einmal.

Erstempfehlung nach Stadt · Hauptmessung, n = 160 · Striche: 95-%-Intervall

Lübeck

90,6 %[85,1 bis 94,2]

Bremen

6,9 %[3,9 bis 11,9]

Hamburg

1,9 %[0,6 bis 5,4]

Celle

0,6 %[0,1 bis 3,5]

Rostock

0,0 %[0,0 bis 2,3]

0255075100 %
StadtErstempfehlungAls Ziel empfohlen
Lübeck90,6 % [85,1 % bis 94,2 %]95,6 % [91,2 % bis 97,9 %]
Bremen6,9 % [3,9 % bis 11,9 %]63,1 % [55,4 % bis 70,2 %]
Hamburg1,9 % [0,6 % bis 5,4 %]74,4 % [67,1 % bis 80,5 %]
Celle0,6 % [0,1 % bis 3,5 %]20,0 % [14,5 % bis 26,9 %]
Rostock0,0 % [0,0 % bis 2,3 %]31,9 % [25,2 % bis 39,4 %]

Tabelle 1: Die fünf Städte mit den höchsten Erstempfehlungs- oder Empfehlungsquoten in der Hauptmessung S1 bis S4. Herkunftsorte, die lediglich als Ausgangspunkt einer Reise genannt wurden, sind nicht aufgeführt.

Hamburg wird demnach in fast drei Vierteln der Antworten als mögliches Ziel empfohlen, steht allerdings nur dreimal an erster Stelle. Rostock erscheint in knapp einem Drittel der Antworten als Empfehlung und erhält keine Erstempfehlung.

Aus Köln empfiehlt ChatGPT Lübeck seltener

Bei den deutschen Fragen war Köln als Ausgangsort angegeben. Die dänischen Fragen wurden mit Kopenhagen, die schwedischen mit Malmö und die englischen mit London verbunden.

SprachfassungHerkunftsortErstempfehlung Lübeck
DeutschKöln70,0 % [54,6 % bis 81,9 %]
DänischKopenhagen100,0 % [91,2 % bis 100,0 %]
SchwedischMalmö100,0 % [91,2 % bis 100,0 %]
EnglischLondon92,5 % [80,1 % bis 97,4 %]

Tabelle 2: Erstempfehlungsquote Lübecks nach Sprachfassung und festgelegtem Herkunftsort, jeweils n = 40.

Das Intervall der deutschen Bedingung überschneidet sich nicht mit den Intervallen der dänischen und schwedischen Bedingung. Dieser Unterschied ist damit anhand der berechneten Intervalle gestützt. Sprache und Herkunftsort wurden jedoch nicht unabhängig voneinander variiert. Aus der Messung lässt sich deswegen nicht bestimmen, ob die Sprache, der Herkunftsort oder ihr Zusammenspiel für den Unterschied verantwortlich ist.

Bei der Frage nach ganz Deutschland liegt Lübeck nicht vorn

Die Kontrollfrage K1 erweitert den Zielraum von Norddeutschland auf ganz Deutschland. Unter der deutschen Bedingung wird Lübeck in 0,0 % [0,0 % bis 27,8 %] und unter der englischen Bedingung ebenfalls in 0,0 % [0,0 % bis 27,8 %] der jeweils zehn Antworten zuerst empfohlen. Unter der dänischen Bedingung erreicht Lübeck 80,0 % [49,0 % bis 94,3 %], unter der schwedischen 90,0 % [59,6 % bis 98,2 %].

Ein gemeinsamer Wert über alle vier K1-Zellen würde Fragen aus Deutschland und aus dem Ausland vermischen. Er wird deshalb nicht als Gesamtergebnis berichtet. Für die deutsche bzw. englische Frage nach einem Weihnachtsmarkt in ganz Deutschland liegen andere Städte vorn.

luebeck-tourismus.de ist die meistzitierte Domain

In allen 240 Antworten nutzte ChatGPT die Websuche. Insgesamt wurden 266 Suchvorgänge ausgelöst. Die Domain luebeck-tourismus.de erschien in 162 Antworten, was 67,5 % [61,3 % bis 73,1 %] entspricht. visit-luebeck.com wurde in 72 Antworten bzw. 30,0 % [24,6 % bis 36,1 %] zitiert.

Zitierquote in den 240 Antworten

luebeck-tourismus.de 67,5 %
visit-luebeck.com 30,0 %

Für die touristische Kommunikation Lübecks ist diese Quellenverteilung relevant. Die offizielle Tourismusseite erschien in zwei Dritteln der Antworten auf Fragen, wie sie potentielle Gäste bei der Reiseplanung stellen könnten. Aus den Zitierquoten lässt sich allerdings nicht ableiten, dass eine einzelne Quelle die Erstempfehlung verursacht hat.

ChatGPT nennt mehr als den eigentlichen Weihnachtsmarkt

Die Direktfrage „Lohnt sich der Lübecker Weihnachtsmarkt?“ beantwortete ChatGPT in allen 40 Fällen positiv. In den Begründungen erschienen regelmäßig die historische Altstadt, mehrere Weihnachtsmärkte, Marzipan, Backsteingotik und kurze Wege. Die Antworten beschrieben damit, was Besucher während eines Adventswochenendes in Lübeck miteinander verbinden können.

Die Erstempfehlung wurde zusätzlich von Hand geprüft

Für 24 der 240 Antworten wurde vor der Einsicht in die automatische Auswertung jeweils eine Antwort aus jeder Szenario-Sprach-Kombination von Hand codiert. In allen 24 Fällen stimmte die automatisch bestimmte Erstempfehlung mit der Handcodierung überein.

Bei sekundären Ortsnennungen traten dagegen Abweichungen auf. Hierzu gehörten vor allem Herkunfts- und Transitorte, die der Extraktor im Antworttext erkannte, obwohl sie kein empfohlenes Reiseziel waren. Diese Orte werden in den veröffentlichten Städtetabellen nicht als Empfehlung behandelt.

Abschnitt 03

Wie der Titel geprüft wurde

Bezeichnung von Lübeck Management e.V. · konkurrierende Städte aus den Antworten · Belege archiviert am 15.08.2026

Lübeck Management e.V. verwendet seit Jahren die Bezeichnung „Lübeck. Weihnachtsstadt des Nordens“. Dieser Marketinganspruch bildet den Ausgangspunkt der Erhebung.

Auch andere norddeutsche Städte werben mit Superlativen rund um ihre Weihnachtsmärkte. Rostock bezeichnet seinen Weihnachtsmarkt beispielsweise als den größten Norddeutschlands. Inhaltlich ist das allerdings kein unmittelbarer Gegenanspruch zur „Weihnachtsstadt des Nordens“. Für die Messung wird Rostock deswegen auch nicht als festgelegter Konkurrent behandelt. Welche Städte mit Lübeck konkurrieren, ergibt sich ausschließlich aus den Antworten von ChatGPT.

Archivkopien der verwendeten Belege liegen seit dem 15.08.2026 in den Studienunterlagen.

Vor Beginn der Erhebung stand fest, was die Messung zeigen musste. Lübeck sollte häufiger als jede andere Stadt zuerst empfohlen werden. Außerdem sollte der statistische Unsicherheitsbereich Lübecks vollständig oberhalb des Zweitplatzierten liegen. Beide Bedingungen wurden in Welle A erfüllt. Dafür werden ausschließlich die vier Hauptszenarien verwendet. Die beiden Kontrollfragen gehen nicht in diese Einstufung ein.

StufeBedingung
Klar bestätigtLübeck hat die höchste Erstempfehlungsquote der Hauptmessung, und die Untergrenze seines Konfidenzintervalls liegt über der Obergrenze des Zweitplatzierten.
Bestätigt mit VorbehaltLübeck hat die höchste Erstempfehlungsquote, die Konfidenzintervalle überschneiden sich jedoch.
Nicht bestätigtEine andere Stadt liegt vorn.

Tabelle 3: Die dreistufige Auswertungsregel wurde vor Beginn der Erhebung festgelegt und eingefroren.

Was die Konfidenzintervalle zeigen

Alle Erstempfehlungsquoten werden mit 95-%-Wilson-Konfidenzintervallen ausgewiesen. Diese Bereiche machen sichtbar, wie groß die statistische Unsicherheit der gemessenen Anteile ist.

Dabei ist allerdings zu berücksichtigen, dass innerhalb derselben Szenario-Sprach-Kombination mehrere Antworten erhoben werden. Die Einzelantworten sind daher nicht ohne Weiteres mit einer vollständig unabhängigen Zufallsstichprobe gleichzusetzen. Die Wilson-Intervalle werden aus diesem Grund zusammen mit dem Untersuchungsdesign interpretiert und nicht als alleiniger Nachweis eines Unterschieds verstanden.

In Welle A sind die beiden Bereiche weit voneinander entfernt. Die Untergrenze für Lübeck liegt bei 85,1 %, die Obergrenze für Bremen bei 11,9 %. Damit ist die vorab festgelegte höchste Stufe erreicht.

Abschnitt 04

Die 24 Fragen im Wortlaut

Szenarien 6 · Sprachen 4 · Wiederholungen 10 je Kombination

Die Erhebung besteht aus sechs Szenarien. Vier gehören zur Hauptmessung und zwei dienen als Kontrolle. Jedes Szenario wird auf Deutsch, Dänisch, Schwedisch und Englisch abgefragt.

Bei der Formulierung der fremdsprachigen Varianten wurden reale Suchformulierungen aus den jeweiligen Märkten berücksichtigt. Als zusätzliche Grundlage dienten die Vervollständigungsvorschläge der Google-Suche vom 15.08.2026. Eine muttersprachliche Prüfung der dänischen und schwedischen Fassungen war allerdings nicht verfügbar. Diese Einschränkung gilt insbesondere dann, wenn später Unterschiede zwischen den Sprachversionen betrachtet werden.

SzenarioDeutsch (Köln)Dänisch (Kopenhagen)Schwedisch (Malmö)Englisch (London)
S1 · Offene EmpfehlungWelchen Weihnachtsmarkt in Norddeutschland lohnt es sich dieses Jahr zu besuchen?Hvilket julemarked i Nordtyskland er værd at besøge i år?Vilken julmarknad i norra Tyskland är värd att besöka i år?Which Christmas market in northern Germany is worth visiting this year?
S2 · WochenendreisePlane mir ein Wochenende mit Weihnachtsmarkt-Besuch in Norddeutschland, mit einer Übernachtung.Planlæg en weekendtur til et julemarked i Nordtyskland for mig, med én overnatning.Planera en helgresa till en julmarknad i norra Tyskland åt mig, med en övernattning.Plan a weekend trip to a Christmas market in northern Germany for me, with one overnight stay.
S3 · FamilieWir möchten mit zwei Kindern (5 und 9) einen Weihnachtsmarkt in Norddeutschland besuchen. Welche Stadt eignet sich?Vi vil gerne besøge et julemarked i Nordtyskland med to børn (5 og 9 år). Hvilken by er bedst?Vi vill besöka en julmarknad i norra Tyskland med två barn (5 och 9 år). Vilken stad passar bäst?We’d like to visit a Christmas market in northern Germany with two kids (5 and 9). Which city is best?
S4 · SuperlativWas ist der schönste Weihnachtsmarkt in Norddeutschland?Hvad er det bedste julemarked i Nordtyskland?Vilken är den bästa julmarknaden i norra Tyskland?What is the best Christmas market in northern Germany?
K1 · Nationaler AnkerWelchen Weihnachtsmarkt in Deutschland lohnt es sich dieses Jahr zu besuchen?Hvilket julemarked i Tyskland er værd at besøge i år?Vilken julmarknad i Tyskland är värd att besöka i år?Which Christmas market in Germany is worth visiting this year?
K2 · Direktfrage LübeckLohnt sich der Lübecker Weihnachtsmarkt?Er julemarkedet i Lübeck et besøg værd?Är julmarknaden i Lübeck värd ett besök?Is the Lübeck Christmas market worth a visit?

Tabelle 4: Alle 24 Wortlaute, wie sie über die OpenAI Responses API an GPT-5.6 Luna gingen. Jede Zelle wurde zehnmal abgefragt, verteilt über fünf Erhebungstage.

Die beiden Kontrollfragen werden getrennt von der Hauptmessung ausgewertet.

K1 erweitert die Frage von Norddeutschland auf ganz Deutschland. Damit lässt sich einordnen, ob Lübeck auch dann genannt wird, wenn ChatGPT aus einem wesentlich größeren Feld deutscher Weihnachtsmärkte auswählen kann. Die Antworten gehen nicht in die Erstempfehlungsquote der Hauptmessung ein.

K2 fragt direkt nach dem Lübecker Weihnachtsmarkt und kann deswegen ebenfalls nicht für einen Städtevergleich verwendet werden. Hier werden stattdessen die Gründe erfasst, mit denen ChatGPT eine Reise nach Lübeck empfiehlt oder davon abrät. Dazu können beispielsweise die Altstadt, Marzipan oder einzelne Weihnachtsmärkte gehören.

Abschnitt 05

So wird gemessen

Modell gpt-5.6-luna · Websuche an, Standort je Sprache · Eigener Systemprompt keiner

Übergreifende Methodik

Die Methodik des Lübecker KI-Monitors beschreibt die wiederkehrenden Grundsätze meiner Erhebungen, darunter API-Messung, Wiederholungen, Codierung, statistische Auswertung und Reproduzierbarkeit. Maßgeblich für die Durchführung dieser Untersuchung bleibt das hier dokumentierte Studienprotokoll, da die übergreifende Methodikseite erst am 21.08.2026 in Fassung 1.0 veröffentlicht wurde.

Warum wird nur ChatGPT untersucht?

Diese Erhebung untersucht bewusst ein einzelnes KI-System. Ein Vergleich zwischen ChatGPT, Gemini und weiteren Systemen würde eine zusätzliche Forschungsfrage eröffnen und die Zahl der notwendigen Abfragen erheblich erhöhen.

Die Ergebnisse gelten deswegen ausschließlich für das verwendete ChatGPT-Modell unter den dokumentierten Messbedingungen. Sie erlauben keine Aussage darüber, wie andere KI-Systeme dieselben Fragen beantworten würden.

Warum wird gpt-5.6-luna verwendet?

Die Messung soll eine typische private Reiseplanung über ChatGPT annähern. Verwendet wird deshalb gpt-5.6-luna mit aktivierter Websuche. Ein eigener Systemprompt oder eine Formatvorgabe werden nicht gesetzt.

Über die API lässt sich die öffentliche ChatGPT-Anwendung allerdings nicht vollständig reproduzieren. Unter anderem fehlen die dort verwendete Produktkonfiguration und mögliche Personalisierungen. Diese Einschränkung gilt für alle Ergebnisse der Erhebung.

Warum Köln, Kopenhagen, Malmö und London?

Für jede Sprache wurde vor Beginn der Erhebung ein Herkunftsort festgelegt. Köln steht für die deutsche, Kopenhagen für die dänische, Malmö für die schwedische und London für die englische Sprachfassung.

Die Orte liegen außerhalb des abgefragten Zielraums Norddeutschland. Dadurch wird vermieden, dass der gesetzte Standort selbst als naheliegendes Reiseziel innerhalb der untersuchten Region erscheint.

Warum zehn Wiederholungen an fünf Tagen?

Generative Sprachmodelle erzeugen ihre Antworten probabilistisch. Auch bei identischer Eingabe kann deshalb eine andere Stadt empfohlen oder die Reihenfolge der Vorschläge verändert werden.

Eine einzelne Antwort eignet sich damit nicht als Grundlage für eine Empfehlungsquote. Jede der 24 Kombinationen aus Szenario und Sprache wurde deswegen zehnmal abgefragt. Die Wiederholungen verteilen sich auf fünf Erhebungstage, sodass auch Schwankungen zwischen den Tagen sichtbar bleiben.

Wie werden aus den Antworten Daten?

ChatGPT antwortet als Fließtext. Für die quantitative Auswertung müssen daraus die genannten Städte, ihre Reihenfolge und die Art der Empfehlung bestimmt werden.

Dafür durchlaufen die Antworten einen zweiten, vom eigentlichen Messlauf getrennten Verarbeitungsschritt ohne Websuche. Der Extraktor ordnet die Textstellen anhand der vorab definierten Kategorien und speichert zu jeder Zuordnung ein wörtliches Zitat aus der ursprünglichen Antwort. Dadurch kann später nachvollzogen werden, weshalb eine Stadt auf eine bestimmte Weise codiert wurde.

Anschließend werden Schreibvarianten und einzelne Märkte auf Stadtebene zusammengeführt. Stadtteile werden der jeweiligen Stadt zugerechnet, Travemünde also beispielsweise Lübeck.

Für 10 Prozent der Antworten wurde die automatische Codierung zusätzlich blind von Hand geprüft. Die für das Hauptergebnis maßgebliche Erstempfehlung stimmte in allen 24 geprüften Antworten überein. Bei sekundären Ortsnennungen wurden dagegen Abweichungen festgestellt und vor der Veröffentlichung eingeordnet.

Szenarien und Messskripte wurden vorab eingefroren

Die sechs Szenarien, das Messskript und das Extraktionsskript standen vor Beginn der ersten Messwelle fest. Für alle drei Dateien wurden SHA-256-Prüfsummen gespeichert.

Mit diesen Prüfsummen lässt sich erkennen, ob eine der eingefrorenen Dateien später verändert wurde. Für notwendige Ergänzungen wurde ebenfalls vorab eine Regel festgelegt. Ergänzungen dürfen vorgenommen werden, wenn Datum und Grund dokumentiert werden. Die eingefrorenen Inhalte selbst werden nicht gestrichen oder umformuliert.

Von dieser Ergänzungsregel wurde am 17.08.2026 erstmals Gebrauch gemacht. Der entsprechende Eintrag steht im Erhebungstagebuch.

Eingefrorene DateiSHA-256-Prüfsumme
szenarien.json91DF24A17AA7F3A44D83196BC99243FEAF52FE221DE0571E47CAF8A7360B0172
weihnachts-messung.mjs30DAF4C0429B68BA66DA8A284D694A1B75D8E343963BFD483357459FF13514FA
ziel-extraktion.mjsE622A770E96369C381A21557785B23EA34B68CC6E8AC661C46219F58602B4EF1

Tabelle 5: Die drei eingefrorenen Dateien mit ihren Prüfsummen vom 15.08.2026. Sie werden der Veröffentlichung beigelegt.

Abschnitt 06

Grenzen der Aussagekraft

Die Erhebung bewertet keine Weihnachtsmärkte. Aus einer hohen Erstempfehlungsquote lässt sich weder ableiten, dass ein Markt objektiv schöner ist, noch dass Programm, Atmosphäre oder gastronomisches Angebot besser sind. Gemessen wird ausschließlich, welche Städte ChatGPT auf die untersuchten Fragen empfiehlt.

Die ergänzend geplante Prüfung vor Ort entfällt für Welle A. Sie sollte den Kontext erweitern, war jedoch kein Teil der ChatGPT-Messung. Die 240 Antworten und ihre Auswertung verändern sich dadurch nicht. Zur tatsächlichen Qualität der Weihnachtsmärkte macht diese Studie keine Aussage.

Alle Antworten wurden über die OpenAI-API erhoben. Die API-Konfiguration entspricht der öffentlichen ChatGPT-Anwendung nicht vollständig. Die Ergebnisse beschreiben deshalb das Verhalten des verwendeten Modells unter den dokumentierten Messbedingungen und lassen sich nicht wortgleich auf jede Nutzung von ChatGPT übertragen.

Die erste Messung fand außerdem im August und damit mehrere Monate vor Beginn der Weihnachtsmärkte statt. Zu diesem Zeitpunkt können Informationen zur Saison 2026 noch unvollständig sein oder ältere Angaben weiterhin im Web stehen. Ob und in welchem Umfang dies auch die Auswahl der empfohlenen Städte beeinflusst, lässt sich aus der Augustmessung allein nicht bestimmen. Deswegen wird dieselbe Messung Ende November während der laufenden Adventssaison wiederholt.

Für jede Sprach- und Herkunftsbedingung stehen in der Hauptmessung 40 Antworten zur Verfügung. Unterschiede werden daher vorsichtig interpretiert. Da jede Sprache an einen Herkunftsort gekoppelt ist, lassen sich Sprach- und Standorteffekte nicht voneinander trennen. Hinzu kommt, dass die dänischen und schwedischen Prompts nicht von Muttersprachlern geprüft wurden.

Auch die wiederholten Abfragen innerhalb derselben Szenario-Sprach-Kombination sind bei der statistischen Interpretation zu berücksichtigen. Die 160 Antworten der Hauptmessung bilden keine einfache Zufallsstichprobe aus 160 vollständig unabhängigen Beobachtungen.

Ausgewertet werden Städte, weil sie die Untersuchungseinheiten der Studie sind. Einzelne Buden, Cafés, Hotels oder andere Betriebe, die ChatGPT innerhalb einer Antwort erwähnt, werden dagegen nicht bewertet oder öffentlich als Negativbeispiele herausgestellt.

Schließlich gelten sämtliche Ergebnisse für das untersuchte Modell und den dokumentierten Erhebungszeitraum. Aus ihnen folgt keine allgemeine Aussage über alle Antworten von ChatGPT oder über OpenAI als Unternehmen.

Abschnitt 07

Erhebungstagebuch

Einträge 5 · Neuester 2026-08-30

Dieses Protokoll dokumentiert die Messungen und Änderungen während der Erhebung. Der neueste Eintrag steht oben.

  • 2026-08-30 · Auswertung und Handcodierung abgeschlossen

    Ergebnisse der Welle A veröffentlicht

    Die Auswertung nach den vorab festgelegten Regeln ergibt für Lübeck eine Erstempfehlungsquote von 90,6 % [85,1 % bis 94,2 %]. Bremen folgt mit 6,9 % [3,9 % bis 11,9 %]. Der statistische Unsicherheitsbereich Lübecks liegt vollständig über dem Bremer Bereich. Damit ist die höchste Stufe der Auswertungsregel erreicht.

    In der blind handcodierten Stichprobe stimmte die Erstempfehlung in allen 24 Antworten mit der automatischen Extraktion überein. Bei sekundären Ortsnennungen wurden vor allem Herkunfts- und Transitorte zusätzlich erkannt.

    Durch die Handcodierung fiel außerdem auf, dass der Name „Rathausmarkt“ in der Normalisierung pauschal Hamburg zugeordnet war, obwohl er in mehreren Antworten den Lübecker Rathausmarkt bezeichnete. Die globale Zuordnung wurde entfernt und die Auswertung neu gerechnet. Die Erstempfehlungsquoten und die Einstufung des Anspruchs blieben unverändert.

  • 2026-08-19 · Welle 5 abgeschlossen, 240 von 240 Antworten gültig

    Erhebung der Welle A abgeschlossen

    Mit der fünften Welle ist die erste Messung vollständig. Alle 240 geplanten Abfragen haben eine gültige Antwort geliefert.

    In jeder dieser Antworten wurde die Websuche mindestens einmal verwendet. Insgesamt wurden dabei 266 Suchvorgänge ausgelöst. Damit steht fest, dass sämtliche gemessenen Antworten unter Einbezug der Websuche entstanden sind. Daraus lässt sich allerdings nicht ableiten, welchen Anteil abgerufene Quellen und internes Modellwissen jeweils an der erzeugten Antwort hatten.

    Die reine API-Erhebung hat 3,23 Euro gekostet.

    Nach Abschluss der Erhebung wurden die Antworten nach den vorab festgelegten Regeln in einzelne Städte, ihre Reihenfolge und die Art der Empfehlung zerlegt. Für 10 Prozent der Antworten wurde anschließend geprüft, wie häufig die automatische Codierung mit einer manuellen Zuordnung übereinstimmt.

    Zusätzlich wurde ausgewertet, welche Quellen bzw. Domains in den Antworten verwendet oder zitiert werden.

  • 2026-08-17 · Ergänzung nach der Änderungsregel, Prüfsummen erneut bestätigt

    Vorprüfung der Wellenzählung ergänzt

    Seit dem 17.08.2026 prüft ein zusätzlicher Schritt vor jedem Messlauf, ob bereits angelegte Wellenordner tatsächlich Antworten enthalten.

    Der Grund dafür ist technisch: Bricht ein Lauf vor der ersten gespeicherten Antwort ab, könnte ein leerer Ordner bei der automatischen Zählung trotzdem als abgeschlossene Welle erkannt werden. Die Erhebung hätte dadurch vorzeitig enden können.

    Die drei vor Beginn der Erhebung eingefrorenen Dateien wurden dafür nicht verändert. Ihre SHA-256-Prüfsummen wurden nach der Ergänzung erneut geprüft und stimmen weiterhin mit den am 15.08.2026 gespeicherten Werten überein.

  • 2026-08-15 · Kalibrierung bestanden, Präregistrierung eingefroren, Welle 1 erhoben

    Erhebung gestartet

    Vor der ersten Messwelle lief ein Kalibrierungstest mit 24 Abfragen, also einer Abfrage je Kombination aus Szenario und Sprache.

    Geprüft wurde unter anderem, ob ChatGPT in der vorgesehenen Sprache antwortet und den jeweils gesetzten Herkunftsort verarbeitet. Die dänischen Antworten erschienen auf Dänisch, die schwedischen auf Schwedisch und einzelne Antworten nahmen ausdrücklich Bezug auf den gesetzten Standort, beispielsweise mit „från Malmö“.

    Der Kalibrierlauf kostete 0,31 Euro. Anschließend wurden Szenarien, Messskript und Extraktionsskript mit ihren SHA-256-Prüfsummen eingefroren. Noch am selben Tag folgte die erste reguläre Welle mit 48 von 48 gültigen Antworten.

  • 2026-08-15 · vor dem Einfrieren

    Prüfung von Terminen aus dem Design gestrichen

    In einer frühen Fassung sollte zusätzlich geprüft werden, ob ChatGPT für die Weihnachtsmärkte korrekte Termine nennt.

    Parallel läuft allerdings bereits eine eigene Untersuchung, in der ich die Faktentreue von ChatGPT bei Lübecker Reiseplänen prüfe. Um diese beiden Fragestellungen getrennt zu halten, wurde die Terminprüfung noch vor dem Einfrieren aus dem Design entfernt.

    Die Weihnachtsstadt-Erhebung konzentriert sich damit auf die Auswahl und Reihenfolge der empfohlenen Städte sowie auf die Begründungen der Empfehlungen.

Kontakt und Nachnutzung

Rückfragen zur Methodik beantworte ich gern.

Die Erhebung ist eigenfinanziert und entstand ohne Auftrag, Beteiligung oder Vorabkenntnis von Lübeck Management e.V., der Lübeck und Travemünde Marketing GmbH, der Hansestadt Lübeck oder anderen genannten Organisationen.

© 2026 Patrick Stolp