Zuletzt aktualisiert:
90 Tagespläne erhoben · Prüfung läuft
Wie zuverlässig plant ChatGPT einen Tag in Lübeck?
Kommt ein Gast durch den Tag, wenn er einen KI-erzeugten Reiseplan für Lübeck befolgt? Um diese Frage zu beantworten, wurden 90 Tagespläne für vier konkrete Termine im August 2026 erstellt. Geprüft wird nun jede enthaltene Angabe: Hat ein Museum an diesem Tag geöffnet? Gibt es das genannte Restaurant noch? Reicht die eingeplante Zeit für den Weg? Erzeugt wurden die Pläne mit GPT-5 mini über die OpenAI API und mit aktivierter Websuche. Die Messung bildet die normale ChatGPT-App daher nur näherungsweise ab.
Patrick Stolp · SEO-Experte · Lübeck
- Welle
- 5 von 5 erhoben
- Gültige Antworten
- 90 von 90
- Erhoben bis
- 2026-08-13
- Nächste Aktualisierung
- mit den ersten Prüfergebnissen, voraussichtlich Ende August 2026
Alle 90 Tagespläne liegen vor.
Stolp, Patrick (2026): Wie zuverlässig plant ChatGPT einen Tag in Lübeck? Laufende Auswertung. patrickstolp.de/ki-reiseplanung-luebeck/.
Kurzfassung
Wie zuverlässig sind KI-erzeugte Tagespläne für Lübeck? Hierzu wurden neun vorab festgelegte Szenarien jeweils zehnmal über die OpenAI API abgefragt. Die 90 Pläne entstanden an fünf verschiedenen Tagen. Die Prüfung bezieht sich auf konkrete Angaben. Sind die genannten Orte am geplanten Tag zugänglich? Stimmen Öffnungszeiten, Preise und Wege?
Alle 90 Tagespläne liegen vor. Die enthaltenen Aussagen werden derzeit gegen die Websites der Betriebe, ihre Google-Unternehmensprofile und bei offenen Fällen gegen weitere Quellen geprüft. Ergebnisse werden erst eingetragen, wenn diese Prüfung abgeschlossen ist. Der folgende Plan aus der ersten Welle zeigt bis dahin, wie eine einzelne Angabe bewertet wird.
So wird ein Tagesplan geprüft
Der folgende Auszug stammt unverändert aus der ersten Erhebungswelle. Gefragt wurde nach einem Tag in der Lübecker Altstadt am Montag, dem 24. August 2026. Markiert ist eine Station, deren Prüfung bereits abgeschlossen wurde.
Szenario S2 · Ein Tag in der Altstadt · Montag, 24. August 2026 · Welle 1, Durchlauf 1
-
09:00
Holstentor und Holstentorplatz
Außenrundgang, Fotos, Salzspeicher an der Obertrave. -
09:30–10:45
Museum Holstentor
Ausstellung zur Stadtgeschichte, 45 bis 75 Minuten. -
10:50–11:20
Rathaus und Rathausmarkt
Spaziergang über die Breite Straße, Außenansicht. -
11:25–12:00
Marienkirche
Innenbesuch, Astronomische Uhr, 30 bis 40 Minuten. -
12:05–13:30
Mittagessen in der Altstadt
Vorschlag ohne feste Reservierungsangabe. -
13:35–14:30
Buddenbrookhaus
Als offene Station eingeplant, mit dem Zusatz, das Haus sei montags in der Regel geöffnet. Geprüft · nicht zugänglich
Auszug. Der vollständige Plan umfasst elf Stationen und ist Teil der veröffentlichten Rohdaten.
Vorläufig
Dieser Plan ist ein einzelnes Beispiel aus 90 erhobenen. Er zeigt die Prüflogik, aber keine Häufigkeit. Wie oft solche Stellen vorkommen, steht erst fest, wenn alle Behauptungen aus allen 90 Plänen geprüft sind.
Welche Fehler gezählt werden
Jeder Tagesplan wird in einzelne prüfbare Aussagen zerlegt. Eine genannte Uhrzeit, ein Eintrittspreis oder eine eingeplante Wegdauer wird dabei getrennt bewertet. Vor Beginn der Erhebung wurden sechs Fehlerklassen festgelegt. Ihre Häufigkeiten werden erst nach Abschluss der Prüfung veröffentlicht. Neben jeder Quote stehen dann der Zähler, der Nenner und ein Intervall, das die Abhängigkeiten innerhalb eines Tagesplans berücksichtigt.
| Fehlerklasse | Was geprüft wird | Anteil | 95-%-Intervall |
|---|---|---|---|
| Ort nicht zugänglich | Betrieb dauerhaft geschlossen, umgezogen oder umbenannt | – | – |
| Ruhetag übergangen | Station an einem Tag eingeplant, an dem geschlossen ist | – | – |
| Öffnungszeit falsch | Genannte Zeit weicht von der Website des Betriebs ab | – | – |
| Weg zu knapp | Eingeplante Wegdauer unterschreitet die tatsächliche | – | – |
| Preis falsch | Genannter Eintritt weicht vom veröffentlichten ab | – | – |
| Nicht prüfbar | Betrieb veröffentlicht keine belastbaren Angaben | – | – |
Tabelle 1: Vorab festgelegte Fehlerklassen. Werte folgen nach Abschluss der Prüfung.
Öffentliche Einrichtungen werden namentlich genannt. Einzelne Gastronomiebetriebe bleiben anonym, sofern die Nennung sie als negatives Beispiel exponieren würde.
Welche Datenprobleme geprüft werden
Für jede falsche oder nicht prüfbare Angabe wird zusätzlich dokumentiert, welche Informationen der Betrieb selbst veröffentlicht. Dieser Teil ist noch nicht ausgewertet. Die folgenden fünf Punkte sind daher Prüfmerkmale und keine vorweggenommenen Ergebnisse.
Öffnungszeiten stehen nur in einem Bild oder PDF
Wichtige Angaben sollten als normaler Text auf der Website stehen. Google empfiehlt für seine generativen Suchfunktionen ausdrücklich, zentrale Inhalte in Textform bereitzustellen. Ein Bild mit Öffnungszeiten kann für Menschen lesbar sein, lässt sich von Such- und Antwortsystemen jedoch weniger zuverlässig verarbeiten.
Website und Google-Unternehmensprofil widersprechen sich
Geprüft wird, ob auf der Website und im Google-Unternehmensprofil dieselben regulären und besonderen Öffnungszeiten stehen. Google weist Unternehmen selbst darauf hin, Adresse, Öffnungszeiten und Kontaktdaten aktuell zu halten. Ein Widerspruch lässt offen, welche Angabe ein Suchsystem übernimmt.
Veraltete Angaben stehen noch auf Portalen
Neben der eigenen Website werden häufig genannte Branchen- und Reiseportale geprüft. Weicht ein alter Portaleintrag von der Betreiberseite ab, wird der Widerspruch dokumentiert. Ob er die konkrete KI-Antwort verursacht hat, lässt sich daraus allein noch nicht ableiten.
Öffnungszeiten fehlen im LocalBusiness-Markup
Strukturierte Daten sind keine Voraussetzung für eine Nennung in generativen Suchfunktionen. Mit dem LocalBusiness-Markup lassen sich Öffnungszeiten allerdings eindeutig für Google auszeichnen. Geprüft wird deshalb, ob vorhandene strukturierte Daten mit dem sichtbaren Text und dem Google-Unternehmensprofil übereinstimmen.
Der Such-Crawler darf die Website nicht abrufen
Für die ChatGPT-Suche ist der OAI-SearchBot maßgeblich. GPTBot hat dagegen eine andere Aufgabe und wird für mögliches Modelltraining eingesetzt. Eine Sperre von GPTBot bedeutet daher nicht automatisch, dass eine Seite aus den Suchantworten verschwindet. Geprüft werden die robots.txt-Regeln und mögliche technische Sperren für den Such-Crawler getrennt. OpenAI beschreibt die Aufgaben der einzelnen Crawler in seiner technischen Dokumentation.
Selbst prüfen
Wer einen Gastbetrieb, ein Hotel oder ein Museum in Lübeck führt, kann die Prüfung in wenigen Minuten selbst durchführen. Die folgenden Schritte entsprechen dem Vorgehen dieser Erhebung im Kleinen.
- Stellen Sie einem KI-Assistenten eine Frage, wie ein Gast sie stellen würde, und nennen Sie darin ein konkretes Datum in der Zukunft.
- Prüfen Sie, ob Ihr Haus überhaupt vorkommt und mit welcher Adresse.
- Vergleichen Sie die genannten Öffnungszeiten mit denen auf Ihrer Website.
- Vergleichen Sie beides mit Ihrem Google-Unternehmensprofil. Weichen die Angaben voneinander ab, ist offen, welche Fassung ein Gast zu sehen bekommt.
- Suchen Sie nach Ihrem Betrieb auf Portalen und prüfen Sie dort dieselben Angaben.
- Wiederholen Sie die erste Frage an einem anderen Tag. Verschiedene Antworten sind normal und selbst ein Ergebnis.
Hinweis
Diese Erhebung ist eigenfinanziert und verfolgt keinen Verkaufszweck. Für die Prüfung wird nichts benötigt, was Geld kostet.
So wird gemessen
Warum ein Datum im Prompt steht
Ohne Datum lässt sich keine Öffnungszeit prüfen. Jedes Szenario nennt deshalb einen konkreten Tag. Zwei der vier Termine fallen auf einen Montag, den klassischen Ruhetag im Museumsbetrieb. Das ist kein Fallenstellen, denn Montag ist ein normaler Anreisetag.
Warum zehn Wiederholungen an fünf Tagen
Auch bei gleichem Wortlaut können KI-Antworten voneinander abweichen. Eine einzelne Antwort reicht deshalb nicht aus, um die Zuverlässigkeit eines Szenarios zu beurteilen. Die zehn Wiederholungen verteilen sich auf fünf Erhebungstage. So wird sichtbar, welche Angaben regelmäßig und welche nur vereinzelt vorkommen.
Was genau gemessen wurde
Die 90 Antworten stammen aus der OpenAI API mit dem Modell gpt-5-mini und aktivierter Websuche. Das erlaubt identische technische Bedingungen für alle Durchläufe. Es ist trotzdem nicht dasselbe wie eine Anfrage in der ChatGPT-App. Dort können Produktauswahl, Einstellungen und Darstellung anders ausfallen. Die Ergebnisse beschreiben daher dieses festgelegte Messverfahren und nicht jede Form der Reiseplanung mit ChatGPT.
Mit welcher Quelle die Angaben verglichen werden
Für den Vergleich wurde vorab eine feste Reihenfolge bestimmt. Zuerst gilt die Website des Betriebs. Widerspricht ihr das Google-Unternehmensprofil, wird die Website für die Prüfung verwendet und der Widerspruch zusätzlich erfasst. Fehlt die gesuchte Angabe, folgt eine telefonische Nachfrage. Was danach offenbleibt, wird als nicht prüfbar ausgewiesen und nicht in die Fehlerquote eingerechnet. Weil solche Fälle aus Zähler und Nenner fallen, lässt sich die Richtung des möglichen Einflusses auf die Quote nicht sicher bestimmen.
Die neun Szenarien im Wortlaut
Sieben Szenarien bilden typische Besuchssituationen ab. Zwei Kontrollfragen prüfen gezielt, ob eine ausdrückliche Aufforderung zur Kontrolle und eine aktuelle lokale Veränderung die Antworten beeinflussen.
- S1, Fähranreise: „Wir kommen am Freitag, 21. August 2026 mit der Fähre aus Schweden in Travemünde an und haben von 9 bis 17 Uhr Zeit, bevor wir weiterfahren. Was können wir in der Zeit in Lübeck sehen und wie kommen wir hin?“
- S2, Altstadt am Montag: „Ich bin am Montag, 24. August 2026 einen Tag in Lübeck. Kannst du mir einen Tagesplan für die Altstadt machen, mit Uhrzeiten?“
- S3, Regentag: „Es soll am Montag, 24. August 2026 den ganzen Tag regnen in Lübeck. Was kann ich da machen? Ich bin mit dem Zug da und habe kein Auto.“
- S4, Familie mit Kindern: „Wir fahren am Samstag, 22. August 2026 mit unseren Kindern (5 und 9) nach Lübeck. Was können wir da den Tag über machen? Wir kommen mit dem Auto.“
- S5, abends essen: „Wo kann ich am Freitagabend, 21. August 2026, in Lübeck gut essen gehen? Wir sind zu viert und wollen so gegen 19:30 Uhr los.“
- S6, Strandtag in Travemünde: „Ich will am Sonntag, 23. August 2026 einen Strandtag in Travemünde machen und auch mal auf den Priwall rüber. Wie plane ich das am besten? Ich starte von der Lübecker Altstadt.“
- S7, barrierefreier Tag: „Meine Mutter sitzt im Rollstuhl. Wir wollen am Samstag, 22. August 2026 nach Lübeck. Was können wir uns dort ansehen, das wirklich barrierefrei ist?“
- K1, Montag mit Prüfaufforderung: „Ich bin am Montag, 24. August 2026 einen Tag in Lübeck. Kannst du mir einen Tagesplan für die Altstadt machen, mit Uhrzeiten? Bitte prüfe für jeden Ort die Öffnungszeiten an diesem Tag.“
- K2, Kreuzfahrtkontrolle: „Ich komme am Freitag, 21. August 2026 mit dem Kreuzfahrtschiff in Travemünde an. Wir sind von 9 bis 17 Uhr an Land. Was kann ich in der Zeit in Lübeck sehen und wie komme ich hin?“
Vorab festgelegt und eingefroren
Szenarien und Auswertungsregeln standen vor Beginn der Erhebung fest. Die Prüfsummen machen spätere Änderungen an den beiden Dateien erkennbar. Eine Abweichung bei der Prüfsumme des Messskripts wird derzeit noch anhand des Änderungsprotokolls geklärt und deshalb hier nicht als abgeschlossen dargestellt.
Szenarien, SHA-256:4DDC828912B70DCC1C7A06161A1492B33988624D43BB84BD46886D296E7D42DE
Präregistrierung, SHA-256:FBC7721C488469C3C3D137317A0BE769071D7E79EA483F2B66BACDFFEF6EE1D1
Grenzen der Aussagekraft
Diese Erhebung bewertet nicht, ob ein Museum sehenswert oder ein Restaurant gut ist. Sie prüft, ob konkrete Angaben in KI-erzeugten Tagesplänen mit den festgelegten Vergleichsquellen übereinstimmen.
Die Untersuchung ist auch keine Sichtbarkeitsstudie. Häufige Nennungen sind kein Gütezeichen. Sie führen lediglich dazu, dass zu einem Haus mehr prüfbare Angaben vorliegen.
Die 90 Antworten wurden mit einer bestimmten API-Konfiguration und innerhalb von fünf Tagen erzeugt. Andere Modelle, spätere Modellfassungen und die ChatGPT-App können zu anderen Ergebnissen kommen. Außerdem hängen die ausgewiesenen Quoten von den neun Lübecker Szenarien und der festgelegten Quellenhierarchie ab.
Erhebungstagebuch
Dieses Protokoll hält fest, was wann gemessen, entschieden und korrigiert wurde. Der neueste Eintrag steht oben.
-
2026-08-13 · Welle 5 abgeschlossen, 90 von 90 Antworten gültig
Erhebung vollständig
Die fünfte und letzte Welle ist erhoben. Über alle fünf Erhebungstage hinweg blieb kein Durchlauf ohne gültige Antwort. In jedem der 90 Pläne hat das Modell die Websuche benutzt, insgesamt 173 Mal, im Schnitt knapp zweimal je Plan. Die Erhebung hat 2,18 Euro gekostet.
Die Websuche wurde in allen 90 Plänen mindestens einmal verwendet. Das zeigt allerdings noch nicht, dass jede einzelne Aussage auf einer gefundenen Quelle beruht. In der nächsten Phase wird deshalb geprüft, welche Quellen das System nennt und ob die konkrete Angabe dort tatsächlich steht.
Als Nächstes werden die Pläne in einzelne Behauptungen zerlegt und gegen die Datenlage der genannten Betriebe geprüft.
-
2026-08-09 · Welle 1 abgeschlossen, 18 von 18 Antworten gültig
Erhebung gestartet
Die erste von fünf Wellen ist erhoben. Auffällig war ein Szenario, das nach einem Kreuzfahrt-Landgang in Travemünde fragt: Der Ostpreußenkai ist seit Juni wegen Einsturzgefahr gesperrt, der einzige für dieses Jahr geplante Anlauf wurde nach Kiel verlegt. In keinem der bisherigen Durchläufe kam das vor.
-
2026-08-09 · vor Erhebungsbeginn
Szenario ausgetauscht, ursprüngliche Fassung als Kontrollfrage weitergeführt
Ein Szenario war zunächst als Kreuzfahrt-Landgang formuliert. Die Recherche vor dem Einfrieren ergab, dass Travemünde in diesem Jahr faktisch keine Kreuzfahrtschiffe abfertigt, womit die Frage keine Alltagssituation mehr abbildet. Sie wurde durch eine Fähranreise mit gleichem Zeitfenster ersetzt. Der ursprüngliche Wortlaut läuft als Kontrollfrage weiter und misst etwas anderes, nämlich ob eine lokale Veränderung vom Juni 2026 in den Antworten angekommen ist.
Kontakt und Nachnutzung
Rückfragen zur Methodik beantworte ich gern. Betriebe und Einrichtungen, die in der Erhebung vorkommen, erhalten ihre Einzelauswertung auf Anfrage nach Studienabschluss.
Die Erhebung ist eigenfinanziert und entstand ohne Auftrag, Beteiligung oder Vorabkenntnis eines der untersuchten Betriebe oder Verbände.
