Zuletzt aktualisiert:

90 Tagespläne erhoben · Prüfung läuft

Wie zuverlässig plant ChatGPT einen Tag in Lübeck?

Kommt ein Gast durch den Tag, wenn er einen KI-erzeugten Reiseplan für Lübeck befolgt? Um diese Frage zu beantworten, wurden 90 Tagespläne für vier konkrete Termine im August 2026 erstellt. Geprüft wird nun jede enthaltene Angabe: Hat ein Museum an diesem Tag geöffnet? Gibt es das genannte Restaurant noch? Reicht die eingeplante Zeit für den Weg? Erzeugt wurden die Pläne mit GPT-5 mini über die OpenAI API und mit aktivierter Websuche. Die Messung bildet die normale ChatGPT-App daher nur näherungsweise ab.

Patrick Stolp · SEO-Experte · Lübeck

Typ
Laufende Auswertung, ohne Begutachtung
Fassung
0.1, laufende Auswertung
Erhebung
2026-08-09 bis 2026-08-13, fünf Wellen an fünf Tagen
System
OpenAI API, gpt-5-mini mit Websuche und Standort Lübeck
Vorab festgelegt
Neun Szenarien und alle Auswertungsregeln vor Welle 1 eingefroren
Interessenkonflikt
Die Erhebung ist eigenfinanziert und entstand ohne Auftrag eines der untersuchten Betriebe oder Verbände.
Lizenz
Nachnutzung mit Quellenangabe und Wellennummer erwünscht
Welle
5 von 5 erhoben
Gültige Antworten
90 von 90
Erhoben bis
2026-08-13
Nächste Aktualisierung
mit den ersten Prüfergebnissen, voraussichtlich Ende August 2026

Alle 90 Tagespläne liegen vor.

Stolp, Patrick (2026): Wie zuverlässig plant ChatGPT einen Tag in Lübeck? Laufende Auswertung. patrickstolp.de/ki-reiseplanung-luebeck/.

Kurzfassung

Wie zuverlässig sind KI-erzeugte Tagespläne für Lübeck? Hierzu wurden neun vorab festgelegte Szenarien jeweils zehnmal über die OpenAI API abgefragt. Die 90 Pläne entstanden an fünf verschiedenen Tagen. Die Prüfung bezieht sich auf konkrete Angaben. Sind die genannten Orte am geplanten Tag zugänglich? Stimmen Öffnungszeiten, Preise und Wege?

Alle 90 Tagespläne liegen vor. Die enthaltenen Aussagen werden derzeit gegen die Websites der Betriebe, ihre Google-Unternehmensprofile und bei offenen Fällen gegen weitere Quellen geprüft. Ergebnisse werden erst eingetragen, wenn diese Prüfung abgeschlossen ist. Der folgende Plan aus der ersten Welle zeigt bis dahin, wie eine einzelne Angabe bewertet wird.

9vorab eingefrorene Szenarien, davon zwei Kontrollfragen
90erhobene Tagespläne, jeder einzelne mit Websuche des Modells
5Erhebungstage gegen die Streuung der Suchsysteme
4konkrete Termine im August, auf die sich die Pläne beziehen

So wird ein Tagesplan geprüft

Der folgende Auszug stammt unverändert aus der ersten Erhebungswelle. Gefragt wurde nach einem Tag in der Lübecker Altstadt am Montag, dem 24. August 2026. Markiert ist eine Station, deren Prüfung bereits abgeschlossen wurde.

Szenario S2 · Ein Tag in der Altstadt · Montag, 24. August 2026 · Welle 1, Durchlauf 1

  1. 09:00 Holstentor und Holstentorplatz
    Außenrundgang, Fotos, Salzspeicher an der Obertrave.
  2. 09:30–10:45 Museum Holstentor
    Ausstellung zur Stadtgeschichte, 45 bis 75 Minuten.
  3. 10:50–11:20 Rathaus und Rathausmarkt
    Spaziergang über die Breite Straße, Außenansicht.
  4. 11:25–12:00 Marienkirche
    Innenbesuch, Astronomische Uhr, 30 bis 40 Minuten.
  5. 12:05–13:30 Mittagessen in der Altstadt
    Vorschlag ohne feste Reservierungsangabe.
  6. 13:35–14:30 Buddenbrookhaus
    Als offene Station eingeplant, mit dem Zusatz, das Haus sei montags in der Regel geöffnet. Geprüft · nicht zugänglich

Auszug. Der vollständige Plan umfasst elf Stationen und ist Teil der veröffentlichten Rohdaten.

Vorläufig

Dieser Plan ist ein einzelnes Beispiel aus 90 erhobenen. Er zeigt die Prüflogik, aber keine Häufigkeit. Wie oft solche Stellen vorkommen, steht erst fest, wenn alle Behauptungen aus allen 90 Plänen geprüft sind.

Welche Fehler gezählt werden

Jeder Tagesplan wird in einzelne prüfbare Aussagen zerlegt. Eine genannte Uhrzeit, ein Eintrittspreis oder eine eingeplante Wegdauer wird dabei getrennt bewertet. Vor Beginn der Erhebung wurden sechs Fehlerklassen festgelegt. Ihre Häufigkeiten werden erst nach Abschluss der Prüfung veröffentlicht. Neben jeder Quote stehen dann der Zähler, der Nenner und ein Intervall, das die Abhängigkeiten innerhalb eines Tagesplans berücksichtigt.

FehlerklasseWas geprüft wirdAnteil95-%-Intervall
Ort nicht zugänglichBetrieb dauerhaft geschlossen, umgezogen oder umbenannt––
Ruhetag übergangenStation an einem Tag eingeplant, an dem geschlossen ist––
Öffnungszeit falschGenannte Zeit weicht von der Website des Betriebs ab––
Weg zu knappEingeplante Wegdauer unterschreitet die tatsächliche––
Preis falschGenannter Eintritt weicht vom veröffentlichten ab––
Nicht prüfbarBetrieb veröffentlicht keine belastbaren Angaben––

Tabelle 1: Vorab festgelegte Fehlerklassen. Werte folgen nach Abschluss der Prüfung.

Öffentliche Einrichtungen werden namentlich genannt. Einzelne Gastronomiebetriebe bleiben anonym, sofern die Nennung sie als negatives Beispiel exponieren würde.

Welche Datenprobleme geprüft werden

Für jede falsche oder nicht prüfbare Angabe wird zusätzlich dokumentiert, welche Informationen der Betrieb selbst veröffentlicht. Dieser Teil ist noch nicht ausgewertet. Die folgenden fünf Punkte sind daher Prüfmerkmale und keine vorweggenommenen Ergebnisse.

Öffnungszeiten stehen nur in einem Bild oder PDF

Wichtige Angaben sollten als normaler Text auf der Website stehen. Google empfiehlt für seine generativen Suchfunktionen ausdrücklich, zentrale Inhalte in Textform bereitzustellen. Ein Bild mit Öffnungszeiten kann für Menschen lesbar sein, lässt sich von Such- und Antwortsystemen jedoch weniger zuverlässig verarbeiten.

Website und Google-Unternehmensprofil widersprechen sich

Geprüft wird, ob auf der Website und im Google-Unternehmensprofil dieselben regulären und besonderen Öffnungszeiten stehen. Google weist Unternehmen selbst darauf hin, Adresse, Öffnungszeiten und Kontaktdaten aktuell zu halten. Ein Widerspruch lässt offen, welche Angabe ein Suchsystem übernimmt.

Veraltete Angaben stehen noch auf Portalen

Neben der eigenen Website werden häufig genannte Branchen- und Reiseportale geprüft. Weicht ein alter Portaleintrag von der Betreiberseite ab, wird der Widerspruch dokumentiert. Ob er die konkrete KI-Antwort verursacht hat, lässt sich daraus allein noch nicht ableiten.

Öffnungszeiten fehlen im LocalBusiness-Markup

Strukturierte Daten sind keine Voraussetzung für eine Nennung in generativen Suchfunktionen. Mit dem LocalBusiness-Markup lassen sich Öffnungszeiten allerdings eindeutig für Google auszeichnen. Geprüft wird deshalb, ob vorhandene strukturierte Daten mit dem sichtbaren Text und dem Google-Unternehmensprofil übereinstimmen.

Der Such-Crawler darf die Website nicht abrufen

Für die ChatGPT-Suche ist der OAI-SearchBot maßgeblich. GPTBot hat dagegen eine andere Aufgabe und wird für mögliches Modelltraining eingesetzt. Eine Sperre von GPTBot bedeutet daher nicht automatisch, dass eine Seite aus den Suchantworten verschwindet. Geprüft werden die robots.txt-Regeln und mögliche technische Sperren für den Such-Crawler getrennt. OpenAI beschreibt die Aufgaben der einzelnen Crawler in seiner technischen Dokumentation.

Selbst prüfen

Wer einen Gastbetrieb, ein Hotel oder ein Museum in Lübeck führt, kann die Prüfung in wenigen Minuten selbst durchführen. Die folgenden Schritte entsprechen dem Vorgehen dieser Erhebung im Kleinen.

  1. Stellen Sie einem KI-Assistenten eine Frage, wie ein Gast sie stellen würde, und nennen Sie darin ein konkretes Datum in der Zukunft.
  2. Prüfen Sie, ob Ihr Haus überhaupt vorkommt und mit welcher Adresse.
  3. Vergleichen Sie die genannten Öffnungszeiten mit denen auf Ihrer Website.
  4. Vergleichen Sie beides mit Ihrem Google-Unternehmensprofil. Weichen die Angaben voneinander ab, ist offen, welche Fassung ein Gast zu sehen bekommt.
  5. Suchen Sie nach Ihrem Betrieb auf Portalen und prüfen Sie dort dieselben Angaben.
  6. Wiederholen Sie die erste Frage an einem anderen Tag. Verschiedene Antworten sind normal und selbst ein Ergebnis.

Hinweis

Diese Erhebung ist eigenfinanziert und verfolgt keinen Verkaufszweck. Für die Prüfung wird nichts benötigt, was Geld kostet.

So wird gemessen

Warum ein Datum im Prompt steht

Ohne Datum lässt sich keine Öffnungszeit prüfen. Jedes Szenario nennt deshalb einen konkreten Tag. Zwei der vier Termine fallen auf einen Montag, den klassischen Ruhetag im Museumsbetrieb. Das ist kein Fallenstellen, denn Montag ist ein normaler Anreisetag.

Warum zehn Wiederholungen an fünf Tagen

Auch bei gleichem Wortlaut können KI-Antworten voneinander abweichen. Eine einzelne Antwort reicht deshalb nicht aus, um die Zuverlässigkeit eines Szenarios zu beurteilen. Die zehn Wiederholungen verteilen sich auf fünf Erhebungstage. So wird sichtbar, welche Angaben regelmäßig und welche nur vereinzelt vorkommen.

Was genau gemessen wurde

Die 90 Antworten stammen aus der OpenAI API mit dem Modell gpt-5-mini und aktivierter Websuche. Das erlaubt identische technische Bedingungen für alle Durchläufe. Es ist trotzdem nicht dasselbe wie eine Anfrage in der ChatGPT-App. Dort können Produktauswahl, Einstellungen und Darstellung anders ausfallen. Die Ergebnisse beschreiben daher dieses festgelegte Messverfahren und nicht jede Form der Reiseplanung mit ChatGPT.

Mit welcher Quelle die Angaben verglichen werden

Für den Vergleich wurde vorab eine feste Reihenfolge bestimmt. Zuerst gilt die Website des Betriebs. Widerspricht ihr das Google-Unternehmensprofil, wird die Website für die Prüfung verwendet und der Widerspruch zusätzlich erfasst. Fehlt die gesuchte Angabe, folgt eine telefonische Nachfrage. Was danach offenbleibt, wird als nicht prüfbar ausgewiesen und nicht in die Fehlerquote eingerechnet. Weil solche Fälle aus Zähler und Nenner fallen, lässt sich die Richtung des möglichen Einflusses auf die Quote nicht sicher bestimmen.

Die neun Szenarien im Wortlaut

Sieben Szenarien bilden typische Besuchssituationen ab. Zwei Kontrollfragen prüfen gezielt, ob eine ausdrückliche Aufforderung zur Kontrolle und eine aktuelle lokale Veränderung die Antworten beeinflussen.

  1. S1, Fähranreise: „Wir kommen am Freitag, 21. August 2026 mit der Fähre aus Schweden in Travemünde an und haben von 9 bis 17 Uhr Zeit, bevor wir weiterfahren. Was können wir in der Zeit in Lübeck sehen und wie kommen wir hin?“
  2. S2, Altstadt am Montag: „Ich bin am Montag, 24. August 2026 einen Tag in Lübeck. Kannst du mir einen Tagesplan für die Altstadt machen, mit Uhrzeiten?“
  3. S3, Regentag: „Es soll am Montag, 24. August 2026 den ganzen Tag regnen in Lübeck. Was kann ich da machen? Ich bin mit dem Zug da und habe kein Auto.“
  4. S4, Familie mit Kindern: „Wir fahren am Samstag, 22. August 2026 mit unseren Kindern (5 und 9) nach Lübeck. Was können wir da den Tag über machen? Wir kommen mit dem Auto.“
  5. S5, abends essen: „Wo kann ich am Freitagabend, 21. August 2026, in Lübeck gut essen gehen? Wir sind zu viert und wollen so gegen 19:30 Uhr los.“
  6. S6, Strandtag in Travemünde: „Ich will am Sonntag, 23. August 2026 einen Strandtag in Travemünde machen und auch mal auf den Priwall rüber. Wie plane ich das am besten? Ich starte von der Lübecker Altstadt.“
  7. S7, barrierefreier Tag: „Meine Mutter sitzt im Rollstuhl. Wir wollen am Samstag, 22. August 2026 nach Lübeck. Was können wir uns dort ansehen, das wirklich barrierefrei ist?“
  8. K1, Montag mit Prüfaufforderung: „Ich bin am Montag, 24. August 2026 einen Tag in Lübeck. Kannst du mir einen Tagesplan für die Altstadt machen, mit Uhrzeiten? Bitte prüfe für jeden Ort die Öffnungszeiten an diesem Tag.“
  9. K2, Kreuzfahrtkontrolle: „Ich komme am Freitag, 21. August 2026 mit dem Kreuzfahrtschiff in Travemünde an. Wir sind von 9 bis 17 Uhr an Land. Was kann ich in der Zeit in Lübeck sehen und wie komme ich hin?“

Vorab festgelegt und eingefroren

Szenarien und Auswertungsregeln standen vor Beginn der Erhebung fest. Die Prüfsummen machen spätere Änderungen an den beiden Dateien erkennbar. Eine Abweichung bei der Prüfsumme des Messskripts wird derzeit noch anhand des Änderungsprotokolls geklärt und deshalb hier nicht als abgeschlossen dargestellt.

Szenarien, SHA-256:
4DDC828912B70DCC1C7A06161A1492B33988624D43BB84BD46886D296E7D42DE

Präregistrierung, SHA-256:
FBC7721C488469C3C3D137317A0BE769071D7E79EA483F2B66BACDFFEF6EE1D1

Grenzen der Aussagekraft

Diese Erhebung bewertet nicht, ob ein Museum sehenswert oder ein Restaurant gut ist. Sie prüft, ob konkrete Angaben in KI-erzeugten Tagesplänen mit den festgelegten Vergleichsquellen übereinstimmen.

Die Untersuchung ist auch keine Sichtbarkeitsstudie. Häufige Nennungen sind kein Gütezeichen. Sie führen lediglich dazu, dass zu einem Haus mehr prüfbare Angaben vorliegen.

Die 90 Antworten wurden mit einer bestimmten API-Konfiguration und innerhalb von fünf Tagen erzeugt. Andere Modelle, spätere Modellfassungen und die ChatGPT-App können zu anderen Ergebnissen kommen. Außerdem hängen die ausgewiesenen Quoten von den neun Lübecker Szenarien und der festgelegten Quellenhierarchie ab.

Erhebungstagebuch

Dieses Protokoll hält fest, was wann gemessen, entschieden und korrigiert wurde. Der neueste Eintrag steht oben.

  • 2026-08-13 · Welle 5 abgeschlossen, 90 von 90 Antworten gültig

    Erhebung vollständig

    Die fünfte und letzte Welle ist erhoben. Über alle fünf Erhebungstage hinweg blieb kein Durchlauf ohne gültige Antwort. In jedem der 90 Pläne hat das Modell die Websuche benutzt, insgesamt 173 Mal, im Schnitt knapp zweimal je Plan. Die Erhebung hat 2,18 Euro gekostet.

    Die Websuche wurde in allen 90 Plänen mindestens einmal verwendet. Das zeigt allerdings noch nicht, dass jede einzelne Aussage auf einer gefundenen Quelle beruht. In der nächsten Phase wird deshalb geprüft, welche Quellen das System nennt und ob die konkrete Angabe dort tatsächlich steht.

    Als Nächstes werden die Pläne in einzelne Behauptungen zerlegt und gegen die Datenlage der genannten Betriebe geprüft.

  • 2026-08-09 · Welle 1 abgeschlossen, 18 von 18 Antworten gültig

    Erhebung gestartet

    Die erste von fünf Wellen ist erhoben. Auffällig war ein Szenario, das nach einem Kreuzfahrt-Landgang in Travemünde fragt: Der Ostpreußenkai ist seit Juni wegen Einsturzgefahr gesperrt, der einzige für dieses Jahr geplante Anlauf wurde nach Kiel verlegt. In keinem der bisherigen Durchläufe kam das vor.

  • 2026-08-09 · vor Erhebungsbeginn

    Szenario ausgetauscht, ursprüngliche Fassung als Kontrollfrage weitergeführt

    Ein Szenario war zunächst als Kreuzfahrt-Landgang formuliert. Die Recherche vor dem Einfrieren ergab, dass Travemünde in diesem Jahr faktisch keine Kreuzfahrtschiffe abfertigt, womit die Frage keine Alltagssituation mehr abbildet. Sie wurde durch eine Fähranreise mit gleichem Zeitfenster ersetzt. Der ursprüngliche Wortlaut läuft als Kontrollfrage weiter und misst etwas anderes, nämlich ob eine lokale Veränderung vom Juni 2026 in den Antworten angekommen ist.

Kontakt und Nachnutzung

Rückfragen zur Methodik beantworte ich gern. Betriebe und Einrichtungen, die in der Erhebung vorkommen, erhalten ihre Einzelauswertung auf Anfrage nach Studienabschluss.

Die Erhebung ist eigenfinanziert und entstand ohne Auftrag, Beteiligung oder Vorabkenntnis eines der untersuchten Betriebe oder Verbände.