llms.txt, JSON-LD, zitierfähige Fakten: die technische Checkliste für KI-Sichtbarkeit
KI-Systeme lesen Websites ähnlich wie Crawler: Sie sehen das ausgelieferte HTML, suchen nach eindeutigen Entitäten und bevorzugen Aussagen, die sich zitieren lassen. Diese Checkliste legt die acht Kriterien offen, nach denen der kostenlose QueryHalo-Check eine Startseite bewertet – samt Gewichtung und Schwellen, damit Sie die Prüfung auch ohne uns nachvollziehen können.
QueryHalo ist ein einmaliges KI-Sichtbarkeits-Audit: 6 neutrale Kaufanfragen gehen an 3 KI-Modelle (GPT, Claude, Gemini), alle 18 Antworten werden mit den genannten Mitbewerbern dokumentiert. Der Website-Check ist kostenlos; der vollständige Bericht kostet einmalig 29 € (3 Audits 59 €, 10 Audits 149 €), dauert meist 1–3 Minuten und liegt als PDF und JSON vor.
Die acht Kriterien auf einen Blick
Alle Kriterien werden am Server-HTML der Startseite geprüft, also ohne Ausführen von JavaScript. Die Schwellen sind bewusst erreichbar: Sie beschreiben Grundlagen, nicht Perfektion.
| Kriterium | Punkte | Volle Punkte, wenn … | Teilpunkte |
|---|---|---|---|
| Seitentitel (Title-Tag) | 14 | der Titel mindestens 20 Zeichen hat | 7 bei kürzerem Titel, 0 ohne Titel |
| Meta-Description | 12 | die Beschreibung mindestens 80 Zeichen hat | 6 bei kürzerer Beschreibung, 0 ohne |
| Hauptüberschrift (H1) | 12 | die erste H1 mindestens 12 Zeichen hat | 6 bei kürzerer H1, 0 ohne H1 |
| Strukturierte Entitätsdaten (JSON-LD) | 20 | ein JSON-LD-Block den Typ Organization, Corporation, LocalBusiness, Product, SoftwareApplication oder Service enthält | 8, wenn JSON-LD ohne diese Typen vorhanden ist; 0 ohne JSON-LD |
| Markenname im Seitentext | 12 | der erkannte Markenname im sichtbaren Text vorkommt | 4, wenn nicht |
| Zitierfähige Fakten | 20 | mindestens vier Zahlen mit Einheit oder Währung im Text stehen | 5 Punkte je Fakt |
| robots.txt erreichbar | 8 | /robots.txt mit Status 200 antwortet | 4, wenn nicht erreichbar |
| llms.txt (optional) | 2 | immer – die Datei ist ein Hinweis, kein Kriterium | – |
1. Seitentitel und 2. Meta-Description
Der Title-Tag ist die kürzeste Beschreibung Ihrer Seite und wird von Suchmaschinen wie von Modellen als Entitätsname gelesen. Nennen Sie das Angebot und die Marke, zum Beispiel „KI-Sichtbarkeit prüfen: Empfiehlt KI Ihre Firma? | QueryHalo“. Für volle Punkte genügen 20 Zeichen; für Suchergebnisse sind 30–60 Zeichen üblich.
Die Meta-Description ist die zitierfähige Kurzfassung: Angebot, Zielgruppe, Region und ein belegbarer Unterschied in 110–155 Zeichen. Sie beeinflusst keine Rankings direkt, wird aber häufig als Zusammenfassung übernommen. Ab 80 Zeichen gibt es volle Punkte.
3. Hauptüberschrift
Genau eine H1 pro Seite, die Kategorie, Nutzen und Zielgruppe verbindet. „Willkommen“ ist keine Überschrift, mit der ein Modell etwas anfangen kann. Prüfen Sie im Quelltext, dass die H1 im HTML steht und nicht erst per JavaScript erzeugt wird.
4. Strukturierte Entitätsdaten in JSON-LD
JSON-LD ist der direkteste Weg, einer Maschine zu sagen, wer Sie sind. Zeichnen Sie die Firma als Organization aus (Name, URL, Adresse, Kontakt) und das Angebot als Product, Service oder SoftwareApplication mit Offers – Preis, Währung, Verfügbarkeit. Verwenden Sie in Text, Title und JSON-LD denselben Namen; abweichende Schreibweisen zerlegen eine Entität in mehrere.
Der Check vergibt volle Punkte, sobald einer der Typen Organization, Corporation, LocalBusiness, Product, SoftwareApplication oder Service als Zeichenkette im JSON-LD vorkommt. Prüfen Sie Ihre Auszeichnung mit dem Schema.org-Validator und dem Google Rich Results Test; beide sind kostenlos.
5. Markenname im sichtbaren Text
Klingt banal, scheitert aber oft: Der Firmenname steht im Logo als Bild, im Footer als Grafik und sonst nirgends. Modelle lesen Text. Nennen Sie die Marke im Fließtext der Startseite, idealerweise in einem Satz, der sagt, was sie ist: „QueryHalo ist ein einmaliges KI-Sichtbarkeits-Audit …“. Der Check erkennt den Markennamen aus JSON-LD, og:site_name oder Titel und sucht ihn im Text.
6. Zitierfähige Fakten
Modelle bevorzugen Aussagen, die sich als Zahl mit Einheit wiedergeben lassen: Preise („29 €“), Mengen („18 Antworten“ zählt nur mit einer erkannten Einheit, „3 Modelle“ nicht), Zeiträume („seit 12 Jahren“), Anteile („67 %“), Kundenzahlen, Standorte, Bearbeitungszeiten. Vier solche Fakten auf der Startseite ergeben volle Punkte. Vage Superlative („führend“, „innovativ“) zählen nicht – weder im Check noch in Modellantworten.
Gute Orte für Fakten: ein kurzer Definitionssatz unter der H1, eine Preisangabe, ein datierter Hinweis „Zuletzt aktualisiert“, konkrete Leistungsgrenzen.
7. robots.txt und KI-Crawler
Eine erreichbare robots.txt ist die Voraussetzung dafür, dass Crawler überhaupt wissen, was sie dürfen. Für KI-Sichtbarkeit lohnt ein Blick auf die Crawler, die Modellanbieter dokumentieren: GPTBot und OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot, Google-Extended (steuert die Nutzung für Gemini-Training getrennt vom Googlebot), Applebot-Extended und Bingbot. Wer diese Crawler sperrt, entscheidet sich bewusst gegen Sichtbarkeit in den jeweiligen Systemen – das kann richtig sein, sollte aber eine Entscheidung und kein Zufall sein.
QueryHalo erlaubt diese Crawler auf queryhalo.app ausdrücklich und sperrt nur die Berichts- und API-Routen. Der Check prüft nur die Erreichbarkeit der Datei, nicht ihren Inhalt.
8. llms.txt – optional, aber günstig
llms.txt ist ein Vorschlag von llmstxt.org: eine Markdown-Datei unter /llms.txt, die einer Maschine in wenigen Zeilen erklärt, was die Website ist, und die wichtigsten Seiten verlinkt. Es gibt keine Zusage der großen Modellanbieter, die Datei auszuwerten; deshalb vergibt der Check die 2 Punkte immer und behandelt die Datei als Hinweis. Der Aufwand ist gering, und die Datei zwingt Sie, Ihr Angebot in einem Absatz zu erklären – das allein ist nützlich. Ein Beispiel finden Sie unter queryhalo.app/llms.txt.
Reihenfolge der Umsetzung
- Title, Description und H1 im HTML ausliefern – ein Nachmittag, größte Wirkung pro Stunde.
- Einen Definitionssatz mit vier Fakten unter die H1 setzen und den Markennamen im Text nennen.
- Organization plus Product/Service/SoftwareApplication als JSON-LD ergänzen und validieren.
- robots.txt prüfen; bewusst entscheiden, welche KI-Crawler erlaubt sind.
- llms.txt ergänzen, danach den Check wiederholen.
Häufige Fragen
Warum zählt llms.txt nur 2 Punkte?+
Weil kein großer Modellanbieter dokumentiert hat, die Datei zu lesen. Wir wollen niemanden für eine fehlende Datei bestrafen, deren Wirkung unbelegt ist; deshalb werden die 2 Punkte immer vergeben. Der Check zeigt aber an, ob sie vorhanden ist.
Reicht JSON-LD auf einer Unterseite?+
Der Check liest nur die Startseite, weil sie die Seite ist, die Crawler und Modelle am häufigsten sehen. Zeichnen Sie die Organisation auf jeder Seite aus und das konkrete Angebot dort, wo es beschrieben wird.
Wie prüfe ich, was ein Crawler sieht?+
Rufen Sie Ihre Startseite mit curl oder „Seitenquelltext anzeigen“ auf. Was dort nicht steht, existiert für den Check und für viele Crawler nicht. Der kostenlose QueryHalo-Check macht genau das und zeigt die acht Kriterien mit Punkten.
Quellen
- llms.txt proposal (llmstxt.org) (https://llmstxt.org/)
- OpenAI: Overview of OpenAI crawlers (GPTBot, OAI-SearchBot, ChatGPT-User) (https://platform.openai.com/docs/bots)
- Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler? (https://support.anthropic.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler)
- Perplexity: Perplexity crawlers (https://docs.perplexity.ai/guides/bots)
- Google: Overview of Google crawlers and fetchers (incl. Google-Extended) (https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)
- Apple: About Applebot and Applebot-Extended (https://support.apple.com/en-us/119829)
- Microsoft Bing: Which crawlers does Bing use? (https://www.bing.com/webmasters/help/which-crawlers-does-bing-use-8c184ec0)
- RFC 9309: Robots Exclusion Protocol (https://www.rfc-editor.org/rfc/rfc9309.html)
- Google: Introduction to robots.txt (https://developers.google.com/search/docs/crawling-indexing/robots/intro)
- Schema.org validator (https://validator.schema.org/)
- Google Rich Results Test (https://search.google.com/test/rich-results)