llms.txt: Was die Datei ist, wie man sie erstellt und was sie wirklich bringt
Eine llms.txt ist eine Textdatei im Stammverzeichnis einer Website, die in einfachem Markdown auflistet, welche Seiten für Sprachmodelle wichtig sind. Der Vorschlag stammt aus dem Herbst 2024. Bis heute hat keiner der großen Anbieter bestätigt, dass seine Systeme die Datei für Antworten nutzen; Google hat gesagt, dass es sie nicht verwendet. Ihren praktischen Nutzen hat sie bei Entwickler-Dokumentationen, die KI-Werkzeuge auf Abruf lesen. Für die Frage, ob ein Unternehmen in ChatGPT oder Perplexity genannt wird, entscheidet sie nichts. Erstellen lässt sie sich in dreißig Minuten und ohne Geld; wer sie als eigenständige Maßnahme für KI-Sichtbarkeit verkauft, verkauft dreißig Minuten Arbeit.
Was ist eine llms.txt?
Die llms.txt ist ein Vorschlag von Jeremy Howard, veröffentlicht im September 2024 unter llmstxt.org. Die Idee: Websites legen unter /llms.txt eine Datei ab, die in Markdown beschreibt, worum es auf der Seite geht und welche Unterseiten den Kern tragen. Sprachmodelle haben ein begrenztes Kontextfenster und tun sich mit Navigation, Werbung und Skripten schwer; eine kuratierte Liste mit kurzen Beschreibungen soll ihnen den Weg zu den wichtigen Inhalten abkürzen.
Damit steht die Datei neben drei älteren Dateien, die etwas anderes tun. Die robots.txt regelt, welche Crawler welche Bereiche abrufen dürfen, auch die Crawler der KI-Anbieter. Die sitemap.xml listet alle Adressen für Suchmaschinen, ohne Gewichtung. Strukturierte Daten nach Schema.org beschreiben Fakten maschinenlesbar im Quelltext der Seite selbst. Die llms.txt ist dagegen eine Empfehlung an Programme, die sie annehmen können oder nicht: ein Inhaltsverzeichnis mit Prioritäten.
Als Ergänzung hat sich die llms-full.txt eingebürgert. Sie enthält den vollständigen Text der wichtigsten Seiten in einer einzigen Datei, damit ein Werkzeug alles auf einmal laden kann. Die Spezifikation schlägt außerdem vor, jede Seite zusätzlich als Markdown anzubieten, erreichbar über die Adresse der Seite mit angehängtem „.md“.
Wie ist eine llms.txt aufgebaut?
Das Format ist bewusst klein gehalten, damit Menschen und Programme es gleichermaßen lesen können:
- Eine Überschrift erster Ordnung mit dem Namen der Website oder des Projekts. Sie ist der einzige Pflichtteil.
- Ein Zitatblock mit einer Zusammenfassung in ein bis drei Sätzen.
- Optional ein paar Absätze oder Listen mit Hintergrund, etwa zur Zielgruppe oder zu Begriffen.
- Abschnitte mit Überschriften zweiter Ordnung, darunter Listen von Links: je Zeile ein Bindestrich, der Seitenname in eckigen Klammern, die Adresse in runden Klammern und nach einem Doppelpunkt eine kurze Beschreibung.
- Ein Abschnitt „Optional“ für Seiten, die ein Programm überspringen darf, wenn der Platz knapp wird.
So sähe die Datei für einen Dachdeckerbetrieb aus: In der ersten Zeile steht der Name, „Beispiel Dachdeckerei“, darunter als Zitat die Zusammenfassung, „Dachdeckerbetrieb in Musterstadt, spezialisiert auf Steildach, Flachdach und Dachsanierung für Privathäuser und Gewerbe“. Dann folgen drei Abschnitte:
- Leistungen: die Seiten Dachsanierung („Ablauf, Dauer, Kostenrahmen“), Flachdach („Abdichtung, Begrünung, Wartung“) und Notdienst („Erreichbarkeit, Einsatzgebiet“), jede als Link mit der Beschreibung hinter dem Doppelpunkt.
- Unternehmen: die Seiten Über uns („Team, Qualifikationen, Einsatzgebiet“) und Kontakt.
- Optional: der Ratgeber („Beiträge zu Dachpflege und Förderung“).
Mehr braucht es nicht, etwa fünfzehn Zeilen. Die Beschreibungen hinter dem Doppelpunkt sind der eigentliche Wert der Datei: Sie sagen einem Programm, was es auf der Seite findet, ohne dass es die Seite laden muss.
Lesen KI-Systeme die llms.txt überhaupt?
Das ist die entscheidende Frage, und die Antwort fällt nüchtern aus. Weder OpenAI noch Anthropic, Perplexity oder Google haben dokumentiert, dass ihre Crawler oder ihre Antwortsysteme die Datei auswerten. Google-Mitarbeiter haben 2025 mehrfach öffentlich gesagt, dass Google die Datei nicht nutzt; eine Unterstützung ist nicht angekündigt. Ein Vorschlag wird erst zum Standard, wenn die Gegenseite ihn annimmt, und das ist bislang nicht geschehen.
Die Zugriffsdaten passen dazu. Der Werkzeuganbieter Ahrefs hat für den Mai 2026 die Zugriffsprotokolle von etwa 137.000 Websites untersucht. Bei 97 Prozent der vorhandenen llms.txt-Dateien gab es im ganzen Monat keinen einzigen Abruf. Wo Abrufe vorkamen, stammten sie überwiegend von Prüfwerkzeugen und klassischen Crawlern. Unter den KI-Werkzeugen lag der Crawler von OpenAI vorn, gefolgt vom Programmier-Assistenten Claude Code.
Wann ist eine llms.txt sinnvoll, und wann nicht?
Sinnvoll ist sie für Websites, deren Inhalte von KI-Werkzeugen gezielt geladen werden: Software-Dokumentationen, Schnittstellenbeschreibungen, umfangreiche Fachportale, Wissensdatenbanken für den Kundenservice. Dort spart sie dem Werkzeug Umwege und dem Nutzer Zeit, und die llms-full.txt ersetzt das mühsame Zusammenkopieren einzelner Seiten.
Für ein Unternehmen, das in KI-Antworten als Anbieter genannt werden will, ist sie wirkungslos, aber unschädlich. Im Betrieb entstehen keine Kosten, solange zwei Bedingungen gelten: Die Datei muss zum Inhalt der Website passen, also keine Seiten nennen, die es nicht mehr gibt oder die per robots.txt gesperrt sind, und sie darf nichts aufführen, was nicht öffentlich sein soll. Eine veraltete llms.txt ist schlechter als keine, weil sie einem Programm, das sie doch liest, falsche Wegweiser gibt.
Wer eine Website für KI optimieren will, setzt an anderer Stelle an: bei der Erreichbarkeit für KI-Crawler, bei Seiten, die eine Frage vollständig beantworten, bei strukturierten Daten und bei Erwähnungen durch Dritte. Was davon in welcher Reihenfolge zählt, steht in In ChatGPT, Claude & Co. gefunden werden.
Wie erstellt man eine llms.txt?
Für eine Unternehmenswebsite reicht eine halbe Stunde:
- Die zehn bis dreißig Seiten auswählen, die das Angebot tragen: Leistungen, Unternehmen, Kontakt, die wichtigsten Ratgeber. Impressum, Datenschutz und Archivseiten gehören nicht hinein.
- Je Seite eine Beschreibung in einem Satz schreiben, die sagt, was dort steht, nicht, wie gut es ist.
- Die Datei nach dem Muster oben aufbauen, als reine Textdatei in UTF-8, mit vollständigen Adressen inklusive https://.
- Die Datei unter /llms.txt im Stammverzeichnis ablegen und im Browser aufrufen; sie muss als Text erscheinen, ohne Umleitung und ohne Anmeldung.
- Die Pflege festlegen: Bei jeder neuen oder gelöschten Seite die Liste anpassen. Wer das nicht leisten kann, lässt die Datei automatisch aus der Seitenstruktur erzeugen.
Für WordPress erzeugen gängige SEO-Plugins die Datei inzwischen auf Knopfdruck aus den veröffentlichten Seiten; die Beschreibungen kommen dann aus den Meta-Beschreibungen, und ein Blick hinein lohnt sich, weil dort oft Werbesprache statt Inhaltsangabe steht. Kostenlose Generatoren im Netz lesen eine Website ein und schlagen eine Datei vor; das Ergebnis ist ein Entwurf, den jemand prüfen muss. Eine llms-full.txt lohnt sich nur, wenn Inhalte tatsächlich von Werkzeugen komplett geladen werden sollen, etwa eine Dokumentation.
Was darf eine llms.txt kosten?
Nichts, außer der halben Stunde. Die Datei besteht aus Überschriften und Links, jede Person mit Zugang zum Webspace kann sie anlegen, und Plugins oder Generatoren erledigen es in Minuten. Deshalb lohnt sich ein genauer Blick, wenn sie in einem Angebot auftaucht:
- Als Punkt in einem technischen Audit, neben robots.txt, Sitemap und strukturierten Daten: in Ordnung, das ist eine halbe Stunde Arbeit im Rahmen einer größeren Prüfung.
- Als eigenständige Maßnahme „für KI-Sichtbarkeit“ mit eigenem Preis, als Paketbestandteil mit Wirkungsversprechen oder als monatlich abgerechnete „Überwachung“: Hier fehlt der Beleg, dass die Datei irgendetwas an der Nennung in KI-Antworten ändert. Wer sie so verkauft, sollte erklären können, welches System sie liest und wie sich der Effekt messen lässt.
Der Unterschied zwischen beiden Angeboten ist eine gute Probe für die Frage, wie ernst es ein Anbieter mit Belegen nimmt. Weitere Prüffragen für die Auswahl stehen in GEO-Agentur auswählen.
Wie prüft man, ob KI-Crawler die Datei abrufen?
Ob die Datei gelesen wird, steht im Zugriffsprotokoll des Webservers; jeder Abruf landet dort, und beim Hoster liegt es meist unter „Logfiles“ oder „Zugriffsstatistik“. Dort zeigt eine Suche nach „llms.txt“, ob und von wem die Datei geholt wurde. Die Crawler der KI-Anbieter geben sich mit ihrem Namen im User-Agent zu erkennen, etwa GPTBot und OAI-SearchBot für OpenAI, ClaudeBot für Anthropic, PerplexityBot für Perplexity und Google-Extended für Googles Modelle.
Das Ergebnis ist in den meisten Fällen ernüchternd, und genau darin liegt der Wert der Prüfung: Dieselbe Protokolldatei zeigt, ob die KI-Crawler überhaupt auf der Website unterwegs sind und welche Seiten sie laden. Rufen sie die Leistungsseiten nicht ab, liegt das Problem an der robots.txt, an Sperren des Hosters oder an Seiten, die ohne Skripte leer sind. Das sind die Punkte, die über eine Nennung entscheiden, und sie lassen sich beheben. Wie sich danach messen lässt, ob die Marke in Antworten vorkommt, steht in KI-Sichtbarkeit messen.
Was bewegt die Nennung in KI-Antworten stattdessen?
Die Systeme bauen ihre Antworten aus Quellen, die sie prüfen können: Seiten, die eine Frage in wenigen Sätzen vollständig beantworten; Fakten, die auf der Website, im Unternehmensprofil und in Verzeichnissen übereinstimmen; Erwähnungen in Fachmedien, Verzeichnissen und Bewertungen; und eine Technik, die die Inhalte ohne Umwege ausliefert. Eine llms.txt ersetzt keinen dieser Punkte, und keiner davon lässt sich mit einer Datei erledigen.
Für Unternehmen, die wissen wollen, ob sie heute in KI-Antworten vorkommen, ist die Nullmessung der Anfang: dieselben Fragen an mehrere Systeme, gezählt wird, wer genannt wird. Wie diese Arbeit als Auftrag aussieht, steht auf der Seite zur GEO-Agentur.
Häufige Fragen
Nein, sie ist kein Muss. Sie schadet nicht, wenn sie aktuell ist, und sie bringt nach heutigem Stand keine Nennung in KI-Antworten. Für Dokumentationen und Fachportale, die KI-Werkzeuge gezielt laden, ist sie nützlich.
Die robots.txt ist eine Regel: Sie erlaubt oder sperrt Crawlern den Zugriff, und die großen Anbieter halten sich daran. Die llms.txt ist ein Angebot: eine Leseliste, die ein Programm annehmen kann oder nicht. Wer KI-Crawler in der robots.txt aussperrt, ist aus den Antworten der betroffenen Systeme raus, ganz gleich, was in der llms.txt steht.
Eine einzelne Textdatei mit dem vollständigen Inhalt der wichtigsten Seiten. Sie richtet sich an Werkzeuge, die eine ganze Dokumentation auf einmal laden sollen, und lohnt sich nur dort.
Nein. Google hat 2025 erklärt, die Datei nicht zu nutzen. Für Google zählen die Inhalte der Seiten, die robots.txt, die Sitemap und strukturierte Daten.
Entweder von Hand als Textdatei im Stammverzeichnis oder über ein SEO-Plugin, das die Datei aus den veröffentlichten Seiten erzeugt. Danach die Datei aufrufen und lesen: Die Beschreibungen sollen sagen, was auf einer Seite steht, keine Werbesätze wiederholen.
Sie schadet, wenn sie veraltet ist, auf gesperrte oder gelöschte Seiten zeigt oder interne Adressen nennt, die nicht öffentlich sein sollen. Eine automatisch erzeugte Datei gehört deshalb einmal gelesen, bevor sie online bleibt.
Weil der Vorschlag plausibel klingt, in Prüfwerkzeugen als Häkchen auftaucht und sich in Minuten umsetzen lässt. Ob sie etwas bewirkt, prüft dabei selten jemand nach; die Zugriffsprotokolle wären der Ort dafür. Der Vorschlag ist sinnvoll gedacht, nur hat die Seite, die ihn annehmen müsste, das bisher nicht getan.
