Das Kontextfenster (englisch Context Window) ist die maximale Menge an Text, gemessen in Tokens, die ein Sprachmodell bei einer Anfrage gleichzeitig verarbeiten kann: Systemanweisung, Gesprächsverlauf, mitgelieferte Dokumente und die erzeugte Antwort zusammen. Es ist das Arbeitsgedächtnis des Modells und bestimmt, wie viel Information in eine einzelne Aufgabe passt.
Wie das Kontextfenster funktioniert
Ein Sprachmodell liest keine Wörter, sondern Tokens: Textbausteine von etwa drei bis vier Zeichen im Englischen, im Deutschen wegen der langen Komposita eher etwas weniger Zeichen pro Token. Eine DIN-A4-Seite Fließtext entspricht grob 500 bis 700 Tokens, ein Roman von 300 Seiten rund 150.000 Tokens. Das Kontextfenster gibt an, wie viele dieser Tokens das Modell auf einmal „sehen" kann. Bei einem Fenster von 200.000 Tokens passen also mehrere hundert Seiten Text in eine einzige Anfrage; bei einer Million Tokens eine mittlere Codebasis oder ein Jahr Support-Tickets.
Technisch ergibt sich die Grenze aus der Transformer-Architektur. Ihr Kernmechanismus, die Self-Attention, setzt jedes Token mit jedem anderen Token im Fenster in Beziehung. Der Rechen- und Speicheraufwand wächst dabei quadratisch mit der Länge: Doppelt so viel Kontext bedeutet viermal so viel Attention-Rechnung. Deshalb waren die Fenster der ersten Generationen klein. GPT-3 verarbeitete 2020 rund 2.000 Tokens, GPT-4 startete 2023 mit 8.000 und 32.000 Tokens. Erst Fortschritte bei Positionskodierung (etwa RoPE mit Skalierung), effizienteren Attention-Varianten (FlashAttention, Sliding Window, Grouped Query Attention) und gezieltem Training auf lange Sequenzen machten Fenster von 128.000, 200.000 und schließlich einer Million Tokens möglich. Google demonstrierte mit Gemini 1.5 im Jahr 2024 als erster Anbieter ein Fenster von einer Million Tokens im produktiven Einsatz.
Was in das Fenster hineinzählt
- Systemprompt: Rollenbeschreibung, Regeln, Formatvorgaben. In Agenten-Setups oft mehrere tausend Tokens.
- Werkzeugdefinitionen: Bei Agenten die Beschreibung aller verfügbaren Tools; kann bei vielen Integrationen schnell 10.000 Tokens und mehr belegen.
- Gesprächsverlauf: Alle bisherigen Nutzer- und Modellnachrichten, einschließlich Tool-Aufrufe und Tool-Ergebnisse.
- Beigefügte Inhalte: Dokumente, Codedateien, Suchergebnisse, Datenbankauszüge.
- Die Antwort selbst: Auch die erzeugten Tokens belegen Platz. Viele Modelle haben zusätzlich eine eigene, kleinere Obergrenze für die Ausgabelänge.
- Denk-Tokens: Bei Modellen mit sichtbarem oder verborgenem Schlussfolgern (Reasoning) belegt auch dieser Zwischentext Kontext.
Wird die Grenze überschritten, lehnt die API die Anfrage ab oder die Anwendung muss ältere Teile des Verlaufs abschneiden oder zusammenfassen. Chat-Oberflächen tun das im Hintergrund automatisch, was erklärt, warum ein Assistent in langen Gesprächen Details vom Anfang „vergisst".
Typische Fenstergrößen im Überblick
Die Angaben der Anbieter haben sich in wenigen Jahren um mehrere Größenordnungen verschoben. Eine grobe Einordnung, die sich mit jeder Modellgeneration weiter nach oben verschiebt:
- Bis 8.000 Tokens: Erste Generation moderner Chatmodelle (2020 bis Anfang 2023). Reicht für ein Gespräch oder ein kurzes Dokument, nicht für ganze Verträge.
- 32.000 bis 128.000 Tokens: Standard ab 2023 und 2024. Ein umfangreicher Vertrag, ein Geschäftsbericht oder ein längerer Support-Verlauf passen vollständig hinein.
- 200.000 Tokens: Lange Zeit die Obergrenze der Claude-Modelle und vieler offener Modelle. Mehrere hundert Seiten oder ein mittleres Softwaremodul in einer Anfrage.
- 1 Million Tokens und mehr: Seit 2024 bei Gemini, inzwischen bei den Spitzenmodellen von Anthropic und OpenAI sowie bei mehreren offenen Modellen aus China Standard. Ganze Codebasen, Buchreihen oder Videoanalysen mit Transkript werden möglich.
Die Zahlen gelten jeweils für die API. Chat-Oberflächen und günstigere Abostufen bieten häufig ein kleineres Fenster als das technische Maximum des Modells, und für Fenster oberhalb von 200.000 Tokens berechnen einige Anbieter höhere Token-Preise.
Größe ist nicht gleich Qualität
Ein großes Kontextfenster bedeutet nicht, dass das Modell alle Inhalte darin gleich gut nutzt. Die Forschung zeigt seit 2023 einen Effekt, der als „Lost in the Middle" bekannt wurde: Modelle finden Informationen am Anfang und am Ende des Kontexts zuverlässiger als in der Mitte. Sogenannte Needle-in-a-Haystack-Tests, bei denen ein einzelner Fakt in einem langen Text versteckt wird, bestehen aktuelle Modelle meist gut; anspruchsvollere Aufgaben, bei denen viele über den Kontext verteilte Fakten kombiniert werden müssen, zeigen aber weiterhin mit wachsender Länge sinkende Trefferquoten.
Hinzu kommt der Preis. Eingabe-Tokens werden pro Million abgerechnet, und ein voll ausgeschöpftes Fenster von einer Million Tokens kostet bei einem Spitzenmodell mehrere US-Dollar pro einzelner Anfrage. In agentischen Abläufen, bei denen derselbe Kontext bei jedem Schritt erneut gesendet wird, vervielfacht sich das. Anbieter begegnen dem mit Prompt Caching: Bereits verarbeitete Kontextanfänge werden zwischengespeichert und beim nächsten Aufruf zu einem Bruchteil des Preises erneut geladen. Auch die Latenz steigt mit der Länge, denn das Modell muss den gesamten Kontext verarbeiten, bevor es das erste Antwort-Token erzeugt.
Relevanz für Unternehmen und Mittelstand
Für die Praxis entscheidet das Kontextfenster über die Architektur einer KI-Anwendung. Drei typische Fälle:
| Anwendungsfall | Anforderung an den Kontext | Typische Lösung |
|---|---|---|
| Vertragsprüfung, Angebotsvergleich | Ein oder wenige lange Dokumente vollständig im Blick | Gesamtes Dokument ins Fenster laden; ab 100.000 Tokens Fenster problemlos |
| Wissensassistent über Tausende Dokumente | Weit mehr Inhalt als in jedes Fenster passt | Retrieval Augmented Generation: passende Ausschnitte suchen und nur diese in den Kontext geben |
| Coding-Agent in großer Codebasis | Viele Dateien, langer Verlauf, viele Tool-Ergebnisse | Großes Fenster plus aktives Kontextmanagement: Zusammenfassen, Ausblenden alter Tool-Ausgaben, Prompt Caching |
Der Grundsatz lautet: Nicht alles, was ins Fenster passt, gehört hinein. Jedes Token kostet Geld und Aufmerksamkeit des Modells. Ein präzise zusammengestellter Kontext von 20.000 Tokens liefert häufig bessere Ergebnisse als ein wahllos befüllter von 500.000. Gutes Kontextmanagement ist damit eine Kernkompetenz beim Bau von KI-Systemen und hat in der Fachdiskussion einen eigenen Namen bekommen: Context Engineering.
Für Datenschutz und Compliance ist außerdem relevant, dass alles im Kontextfenster an den Anbieter übertragen wird. Wer einen ganzen Kundenordner in eine Anfrage packt, überträgt ihn vollständig, auch die Teile, die für die Aufgabe irrelevant sind. Datensparsamkeit gilt für den Kontext genauso wie für jede andere Verarbeitung.
Ein Realbeispiel: Codebasen im Ganzen lesen
Ein greifbares Beispiel für den Nutzen großer Fenster liefern Coding-Werkzeuge. Vor Fenstern von 100.000 Tokens und mehr mussten Assistenten wie die ersten Versionen von GitHub Copilot mit wenigen Zeilen Umgebung um den Cursor auskommen; sie kannten weder die Architektur des Projekts noch die Konventionen anderer Dateien. Mit Fenstern von 200.000 Tokens und darüber können Werkzeuge wie Claude Code, Cursor oder Codex CLI ganze Module, Tests und Dokumentation gleichzeitig laden, ein Ticket über mehrere Dateien hinweg umsetzen und dabei den Verlauf aller bisherigen Änderungen im Blick behalten.
Dasselbe Beispiel zeigt die Grenzen. Eine mittelgroße Anwendung mit 500.000 Zeilen Code umfasst mehrere Millionen Tokens und passt in kein Fenster. Die Werkzeuge lösen das mit gezieltem Nachladen: Sie durchsuchen das Repository, lesen nur relevante Dateien und fassen ältere Arbeitsschritte zusammen, sobald der Kontext sich füllt. Anbieter wie Anthropic dokumentieren in ihren Entwicklerunterlagen zum Kontextfenster, wie Ein- und Ausgabe-Tokens, Denk-Tokens und Caching zusammenspielen. Das große Fenster ist also Voraussetzung, aber das Kontextmanagement macht den Unterschied.
Abgrenzung und Missverständnisse
Kontextfenster ist nicht Trainingswissen. Was das Modell beim Training gelernt hat, steckt in seinen Gewichten und ist immer verfügbar. Das Kontextfenster enthält nur, was bei dieser Anfrage mitgeschickt wird. Nach dem Ende der Anfrage ist der Kontext weg; ein Modell „merkt" sich nichts zwischen Sitzungen, sofern die Anwendung nicht selbst ein Gedächtnis (etwa eine Datenbank mit früheren Erkenntnissen) einbaut.
Kontextfenster ist nicht Ausgabelimit. Die meisten Modelle können deutlich weniger Tokens erzeugen, als sie lesen können. Ein Fenster von einer Million bei einem Ausgabelimit von 64.000 Tokens ist üblich.
Ein großes Fenster ersetzt keine Suche. RAG und lange Kontexte sind keine Konkurrenten, sondern Ergänzungen. Die Suche filtert aus Millionen Dokumenten die relevanten heraus, das Fenster verarbeitet diese Auswahl im Zusammenhang. Erst wenn die gesamte Wissensbasis klein genug ist, kann das Fenster die Suche ersetzen.
„1M Kontext" ist eine technische Obergrenze, keine Qualitätszusage. Anbieter geben das maximal akzeptierte Fenster an; die effektiv nutzbare Länge, ab der die Qualität messbar sinkt, ist oft kleiner und variiert je nach Aufgabe. Unabhängige Long-Context-Benchmarks liefern dafür bessere Anhaltspunkte als die Zahl im Datenblatt.
Ausblick
Die Fenster wachsen weiter, aber der Fokus verschiebt sich. Statt reiner Größe rücken effektive Nutzung und Kosten in den Vordergrund: Caching-Preise fallen, Modelle werden gezielt auf das Kombinieren vieler weit verteilter Fakten trainiert, und Agenten-Frameworks bauen Kontextmanagement als Standardfunktion ein, etwa automatische Kompaktierung des Verlaufs oder das Auslagern von Zwischenergebnissen in Dateien. Parallel entstehen Architekturen jenseits der klassischen quadratischen Attention, die mit sehr langen Sequenzen effizienter umgehen. Für Anwender bedeutet das: Das Kontextfenster wird seltener der begrenzende Faktor sein, die Kunst, es richtig zu füllen, dafür umso öfter.
Häufige Fragen
Wie viele Wörter passen in ein Kontextfenster von 200.000 Tokens?
Grob 130.000 bis 150.000 deutsche Wörter, also etwa 250 bis 300 Buchseiten. Der genaue Wert hängt von Sprache, Fachvokabular und Formatierung ab; Code und Tabellen verbrauchen pro Wort mehr Tokens als Fließtext.
Was passiert, wenn das Kontextfenster voll ist?
Die API lehnt die Anfrage mit einem Fehler ab. Chat-Anwendungen und Agenten fangen das vorher ab, indem sie ältere Nachrichten kürzen, zusammenfassen oder entfernen. Dadurch gehen Details aus dem Anfang eines langen Gesprächs verloren.
Ist ein größeres Kontextfenster immer besser?
Nein. Es erlaubt mehr Inhalt, kostet aber pro Anfrage mehr Geld und Zeit, und die Qualität kann bei sehr langen Eingaben sinken. Ein gezielt zusammengestellter kurzer Kontext ist oft besser als ein voller.
Wann brauche ich RAG statt eines großen Kontextfensters?
Sobald die Wissensbasis größer ist als das Fenster oder sich häufig ändert, oder wenn Kosten pro Anfrage eine Rolle spielen. Für wenige, stabile Dokumente reicht das Fenster; für ein Unternehmenswiki mit Tausenden Seiten braucht es eine Suche davor.
Zählen die Antworten des Modells zum Kontextfenster?
Ja. Eingabe und Ausgabe teilen sich das Fenster. Wer 900.000 Tokens Eingabe sendet, hat bei einem Fenster von einer Million nur noch 100.000 Tokens für die Antwort, und das zusätzlich begrenzt durch das jeweilige Ausgabelimit des Modells.