ellypsis~/bibliotek/
spørgsmål
ODENSE Tal med os
← biblioteket
artikel · 5 min læsning

Hvad er et context window, og hvorfor er større ikke altid bedre?

27. mar 2026
gæst@ellypsis:~$ cat tldr.md

De førende modeller læser omkring en million tokens pr. forespørgsel, cirka 750.000 ord. Hver eneste måling siden 2023 viser, at præcisionen falder, jo mere vinduet fyldes. Vinduet er loftet, ikke arbejdsbordet.

Et context window er den mængde tekst, en sprogmodel kan læse i én forespørgsel. Det måles i tokens, og i 2026 ligger de førende modeller omkring en million af dem, cirka 750.000 ord. Målingerne peger den anden vej: siden 2023 har hver eneste offentliggjorte test vist, at præcisionen falder, jo mere man fylder i vinduet. Vinduet er loftet. Det er ikke arbejdsbordet.

Et context window er et budget, ikke en hukommelse

Modellen husker ikke jeres sidste samtale. Hver forespørgsel starter forfra med ét budget, og det budget er context windowet.

Ind i det skal alt, hvad modellen har brug for at svare. Systemprompten. Samtalen indtil nu. De dokumenter, I har vedhæftet. De data, et opslag har hentet. Og plads til selve svaret. Tokens er stumper af ord, og OpenAIs tommelfingerregel er 1.000 tokens til cirka 750 engelske ord. Et vindue på 200.000 tokens rummer altså omkring 150.000 ord, eller 300 sider med enkelt linjeafstand.

Rammer man loftet, klipper modellen. Som regel uden at sige det. Det første, der forsvinder, er midten af samtalen, og det er præcis der, brugerens seneste hensigt står.

Frontlinjen ligger omkring en million tokens

I maj 2026 ligger de tre store laboratorier stort set på linje omkring 1M tokens i deres produktionsmodeller.

Anthropic leverer Claude Opus 4.7 og Sonnet 4.6 med et vindue på 1.000.000 tokens til almindelig pris, 3 dollars pr. million input-tokens og 15 dollars pr. million output for Sonnet 4.6. Sonnet 4.5 havde et 1M-vindue i beta med et tillæg for lang kontekst, og da betaen lukkede 30. april 2026, faldt modellen tilbage til sit standardvindue på 200K. OpenAIs GPT-5.4 og 5.5 giver adgang til 1,05M tokens, mens GPT-5.2 ligger på 400K. Googles Gemini 2.5 Pro ligger på 1M, og udvidelsen til 2M er stadig undervejs. Gemini 1.5 Pro havde 2M-vinduet først.

Tallene ligger nu så tæt på hinanden, at »det største vindue« ikke længere skiller nogen ud. Det interessante er, hvad modellen rent faktisk stiller op med det, man hælder i.

TALLENE · MAJ 2026
  • frontlinjens vindue, cirka 750.000 ord1M tokens
  • procentpoint tabt, når svaret ligger i midten20 til 30
  • så meget billigere kører opslag end lang kontekst8 til 82x
  • om måneden for ti personer med 200K-prompts6.000 dollars

Lost in the middle er fra 2023 og stadig uløst

Liu og hans medforfattere fra Stanford og Samaya AI udgav »Lost in the Middle« i 2023. Resultatet ligger i selve titlen.

De testede GPT-3.5, GPT-4, Claude og en række åbne modeller på spørgsmål, hvor svaret lå i ét ud af 20 dokumenter. Ligger det rigtige dokument på plads 1, rammer modellen næsten hver gang. Ligger det på plads 20, næsten lige så godt. Ligger det på plads 10, falder præcisionen med 20 til 30 procentpoint. Kurven former et U, den samme facon psykologer finder, når de måler menneskers hukommelse.

U-kurven holder ved 4K, 16K, 32K og 100K-plus. Det er ikke et hul i træningen. Det er sådan, kausal attention læser.

Context rot gør U-kurven værre, jo mere man fylder i

Chroma Research udgav »Context Rot« i juli 2025. Kelly Hong, Anton Troynikov og Jeff Huber testede 18 frontier-modeller, blandt andet GPT-4.1, Claude Opus 4, Gemini 2.5 og Qwen3.

Alle blev dårligere, efterhånden som inputtet voksede. Ikke da vinduet blev fyldt. Efterhånden som inputtet voksede. Præstationen faldt ved hver eneste længde, de målte, også langt under det annoncerede loft. Chroma pegede på tre mekanismer, der lægger sig oven på hinanden: U-kurven fra Lius arbejde, udtynding af attention (transformer-attention er kvadratisk, så 100K tokens betyder 10 milliarder parvise relationer, og 1M tokens betyder tusind milliarder), og forstyrrelse fra distraktorer, hvor indhold, der ligner det rigtige uden at være det, aktivt trækker modellen på afveje.

Ét resultat er værd at huske. Modellerne klarede sig bedre på tilfældigt blandede bunker end på logisk sammenhængende dokumenter. Den struktur, der hjælper et menneske, skader en model med lang kontekst. Det er ikke indlysende. Det er til gengæld reproducerbart på tværs af alle 18 modeller, de testede.

Lang kontekst og opslag er ikke konkurrenter

Debatten i 2024 stillede RAG (retrieval-augmented generation, altså opslag i jeres eget materiale) op mod lange context windows som to hold. Billedet i 2026 er blandet.

Lang kontekst vinder på sammenhængende, statisk materiale, hvor hele dokumentet skal være i spil på én gang: én kontrakt, én kodebase til gennemgang, én forskningsartikel, man vil grave i. Opslag vinder på materiale, der ændrer sig, på pris og på støjniveau. Et NeurIPS-studie fra 2024, lavet af forskere hos Google og University of Michigan, fandt, at modeller med lang kontekst slår RAG, når de får ressourcer nok, men at RAG stadig er 8 til 82 gange billigere i typiske arbejdsgange. Prisforskellen lukker sig ikke.

I vores egne implementeringer er det bedre spørgsmål ikke »RAG eller lang kontekst«, men »hvad har modellen brug for at se lige nu?«. Vinduet er et budget. Brug det, hvor signalet er.

Det, en mindre virksomhed faktisk skal holde øje med

Tre ting afgør, hvad lang kontekst kommer til at koste jer, og ingen af dem er vinduets størrelse.

Prisen pr. token lægger sig oven på sig selv. En prompt på 200.000 tokens til Claude Sonnet 4.6 koster cirka 0,60 dollars alene i input, hver gang den sendes. Gang det med ti medarbejdere, halvtreds kald om dagen og tyve arbejdsdage: 6.000 dollars om måneden, før output overhovedet er talt med. Modtrækket er prompt caching, hvor Anthropic afregner cache-læsninger til 0,1 gange den almindelige input-pris. At skrive til cachen koster 1,25 gange på fem-minutters-niveauet og 2 gange på en-times-niveauet, så det er tjent hjem ved første cache-hit. Bruger jeres værktøj ikke prompt caching, ligger omkring 90 procent af regningen og flyder.

Svartiden følger inputtets længde næsten lineært. En forespørgsel på 1M tokens føles ikke som en chat. Den føles som et batchjob. I arbejdsgange, hvor et menneske sidder og venter, måles budgettet i sekunders tålmodighed og ikke i millioner af tokens.

Så er der forholdet mellem signal og støj. Hvert irrelevant dokument, I hælder i vinduet, øger risikoen for, at modellen bider på en distraktor. Chromas resultat holder: mere er ikke mere sikkert. Vælg fra.

Konklusionen er usentimental. Længere vinduer erstatter ikke ordentlig informationsarkitektur. De hæver loftet for, hvad man kan forsøge sig med. Arbejdet med at afgøre, hvad modellen skal se, strukturere det så svaret kan findes, og sende det rigtige spørgsmål til det rigtige system, bliver ikke lettere af, at vinduerne vokser. Det bliver vigtigere, for prisen for at være sjusket er nu usynlig i svaret i stedet for synlig som en fejl om afklippet tekst.

Et context window er rummet. Hvad der kommer ind i det, er det mere interessante spørgsmål. Hvordan AI-systemer overhovedet får adgang til jeres egne data, ser vi på i Hvad er MCP, og hvorfor betyder det noget for jeres virksomhed?

OFTE STILLEDE SPØRGSMÅL
Hvad er et context window, kort fortalt?

Det er den maksimale mængde tekst, en model kan læse i én forespørgsel, målt i tokens. Tokens er stumper af ord, og 1.000 tokens svarer til cirka 750 engelske ord. Alt, hvad modellen skal bruge for at svare (instruktioner, samtalens historik, dokumenter og plads til selve svaret), skal være inden for det budget.

Hvor store er context windows hos GPT-5, Claude og Gemini i 2026?

I maj 2026 har Claude Sonnet 4.6 og Opus 4.7 vinduer på 1.000.000 tokens til almindelig pris. OpenAIs GPT-5.4 og GPT-5.5 giver adgang til 1.050.000 tokens, mens GPT-5.2 stopper ved 400.000. Googles Gemini 2.5 Pro ligger på 1.000.000. Gemini 1.5 Pro havde et vindue på 2.000.000 tokens, det største, der har været almindeligt tilgængeligt.

Hvad er 'lost in the middle', og sker det stadig?

Lost in the middle er Liu et al.s fund fra 2023 (Stanford og Samaya AI): en sprogmodel husker det, der står i begyndelsen eller slutningen af en lang kontekst, men taber det, når det ligger i midten. Faldet er på 20 til 30 procentpoint. Chromas studie fra juli 2025 på 18 frontier-modeller bekræfter, at mønstret holder.

Er et større context window altid bedre?

Nej. Chroma Research testede 18 frontier-modeller i juli 2025 og fandt, at præstationen falder ved hvert eneste skridt op i inputlængde, længe før det annoncerede loft. Mekanismerne ligger i arkitekturen (kvadratisk attention, U-formet positionsbias, forstyrrelse fra distraktorer), ikke i træningen. En fokuseret prompt på 10.000 tokens slår rutinemæssigt en altomfattende prompt på 500.000 tokens i samme opgave.

Hvordan er lang kontekst i forhold til RAG i en virksomhed?

Lange vinduer passer til statisk, sammenhængende materiale, hvor hele dokumentet betyder noget på én gang. RAG (retrieval-augmented generation) passer til materiale, der ændrer sig, og kører 8 til 82 gange billigere pr. forespørgsel i typiske arbejdsgange. Svaret i 2026 er begge dele: opslaget indsnævrer, hvad modellen ser, og vinduet holder det, den skal bruge. Vælg efter pris, svartid og hvor hurtigt kilderne ændrer sig.