ellypsis~/bibliotek/
spørgsmål
ODENSE Tal med os
← biblioteket
artikel · 8 min læsning

Agenternes økonomi: tokens bliver billigere, og regningen bliver større

12. maj 2026
gæst@ellypsis:~$ cat tldr.md

Prisen pr. token er faldet cirka 10 gange siden 2023, men en agent sender mange flere tokens pr. opgave, så regningen stiger alligevel. Caching, batch og modelrouting er de håndtag, de færreste har skruet på.

Prisen på en token er faldet cirka 10 gange, siden GPT-4 kom i marts 2023. Samtidig betaler de virksomheder, der har agenter i drift, mere end før. Der er ikke noget mystisk ved det. En agent sender flere tokens pr. opgave, kører flere opgaver og bruger modeller, der tænker, før de svarer. Billigere enhed, større kurv. Regningen stiger.

Priskurven er stejl, og den er veldokumenteret

Enhedsprisen på intelligens falder på måneder, ikke på år.

GPT-4 kostede ved lanceringen i marts 2023 $30 pr. million input-tokens og $60 pr. million output. Claude Sonnet 4.6 koster i maj 2026 $3 pr. million input og $15 pr. million output ifølge Anthropics prisside. Det er et fald på 10 gange på input, 4 gange på output og 6,7 gange på en blandet kurv med 80 % input og 20 % output. GPT-5 udkom i august 2025 og ligger på $1,25 input og $10 output. Gemini 2.5 Pro koster $1,25 input og $10 output for prompts under 200K tokens. Gemini 2.5 Flash koster $0,30 input og $2,50 output, altså hundrede gange billigere på input end GPT-4 ved lanceringen.

PRIS PR. MIO. TOKENS · INPUT / OUTPUT
  • GPT-4 ved lanceringen, marts 2023$30 / $60
  • Claude Sonnet 4.6, maj 2026$3 / $15
  • GPT-5, udgivet august 2025$1,25 / $10
  • Gemini 2.5 Pro, prompts under 200K tokens$1,25 / $10
  • Gemini 2.5 Flash$0,30 / $2,50

Andrew Ng satte i august 2024 tallet for GPT-4o til $4 pr. million tokens blandet, mod $36 for GPT-4 ved lanceringen. Epoch AI måler kurven til cirka 10 gange om året på inferensprisen for samme kapacitet, hvor de hurtigste grupper falder 40 gange og de mest omtalte 900 gange om året siden januar 2024. Det er ikke en leverandørhistorie. Det er den kraftigste tendens i branchen lige nu.

Den slutning, alle drager, holder bare ikke. Billigere tokens giver ikke billigere regninger.

Hvad en agent faktisk bruger

En agent er en proces med mange ture og med værktøjer i hånden. Den koster en størrelsesorden mere pr. resultat end en enkelt prompt, før nogen overhovedet har skiftet model.

En chatbruger sender én prompt og læser ét svar. Måske 4.000 input-tokens og 1.000 output-tokens. På Claude Sonnet 4.6 er det $0,027 pr. gang. En agent, der løser den samme opgave for forretningen, indlæser først en systemprompt, værktøjsdefinitioner, tidligere ture og fremsøgte dokumenter. Så begynder løkken: læs et værktøjssvar, beslut, kald et nyt værktøj, læs igen. En beskeden opgave på ti ture, der bærer 50.000 tokens kontekst pr. tur (historikken vokser, værktøjssvarene hober sig op, sporet bliver længere), sender cirka 500.000 input-tokens og 50.000 output-tokens. Det er $2,25 for opgaven på præcis samme Sonnet 4.6. Samme model, 83 gange så meget.

Augment Code har målt det samme fra en anden vinkel. Ved tur 10 i en samtale ligger prisen pr. kald på cirka 7 gange prisen for tur 1, fordi hvert kald sender hele sporet med igen. Anthropics egen research med flere agenter bruger omkring 15 gange så mange tokens som en enkelt chat. En udvikler fulgte 42 agentkørsler på en FastAPI-kodebase og målte 70 % spildte tokens. Det meste gik med at læse for mange filer, prøve mislykkede forsøg igen og sluge lange værktøjssvar.

Enheden blev billigere. Antallet af enheder eksploderede.

Tænketokens koster mere pr. resultat

Ræsonnerende modeller vælter den gamle forestilling om, at output-tokens er dem, brugeren ser. Det er de ikke.

Claude med extended thinking, OpenAI's o-serie, GPT-5 i reasoning mode og Geminis thinking-varianter laver alle interne tanke-tokens, før de skriver et svar, du kan se. De interne tokens afregnes til almindelig output-pris. Et synligt svar på 500 tokens med 4.000 tokens tankearbejde bag sig koster 9 gange det bare svar, fordi modellen har betalt for 4.500 output-tokens for at give dig 500. På GPT-5.5 koster output $30 pr. million tokens. På Claude Opus 4.7 $25 pr. million. På Gemini 2.5 Pro $10 pr. million. Tænkningen afregnes præcis ligesom resten.

Byttehandlen er reel nok. Ræsonnerende modeller scorer højere på de svære opgaver. Regnestykket vender bare den forkerte vej på de nemme. En ræsonnerende model, der brænder to tusind tanke-tokens af på at bekræfte en fakturakategori, koster mere, end en ikke-ræsonnerende model ville have taget for hele jobbet. At pege ræsonnerende modeller mod alting er den dyreste standardindstilling i produktions-AI i dag.

Agenterne fylder mere, og vi sætter dem til mere

Tre ting sker på én gang. Hver især ser de små ud. Tilsammen æder de hele prisfaldet.

Agenter fylder mere. Store context windows (1.000.000 tokens på Claude Sonnet 4.6 til standardpris, 1.050.000 på GPT-5.4, 1.000.000 på Gemini 2.5 Pro) frister til at hælde hele kodebaser, dokumentsamlinger og mødereferater ind i prompten. Vinduet er budgettet. Og budgetter bliver brugt op. Agenterne er samtidig blevet dygtigere, så vi sætter dem til sværere opgaver med flere gennemløb. Anthropics research har dokumenteret agentkørsler, der løser fejl, som modeller uden den frihed ville give op på, til $5 til $8 pr. opgave i tokenforbrug. Og regnekraften under selve svaret er blevet et håndtag, modellen selv skruer på. Den model, der beslutter at tænke længere, når spørgsmålet er svært, er den samme model, der beslutter at bruge flere af dine penge.

A16z's State of AI-undersøgelse af trafikken på OpenRouter fandt, at virksomhedernes forbrug på sprogmodeller mere end fordobledes fra 2024 til 2025, til cirka 8,4 milliarder dollars. Anthropics årligt tilbagevendende omsætning gik fra 9 til 44 milliarder dollars i løbet af 2026, en fordobling omtrent hver sjette uge (MindStudio-analyse, maj 2026). Mængden af tokens vokser hurtigere, end prisen pr. token falder. Der har I hele paradokset på én linje.

Hvad en SMV med agenter bør vide

Regningen er ikke tilfældig. Den er tokens pr. opgave gange opgaver pr. måned gange valget af model. Alle tre er håndtag, I kan tage fat i.

Tokens pr. opgave handler mest om at styre sporet. Agenter, der kører længe, samler historik og værktøjssvar i konteksten, og det meste af det holder op med at være nyttigt efter få ture. I vores implementeringer er den største enkeltbesparelse at opsummere eller beskære sporet hårdt og holde modellen i et stramt arbejdsvindue i stedet for det fulde loft på 1 mio. tokens. Stevens Institute Online kalder det trajectory tax i deres gennemgang af agenters enhedsøkonomi. Alle, der kører agenter over flere ture, betaler den skat.

Antallet af opgaver er et forretningsspørgsmål, ikke et teknisk. En agent, der kører en gang om dagen efter behov, har ikke samme omkostningsprofil som en agent, der sidder inde i et arbejdsflow og bliver udløst hundrede gange i timen. Sæt omfanget efter, hvad svaret er værd, ikke efter hvad modellen kan.

Valget af model er det håndtag, færrest bruger. Ruter I de simple forespørgsler til Gemini 2.5 Flash ($0,30 input, $2,50 output) og gemmer Claude Opus 4.7 eller GPT-5.5 til de trin, der reelt kræver frontier-ræsonnement, kan I skære 50 til 75 % af forbruget på de fleste arbejdsflows uden målbart kvalitetstab. Forskningen i hierarkiske agenter viser, at budgetmodeller som udførere under en frontier-orkestrator rammer 97,7 % af den fulde frontier-nøjagtighed til 61 % af prisen. Brug den dyre model, hvor den tjener sin pris ind. Brug den billige alle andre steder.

Det, der ændrer sig i 2026

Leverandørerne har bygget håndtagene. De fleste har bare ikke skruet på dem endnu.

Prompt caching er den største gevinst, der ligger og venter. Anthropic tager 10 % af standard input-pris for cache-hits, mens skrivningerne koster 1,25 gange (5-minutters-niveauet) eller 2 gange (1-times-niveauet). For en agent, der sender den samme systemprompt og de samme værktøjsdefinitioner igen hver tur, falder input-prisen fra $1,50 til $0,42 pr. opgave på Sonnet 4.6 ved 80 % cache-hits på et input på 500.000 tokens. Det er 72 % ned. Det tjener sig hjem ved det første cache-hit. Alligevel bruger de færreste agentløkker det.

Batch-API'er tager yderligere 50 % af både input og output på opgaver, der ikke skal svare med det samme. De to kan lægges oven på hinanden: batch plus caching bringer den reelle pris ned omkring 5 % af listeprisen på de arbejdsflows, der kan bruge dem. Anthropic, OpenAI og Google udbyder det alle sammen. Det er den billigste infrastrukturbeslutning, man kan træffe for job, der ikke er interaktive. Modelrouting er det tredje håndtag og det eneste, der kræver rigtigt ingeniørarbejde. Gemini 2.5 Flash, Claude Haiku 4.5 ($1 input, $5 output) og GPT-5.2 ($0,875 input, $7 output) er kompetente nok til de fleste trin i de fleste arbejdsflows. Frontier-modellen er til det trin, der faktisk har brug for en frontier-model.

For en SMV, der lægger budget for agenter i 2026, er det tal, vi selv regner med hos Ellypsis, $50 til $500 om måneden pr. agent med lavt volumen (nogle få dusin kørsler om dagen, ordentligt bygget) og $1.000 til $5.000 om måneden pr. agent med højt volumen (hundredvis af kørsler i timen, med caching og routing på plads). Uden caching og routing ganger I med tre til fem. De implementeringer, der sprænger budgettet, er næsten altid dem, hvor håndtagene aldrig blev skruet på.

Spørgsmålet ingen kan svare på

Det ærlige er, at ingen ved, hvor det her lander.

Prisen pr. token falder hurtigere, end antallet af tokens pr. opgave stiger, hvis man kun ser på de store tal. Men tokens pr. opgave stiger hurtigere, end de fleste virksomheders AI-budgetter gør. Inferens ventes at overhale træning i hyperskala-investeringer i 2026 (Gartner-prognose, marts 2026), og det betyder, at omkostningskurven for at drive agenter stadig er ved at blive bygget. Gartner forventer også over 90 % lavere pris på inferens for modeller med tusind milliarder parametre i 2030 målt mod priserne i 2025. Om det kommer hurtigt nok til at optage efterspørgslen fra en arbejdsstyrke, der til den tid kører tusindvis af agenter pr. medarbejder, er der ingen, der vil skrive under på.

Vi siger det samme til kunderne hvert kvartal. Behandl AI-regningen som et spørgsmål om enhedsøkonomi, ikke som en softwarelicens. Mål prisen pr. brugbart resultat, ikke prisen pr. million tokens. Det første tal er det eneste, der overlever den næste prisnedsættelse.

Tokenprisen er én variabel i et større implementeringsspørgsmål. Hvad en AI-implementering faktisk koster hele vejen igennem, står i gennemgangen af priserne på en AI-implementering. Standarden bag agenternes brug af værktøjer står i hvad MCP er, og hvorfor det betyder noget for jeres forretning.

OFTE STILLEDE SPØRGSMÅL
Hvorfor stiger vores AI-regning, når prisen pr. token falder?

Prisen pr. token er faldet cirka 10 gange fra 2023 til 2026, men en agent sender langt flere tokens pr. opgave, end en chat gør. En agent over ti ture kan koste 80 gange så meget som en enkelt chat-prompt på samme model, fordi den sender ophobet historik og værktøjssvar med i hver eneste tur. Billigere enhed, større kurv.

Hvad koster én agentopgave i 2026?

En agent over ti ture på Claude Sonnet 4.6, der bærer 50.000 tokens kontekst pr. tur, koster cirka $2,25 pr. opgave (500.000 input-tokens til $3 pr. million og 50.000 output til $15 pr. million). Anthropics research dokumenterer softwareagenter uden begrænsninger til $5 til $8 pr. opgave. Prisen følger sporets længde.

Hvad er tænketokens, og hvorfor koster de så meget?

Tænketokens er de interne tanke-tokens, som ræsonnerende modeller (Claude med extended thinking, OpenAI's o-serie, GPT-5 i reasoning mode, Geminis thinking-varianter) laver, før de skriver et svar, du kan se. De afregnes til output-pris. Et synligt svar på 500 tokens med 4.000 tanke-tokens bag sig koster 9 gange det bare svar.

Hvor meget kan prompt caching og batch-API'er skære af prisen?

Anthropic tager 10 % af standard input-pris for cache-hits og 50 % af begge veje på batch-API'et. De to kan lægges oven på hinanden. En agent med 80 % cache-hits på gentaget kontekst får input-forbruget cirka 72 % ned. Tilsammen skærer batch og caching op til 95 % af den reelle pris på asynkrone opgaver, der kan bruge dem.

Skal vi bruge den billigste eller den bedste model til vores agent?

Ingen af delene til hvert trin. Send de simple trin til budgetmodeller (Gemini 2.5 Flash $0,30/$2,50, Claude Haiku 4.5 $1/$5, GPT-5.2 $0,875/$7) og gem frontier-modellerne (Claude Opus 4.7, GPT-5.5) til de trin, der har brug for dem. Forskning viser, at man på den måde rammer 97,7 % af den fulde frontier-nøjagtighed til 61 % af prisen.