Hva en AI-agent faktisk koster i produksjon
Kostnad
Den første fakturaen overrasker de fleste. Ikke fordi prisen per Tekst delt opp i småbiter som modellen regner på. Et norsk ord er typisk ett til tre tokens. Prisen på en modell oppgis alltid per million tokens. er høy, men fordi intuisjonen er feil: et SaaS-produkt koster mer når flere bruker det, en agent koster mer hver gang den tenker en runde til.
Kostnaden ligger i konteksten, ikke i svaret
En En modell som får lov til å kalle verktøy og kjøre flere runder på egen hånd, i stedet for å svare én gang og stoppe. er en løkke: oppgave, verktøykall, resultat, vurder på nytt. Poenget som overrasker er at hele Alt som sendes inn til modellen i ett kall: instruksjoner, samtalehistorikk og svar fra verktøy. Modellen husker ingenting mellom kallene, så konteksten må sendes på nytt hver gang. sendes inn igjen for hver runde. Modellen husker ingenting mellom kallene, så Den faste instruksjonen som ligger først i konteksten og forteller modellen hva den skal gjøre. Den er identisk ved hvert eneste kall., verktøydefinisjoner og all tidligere historikk må med hver gang.
| Runde | Fast kontekst | Historikk | Sendt inn |
|---|---|---|---|
| 1 | 3 000 | 500 | 3 500 |
| 2 | 3 000 | 1 200 | 4 200 |
| 3 | 3 000 | 2 000 | 5 000 |
| 4 | 3 000 | 2 800 | 5 800 |
| Sum | 12 000 | 6 500 | 18 500 |
Én henvendelse, 4 runder, tokens per runde. Legg merke til sumraden: 12 000 av de 18 500 tokenene er den samme systemprompten sendt 4 ganger.
En agent som bruker 6 runder koster altså ikke 6 ganger én runde. Den koster summen av en voksende kontekst, og den summen domineres av tokens som går inn, ikke av svaret som kommer ut.
Et regnestykke
Sett inn deres egne tall, strukturen er den samme. Et støtteverktøy med 20 000 henvendelser i måneden, 4 runder per henvendelse, og 3 000 tokens fast systemprompt.
Rundt 18 500 tokens inn per henvendelse, mot 1 200 ut. Ganget opp: 370 millioner tokens inn i måneden, der de faste 3 000 alene utgjør 240 millioner. Nesten to tredeler av regningen, før agenten har gjort noe nyttig.
Nesten to tredeler av regningen var den samme systemprompten sendt om igjen.
Hva det blir i penger
370 millioner tokens inn og 24 millioner ut i måneden. Det er de samme kallene, det samme systemet, den samme oppgaven. Det eneste som endrer seg nedover i tabellen er hvilken modell dere peker på.
| Kjører alt på | Inn | Ut | Per måned |
|---|---|---|---|
| Fronten | $1 850 | $600 | $2 450 |
| Mellomsjiktet | $740 | $288 | $1 028 |
| De små | $52 | $7 | $59 |
Prisene er hentet 7. august 2026 og gjelder de tre nivåene vi beskriver i prisartikkelen. Forskjellen mellom øverste og nederste rad er 41 ganger, på et system som gjør nøyaktig det samme.
Samme system, samme oppgave, samme antall kall. 2 450 dollar eller 59.
Poenget er ikke at dere skal kjøre alt nederst. Det er at ingen kjører alt ett sted. Legger dere de trivielle stegene på nederste rad og beholder fronten der den faktisk trengs, havner regningen nær bunnen, mens kvaliteten der det betyr noe blir liggende på toppen.
Prisforskjellen mellom modeller er større enn folk tror
En gjennomgang av frontmodeller i juli 2026 fant en forskjell på 643 ganger mellom dyreste og billigste pris per million tokens ut, mellom modeller du kaller med nesten identiske forespørsler. Det er den samme oppgaven, det samme regnestykket over, og en helt annen sluttsum avhengig av hva dere peker på. Vi har skrevet mer om hvordan prisene beveger seg i Prisen på AI faller som en stein.
Den store modellen er sjelden riktig standardvalg. En agentløkke har noen få krevende steg og mange trivielle, og de trivielle utgjør mesteparten av volumet.
4 grep som virker
Velg modell per steg, ikke per system
Rutingen trenger ikke være smart, bare en tabell fra stegtype til modellstørrelse. Gevinsten er at volumet flyttes vekk fra den dyre modellen.
| Steg i løkka | Andel av volumet | Vanskelighet | Modell |
|---|---|---|---|
| Klassifiser henvendelsen | Høy | Lav | Liten |
| Hent ut et felt | Høy | Lav | Liten |
| Oppsummer et verktøysvar | Middels | Middels | Middels |
| Planlegg neste steg | Lav | Høy | Stor |
| Skriv svaret til bruker | Middels | Middels | Middels |
Legg merke til hvor den store modellen står: på det ene steget med lavt volum. Det er der den er verdt pengene.
Leverandøren lagrer den delen av konteksten som ikke endrer seg, så dere slipper å betale full pris for den ved hvert kall. det som ikke endrer seg
Systemprompten er identisk ved hvert kall, og ligger først i konteksten. De fleste leverandører tilbyr caching av nettopp den delen. I regnestykket over er dette den enkeltposten som betyr mest.
Sett tak på historikken
En agent som får løpe fritt bruker noen ganger 20 runder på noe den ikke klarer. Et hardt tak på runder kutter halen der kostnaden løper løpsk.
Mål kostnad per kjøring, ikke per måned
En månedlig totalsum sier ingenting om hvor pengene går. Logg tokens og modell per steg, aggreger på oppgavetype, og dere ser hvilke 5 prosent av henvendelsene som står for halve regningen.
Det henger sammen med evaluering
Alt dette forutsetter at dere kan svare på ett spørsmål: ble det dårligere? Å bytte modell uten å kunne måle kvalitet er ikke kostnadskontroll, det er gjetting.
