Inveniq
Alle artikler

RAG eller finjustering: når skal dere bruke hva?

Arkitektur

Kort svar: Skal modellen svare ut fra dokumentene deres, bruk . Skal den svare i et bestemt format, tone eller mønster, vurder . Og vit at dere per september 2026 ikke kan finjustere de nyeste modellene fra OpenAI, Anthropic eller Googles Pro-modeller som vanlig kunde.

Kunnskap eller oppførsel

OpenAIs egen veiledning deler problemet i to. Mangler modellen kunnskap, fordi den er ny, utdatert eller intern, er løsningen å gi den riktig . Det gir mer korrekte svar. Svarer modellen ujevnt, i feil format eller feil tone, er løsningen å endre modellen. Det gir jevnere oppførsel.

BehovBruk
Svar fra dokumenter som endrer segRAG
Liten, stabil kunnskapsbaseAlt i konteksten, med caching
Fast format, tone eller klassifiseringEksempler i prompten først, finjustering hvis det ikke holder
En smal oppgave på en billigere modellFinjustering
Oppdaterte faktaAldri finjustering alene

Hvorfor finjustering er dårlig til å lære fakta

Den mest siterte sammenligningen, Ovadia og kolleger fra 2023, testet begge metodene på spørsmål om nyheter modellene ikke kunne kjenne til. RAG vant hver gang. Med Mistral-7B gikk treffsikkerheten fra 0,481 til 0,875 med RAG, men bare til 0,504 med finjustering.

En studie fra EMNLP 2024 fant noe verre: når en modell finjusteres på ny kunnskap, lærer den den saktere, og når den først har lært den, øker tendensen til å finne på svar. Det er motsatt av hva de fleste håper å oppnå.

Det finnes nyere arbeider som får finjustering til å fungere bedre for fakta, med omhyggelig laget treningsdata. Flere av dem er ikke fagfellevurdert ennå.

De nyeste modellene kan ikke finjusteres

Status 14. september 2026, fra leverandørenes egne sider:

LeverandørFinjustering
OpenAILegges ned. Nye kunder stengt ute siden mai 2026, ingen nye jobber fra 6. januar 2027. Ingen GPT-5 eller GPT-6-modeller.
AnthropicIkke i Claude API. Eneste vei var Claude 3 Haiku via AWS, som ble faset ut 10. september 2026.
GoogleIkke i Gemini API. Mulig i Google Cloud for Flash- og eldre Pro-modeller, med 1,5 ganger pris på den finjusterte modellen.
Microsoft AzureMulig for GPT-4.1 og GPT-4o. Hver finjusterte modell har en fast timepris for drift.

I praksis betyr det at finjustering har blitt et verktøy for små og eldre modeller. Bygger dere på de beste modellene i dag, er RAG og god kontekst det dere har.

Lang kontekst har endret regnestykket

De nyeste modellene tar 1 million tokens, og Anthropic priser hele vinduet likt. Samtidig gjør det faste innholdet billig å sende på nytt: hos Anthropic koster en cachet token for Claude Sonnet 5 $0,20 per million, mot $2 ordinært.

Er kunnskapsbasen liten og endrer seg sjelden, kan det være enklere å legge alt i konteksten enn å bygge søk. Men forskning viser at modeller blir dårligere til å finne informasjon som ligger midt i en lang kontekst, og at lang kontekst i snitt gir bedre svar enn RAG, men koster mer. Det finnes ingen universell vinner. Det avgjøres av oppgaven, og det må måles.

Der RAG går galt

RAG er ikke gratis kvalitet. En studie av RAG-systemer i drift fant 7 typiske feilpunkter, fra at svaret ikke finnes i dokumentene, til at riktig dokument ble funnet men ikke rangert høyt nok. To ting er verdt å passe særlig på:

  • Tilganger. Et søkeindeks som ikke respekterer hvem som har lov til å se hva, kan lekke dokumenter mellom brukere. OWASP lister dette som en egen risiko.
  • Gamle tilganger. Endres rettighetene i kildesystemet, gjelder det ofte ikke i søket før indeksen er synkronisert på nytt.

Begge deler oppdages bare hvis dere tester systemet systematisk. Hvordan står i artikkelen om evaluering av AI-systemer.

Kilder

Alle kilder er sjekket 14. september 2026.

3 min lesetidSist oppdatert

Målet er en virksomhet som er bedre rustet til å ta beslutninger

Ikke bare å løse dagens utfordringer, men å gjøre virksomheten bedre rustet til å ta beslutninger i et teknologilandskap som endrer seg raskere enn noen gang. Det er dette vi bygger.

Ta kontakt