Lokal AI-model udfordrer Sonnet

Lokal AI-model udfordrer Sonnet

En 35B-parameter model, der kører lokalt uden cloud-opkald, har i syv

En 35B-parameter model, der kører lokalt uden cloud-opkald, har i syv ugers løbende test lukket en markant del af afstanden til Sonnet 4.6 på rigtige kodningsopgaver. Det ændrer regnestykket for danske virksomheder, der overvejer om AI-assisteret udvikling kræver dyre topmodeller eller kan køres billigere og mere kontrolleret på egen infrastruktur.

Testmetode

AE Eval: sådan testes AI-kodningsmodeller på rigtige opgaver

AE Eval er en intern testramme, der uge for uge kører et sæt AI-modeller gennem virkelige kodningsopgaver hentet fra faktiske kundeprojekter og interne systemer. Modsat generiske benchmarks, som ofte belønner modeller der er trænet specifikt til at score højt på kendte testsæt, måler AE Eval om koden rent faktisk kører, består de tilhørende tests og kan bruges uden manuel oprydning bagefter.

Hver opgave scores på to akser: en rå kvalitetsscore for løsningens struktur og læsbarhed, og en pass rate, altså andelen af forsøg hvor koden faktisk virker første gang. Det er kombinationen af de to tal, der gør testen interessant, for de fortæller sjældent den samme historie.

Sonnet 4.6 topper - men pass rate fortæller en anden historie

Sonnet 4.6 lander øverst på den samlede kvalitetsscore i uge 7, som den har gjort de fleste uger siden testen startede. Modellen skriver kode med god struktur, fornuftig navngivning og sjældent unødvendig kompleksitet.

Men når man kigger på pass rate isoleret, er billedet mindre entydigt. Sonnet leverer stærke løsninger, men ikke markant flere fejlfrie løsninger end de bedste konkurrenter. Det betyder, at en del af Sonnets forspring handler om kodestil og læsbarhed snarere end om reel funktionel overlegenhed. For en virksomhed, der betaler per token og vægter driftssikkerhed højere end æstetik, er det en vigtig nuance.

Opus 4.8's gab mellem score og pålidelighed

Opus 4.8 scorer højt på papiret, men AE Eval afslører et gab mellem den rå kvalitetsscore og modellens faktiske pålidelighed i praksis. Modellen producerer ofte ambitiøse løsninger med flere bevægelige dele end opgaven strengt taget kræver, hvilket booster kvalitetsscoren men samtidig øger risikoen for fejl i kanttilfælde.

Resultatet er en model, der ser stærk ud i en enkeltstående vurdering, men som i den løbende test viser større variation fra uge til uge end Sonnet. For teams der skal stole på output uden tung manuel gennemgang, er den variation en reel omkostning, selv når gennemsnittet ser pænt ud.

Codex og Cursor: mistænkeligt perfekte tal

Både Codex og Cursor leverer i flere af ugerne pass rates, der ligger usædvanligt tæt på 100 procent på bestemte opgavetyper. Det er et mønster, der kræver et kritisk blik snarere end begejstring. Når en model konsekvent rammer perfekte tal på opgaver, der historisk har spredning hos alle andre modeller, er den mest sandsynlige forklaring, at opgaverne minder for meget om noget modellen allerede har set under træning eller finjustering.

Det gør ikke tallene ubrugelige, men det betyder, at de skal læses som et signal om opgavegenkendelse snarere end som bevis på generel kodningsevne. AE Eval justerer løbende opgavesættet for at modvirke netop den slags overfitting, men uge 7 viser stadig rester af mønsteret hos begge værktøjer.

Ornith: den lokale 35B-model der lukker hullet

Den mest interessante bevægelse i uge 7 kommer fra Ornith, en 35B-parameter model der kører fuldt lokalt uden afhængighed af en cloud-udbyder. Ornith lander ikke øverst på nogen af de to akser, men den lukker en markant del af afstanden til Sonnet på pass rate, samtidig med at den holder en kvalitetsscore, der er langt tættere på topmodellerne end dens størrelse skulle tilsige.

Det interessante er ikke, at en lille model kan matche en topmodel fuldt ud, det kan den ikke, men at gabet er blevet lille nok til at være en reel afvejning frem for et automatisk nej. En model, der kører lokalt, betyder ingen tokenomkostninger per kald, ingen data der forlader egen infrastruktur, og fuld kontrol over hvornår og hvordan modellen opdateres. For opgaver hvor pass rate og driftskontrol vejer tungere end den sidste finpolering af kodestil, er det en reel konkurrent.

Gabet er blevet lille nok til at være en reel afvejning frem for et automatisk nej.

Hvad betyder det for danske SMV-ledere?

For en dansk virksomhed, der overvejer AI-assisteret udvikling, betyder resultaterne fra AE Eval, at valget ikke længere er binært mellem "betal for topmodellen" og "nøjes med mindre". Der er nu en tredje vej: en lokal model, der på en del af de opgaver, der faktisk fylder i hverdagen, leverer tæt på samme pålidelighed som Sonnet, uden løbende cloud-omkostninger og uden at kundedata eller kildekode forlader huset.

01 / 01

Et øjeblik…

Henter spørgsmål…