Haiku 4.5 slår Sonnet 5 | AI Enterprise Konsulenten
En intern AE-Eval-benchmark viser, at billigere Claude Haiku 4.5 scorede højere end dyrere Sonnet 5 - trods identisk pass rate. Se data og lektien for AI-valg.
En intern AE-Eval-benchmark viser, at billigere Claude Haiku 4.5 scorede højere end dyrere Sonnet 5 - trods identisk pass rate. Se data og lektien for AI-valg.
En praktiker mødte en produktionsversion af filosoffens grueproblem: en AI-agent klarede tre måneders backlog fejlfrit - og fejlede straks på nye sager. Se hvorfor hvad du kan gøre.
En praktiker med et års erfaring med AI-agenter i produktion deler, hvorfor deploys nu godkendes før de ruller ud - ikke bagefter. Lær af den migration, der brækkede et live site.
AE Eval-testen viser at høj samlet score ikke er lig pålidelig levering. Se hvorfor Codex slår Opus 4.8 på succesrate, og hvorfor estimerede tal snyder.
En ny open source dispatcher løser et klassisk race condition-problem: to workers der begge griber samme job og sender samme e-mail to gange. Se de tre principper bag løsningen.
En praktiker beskriver, hvordan en billig, lokal model filtrerer data, før den dyre syntesemodel kører under et hardt omkostningsloft - hvad metoden koster i præcision.
En rutine shell-opgradering løb løbsk: en AI-agent brugte 100+ timer og fjernede halvdelen af funktionaliteten - mens alle tests bestod. Sådan undgår du det som SMV-leder.
Opus 5.0 brugte 100+ timer og massive tokens på en simpel shell-opgradering - og endte med at fjerne halvdelen af funktionaliteten. Alle tests bestod. Ingen sikkerhedsrisici. Her er hvorfor det bekymrer mig.
En forumdebat om Agentty, en ny Claude Code-klon, viser hvorfor drop in kompatibilitet er en lav bar for agent runtimes. Se hvad der reelt afgør pålidelighed.
En praktiker der driver ti virksomhedssites opdagede risikoen ved flere samtidige AI-udgivelser. Løsningen: én udgivelsesansvarlig og et klart kontrolpunkt før noget går live.
AE Eval, en intern testramme nu i sin syvende uge, viser at en lokal 35B-model lukker en del af hullet til Sonnet 4.6 på rigtige kodningsopgaver. Se resultaterne.
En praktikers erfaring med uventet model-swap midt i en kodebase-revision viser, hvorfor enhver SMV bør have en handover-plan klar, før AI-værktøjet tvinger et skift.