Hopp til innhold
Borge Labs

Automatisk AI-oversatt fra engelsk.

Ingeniørnotat · July 2026

Vurderinger som endret beslutninger

En evaluering som ikke kan endre hva du gjør, er pynt. Tre ganger vår gjorde det.

Den ødelagte gjenfinningsveien

Semantisk søk i kommunale dokumenter fungerte fint i demo, men ble stille brutt i produksjon for skopede søk: spør innenfor en kommune eller et utvalg uten et eksakt søkeord, og rett dokument kom sjelden tilbake. En liten retrieval-evaluering, ni vektede søk med kjente riktige og forbudte dokumenter, gjorde feilen synlig og målbar: den semantiske kategorien scoret null. Fiksen rutet skopede søk gjennom et filter-first tett søk i stedet for det generelle indeks. Den kategorien gikk fra null til perfekt, den vektede treffprosenten steg, og evalueringen vokter nå veien mot regresjon. En kategori, gjenfinning av en saks tidligere utvalgbehandling, rangerer fortsatt rett dokument for lavt til å passere, og står på listen. Uten evalueringen ville alt dette ha blitt arkivert under AI som upålitelig, når modellen aldri var problemet.

Anmelderen som ikke kunne se bestillingsfeil

En del av labens kodeagent har en automatisk anmelder. Kandidatmodeller ble testet på lapper med innlagte feil. Overraskelsen var ikke rangeringen, det var formen: den billigste plausible kandidaten var helt blind for en type feil, mens den fanget andre helt fint. Gjennomsnittsverdier skjuler det; per-klasse-resultater avslører det. Standard-anmelderen ble endret, og leksen satt. Modellvalg er en per-oppgave-beslutning, og en evaluering som bare rapporterer en enkelt score vil til slutt lyve til deg.

Benchmark hvor det enkle er det beste

Multimodell-selen ble benchmarket mot en enklere enkeltmodell-sele på en blandet oppgave, og den enklere selen vant. Resultatet er i åpen benchmark-rekord, negative outcome included, because the point of the benchmark was to decide how much orchestration complexity is actually earning its place. Some of it was not. Evaluering er hvordan kompleksitet blir forkastet, ikke bare hvordan funksjoner blir skrytt av.

Vanene

Mønsteret er det samme for alle tre: små, spesifikke, knyttet til en beslutning. Ni merkede tilfeller slår tusen vibber. Talepipelinen bak transkripsjonsarbeidet fungerer på samme måte: feilrate og talerattribusjon måles mot et gullsett før og etter hver signifikante endring, og de tallene har stoppet endringer som føltes som forbedringer.

Skrevet av Eldar Borge. Tilbake til borge-labs.no