Slik bygger du en AI-agent som holder i produksjon
De fleste AI-agenter fungerer i demo og svikter i drift. Her er arkitekturen, sperrene og målingen som skiller en pilot fra et system dere kan stole på.
Å få en AI-agent til å fungere én gang er enkelt. Å få den til å fungere hver gang, for saker ingen forutså, er selve arbeidet. Forskjellen ligger sjelden i modellvalget, men i fire ting: hvor snevert oppdraget er, hvordan verktøyene er bygget, hvilke sperrer som finnes og hvordan dere måler treffsikkerheten.
Start med et oppdrag som lar seg vurdere
Den vanligste grunnen til at agentprosjekter stopper opp, er at oppdraget er formulert så bredt at ingen kan avgjøre om resultatet er riktig. Ta hånd om kundeservice lar seg ikke evaluere. Foreslå et svarutkast på innkommende fakturaspørsmål og hent opplysningene fra forretningssystemet lar seg evaluere, sak for sak.
Bygg verktøyene for en maskin, ikke for et menneske
- Ett verktøy per tydelig oppgave, med et navn som beskriver hva det gjør
- Få parametere, og tydelige feil når noe mangler — agenten retter seg etter feilmeldinger
- Returner det som trengs for neste steg, ikke hele databaseposten
- Gjør lesing og skriving til separate verktøy, slik at skriving kan kreve godkjenning
- Gjør skrivende kall idempotente, slik at en ny kjøring ikke lager duplikater
Hold konteksten kort og relevant
Mer informasjon gjør ikke agenten klokere. Lange instruksjoner og store datamengder gjør at det viktige drukner, øker kostnaden per sak og gjør feilene vanskeligere å forstå. Gi agenten det som trengs for steget den står i, og la den hente resten selv med et verktøy.
Sett sperrer der en feil koster penger
- La agenten foreslå, men la et menneske godkjenne det som er uopprettelig
- Sett tak: beløp, antall saker per time, antall steg per oppgave
- Begrens tilgangen til nøyaktig de systemene oppgaven krever, med egne rettigheter for agenten
- Logg hvert verktøykall med inndata, utdata og tidspunkt
- Ha en av-knapp som stopper agenten uten å stanse resten av virksomheten
Behandle agenten som en ny medarbeider uten tidligere erfaring: tydelig oppdrag, begrensede rettigheter, noen som kvalitetssikrer i starten og gradvis mer tillit når resultatene er dokumentert gode.
Mål treffsikkerheten før dere skalerer
Samle tjue til femti reelle saker med kjent fasit og kjør dem som en test hver gang dere endrer instruksjoner, verktøy eller modell. Uten den testen vet dere ikke om en endring gjorde agenten bedre eller dårligere — dere vet bare at det føltes bedre i eksempelet dere tilfeldigvis prøvde.
- Hvor ofte blir svaret riktig uten menneskelig retting?
- Hvor ofte velger agenten feil verktøy eller setter seg fast i løkker?
- Hva koster en sak i modellkall, og hvordan varierer det?
- Hvor lang tid tar en sak sammenlignet med manuell håndtering?
Planlegg for at modellen byttes ut
Modeller oppdateres ofte, og oppførselen endrer seg med dem. Bygg derfor slik at modellen er utskiftbar: hold instruksjoner, verktøy og evaluering atskilt fra selve modellkallet. Da blir et modellbytte en test i stedet for en omstart.
Skriven av
Robin EnglundMedgrunnlegger & CTO, Axuvo
Robin er medgrunnlegger og CTO i Axuvo. Med bakgrunn som teknisk leder i flere selskaper hjelper han bedrifter med å ta riktige teknologibeslutninger og bygge digitale løsninger som holder.
AI-ansatte
Kolleger for kundeservice, ordre, salg og økonomi som jobber i systemene deres. Gratis å komme i gang, betal per bruk.
Les merOfte stilte spørsmål
Relaterte artikler
Hvorfor Secure by Design ikke er et tilvalg
Sikkerhet må bygges inn fra dag én, ikke lappes på senere. Lær hvorfor Secure by Design er kritisk for systemene og forretningen din.
Hva er en AI-agent? Forskjellen fra chatboter og vanlig automatisering
En AI-agent er et system som selvstendig planlegger og utfører oppgaver i flere steg ved hjelp av verktøy. Her er definisjonen, forskjellen fra chatboter og automatisering, og når en agent er riktig løsning.
Vil dere se det på deres egne e-poster?
Book en gjennomgang på 30 minutter. Vi setter opp en rolle i skyggedrift mot innboksen deres, gratis.