Design
Alle lanserte taleagenter. Ingen designet dem.
Tre taleagenter ble lansert på under to uker. Alle tre viser fram byggeverktøyet. Ingen av dem viser fram samtalen, som er det eneste kunden din faktisk møter.

De to første ukene av september ga tre lanseringer av taleagenter fra tre helt ulike hjørner av markedet. Fireflies lanserte Voice Agents 2. september og oppga over 40 000 gjennomførte samtaler i 2 100 organisasjoner allerede ved lansering. Gupshup slapp en selvbetjent plattform der du bygger, tester og setter taleagenter i drift mot telefoni. Genesys la stemme inn i sin Agentic Virtual Agent for kontaktsentre.
Tre selskaper, tre markeder, samme uke. Og nesten samme demo.
Alle tre viser fram byggeverktøyet
Se på hva som faktisk vises i lanseringene. Et grensesnitt der du setter opp agenten, tester den, kobler den til telefoni og ser statistikk etterpå. Det er et dashbord. Det er ryddig, det er kjent fra all annen SaaS, og det er ikke der kunden din er.
Kunden din er i en telefonsamtale på halvannet minutt. Ingen skjerm. Ingen mulighet til å bla tilbake. Ingen tålmodighet. Alt som avgjør om den samtalen går bra, er designbeslutninger: hvor lang åpningsreplikken er, hva agenten gjør når den ikke forstår, hvor mange ganger den tør å spørre om igjen, og når den gir seg og sender deg videre til et menneske.
Ingen av de beslutningene tas i dashbordet. De tas i manuset. Og manuset skrives nesten alltid av noen andre enn en designer.

En samtale har alt et grensesnitt har
Forskjellen er at kunden ikke kan se noen av delene. Alt må bæres av rekkefølge, formulering og timing. Hver komponent du kjenner fra skjermdesign har en motpart i samtalen, og hver av dem må bestemmes av noen.
| På skjerm | I samtalen |
|---|---|
| Navigasjon og tilbakeknapp | Rekkefølgen på spørsmålene, og om kunden kan endre et svar |
| Tilstandsindikator | Agentens korte oppsummering underveis |
| Feilmelding | Det agenten sier når den ikke forstår |
| Tomtilstand | Det agenten sier når den ikke har svaret |
| Lastindikator | Lyden eller ordene som fyller ventetiden ved et oppslag |
| Avbryt og lukk | Overlevering til et menneske |
Står disse seks radene ubesvart, er samtalen ikke designet. Da er den skrevet.
To åpningsreplikker, samme agent
Her er forskjellen mellom en skrevet og en designet samtale, i én beslutning.
A: Hei og velkommen til kundeservice hos Selskapet. Jeg er en KI-assistent som kan hjelpe deg med bestillinger, fakturaspørsmål, endringer på abonnementet ditt og mye mer. Hva kan jeg hjelpe deg med i dag?
B: Hei, du har kommet til Selskapet. Hva gjelder det?
A er 34 ord og tar rundt tolv sekunder. På en nettside ville den samme teksten vært grei, fordi kunden skanner forbi den på et halvt sekund. I en telefonsamtale er tolv sekunder dødtid, og de fleste innringere begynner å snakke oppi den. Da må agenten håndtere en avbrytelse i sin aller første tilstand, som er det vanskeligste stedet å håndtere den.
B er åtte ord. Den gir fra seg kontrollen med en gang, og legger jobben med å forstå på agenten i stedet for på kunden.
Begge er ett felt i det samme dashbordet. Bare den ene er en designbeslutning.
De fire øyeblikkene som avgjør alt
Når vi vurderer en taleagent, ser vi ikke på hvor godt den svarer når alt går som planlagt. Vi ser på fire situasjoner:
- Når den ikke forstår. Hvor mange ganger spør den om igjen før den bytter strategi? Bytter den formulering, eller gjentar den seg selv?
- Når kunden avbryter. Stopper den å snakke umiddelbart, og husker den hvor i flyten den var?
- Når den ikke har svaret. Sier den det rett ut, eller gjetter den? Dette er det farligste feltet i hele manuset.
- Når samtalen skal overleveres. Hva er terskelen, og hva får mennesket vite om det som allerede er sagt?
Alle fire er tilstander i et diagram. Ingen av dem løses ved å bytte modell.

Hvorfor faget henger etter
Grensesnittet har flyttet seg fra skjerm til samtale og API. Designfaget står fortsatt på skjermen.
Det er en forklarlig treghet. Verktøykassa vår er visuell. Figma tegner ikke en samtale. Et tilstandsdiagram over en telefonsamtale ser ikke ut som en portefølje. Og den som skriver manuset i dag er som regel en utvikler eller en fagperson fra kundeservice, som begge kan produktet godt og ingen av dem har flyt og feilhåndtering som fag.
Resultatet er produkter der byggeverktøyet er gjennomdesignet og samtalen er satt sammen av en prompt noen skrev på en fredag.
Sjekkliste før du kjøper
Still disse spørsmålene til leverandøren, og be om konkrete formuleringer og terskler, ikke prinsipper:
- Hva sier agenten ordrett når den ikke forstår andre gang på rad?
- Hva skjer hvis jeg avbryter midt i en setning?
- Hvilken terskel utløser overlevering til et menneske, og hva overføres av kontekst?
- Hvor lang er åpningsreplikken i sekunder?
- Hvem hos dere har tegnet samtaleflyten, og kan jeg få se den?
Får du ikke svar med tall og sitater i, har du kjøpt et byggeverktøy og fått designjobben med på kjøpet uten å vite det.
Hva vi gjør annerledes
Vi behandler samtalen som grensesnittet og manuset som designfilen. Det betyr tilstandsdiagram før første linje tekst, definerte feilstier for hver tilstand, og en fast regel for når agenten skal gi opp og hente et menneske. Byggeverktøyet er infrastruktur. Produktet er de nitti sekundene.
Skal dere sette opp en taleagent i år, begynn med å tegne samtalen. Verktøyet kan dere velge etterpå.
Videre lesning
- Hvordan kan agentisk KI forbedre virksomheten min?. Hvilken kontrollflate en agent trenger før den settes i drift, og hva tallene fra 2026 sier om hvor det lønner seg.
- Design er der teknologivalget blir billig. Hvorfor beslutninger er billige så lenge de bare er tegninger, som er den samme grunnen til å tegne samtaleflyten før du velger verktøy.
FAQ
- Er ikke dette bare prompt engineering med et nytt navn?
- Nei. Prompt engineering handler om å få modellen til å svare riktig. Dette handler om hva som skjer med kunden gjennom en samtale som varer i halvannet minutt: når hun blir avbrutt, når hun må gjenta seg, når hun ikke får svar. Det er de samme problemstillingene som i skjermdesign, bare uten skjerm.
- Hvem bør eie manuset i en organisasjon?
- Den som ellers ville eid grensesnittet. I praksis skrives det i dag oftest av en utvikler eller en fagperson fra kundeservice, og resultatet blir deretter. Manuset trenger noen som tenker i flyt, tilstander og feilsituasjoner.
- Hvordan tester man en taleagent når svarene varierer fra gang til gang?
- Du tester ikke at agenten sier nøyaktig det samme hver gang, for det gjør den ikke. Du tester at den havner i riktig tilstand og at feilstiene fungerer. Et fast sett med testsamtaler som dekker de vanskelige situasjonene gir mer enn å lytte på tilfeldige opptak.
- Trenger vi en designer for å komme i gang med en taleagent?
- Ikke for å komme i gang, men for å komme forbi pilotstadiet. De fleste taleagenter fungerer greit i demo og faller sammen i møte med ekte innringere som snakker i munnen på dem, bytter tema underveis og har dialekt.
- Hvor lang bør en åpningsreplikk være?
- Kortere enn de fleste tror. Under ti ord fungerer i de aller fleste tilfeller, fordi innringeren allerede vet hvem hun ringte og hvorfor. Lange åpninger skaper avbrytelser i agentens første tilstand, som er der den er dårligst rustet til å håndtere dem.


