Så funkar det
Från publik information till ett svar ni kan stå bakom.
Vem som helst kan peka en språkmodell på en webbplats. Avståndet mellan det och ett svar ett reglerat bolag vågar sätta sitt namn på, där sitter arbetet. Vi bygger både lagret och agenten som går på det.
Läs färgerna
Körs automatiskt, löpandeEn människa beslutar, vår eller erFem steg, och det mesta av arbetet är inte kod
Samla in
Vi läser den publika webben som en varsam gäst, och lägger sedan till det bara ni har.
Publika källor
Ert eget material
- robots.txt följs enligt RFC 9309, crawl-takten hålls varsam, avgränsad till rätt marknad
- Omcrawlningar upptäcker vad som ändrats, inte bara vad som finns
- Vilka källor som är värda att läsa, och hur djupt
Varför det är svårare än det ser ut
Varje sajt är byggd på sitt eget sätt, och hälften av dem gör om sina sidor nästa kvartal utan att säga till, så att inläsningen slutar fungera.
Verifiera
Två spår som hanteras olika och hålls åtskilda. De möts inne i ett svar, aldrig i en databas.
- Båda spåren först: menyer, banners och juridisk boilerplate skalas bort, bara den text som faktiskt bär ett svar sparas
- Ert innehåll struktureras med de fakta som avgör om ett svar blir rätt: produkter, kreditprocess, vilken kreditupplysning ni använder, vilka marknader ni finns på
- Material som aldrig legat på er sajt kopplas in tillsammans med er
- Inget annat bolags chat kan hämta ert innehåll, och det kan inte bli delad kunskap utan både ert medgivande och ett uttryckligt godkännande från oss
- Den delade kunskapen skrivs, kontrolleras mot primärkällorna och signeras av en branschexpert innan den får serveras
Varför det är svårare än det ser ut
Att hålla de två åtskilda är ett arkitekturbeslut som inte går att laga i efterhand. Att blanda dem är enkelt och billigt, och det är skälet till att de flesta sådana system inte går att sälja till en bank.
Organisera
En svarsordning som tillämpas på varje fråga, varje gång.
- Ert innehåll och det delade lagret indexeras separat, per bolag
- Skrivs och indexeras en gång på engelska, besvaras på 50 språk
- Strukturerade fakta om ert bolag, era produkter och er roll på marknaden, och de gäller som grundsanning
- Svarsordningen bestäms tillsammans med er, och den nivå ni inte vill ha stängs av
Varför det är svårare än det ser ut
Att ta fel hylla är sämre än att hyllan står tom. Det är svaret som självsäkert anger fel källa som hamnar i en skärmdump.
Svara
Varje svar kontrolleras innan någon ser det.
- Skrivs utifrån hämtade textavsnitt, med källan intill
- En andra modell läser svaret mot de avsnitten och stoppar det som inte har stöd
- Skyddsräcken: inga påhittade priser eller räntor, ingen rådgivning utanför uppdraget, inga personuppgifter som upprepas tillbaka
- AI-modellen är en komponent, inte produkten. Vi testar och byter den underliggande LLM:en när bättre kommer; er kunskap, era regler och er röst står kvar
- Tonen, gränserna och eskaleringsreglerna sätts tillsammans med er, per bolag
Varför det är svårare än det ser ut
Att veta när man ska avstå är något man trimmar in, inte något man slår på. Är agenten för försiktig blir den oanvändbar, är den för villig blir den en risk.
Leverera
Där era kunder redan är, i båda riktningarna.
- Chatwidget på er egen sajt, i er egen branding
- Portal för ert team: vad som frågades, vad som svarades, vad som saknades
- MCP för andra AI-assistenter, samt mejl och röst in och ut, är på väg
- En människa godkänner meddelandet och vilka som får det, innan något går ut
Varför det är svårare än det ser ut
Vem som helst kan skicka ett meddelande. Att hantera svaret är det svåra, och det funkar bara när meddelandet och svaret kommer ur samma verifierade källa.
Svarsordningen
Tre nivåer serveras. Tre andra finns, men nekas.
- 1
Den här kundens eget ärende
Ett dokument kunden delat, eller era egna system
Primär
- 2
Ert eget innehåll
Er sajt, era dokument, det ni gett oss
Primär
- 3
Det delade verifierade lagret
Våra egna verifierade artiklar först, myndighetskällor därefter
Fallback
- 4
Andra bolags privata innehåll
Delas aldrig
- 5
Overifierat eller utgånget innehåll
Serveras aldrig
- 6
Det öppna internet
Serveras aldrig
Om ingen av de tre första bär svaret säger agenten det. Den faller inte igenom till dem nedanför.
Steg 2 i detalj
Det verifierade kunskapslagret, och varför det är den långsamma delen
Varje bolags eget innehåll tar slut vid kanten av vad bolaget publicerar. Kunderna frågar bortom den kanten hela tiden: vad en betalningsanmärkning faktiskt gör med en, vad Kronofogden får och inte får ta, hur en kreditförfrågan syns två år senare. Ingens hemsida svarar på det, för det är ingens uppgift.
Över 864 bedömda svar byggde fyra av tio helt eller delvis på det här delade lagret. På kreditupplysningsfrågor var det närmare sju av tio. Ju tunnare ett bolags eget innehåll är i ett ämne, desto mer av svaret bär det här lagret.
Bevaka
Myndigheter och konsumentorganisationer crawlas löpande. Inte för att svara ifrån, utan för att fånga förändring: ett nytt SFS-nummer, ett justerat belopp, en sida som tyst bytts ut.
Skriv
En artikel skrivs för att besvara en fråga en verklig person ställt, genom att föra ihop flera källor. En enskild myndighetssida svarar nästan aldrig på det som faktiskt frågades.
Verifiera
En branschexpert kontrollerar mot primärkällorna: författningen själv, myndighetens egen formulering, beloppet som det står i år.
Signera och datera
Artikeln visar vem som verifierat den och när. Ett osignerat utkast får inte serveras, hur välskrivet det än är. Det upprätthålls av systemet, inte av disciplin.
Omprövning
När bevakningen märker att något har ändrats går artikeln tillbaka till en människa. En regeländring är en omverifiering, inte en rad i en backlog.
Pensionera
När en nyare artikel täcker samma ämne dras den äldre in, istället för att ligga kvar och tyst säga emot sin ersättare.
Ligger under, hela tiden
Kvalitetsloopen
Svarskvalitet är en siffra här, inte ett intryck. Varje svar poängsätts mot ett facit som en människa skrivit, och poängen måste hålla innan något når en kund.
Benchmark
Varje körning hämtar hela konversationer ur en bank på 781 frågor över åtta produkttyper, med fast seed, så kurvorna är jämförbara efter en dataändring.
Facit
Varje fråga har ett facit som en människa skrivit och granskat: riktningen ett korrekt svar tar, eller vad ett bra svar måste göra och aldrig hitta på.
Domare
En oberoende domarmodell, aldrig den som skrev svaret, på temperatur noll så att en omkörning ger samma siffra. Tolv axlar, betygsatta ett till fem.
Triage och grind
Varje bolag får ett utlåtande om chatten över huvud taget är redo att slås på. En ändring som sänker poängen släpps inte. Det beslutet är vårt, inte modellens.
Vad domaren väger in
Sex kategorier på en skala 0–100. Allt bedöms utifrån frågan och svaret enbart, utan tillgång till vad chatten hämtat, vilket betyder att samma mått kan köras på vilken chat som helst, inklusive den ni har idag.
- Svarskorrekthet
- Stämmer fakta, och gäller de svenska förhållanden
- Hallucinationskontroll
- Finns påståenden som inte har stöd någonstans
- Compliance
- Håller sig rådgivningen inom sina gränser, och upprepas inga personuppgifter tillbaka till kunden
- Källtransparens
- Ser läsaren en källa där ett påstående behöver en
- Svarsrelevans
- Täcker svaret det som faktiskt frågades
- Tonalitet
- Låter det som ni, och är svaret rimligt långt för frågan
Compliance är en beteendekontroll av hur chatten uttrycker sig, inte en juridisk revision mot en författning. Kategorierna är viktade sinsemellan, men vikterna är ett verktyg för oss och inte ett löfte till er.
Tre mått som kräver att vi äger indexet
Alla tre är kvantitativa och mäts löpande, 0 till 100. De går inte att beräkna för en extern chat, eftersom de kräver insyn i exakt vilka källor svaret byggde på.
- FaithfulnessGrön ≥ 95
- Andelen påståenden i svaret som faktiskt bärs av de hämtade källorna.
- CitatprecisionGrön ≥ 85
- Av de påståenden som visar en källa, andelen där källan bär påståendet ärligt.
- DatakvalitetGrön ≥ 70
- Hur väl ert eget innehåll räcker för era egna kunders frågor, eller om vi behöver hämta mer.
- ProvenanceSummerar till 100
- Varifrån svaret faktiskt hämtades: ert eget innehåll, det delade lagret, båda, eller ingetdera.
Trösklarna skiljer per mått. Faithfulness har den strängaste av alla, eftersom en chat som svarar ur vårt eget index har få ursäkter för ett påstående källorna inte bär.
~100
svenska bolag vars innehåll kunskapsbasen redan täcker
4 av 10
svar hämtar ur det delade verifierade lagret, 7 av 10 hos kreditupplysningsbolag
50
språk besvarade från en kanonisk engelsk källa
92 %
av påståendena i ett svar bärs av en källa vi hämtat
781
benchmarkfrågor, var och en med ett facit skrivet och granskat av en människa
Hur ser det ut för ert bolag?
Kunskapsbasen täcker redan ett hundratal svenska bolag, och ert är sannolikt ett av dem. Ställ en fråga i demon och se vad den svarar om er idag, med källor. Vill ni se hela mätningen kör vi er egen frågeuppsättning och visar resultatet som det blev, inklusive det som inte höll.
