BilluminateBilluminate

Så funkar det

Från publik information till ett svar ni kan stå bakom.

Vem som helst kan peka en språkmodell på en webbplats. Avståndet mellan det och ett svar ett reglerat bolag vågar sätta sitt namn på, där sitter arbetet. Vi bygger både lagret och agenten som går på det.

Läs färgerna

Körs automatiskt, löpandeEn människa beslutar, vår eller er

Fem steg, och det mesta av arbetet är inte kod

1

Samla in

Vi läser den publika webben som en varsam gäst, och lägger sedan till det bara ni har.

Publika källor

bolagens sajterkronofogden.secsn.sefi.sekonsumentorganisationer

Ert eget material

produktdokumentvillkorinterna FAQ:ersupportdialoger
  • robots.txt följs enligt RFC 9309, crawl-takten hålls varsam, avgränsad till rätt marknad
  • Omcrawlningar upptäcker vad som ändrats, inte bara vad som finns
  • Vilka källor som är värda att läsa, och hur djupt

Varför det är svårare än det ser ut

Varje sajt är byggd på sitt eget sätt, och hälften av dem gör om sina sidor nästa kvartal utan att säga till, så att inläsningen slutar fungera.

2

Verifiera

Två spår som hanteras olika och hålls åtskilda. De möts inne i ett svar, aldrig i en databas.

  • Båda spåren först: menyer, banners och juridisk boilerplate skalas bort, bara den text som faktiskt bär ett svar sparas
  • Ert innehåll struktureras med de fakta som avgör om ett svar blir rätt: produkter, kreditprocess, vilken kreditupplysning ni använder, vilka marknader ni finns på
  • Material som aldrig legat på er sajt kopplas in tillsammans med er
  • Inget annat bolags chat kan hämta ert innehåll, och det kan inte bli delad kunskap utan både ert medgivande och ett uttryckligt godkännande från oss
  • Den delade kunskapen skrivs, kontrolleras mot primärkällorna och signeras av en branschexpert innan den får serveras

Varför det är svårare än det ser ut

Att hålla de två åtskilda är ett arkitekturbeslut som inte går att laga i efterhand. Att blanda dem är enkelt och billigt, och det är skälet till att de flesta sådana system inte går att sälja till en bank.

3

Organisera

En svarsordning som tillämpas på varje fråga, varje gång.

  • Ert innehåll och det delade lagret indexeras separat, per bolag
  • Skrivs och indexeras en gång på engelska, besvaras på 50 språk
  • Strukturerade fakta om ert bolag, era produkter och er roll på marknaden, och de gäller som grundsanning
  • Svarsordningen bestäms tillsammans med er, och den nivå ni inte vill ha stängs av

Varför det är svårare än det ser ut

Att ta fel hylla är sämre än att hyllan står tom. Det är svaret som självsäkert anger fel källa som hamnar i en skärmdump.

4

Svara

Varje svar kontrolleras innan någon ser det.

  • Skrivs utifrån hämtade textavsnitt, med källan intill
  • En andra modell läser svaret mot de avsnitten och stoppar det som inte har stöd
  • Skyddsräcken: inga påhittade priser eller räntor, ingen rådgivning utanför uppdraget, inga personuppgifter som upprepas tillbaka
  • AI-modellen är en komponent, inte produkten. Vi testar och byter den underliggande LLM:en när bättre kommer; er kunskap, era regler och er röst står kvar
  • Tonen, gränserna och eskaleringsreglerna sätts tillsammans med er, per bolag

Varför det är svårare än det ser ut

Att veta när man ska avstå är något man trimmar in, inte något man slår på. Är agenten för försiktig blir den oanvändbar, är den för villig blir den en risk.

5

Leverera

Där era kunder redan är, i båda riktningarna.

  • Chatwidget på er egen sajt, i er egen branding
  • Portal för ert team: vad som frågades, vad som svarades, vad som saknades
  • MCP för andra AI-assistenter, samt mejl och röst in och ut, är på väg
  • En människa godkänner meddelandet och vilka som får det, innan något går ut

Varför det är svårare än det ser ut

Vem som helst kan skicka ett meddelande. Att hantera svaret är det svåra, och det funkar bara när meddelandet och svaret kommer ur samma verifierade källa.

Svarsordningen

Tre nivåer serveras. Tre andra finns, men nekas.

  1. 1

    Den här kundens eget ärende

    Ett dokument kunden delat, eller era egna system

    Primär

  2. 2

    Ert eget innehåll

    Er sajt, era dokument, det ni gett oss

    Primär

  3. 3

    Det delade verifierade lagret

    Våra egna verifierade artiklar först, myndighetskällor därefter

    Fallback

  4. 4

    Andra bolags privata innehåll

    Delas aldrig

  5. 5

    Overifierat eller utgånget innehåll

    Serveras aldrig

  6. 6

    Det öppna internet

    Serveras aldrig

Om ingen av de tre första bär svaret säger agenten det. Den faller inte igenom till dem nedanför.

Steg 2 i detalj

Det verifierade kunskapslagret, och varför det är den långsamma delen

Varje bolags eget innehåll tar slut vid kanten av vad bolaget publicerar. Kunderna frågar bortom den kanten hela tiden: vad en betalningsanmärkning faktiskt gör med en, vad Kronofogden får och inte får ta, hur en kreditförfrågan syns två år senare. Ingens hemsida svarar på det, för det är ingens uppgift.

Över 864 bedömda svar byggde fyra av tio helt eller delvis på det här delade lagret. På kreditupplysningsfrågor var det närmare sju av tio. Ju tunnare ett bolags eget innehåll är i ett ämne, desto mer av svaret bär det här lagret.

Bevaka

Myndigheter och konsumentorganisationer crawlas löpande. Inte för att svara ifrån, utan för att fånga förändring: ett nytt SFS-nummer, ett justerat belopp, en sida som tyst bytts ut.

Skriv

En artikel skrivs för att besvara en fråga en verklig person ställt, genom att föra ihop flera källor. En enskild myndighetssida svarar nästan aldrig på det som faktiskt frågades.

Verifiera

En branschexpert kontrollerar mot primärkällorna: författningen själv, myndighetens egen formulering, beloppet som det står i år.

Signera och datera

Artikeln visar vem som verifierat den och när. Ett osignerat utkast får inte serveras, hur välskrivet det än är. Det upprätthålls av systemet, inte av disciplin.

Omprövning

När bevakningen märker att något har ändrats går artikeln tillbaka till en människa. En regeländring är en omverifiering, inte en rad i en backlog.

Pensionera

När en nyare artikel täcker samma ämne dras den äldre in, istället för att ligga kvar och tyst säga emot sin ersättare.

Ligger under, hela tiden

Kvalitetsloopen

Svarskvalitet är en siffra här, inte ett intryck. Varje svar poängsätts mot ett facit som en människa skrivit, och poängen måste hålla innan något når en kund.

Benchmark

Varje körning hämtar hela konversationer ur en bank på 781 frågor över åtta produkttyper, med fast seed, så kurvorna är jämförbara efter en dataändring.

Facit

Varje fråga har ett facit som en människa skrivit och granskat: riktningen ett korrekt svar tar, eller vad ett bra svar måste göra och aldrig hitta på.

Domare

En oberoende domarmodell, aldrig den som skrev svaret, på temperatur noll så att en omkörning ger samma siffra. Tolv axlar, betygsatta ett till fem.

Triage och grind

Varje bolag får ett utlåtande om chatten över huvud taget är redo att slås på. En ändring som sänker poängen släpps inte. Det beslutet är vårt, inte modellens.

Vad domaren väger in

Sex kategorier på en skala 0–100. Allt bedöms utifrån frågan och svaret enbart, utan tillgång till vad chatten hämtat, vilket betyder att samma mått kan köras på vilken chat som helst, inklusive den ni har idag.

Svarskorrekthet
Stämmer fakta, och gäller de svenska förhållanden
Hallucinationskontroll
Finns påståenden som inte har stöd någonstans
Compliance
Håller sig rådgivningen inom sina gränser, och upprepas inga personuppgifter tillbaka till kunden
Källtransparens
Ser läsaren en källa där ett påstående behöver en
Svarsrelevans
Täcker svaret det som faktiskt frågades
Tonalitet
Låter det som ni, och är svaret rimligt långt för frågan

Compliance är en beteendekontroll av hur chatten uttrycker sig, inte en juridisk revision mot en författning. Kategorierna är viktade sinsemellan, men vikterna är ett verktyg för oss och inte ett löfte till er.

Tre mått som kräver att vi äger indexet

Alla tre är kvantitativa och mäts löpande, 0 till 100. De går inte att beräkna för en extern chat, eftersom de kräver insyn i exakt vilka källor svaret byggde på.

FaithfulnessGrön ≥ 95
Andelen påståenden i svaret som faktiskt bärs av de hämtade källorna.
CitatprecisionGrön ≥ 85
Av de påståenden som visar en källa, andelen där källan bär påståendet ärligt.
DatakvalitetGrön ≥ 70
Hur väl ert eget innehåll räcker för era egna kunders frågor, eller om vi behöver hämta mer.
ProvenanceSummerar till 100
Varifrån svaret faktiskt hämtades: ert eget innehåll, det delade lagret, båda, eller ingetdera.

Trösklarna skiljer per mått. Faithfulness har den strängaste av alla, eftersom en chat som svarar ur vårt eget index har få ursäkter för ett påstående källorna inte bär.

~100

svenska bolag vars innehåll kunskapsbasen redan täcker

4 av 10

svar hämtar ur det delade verifierade lagret, 7 av 10 hos kreditupplysningsbolag

50

språk besvarade från en kanonisk engelsk källa

92 %

av påståendena i ett svar bärs av en källa vi hämtat

781

benchmarkfrågor, var och en med ett facit skrivet och granskat av en människa

Hur ser det ut för ert bolag?

Kunskapsbasen täcker redan ett hundratal svenska bolag, och ert är sannolikt ett av dem. Ställ en fråga i demon och se vad den svarar om er idag, med källor. Vill ni se hela mätningen kör vi er egen frågeuppsättning och visar resultatet som det blev, inklusive det som inte höll.

Boka genomgång