Vad en Lead AI Architect tar med sig till ett kundmöte
Vilket RAG-designval förbättrar faktiskt svarskvaliteten? Den här sidan mäter det — istället för att gissa.
Ett litet, verkligt RAG-system över sju Försäkringskassan-sidor, testat mot 24 handskrivna frågor. Beräkningen väntar just nu på Cloudflares dagliga gratiskvot för Workers AI (den delas med en annan demo och återställs 00:00 UTC).
Underlaget
Sju sidor från Försäkringskassan om föräldrapenning, graviditetspenning och vab (tillfällig föräldrapenning) — den typ av offentlig vägledningstext en Iver-kund inom kommun, region eller myndighet faktiskt vill ha ett RAG-gränssnitt över. Allt är öppen, fritt tillgänglig myndighetsinformation, hämtad utan inloggning; varje sida citeras med sin källa.
24 frågor med facitsvar skrevs för hand mot den här texten (se data/qa_set.json i repot).
Flera frågor är medvetet snarlika över de tre vab-sidorna (under 12 år / 12 år eller äldre / allvarligt
sjukt barn) för att testa om systemet faktiskt skiljer på reglerna, inte bara känner igen ordet "vab".
Designval 1 — chunkning × embedding-modell
Embeddings är billiga att beräkna, så hela kombinationsmatrisen testas: två sätt att dela upp texten i stycken (chunkning) × två embedding-modeller. Måttet: hur ofta hamnar rätt käll-sida bland de tre bäst matchande styckena för varje fråga (hit@3)?
Designval 2 — reranking av eller på
Den vinnande chunkning/embedding-kombinationen körs sedan genom hela kedjan — hämtning, valfri
omrankning, svarsgenerering, bedömning — för att se om ett extra rerankingsteg
(@cf/baai/bge-reranker-base) faktiskt flyttar svarskvaliteten, inte bara vilket textstycke
som hämtas. Det här steget kostar riktiga LLM-anrop, så det körs bara på de två konfigurationerna, inte
hela matrisen.
Kostnad och latens per 1000 frågor
Uträknat från uppmätt genomsnittlig token-användning och Cloudflares publicerade pris per token (developers.cloudflare.com/workers-ai/platform/pricing), inte en live-faktura — den här demon själv ryms gott och väl inom gratiskvoten.
Referensarkitektur — samma mönster i kundens Azure
Den här demon själv körs på Cloudflare (Pages + Workers AI), av kostnads- och enkelhetsskäl för en ansökningsdemo. Så här skulle samma mönster — hämtning, valfri reranking, spårbar generering — se ut i en kunds befintliga Azure-miljö, vilket är den plattform de flesta Iver-kunder redan står på.
Application Insights ger den spårbarhet över modell- och promptanrop som annonsen efterfrågar ("livscykelhantering av modeller och prompts... med höga krav på kvalitet och kontroll"); Key Vault och Entra ID håller nycklar och åtkomst utanför applikationskoden.
Ställ en fråga, live
Kör den vinnande konfigurationen ovan mot samma sju sidor, i realtid — inte ett förberett svar. Delar samma dagliga gratiskvot som resten av kontot, så den kan vara pausad; de förberäknade resultaten ovan visar samma pipeline och modeller.
Om demon
Byggd av Ulf Faldt Reifenberg som en del av en ansökan till rollen Lead AI Architect hos Iver Accelerate i Göteborg. Inte en generell produktpitch — ett konkret exempel på det en lead-arkitekt faktiskt levererar i ett tidigt kundskede: ett litet, verkligt system, mätt bevis för vilka designval som spelar roll, och en kostnadsbild innan något byggs i skarp drift.
Källkod, precompute-skript och rådata: github.com/AlwaysBlind/iver-lead-ai-architect-demo.
Inofficiell — inte kopplad till, granskad av eller sponsrad av Iver eller Accelerate. Inget Iver-varumärke eller Iver-liknande formgivning används.