Kvalitetssikring af AI kræver mere end test
Fra QA til EvalOps: sådan dokumenterer vi, at et AI-system løser den rigtige opgave med den nødvendige kvalitet, også efter det er sat i drift.

Resumé
En AI-løsning er ikke god, fordi den virker i en demo. Den er god, når vi kan dokumentere, at den løser den rigtige opgave med den nødvendige kvalitet, også efter den er sat i drift.
En klassisk softwaretest har et facit: givet et bestemt input forventer vi et bestemt output. Generativ AI har ikke ét facit. To forskellige svar kan begge være gode, og et svar kan lyde overbevisende og samtidig være forkert. En grøn testsuite siger derfor ikke, om AI-systemet løser opgaven.
EvalOps gør kvaliteten målbar og gentagelig. Succes defineres ud fra den konkrete arbejdsgang og testes på et datasæt, der ligner virkeligheden. Evalueringen kører automatisk ved hver ændring, stopper en deployment ved regression og fortsætter, efter systemet er i drift.
Indhold
- 1Hvorfor klassisk QA ikke rækker
- 2Fra mavefornemmelse til målbar kvalitet
- 3Start med at definere, hvad succes betyder
- 4Byg et evalueringsdatasæt, der ligner virkeligheden
- 5Mål både slutresultatet og komponenterne
- 6Automatiser evalueringen, og kalibrer den mod mennesker
- 7Gør evals til en del af udviklingsprocessen
- 8Evalueringen stopper ikke ved go-live
- 9Den vigtigste eval ligger måske uden for AI-systemet
- 10EvalOps og AI-forordningen
- 11EvalOps erstatter ikke sikkerhed og klassisk QA
- 12Fra AI-projekt til produktionsdisciplin
Skrevet til
Til dig, der bygger eller har ansvaret for et AI-system, som er i drift eller på vej i drift: AI-teams, der arbejder med RAG-løsninger og agenter, og dem, der ejer den arbejdsgang, systemet skal understøtte. White paperet er særligt relevant for organisationer i reguleret sagsbehandling, hvor kvaliteten skal kunne dokumenteres over for tilsyn og klageinstanser.