Neem als voorbeeld een servicebedrijf dat een AI-samenvatting aan zijn klantdossiers wil toevoegen. De beoogde functie verzamelt geselecteerde gespreksnotities en servicemeldingen, waarna AI een concepttekst opstelt. In dit voorbeeld moet de medewerker die tekst kunnen controleren en aanpassen voordat deze als definitieve notitie wordt opgeslagen.
Voor zo’n functie moeten verschillende keuzes technisch worden uitgewerkt. Welke dossiers en contactmomenten worden meegenomen? Hoe wordt voorkomen dat informatie van verschillende klanten door elkaar raakt? Welke gegevens mag de ingelogde medewerker raadplegen? Die toegangsrechten moeten ook gelden voor de informatie die de AI-functie kan ophalen.
Ook het gedrag bij ontbrekende informatie hoort in het ontwerp. In dit voorbeeld kan de applicatie aangeven dat er onvoldoende gegevens zijn om een samenvatting te maken. Bij een storing in de AI-dienst kan de medewerker de oorspronkelijke notities blijven openen. Zo is vooraf duidelijk hoe de functie zich in deze situaties moet gedragen.
Dit voorbeeld laat zien hoeveel van de uitwerking in de applicatie zelf zit. De gegevensselectie, het controlescherm, de opslag en de koppeling met het AI-model vormen samen de functie die de medewerker gebruikt.
Resultaten toetsen in de praktijk
Meet de kwaliteit, het correctiewerk en de gebruikskosten.
Een geslaagde demonstratie geeft nog geen zekerheid over dagelijks gebruik. Het Amerikaanse instituut NIST wijst erop dat testresultaten uit een gecontroleerde omgeving kunnen afwijken van de werking in de praktijk. De omstandigheden waarin de toepassing wordt gebruikt, moeten daarom terugkomen in de beoordeling.
Voor het servicebedrijf betekent dit bijvoorbeeld testen met korte én lange dossiers, dubbele notities en ontbrekende gegevens. De betrokken medewerkers kunnen beoordelen of belangrijke afspraken terugkomen en of de samenvatting informatie toevoegt die niet in het dossier staat. Microsoft onderscheidt bij de evaluatie van AI-antwoorden onder meer relevantie, volledigheid en onderbouwing door de gebruikte informatie.
Naast de inhoud telt de totale verwerkingstijd. Een snel gegenereerde tekst kan alsnog veel correctiewerk vragen. Leg daarom vooraf vast wat een bruikbaar resultaat is en meet hoeveel tijd medewerkers nodig hebben om dat resultaat te bereiken.
Neem ook de kosten per gebruik en het verwachte aantal aanvragen mee. Daarmee kan de opdrachtgever beoordelen of verdere ontwikkeling past bij de beoogde opbrengst. Na wijzigingen aan het model, de instructies of de gegevensselectie kan dezelfde verzameling testdossiers opnieuw worden gebruikt om resultaten te vergelijken.