Kwaliteit in cijfers

Hoe weet je dat Gem werkt? En wordt Gem er echt beter op? We meten het, met echte inwonersvragen.

We kijken niet naar één aspect, maar naar een samenhangend geheel — naar wat er wél in een antwoord moet staan, én naar wat er juist níet in thuishoort. Op deze pagina verzamelen we de metingen van onze antwoordkwaliteit. Elke meting vergelijkt systemen op een vaste set criteria.

Wat is kwaliteit precies? Vijf criteria

  • Juistheid Klopt het antwoord feitelijk?
  • Behulpzaamheid Helpt het de inwoner echt verder?
  • Eenvoud Is het kort en begrijpelijk?
  • Spelling & grammatica Is het foutloos geschreven?
  • Toon Past de toon bij een gemeente?

Dit zijn de vijf criteria die we op dit moment automatisch scoren. Andere eisen aan een goed antwoord — zoals bronvermelding en veiligheid — beoordelen we nog niet machinaal.

Rapport antwoordkwaliteit

Antwoordkwaliteit per criterium: Gem 1.0 naast twee varianten van Gem 2.0

Rooktest · onvolledig uitgevoerd

Hoe scoren de drie varianten op de vijf algemene kwaliteitscriteria die voor elk antwoord gelden, ongeacht welke vraag er gesteld is? Dezelfde vragen gingen langs Gem 1.0 en langs twee varianten van Gem 2.0.

Scores in procenten · kleur = scoreband · het totaal is het gemiddelde van de vijf criteria, elk even zwaar meegeteld.
Criterium Gem 1.0 Gem 2.0 hybride Gem 2.0 puur generatief
Juistheid 93,3% 94,3% 93,1%
Behulpzaamheid 62,4% 53,5% 77,8%
Eenvoud 65,7% 71,6% 67,8%
Spelling & grammatica 85,1% 90,9% 94,3%
Toon 54,9% 56,1% 69,8%
Gewogen totaal 72,3% 73,3% 80,6%

Scorebanden

  • 90–100%
  • 80–89%
  • 70–79%
  • 60–69%
  • < 60%
Wat betekenen deze criteria?

Vijf criteria die voor elk antwoord gelden, los van de inhoud van de vraag.

Juistheid
Doet het antwoord geen onterechte aannames over de situatie van de vragensteller.
Behulpzaamheid
Biedt het antwoord een concrete volgende stap of een manier om meer te weten te komen.
Eenvoud
Gewone woorden, korte zinnen, actieve vorm, logische opbouw. Bestaat uit vier deelmetingen.
Spelling & grammatica
Taalkundig foutloos.
Toon
Professioneel-vriendelijk, jij-vorm, empathie waar nodig.

Wat betekent dit?

Op alle drie de varianten is Juistheid het sterkste punt (93–94%) en Toon het zwakste (55–70%): de antwoorden gebruiken niet consistent de gewenste jij-vorm en missen wat empathie. Behulpzaamheid verschilt het duidelijkst tussen de varianten. Gem 2.0 puur generatief scoort daar 78%, ruim boven Gem 1.0 (62%) en Gem 2.0 hybride (54%, al is dat cijfer op een kleinere steekproef gebaseerd).

Gem 2.0 puur generatief heeft over de volledige set de hoogste gewogen totaalscore (80,6 van de 100). Gem 2.0 hybride staat er op de 23 wél gescoorde vragen beter voor dan Gem 1.0, maar dat is nog geen uitspraak over de volledige set van 51.

Over deze meting

Testset
51 vragen uit 9 examens. Elke score is het gemiddelde over die vragen.
Testopzet
Getest bij de gemeente Utrecht, beoordeeld door een AI-beoordelaar.
Gem 1.0
Herkenning met niet-generatieve AI en vaste antwoorden op basis van gescripte logica.
Gem 2.0 hybride
Herkenning met generatieve AI, vaste antwoorden voor veelgestelde vragen en gegenereerde antwoorden voor minder vaak gestelde vragen.
Gem 2.0 puur generatief
Herkenning met generatieve AI én alle beantwoording door generatieve AI.

Kleine lettertjes: methode & voorbehouden

Deze opstarttest is onvolledig uitgevoerd vanwege beperkingen in het evaluatiesysteem. De cijfers zijn daarmee onder voorbehoud.

Gem 2.0 hybride is op 23 van de 51 vragen gescoord. De overige 28 vragen (meerinfo, sensitive, simple, tussenvragen, verwijzen, en één vraag uit medewerker) zijn voor die variant nog niet beoordeeld.

De testaanpak moet zich ontwikkelen van deze opstarttest naar een vollediger verzameling testgevallen die een representatief beeld geeft van de antwoordkwaliteit. Daarvoor werken we aan meer testcapaciteit voor grotere testsets, een groter examen met criteria die specifiek zijn voor een testgeval, het nalopen van de toon tegen de gewenste toon, en het versimpelen van de antwoorden. Er zijn nu regelmatig lange antwoorden met meerdere bijzinnen.

Alle metingen

Elke meting staat op zijn eigen pagina en blijft daar staan. Vergelijk alleen metingen die dezelfde systemen naast elkaar leggen.

Waarom dit telt voor jouw gemeente

Antwoordkwaliteit is geen technisch detail, maar een kwestie van betrouwbaarheid en reputatie. Eén slecht antwoord ondermijnt het vertrouwen van een inwoner in je hele digitale dienstverlening.

Daarom staat bij Gem degelijkheid voorop: liever een eerlijk “dit zoek ik even voor je uit” met een medewerker erbij, dan een vlot antwoord dat niet klopt. Je krijgt geen chatbot die “wel iets zegt”, maar een assistent waarvan de antwoordkwaliteit gedefinieerd, gemeten en navolgbaar is.

Generatieve AI

Om ook de lastige, nog niet herkende vragen beter te beantwoorden, werken we aan de inzet van generatieve AI. Dat blijft een zorgvuldige afweging: we zetten het alleen in als het de antwoorden aantoonbaar verbetert.

Daarom testen we meerdere taalmodellen naast elkaar — waaronder GPT-NL, het Nederlandse taalmodel voor de publieke sector — en vergelijken we de kwaliteitsverschillen met praktijkgerichte examens: een set vooraf geselecteerde vragen met bijbehorende goede antwoorden. Wie mag straks antwoorden geven aan inwoners? Dat bepalen we niet op gevoel, maar op resultaat.

De criteria controleren deden we lange tijd vooral handmatig, aangevuld met meldingen van inwoners en kritische onderzoekers. Waardevol, maar tijdrovend. Daarom automatiseren we steeds meer controles met een testsysteem dat antwoorden analyseert en beoordeelt aan de hand van diezelfde examens. Zo maken we kwaliteit meetbaar, schaalbaar én consistent — zonder de menselijke blik los te laten.

De uitkomsten van die examens publiceren we periodiek.