Rapport antwoordkwaliteit
Antwoordkwaliteit: Gem 1.0 vergeleken met Gem 2.0
Pilot · deelverzameling van vragen
We legden de oudere dialoogagent (Gem 1.0) naast de nieuwe GenAI-agent (Gem 2.0): zelfde gemeente, zelfde vragen, alleen de motor eronder verschilt.
| Criterium | Gem 1.0 | Gem 2.0 |
|---|---|---|
| Juistheid | ||
| Behulpzaamheid | ||
| Eenvoud | ||
| Spelling & grammatica | ||
| Toon | ||
| Gewogen totaal | 0,872 | 0,888 |
Scorebanden
- 0,90–1,00
- 0,80–0,89
- 0,70–0,79
- 0,60–0,69
- < 0,60
Wat betekent dit?
De belangrijkste verschillen tussen deze versies zijn:
- Gem 2.0 is beter in complexe vragen, bijvoorbeeld als het gaat om co-ouderschap.
- Gem 1.0 is beter bij ruisvragen en informele bewoordingen (zoals “blabla…”, “hoi, ik wil…”).
Over deze meting
- Testset
- 100 vragen uit 12 categorieën van de veelgestelde vragen. Elke score is het gemiddelde over die vragen.
- Criteria
- Criteria en verwachte antwoorden zijn nog niet geoptimaliseerd naar maximale overeenkomst met menselijke beoordelaars. Het criterium “juistheid” is nu algemeen en eenvoudig gehouden.
Kleine lettertjes: methode & voorbehouden
Pilot op een deelverzameling: deze run is niet zonder meer representatief voor alle onderwerpen of alle gemeenten.