Kwaliteit yn sifers

Hoe witsto dat Gem wurket? En wurdt Gem der echt better op? Wy mjitte it, mei echte ynwennersfragen.

Wy sjogge net nei ien aspekt, mar nei in gearhingjend gehiel — nei wat der wèl yn in antwurd stean moat, én nei wat der krekt net yn thúshearret. Op dizze side sammelje wy de mjittingen fan ús antwurdkwaliteit. Elke mjitting fergeliket systemen op in fêste set kritearia.

Wat is kwaliteit krekt? Fiif kritearia

  • Krektens Kloppet it antwurd feitlik?
  • Helpfeardigens Helpt it de ynwenner echt fierder?
  • Ienfâld Is it koart en begryplik?
  • Stavering & grammatika Is it flaterfrij skreaun?
  • Toan Past de toan by in gemeente?

Dit binne de fiif kritearia dy't wy op dit stuit automatysk skoare. Oare easken oan in goed antwurd — lykas boarnefermelding en feiligens — beoardielje wy noch net masinaal.

Rapport antwurdkwaliteit

Antwurdkwaliteit per kritearium: Gem 1.0 neist twa farianten fan Gem 2.0

Rooktest · net folslein útfierd

Hoe skoare de trije farianten op de fiif algemiene kwaliteitskritearia dy't foar elk antwurd jilde, likefolle hokker fraach der steld is? Deselde fragen gongen del by Gem 1.0 en by twa farianten fan Gem 2.0.

Skoares yn prosinten · kleur = skoarebân · it totaal is it gemiddelde fan de fiif kritearia, elk like swier meiteld.
Kritearium Gem 1.0 Gem 2.0 hybride Gem 2.0 suver generatyf
Krektens 93,3% 94,3% 93,1%
Helpfeardigens 62,4% 53,5% 77,8%
Ienfâld 65,7% 71,6% 67,8%
Stavering & grammatika 85,1% 90,9% 94,3%
Toan 54,9% 56,1% 69,8%
Woegen totaal 72,3% 73,3% 80,6%

Skoarebannen

  • 90–100%
  • 80–89%
  • 70–79%
  • 60–69%
  • < 60%
Wat betsjutte dizze kritearia?

Fiif kritearia dy't foar elk antwurd jilde, los fan de ynhâld fan de fraach.

Krektens
Docht it antwurd gjin ûnterjochte oannames oer de situaasje fan de fragesteller.
Helpfeardigens
Biedt it antwurd in konkrete folgjende stap of in manier om mear te witten te kommen.
Ienfâld
Gewoane wurden, koarte sinnen, aktive foarm, logyske opbou. Bestiet út fjouwer dielmjittingen.
Stavering & grammatika
Taalkundich flaterleas.
Toan
Profesjoneel-freonlik, do-foarm, empasy dêr't it nedich is.

Wat betsjut dit?

By alle trije farianten is Krektens it sterkste punt (93–94%) en Toan it swakste (55–70%): de antwurden brûke net konsekwint de winske do-foarm en misse wat empasy. Helpfeardigens ferskilt it dúdlikst tusken de farianten. Gem 2.0 suver generatyf skoart dêr 78%, rom boppe Gem 1.0 (62%) en Gem 2.0 hybride (54%, al is dat sifer op in lytsere stekproef basearre).

Gem 2.0 suver generatyf hat oer de folsleine set de heechste woegen totaalskoare (80,6 fan de 100). Gem 2.0 hybride stiet der op de 23 wól skoarde fragen better foar as Gem 1.0, mar dat is noch gjin útspraak oer de folsleine set fan 51.

Oer dizze mjitting

Testset
51 fragen út 9 eksamens. Elke skoare is it gemiddelde oer dy fragen.
Testopset
Test by de gemeente Utrecht, beoardiele troch in AI-beoardieler.
Gem 1.0
Werkenning mei net-generative AI en fêste antwurden op basis fan skripte logika.
Gem 2.0 hybride
Werkenning mei generative AI, fêste antwurden foar faak stelde fragen en generearre antwurden foar minder faak stelde fragen.
Gem 2.0 suver generatyf
Werkenning mei generative AI én alle beantwurding troch generative AI.

Lytse letterkes: metoade & foarbehâlden

Dizze opstarttest is net folslein útfierd fanwegen beheiningen yn it evaluaasjesysteem. De sifers binne dêrmei ûnder foarbehâld.

Gem 2.0 hybride is op 23 fan de 51 fragen skoard. De oare 28 fragen (meerinfo, sensitive, simple, tussenvragen, verwijzen, en ien fraach út medewerker) binne foar dy fariant noch net beoardiele.

De testoanpak moat him ûntwikkelje fan dizze opstarttest nei in folsleiner samling testgefallen dy't in represintatyf byld jout fan de antwurdkwaliteit. Dêrfoar wurkje wy oan mear testkapasiteit foar gruttere testsets, in grutter eksamen mei kritearia dy't spesifyk binne foar in testgefal, it neirinnen fan de toan tsjin de winske toan, en it ferienfâldigjen fan de antwurden. Der binne no geregeld lange antwurden mei meardere bysinnen.

Alle mjittingen

Elke mjitting stiet op syn eigen side en bliuwt dêr stean. Fergelykje allinne mjittingen dy't deselde systemen neistinoar lizze.

Wêrom't dit telt foar dyn gemeente

Antwurdkwaliteit is gjin technysk detail, mar in kwestje fan betrouberens en reputaasje. Ien min antwurd ûndermynt it fertrouwen fan in ynwenner yn dyn hiele digitale tsjinstferliening.

Dêrom stiet by Gem deeglikheid foarop: leaver in earlik “dit siikje ik even foar dy út” mei in meiwurker derby, as in flot antwurd dat net kloppet. Do krijst gjin chatbot dy't “wol wat seit”, mar in assistint wêrfan de antwurdkwaliteit definiearre, mjitten en neifolchber is.

Generative AI

Om ek de dreege, noch net werkende fragen better te beäntwurdzjen, wurkje wy oan de ynset fan generative AI. Dat bliuwt in soarchfâldige ôfwaging: wy sette it allinne yn as it de antwurden oantoanber ferbetteret.

Dêrom teste wy meardere taalmodellen neistinoar — wêrûnder GPT-NL, it Nederlânske taalmodel foar de publike sektor — en fergelykje wy de kwaliteitsferskillen mei praktykrjochte eksamens: in set foarôf selektearre fragen mei bybehearrende goede antwurden. Wa mei aanst antwurden jaan oan ynwenners? Dat bepale wy net op gefoel, mar op resultaat.

De kritearia kontrolearje diene wy lange tiid benammen mei de hân, oanfolle mei meldingen fan ynwenners en krityske ûndersikers. Weardefol, mar tiidrôvjend. Dêrom automatisearje wy hieltyd mear kontrôles mei in testsysteem dat antwurden analysearret en beoardielet oan de hân fan deselde eksamens. Sa meitsje wy kwaliteit mjitber, skaalber én konsistint — sûnder de minsklike blik los te litten.

De útkomsten fan dy eksamens publisearje wy periodyk.