Rapport antwurdkwaliteit
Antwurdkwaliteit per kritearium: Gem 1.0 neist twa farianten fan Gem 2.0
Rooktest · net folslein útfierd
Hoe skoare de trije farianten op de fiif algemiene kwaliteitskritearia dy't foar elk antwurd jilde, likefolle hokker fraach der steld is? Deselde fragen gongen del by Gem 1.0 en by twa farianten fan Gem 2.0.
| Kritearium | Gem 1.0 | Gem 2.0 hybride | Gem 2.0 suver generatyf |
|---|---|---|---|
| Krektens | |||
| Helpfeardigens | |||
| Ienfâld | |||
| Stavering & grammatika | |||
| Toan | |||
| Woegen totaal | 72,3% | 73,3% | 80,6% |
Skoarebannen
- 90–100%
- 80–89%
- 70–79%
- 60–69%
- < 60%
Wat betsjutte dizze kritearia?
Fiif kritearia dy't foar elk antwurd jilde, los fan de ynhâld fan de fraach.
- Krektens
- Docht it antwurd gjin ûnterjochte oannames oer de situaasje fan de fragesteller.
- Helpfeardigens
- Biedt it antwurd in konkrete folgjende stap of in manier om mear te witten te kommen.
- Ienfâld
- Gewoane wurden, koarte sinnen, aktive foarm, logyske opbou. Bestiet út fjouwer dielmjittingen.
- Stavering & grammatika
- Taalkundich flaterleas.
- Toan
- Profesjoneel-freonlik, do-foarm, empasy dêr't it nedich is.
Wat betsjut dit?
By alle trije farianten is Krektens it sterkste punt (93–94%) en Toan it swakste (55–70%): de antwurden brûke net konsekwint de winske do-foarm en misse wat empasy. Helpfeardigens ferskilt it dúdlikst tusken de farianten. Gem 2.0 suver generatyf skoart dêr 78%, rom boppe Gem 1.0 (62%) en Gem 2.0 hybride (54%, al is dat sifer op in lytsere stekproef basearre).
Gem 2.0 suver generatyf hat oer de folsleine set de heechste woegen totaalskoare (80,6 fan de 100). Gem 2.0 hybride stiet der op de 23 wól skoarde fragen better foar as Gem 1.0, mar dat is noch gjin útspraak oer de folsleine set fan 51.
Oer dizze mjitting
- Testset
- 51 fragen út 9 eksamens. Elke skoare is it gemiddelde oer dy fragen.
- Testopset
- Test by de gemeente Utrecht, beoardiele troch in AI-beoardieler.
- Gem 1.0
- Werkenning mei net-generative AI en fêste antwurden op basis fan skripte logika.
- Gem 2.0 hybride
- Werkenning mei generative AI, fêste antwurden foar faak stelde fragen en generearre antwurden foar minder faak stelde fragen.
- Gem 2.0 suver generatyf
- Werkenning mei generative AI én alle beantwurding troch generative AI.
Lytse letterkes: metoade & foarbehâlden
Dizze opstarttest is net folslein útfierd fanwegen beheiningen yn it evaluaasjesysteem. De sifers binne dêrmei ûnder foarbehâld.
Gem 2.0 hybride is op 23 fan de 51 fragen skoard. De oare 28 fragen (meerinfo, sensitive, simple, tussenvragen, verwijzen, en ien fraach út medewerker) binne foar dy fariant noch net beoardiele.
De testoanpak moat him ûntwikkelje fan dizze opstarttest nei in folsleiner samling testgefallen dy't in represintatyf byld jout fan de antwurdkwaliteit. Dêrfoar wurkje wy oan mear testkapasiteit foar gruttere testsets, in grutter eksamen mei kritearia dy't spesifyk binne foar in testgefal, it neirinnen fan de toan tsjin de winske toan, en it ferienfâldigjen fan de antwurden. Der binne no geregeld lange antwurden mei meardere bysinnen.