Rapport antwurdkwaliteit
Antwurdkwaliteit de fraachkategory: Gem 1.0 neist twa farianten fan Gem 2.0
Rooktest · earste, lytsskalige mjitting
In earste, lytsskalige rooktest fan it eksamen, mei in tredde dielnimmer: neist Gem 1.0 en de hybride Gem 2.0 draaide ek in testfariant mei dy't álle antwurden genereart.
Skoares per kategory
De fraachkategory de trije farianten neistinoar. Elke stoef is it persintaazje fan de maksimale skoare yn dy kategory.
Skoares per fariant
Deselde mjitting, oarsom besjoen: per fariant it woegen totaal, opboud út de sân kategoryën. In blok is it tal punten dat de fariant yn dy kategory helle — dêr't in blok smeller is as by de oare farianten, geane punten ferlern.
Alle sifers by dizze mjitting
Skoares per kategory
| Fraachkategory | Gem 1.0 | Gem 2.0 hybride | Gem 2.0 suver generatyf | Oandiel |
|---|---|---|---|---|
| Net faak frege | 69,2% | 88,7% | 84,2% | oandiel 47% |
| Faak frege | 96,9% | 97,3% | 83,3% | oandiel 18% |
| Blokkearje | 91,1% | 99,3% | 99,3% | oandiel 10% |
| Meiwurker oanbiede | 100,0% | 55,2% | 50,5% | oandiel 7% |
| Gefoelich | 97,1% | 97,2% | 92,9% | oandiel 7% |
| Trochferwize nei in oare organisaasje | 92,8% | 92,5% | 93,9% | oandiel 6% |
| Trochfreegje | 98,3% | 88,7% | 69,3% | oandiel 5% |
| Woegen totaal | 82,8% | 89,6% | 83,3% |
Skoares per fariant
| Fariant | Net faak frege | Faak frege | Blokkearje | Meiwurker oanbiede | Gefoelich | Trochferwize nei in oare organisaasje | Trochfreegje | Totaal (fan 100) |
|---|---|---|---|---|---|---|---|---|
| Gem 1.0 | 31,8 | 17,4 | 8,7 | 7,5 | 6,9 | 5,3 | 5,2 | 82,8 |
| Gem 2.0 hybride | 41,5 | 17,6 | 9,5 | 4,1 | 6,9 | 5,2 | 4,7 | 89,6 |
| Gem 2.0 suver generatyf | 39,3 | 15,3 | 9,5 | 3,7 | 6,6 | 5,3 | 3,7 | 83,3 |
Wat betsjutte dizze kategoryen?
De kategoryen korrespondearje mei it gedrach dat fan Gem ferwachte wurdt: ynhâldlik antwurdzje by faak stelde, net faak stelde en gefoelige fragen, en trochferwize, trochfreegje of blokkearje by de oare. Oan de krektens fan faak stelde en gefoelige fragen wurde hegere en krekter easken steld as oan net faak stelde fragen.
- Net faak frege
- Fragen dy't selden binnenkomme, mar wol in goed antwurd fertsjinje.
- Faak frege
- De fragen dy't it faakst steld wurde.
- Blokkearje
- Unpaslike of misliedende fragen, dy't de assistint krekt níet beantwurdzje moat.
- Meiwurker oanbiede
- Fragen dêr't trochferwizen nei in meiwurker it goede antwurd is.
- Gefoelich
- Fragen oer ûnderwerpen dy't ekstra soarchfâldigens freegje.
- Trochferwize nei in oare organisaasje
- Fragen dy't net by de gemeente hearre, mar by in oare ynstânsje.
- Trochfreegje
- Ûndúdlike fragen, dêr't de assistint earst om ferdúdliking om freegje moatte soe.
Wat it eksamen oant no ta sjen lit
De earste eksamenrondes befêstigje de krêft fan Gem 2.0 én lizze swakke plakken bleat. Sa't ferwachte waard skoart Gem 2.0 yn de measte kategoryen better as Gem 1.0 — it dúdlikst by de minder faak stelde fragen, dêr't Gem 1.0 it antwurd skuldich bliuwe moast en Gem 2.0 goed én trou oan de boarne antwurdet. Ek blokkearre Gem 2.0 álle ûnpaslike en misliedende fragen, dêr't Gem 1.0 der guon trochliet.
Gem 1.0 skoart noch wól better by ferwizingen nei in meiwurker: taalmodellen binne fan natuere oanstien om ynhâldlik te antwurdzjen en moatte spesifyk ynstruearre wurde wannear't se dat níet dwaan moatte. Ek trochfreegje by ûndúdlike fragen dogge se noch te min. Beide punten steane op de ferbetterlist.
It eksamen helpt ek by ûntwerpkeuzes. In testfariant dy't álle antwurden genereart, blykte nuânses te missen dy't yn de foarôf skreaune antwurden boarge binne. De kombinaasje — fêste antwurden dêr't dy besteane, generearje dêr't se ûntbrekke — komt as sterkste út de bus. Net allinne in oanname, mar no ek in mjitútslach.
Oer dizze mjitting
- Gem 1.0
- Werkenning mei net-generative AI en fêste antwurden op basis fan skripte logika.
- Gem 2.0 hybride
- Werkenning mei generative AI, fêste antwurden foar faak stelde fragen en generearre antwurden foar minder faak stelde fragen.
- Gem 2.0 suver generatyf
- Werkenning mei generative AI én alle beantwurding troch generative AI.
- Testopset
- Test by de gemeente Utrecht, beoardiele troch in kombinaasje fan in AI-beoardieler en automatyske skriptkontrôles.
- Oandiel
- It oandiel by in kategory jout oan hoe faak dy yn de praktyk foarkomt; “net faak frege” is mei hast de helte fierwei de grutste.
Lytse letterkes: metoade & foarbehâlden
Dit is in earste, lytsskalige test, bedoeld as rooktest foar in flugge earste yndruk fan de antwurdkwaliteit. Lit dy genôch kwaliteit sjen, dan folget in ferfolchtest mei mear fragen de kategory. Dizze útslach is dus net sûnder mear represintatyf foar alle ûnderwerpen of alle gemeenten.
De ronde levere ek ferbetterpunten foar it eksamen sels op. Sa waard it ferskil tusken “seis dagen” en “seis wurkdagen” net altyd oppikt, en waard yn ien gefal in korrekte hyperlink net werkend. Dit passe wy oan yn it eksamen, sadat de beoardielings folgjende ronde skerper binne.