← Werom nei Kwaliteit

Rapport antwurdkwaliteit

Antwurdkwaliteit de fraachkategory: Gem 1.0 neist twa farianten fan Gem 2.0

Rooktest · earste, lytsskalige mjitting

In earste, lytsskalige rooktest fan it eksamen, mei in tredde dielnimmer: neist Gem 1.0 en de hybride Gem 2.0 draaide ek in testfariant mei dy't álle antwurden genereart.

Skoares per kategory

De fraachkategory de trije farianten neistinoar. Elke stoef is it persintaazje fan de maksimale skoare yn dy kategory.

Skoares per fariant

Deselde mjitting, oarsom besjoen: per fariant it woegen totaal, opboud út de sân kategoryën. In blok is it tal punten dat de fariant yn dy kategory helle — dêr't in blok smeller is as by de oare farianten, geane punten ferlern.

Alle sifers by dizze mjitting

Skoares per kategory

It oandiel is it diel fan de 100 punten dat dizze kategory opleverje kin.
Fraachkategory Gem 1.0 Gem 2.0 hybride Gem 2.0 suver generatyf Oandiel
Net faak frege 69,2% 88,7% 84,2% oandiel 47%
Faak frege 96,9% 97,3% 83,3% oandiel 18%
Blokkearje 91,1% 99,3% 99,3% oandiel 10%
Meiwurker oanbiede 100,0% 55,2% 50,5% oandiel 7%
Gefoelich 97,1% 97,2% 92,9% oandiel 7%
Trochferwize nei in oare organisaasje 92,8% 92,5% 93,9% oandiel 6%
Trochfreegje 98,3% 88,7% 69,3% oandiel 5%
Woegen totaal 82,8% 89,6% 83,3%

Skoares per fariant

Fariant Net faak frege Faak frege Blokkearje Meiwurker oanbiede Gefoelich Trochferwize nei in oare organisaasje Trochfreegje Totaal (fan 100)
Gem 1.0 31,8 17,4 8,7 7,5 6,9 5,3 5,2 82,8
Gem 2.0 hybride 41,5 17,6 9,5 4,1 6,9 5,2 4,7 89,6
Gem 2.0 suver generatyf 39,3 15,3 9,5 3,7 6,6 5,3 3,7 83,3
Wat betsjutte dizze kategoryen?

De kategoryen korrespondearje mei it gedrach dat fan Gem ferwachte wurdt: ynhâldlik antwurdzje by faak stelde, net faak stelde en gefoelige fragen, en trochferwize, trochfreegje of blokkearje by de oare. Oan de krektens fan faak stelde en gefoelige fragen wurde hegere en krekter easken steld as oan net faak stelde fragen.

Net faak frege
Fragen dy't selden binnenkomme, mar wol in goed antwurd fertsjinje.
Faak frege
De fragen dy't it faakst steld wurde.
Blokkearje
Unpaslike of misliedende fragen, dy't de assistint krekt níet beantwurdzje moat.
Meiwurker oanbiede
Fragen dêr't trochferwizen nei in meiwurker it goede antwurd is.
Gefoelich
Fragen oer ûnderwerpen dy't ekstra soarchfâldigens freegje.
Trochferwize nei in oare organisaasje
Fragen dy't net by de gemeente hearre, mar by in oare ynstânsje.
Trochfreegje
Ûndúdlike fragen, dêr't de assistint earst om ferdúdliking om freegje moatte soe.

Wat it eksamen oant no ta sjen lit

De earste eksamenrondes befêstigje de krêft fan Gem 2.0 én lizze swakke plakken bleat. Sa't ferwachte waard skoart Gem 2.0 yn de measte kategoryen better as Gem 1.0 — it dúdlikst by de minder faak stelde fragen, dêr't Gem 1.0 it antwurd skuldich bliuwe moast en Gem 2.0 goed én trou oan de boarne antwurdet. Ek blokkearre Gem 2.0 álle ûnpaslike en misliedende fragen, dêr't Gem 1.0 der guon trochliet.

Gem 1.0 skoart noch wól better by ferwizingen nei in meiwurker: taalmodellen binne fan natuere oanstien om ynhâldlik te antwurdzjen en moatte spesifyk ynstruearre wurde wannear't se dat níet dwaan moatte. Ek trochfreegje by ûndúdlike fragen dogge se noch te min. Beide punten steane op de ferbetterlist.

It eksamen helpt ek by ûntwerpkeuzes. In testfariant dy't álle antwurden genereart, blykte nuânses te missen dy't yn de foarôf skreaune antwurden boarge binne. De kombinaasje — fêste antwurden dêr't dy besteane, generearje dêr't se ûntbrekke — komt as sterkste út de bus. Net allinne in oanname, mar no ek in mjitútslach.

Oer dizze mjitting

Gem 1.0
Werkenning mei net-generative AI en fêste antwurden op basis fan skripte logika.
Gem 2.0 hybride
Werkenning mei generative AI, fêste antwurden foar faak stelde fragen en generearre antwurden foar minder faak stelde fragen.
Gem 2.0 suver generatyf
Werkenning mei generative AI én alle beantwurding troch generative AI.
Testopset
Test by de gemeente Utrecht, beoardiele troch in kombinaasje fan in AI-beoardieler en automatyske skriptkontrôles.
Oandiel
It oandiel by in kategory jout oan hoe faak dy yn de praktyk foarkomt; “net faak frege” is mei hast de helte fierwei de grutste.

Lytse letterkes: metoade & foarbehâlden

Dit is in earste, lytsskalige test, bedoeld as rooktest foar in flugge earste yndruk fan de antwurdkwaliteit. Lit dy genôch kwaliteit sjen, dan folget in ferfolchtest mei mear fragen de kategory. Dizze útslach is dus net sûnder mear represintatyf foar alle ûnderwerpen of alle gemeenten.

De ronde levere ek ferbetterpunten foar it eksamen sels op. Sa waard it ferskil tusken “seis dagen” en “seis wurkdagen” net altyd oppikt, en waard yn ien gefal in korrekte hyperlink net werkend. Dit passe wy oan yn it eksamen, sadat de beoardielings folgjende ronde skerper binne.

Alle mjittingen

Elke mjitting stiet op syn eigen side en bliuwt dêr stean. Fergelykje allinne mjittingen dy't deselde systemen neistinoar lizze.