Gå til indhold
  • Seneste nyt
  • Debat
  • Inspiration
  • Dit fag
  • Job
  • Kontakt
  • Nyhedsbreve
  • Magasin
  • Lærerprofession.dk
  • Annoncering
  • Arrangementer
  • Lærerkursus.dk
Folkeskolen
  • Seneste nyt
  • Debat
  • Inspiration
  • Dit fag
  • Job
Debat

Er de nationale test adaptive - fortsat

Testen og reformen

Niels Christoffersen
Start debatten
28. juni 2013, kl. 13:26

Denne artikel er flyttet fra en tidligere version af folkeskolen.dk, og det kan medføre nogle mangler i bl.a. layout, billeder og billedbeskæring.

Start debatten

Skolereformen bruger resultaterne i de nationale test, som måltal for om reformen virker. Men kan vi nu være helt sikre på, at de nationale test overhovedet er en test?

Klik her for at indsende dit indlæg til folkeskolen.dk - medsend gerne et portrætfoto, som kan bringes sammen med indlægget

I bogen - Evaluering i skolen baggrund, praksis, teori - fra forlaget Dafolo opstilles tre betingelser for at kalde noget en test - side 86 ff.

Jeg refererer og tolker lidt.

a. Opgaverne i en test skal måle, det der testes i.

b. Målingen skal være præcis og pålidelig - tages testen flere gange, så skal resultaterne være ”ens” (min tolkning).

c. Målingen skal være objektiv. Hvis Peter fx viser sig et være bedre end Hanne målt med et sæt opgaver, så skal det også være tilfældet, målt med et andet sæt opgaver fra samme test. Sammenligningen mellem Peter og Hanne kan altid ske ved udelukkende at se på antallet af rigtige svar i stedet for at se på, præcis hvilke opgaver der er besvaret rigtigt og hvilke forkert – (mit eksempel).

Faglig relevans og pålidelighedHvis man nu ser på de nationale test, så ved vi fra evalueringen i 2007, at der var noget galt med nogle af opgaverne, fx målte testen i tekstforståelse ikke tekstforståelse, men viden om dansk litteratur og kultur. Der var også problemer med matematikopgaverne vist nok sammenblanding af profilområder.Opgavernes indhold er ikke dokumenteret, så vi ved ikke, om testen nu lever op til krav om relevante opgaver. Med hensyn til præcision og pålidelighed så vides det heller ikke, om testen lever op til kravene - der er fx ikke lavet test-gentest undersøgelser. Så det er umuligt at sige, om et elevresultat i testen ville være anderledes, hvis testen var taget et par dage tidligere eller senere.

ObjektivitetKravet om objektivitet er opfyldt, hvis opgaverne følger Rasch-modellen. Rasch-modellen kan formuleres sådan her:

#Fil 1

Når man bruger Rasch-modellen, så skal både data, testopgaver og elever passe med modellen. Derfor skal man undersøge testforløbene for at se, om de passer med modellen. Hvis man ikke kan forklare en manglende overensstemmelse med modellen, kan man blive nødt til at udelukke opgaver/elever fra datasættet, fordi der ikke er sket en måling af det man ønskede at måle.(Kilde - se link/citat nederst)

Hvad UVM siger

UVM oplyser, at en elevs resultat på 1-100 skalaen beregnes via formlen

#Fil 2

UVM notation: Det ”store” e er stadig grundtallet for den naturlige logaritme 2,718.., (e(x-f)): ’e’ er en parameter bestemt via fordelingen af elevresultaterne, ’x’ er elevens dygtighed i logit og ’f’ er sværheden af den midterste opgave – ”medianopgaven”.

Eksempel

#Fil 3

Den røde kurve svarer til en Rasch-opgave (sværhed 0,5, hældning e = 1) og den blå til en 2PL-opgave (sværhed = 0,5 og hældning e =1,9).

I de nationale test har hvert profilområde sin værdi af ’e’ fx e= 0,8 eller e = 5, i Rasch-modellen er værdien af e=1.Det får så mig til at slutte, at testen ikke lever op til Rasch-modellen, hvilket UVM så ikke er enig i, så jeg har søgt efter en anden form for dokumentation.Dokumentation – sådan da

Spørger man UVM om kontrol af opgavernes overensstemmelse med Rasch-modellen, får man følgende svar:Citat:Det bliver testet, om en opgave afviger statistisk signifikant fra Rasch-modellen. Signifikant afvigende opgaver kasseres. Det bliver testet, om en opgave udviser statistisk signifikant ’Differential Item Functioning’ (DIF), mht.a) Køn [Dreng;Pige],b) Skolestørrelse [Stor;Lille],c) Geografisk placering [Øst;Vest],d) Klassetrin.Opgaver med signifikant DIF kasseres.Det bliver testet, om en opgave korrelerer signifikant negativt med Rasch-skalaen. Opgaver, der korrelerer signifikant negativt med Rasch-skalaen, kasseres.Citat slut.

Spørger man så, hvorfor man ikke bruger e=1, når man beregner elevens resultat, så lyder svaret:”Den ekstra parameter ’e’ anvendes for at give mere fleksibilitet. Des flere parametre en model har des bedre tilpasning til data.Formålet med at estimere ’e’, fremfor blot at sætte den lig 1, er at opnå en bedre tilpasning til data i de enkelte profilområder.”

Testen følger ikke Rasch-modellen

De to svar får mig til at konkludere, at UVM mener, at samlingen af opgaver i hvert profilområde følger Rasch-modellen. Alle opgaver, der ikke følger modellen, ser ud til at være kasseret.

Men, som det også fremgår af svarene – ”..des flere parameter en model har, des bedre tilpasning til data...” - så det er altså en anden model end Rasch-modellen, der passer med data.Der kunne være tale om en 2PL-model, som ligner Rasch-modellen i og med, at den tillader et tal foran (d-s) fx a*(d-s), hvilket jo netop er, hvad ministeriet bruger. Den logistiske 2PL-model kan bringes til at ligne fordelingsfunktionen (kumulativ frekvensfordeling) for normalfordelingen - sehttps://en.wikipedia.org/wiki/Item_response_theory

Her beskrives hver opgavefunktion ved formlen

#Fil 4

UVM´s beregningsformel for resultatet må altså ses, som en tilnærmelse af resultatet til fordelingsfunktionen for normalfordelingen, hvor

#Fil 5

Med andre ord er UVM´s e-værdier næsten lig med a, opgavediskrimination i den logistiske 2PL-model. Det må så betyde, at ministeriets ’e’ værdier er lig med opgavediskriminationen, når opgaverne bruges i testen.

Mulig forklaring: Ved afvikling af testen ”bestemmer” man opgavernes sværhed med stor præcision, svarende til, at opgaverne formentlig bliver brugt mange flere gange end de er blevet afprøvet.

Konklusion - sammenfatningUVM`s beskrivelse af testens adaptive princip lyder:”De nationale test er adaptive på den måde, at de løbende tilpasser sig den enkelte elev under testforløbet. Hvis eleven svarer rigtigt på et spørgsmål, bliver spørgsmålene sværere. Svarer eleven forkert, bliver spørgsmålene lettere.”

Man må derfor gå ud fra, at eleverne løser forskellige opgaver i testen. En sammenligning af elevernes testresultater - fx i form af præstationsprofiler, gennemsnit og karaktergivning 1-5 etc. - kræver derfor, at målingen er objektiv, at den ikke afhænger af hvilke specifikke opgaver eleven har løst (beregning af gennemsnit kræver vel også, at der er tale om den samme fordelingsfunktion?). Rasch-modellen opfylder kravet om objektivitet og UVM mener åbenbart, at opgavesamlingen følger Rasch-modellen, så alt må være i orden.Ministeriets forklaring på, hvorfor man så ikke bruger modellen ved beregning af elevens resultat viser, at man benytter en anden model med flere parametre til at beskrive fordelingen af resultaterne - "normal ogive models".Altså ser det ud til, at der ikke er overensstemmelse mellem opgavernes egenskaber, når de afprøves og når de bruges i testen. Rasch-modellen gælder med andre ord ikke for testresultaterne (The Rasch approach requires both data fit the Rasch model and that test items and examinees confirm to the model, before claims regarding the presence of a latent trait (elevparameter x) can be considered valid). Testen kan derfor ikke afvikles som ministeriet beskriver, fordi det ikke giver resultater, der måler, det man vil måle. Testen er med andre ord ikke valid – gyldig. Den er så heller ikke en test.(Se også nedenstående citat.)

Skolereformen

Da resultaterne i de nationale test har fået tildelt rollen som måltal i skolereformen, så vil det nok være en god ide at få undersøgt, om måltallene faktisk siger noget om det faglige niveau i folkeskolen – om der måles noget og om det er relevant.

Mon ikke man burde lade evalueringen af de nationale test omfatte en evaluering af opgavernes indhold og testens tekniske egenskaber. Tænk hvis måltallene viste succes, mens andre test viste fiasko eller værre endnu, tænk hvis undervisningen fx holddeling indrettede sig efter testresultaterne, og det så viste sig, at resultaterne var helt i hegnet.

Primær kildeWikipedia - https://en.wikipedia.org/wiki/Item_response_theoryUdvalgt citat - om validitet:The Rasch approach requires both the data fit the Rasch model and that test items and examinees confirm to the model, before claims regarding the presence of a latent trait can be considered valid. Therefore, under Rasch models, misfitting responses require diagnosis of the reason for the misfit, and may be excluded from the data set if substantive explanations can be made that they do not address the latent trait.

Bemærkning – her er et eksempel på en undersøgelse af PISA 2000 læseskala. Det er formentlig noget i den retning, man bør undersøge i de nationale test.https://www.rff.dk/files/RFF-site/Publikations%20upload/Books/WEB%20Pisa%202000%20L%C3%A6seskale.pdf

Start debatten
Debat
Her kan du kommentere på artiklen:

Er de nationale test adaptive - fortsat

Vi har lavet en ny flot platform. Desværre kunne vi ikke flytte de gamle profiler, så hvis du vil kommentere en artikel, skal du oprette en profil. Og er du ny i debatten – så velkommen til. Tjek eventuelt vores retningslinjer for debatten.
Tak fordi du deltager.

Naja Dandanell debatredaktør
  • Seneste nyt
  • Debat
  • Inspiration
  • Dit fag
  • Job
Folkeskolen
Your browser does not support the video tag.

Fagbladet Folkeskolen
Kompagnistræde 34, 3
1208 København K

Skriv til os: folkeskolen@folkeskolen.dk

Ring til os: 3369 6300

  • Seneste nyt
  • Debat
  • Inspiration
  • Dit fag
  • Job
  • Nyhedsbreve
  • Arrangementer
  • Lærerprofession.dk
  • Magasin
  • Levering
  • Udgivelsesplan
  • Abonnement
  • Om Folkeskolen
  • Kontakt
  • Etik
  • Ophavsret
  • Annoncering
  • Lærerkursus.dk
  • Lejrskolekataloget.dk
  • Cookiepolitik
  • Administrer samtykke

Følg os: Facebook · Instagram · Linkedin

Ansv. chefredaktør:
Andreas Marckmann Andreassen
 
Udgives af:
Fagbladet Folkeskolen ApS