I Falsificeret udfordrer vi hver uge vedtagne sandheder, afliver forældet viden og ser på fusk og fejl i forskningens verden.

Det, vi troede, vi vidste

Da der i juli blev afholdt en stor konference om machine learning i Seoul, Korea, besluttede et forskerhold fra Microsoft Research at benytte lejligheden til et lille eksperiment. De over 24.000 forskningsartikler, der var blevet indsendt til konferencen, blev delt i to bunker, og den ene blev vurderet af forskere, der ikke måtte bruge kunstig intelligens, mens den anden blev bedømt af forskere, der kunne bruge store sprogmodeller til at opklare faglige spørgsmål, sammenholde artiklerne med lignende forskning og finpudse deres egne tekster. Men den faglige bedømmelse skulle de stadig selv stå for.

Det viste sig, at bedømmelsen af artiklerne i de to grupper var påfaldende ens: 27 procent blev accepteret i den ene gruppe, 26,5 procent i den anden, og den gennemsnitlige kvalitetsbedømmelse lå omkring 3,3 ud af 6 i begge grupper.

Kunne det virkelig passe, at der ingen forskel var på at bedømme artiklerne med og uden AI?

Forskere vil undersøge, hvordan kunstig intelligens kan bruges til at bedømme artikler. Foto: Wikimedia commons

Det, vi ved nu

Da forskerholdet fulgte op med en anonym spørgeskemaundersøgelse blandt 1.486 af de forskere, der havde bedømt artikler, fandt de forklaringen: 22,5 procent af de forskere, der ikke måtte bruge AI i deres bedømmelse, havde gjort det alligevel. Det fremgår af et endnu ikke fagfællebedømt preprint.

Forskerholdet tjekkede også bedømmelserne med programmet Pangram, der vurderer sandsynligheden for, at en tekst er AI-genereret. Pangram anslog, at kun 52 procent af de bedømmelser, der burde være 100 procent menneskeskrevne, rent faktisk var det. Så måske var det ikke så underligt, at resultaterne for begge grupper lå så tæt på hinanden.

I surveyens åbne besvarelser forklarede flere, at det var tidspres og en høj arbejdsbyrde, der fik dem til at bruge en sprogmodel, mens andre pegede på uklare regler om, hvad der egentlig var tilladt.

Men …

Eksperimentet afslører også, at der kan være brug for en mere fast definition af, hvad det vil sige at stå inde for en tekst. Nogle af forskerne lagde vægt på, at selve evalueringen og den videnskabelige vurdering stadig kom fra dem selv, og at de ikke havde ladet sig påvirke af sprogmodellens input. Men for andre handlede det mere om viljen til at forsvare sin afgørelse og være i stand til at argumentere for den. Louise Fogh Hansen

NewScientist, 28. september