Hoppa till huvudinnehåll
bedoma.se

Transparens om AI-bedömning

Bedoma berättar exakt hur bra AI:n är, ämne för ämne. De flesta verktyg gör det inte.

Sammantaget

I ämnestabellen nedan ligger Bedomas indikation inom ett betygssteg från lärarens i upp till 90 procent av fallen i det starkaste ämnet, och i drygt åtta fall av tio i den senaste kontrollmätningen, mätt mot tusentals bedömda elevtexter från lärare som delat sina egna bedömningar och från de nationella provens provgrupper. Siffrorna ska läsas mot en referens som sällan nämns: när Skolinspektionen lät externa legitimerade bedömare ombedöma nationella prov låg de inom ett betygssteg från skolans lärare i 78,8 procent av fallen, och satte exakt samma betyg i 37,8 procent. Bedömning av elevtexter är svårt, även för erfarna lärare. Hela jämförelsen finns längre ner på sidan.

Senaste kontrollmätningen

Inom ett betygssteg
83,3procent
Bedoma mot lärarens betyg
78,8procent
Två lärare emellan, Skolinspektionens ombedömning
Exakt samma betyg
46,5procent
Bedoma mot lärarens betyg
37,8procent
Två lärare emellan, Skolinspektionens ombedömning

Stort tack till alla er lärare som delat med er av texter och bedömningar. Sedan förra mätningen ligger andelen exakt rätt högre, 40,4 procent i augusti och 46,5 nu, mätt mot vårt material. Skillnaden ryms i mätosäkerheten. Närhetsmåttet ligger däremot nominellt lägre än i augusti, också inom osäkerheten, se bilderna nedan. Varje delad text används till att mäta och kalibrera, och namn byts ut automatiskt mot binära koder innan texten sparas, en pseudonymisering enligt GDPR. Ett annat och mindre underlag än ämnestabellen nedan. Referensraden är vår beräkning på grunddata från Skolinspektionens ombedömning av nationella prov, där en extern legitimerad lärare bedömde samma prov som skolans lärare. Olika underlag, samma två mått. Hela jämförelsen står längre ner på sidan.

Exakt samma betyg som läraren
augusti40,4 procentnu46,5 procent2565
Närhet, viktad kappa
augusti0,67nu0,640,40,85

Strecket är mätvärdet, rektangeln de mest sannolika värdena, linjerna spannet där det verkliga värdet med hög sannolikhet ligger. Där rektanglarna överlappar går skillnaden inte att skilja från slump. Viktad kappa är ett närhetsmått: 0 är slump, 1 är fullständig enighet. Urvalet är mindre än i ämnestabellen nedan.

Per ämne

Här är några av våra bästa ämnen just nu.

Vi mäter inom ett betyg: AI:ns betyg avviker som mest ett steg från lärarens (E räknas matcha D, D räknas matcha C och så vidare). Det är samma definition forskning på inter-bedömar-samstämmighet använder.

ÄmneAntal texterInom ett betyg
Svenska199
90 procent
Samhällskunskap559
87 procent
Historia303
86 procent
Engelska258
84 procent

Vad betyder "inom ett betyg"?

  • AI:n säger C, läraren säger B. Skillnad ett steg. Räknas som träff.
  • AI:n säger C, läraren säger D. Skillnad ett steg. Räknas som träff.
  • AI:n säger A, läraren säger C. Skillnad två steg. Räknas inte som träff.

Vi visar tre mått. Inom ett betyg är huvudtalet, eftersom två lärare sällan sätter exakt samma betyg på samma text. Exakt samma betyg har därför ett tak: inte ens en felfri bedömare skulle träffa en enskild lärare exakt mycket oftare än varannan gång. Viktad kappa fångar närheten och är det mått forskningen använder. Två erfarna lärare kan ge olika betyg på samma text och båda har rätt enligt betygskriterierna.

Så är motorn byggd

Vi har helt enkelt vidareutvecklat en befintlig språkmodell för att passa in i det svenska skolväsendet. Siffrorna ovan är mätta på motorn som den ligger i tjänsten i dag.

Parallellt har vi byggt tre nya delar för nästa steg, som inte är i drift ännu. En kriteriekatalog där varje mening i Skolverkets betygskriterier är segmenterad, verifierad ordagrant mot Skolverkets API och märkt med sin progressionsaxel. Ett bibliotek som översätter kriteriernas progressionsord, enkla, utvecklade, välutvecklade, till konkreta krav per bedömningsaxel, byggt utifrån de nationella provens bedömningsanvisningar. Och en förregistrerad mätrigg som prövar samma texter mot olika språkmodeller på identiska villkor. Varje del går igenom hårda krav innan produktion. Allt detta för att Bedoma ska vara den bästa sambedömaren för Sveriges lärare.

Vad räknas som rätt?

En indikation är rätt när den träffar det betyg som den lärare eller provgrupp som redan bedömt texten satt. Vi mäter mot två sorters facit. Det första är vårt eget material: texter som lärare delat med oss, där lärarens eget betyg är facit. Det är kontrollmätningen ovan.

Det andra är enbart expertbedömda texter: Skolverkets egna bedömda exempeltexter, med nivån hämtad ur de officiella bedömningskommentarerna. Facit kommer från en annan bedömargrupp än lärarna i tjänsten, och de flesta texterna är betygsatta på en tregradig skala där D och B inte finns. Vi mäter mot båda, eftersom en siffra utan sitt facit inte säger något.

Så mäter vi

Texter som redan har ett betyg körs genom motorn, och vi räknar hur ofta indikationen träffar. Förväntningar och mått skrivs ner före varje körning. Lärarreferensen redovisas alltid bredvid. Den kända svagheten just nu: motorn underskattar de starkaste svaren när de är korta, och landar då oftare ett steg under. Externa bedömare ligger också under skolans lärare, i genomsnitt en tredjedels betygssteg och oftast på de högre betygen, se tabellen nedan. Det gör inte vår svaghet mindre, men den är inte unik för maskiner.

Hur ofta är två lärare överens?

Skolinspektionen lät under elva år externa legitimerade lärare ombedöma nationella prov, utan att veta vilket betyg skolans lärare satt. Siffrorna nedan är Bedomas beräkning på Skolinspektionens grunddata, som vi tagit del av som allmän handling. I de fyra senaste omgångarna (gymnasiet, svenska, svenska som andraspråk och engelska, 30 973 ombedömda prov) satte den externa bedömaren exakt samma betyg som skolans lärare i 37,8 procent av fallen, och låg inom ett betygssteg i 78,8 procent.

Skolans betygExtern bedömare satte samma betyg
F69 procent
E45 procent
D29 procent
C32 procent
B21 procent
A32 procent (ombedömaren satte ett lägre betyg i 68 procent av fallen)

Två saker är värda att se i tabellen. Mellanbetygen D och B är svårast även för människor, precis som för AI:n. Och på A-betygen dömde den externa bedömaren oftast lägre än skolans lärare, ett mönster som även syns när Bedoma mäts mot expertbedömda exempeltexter.

Slutsatsen vi drar av jämförelsen nedan är inte att AI:n är bättre än lärare. Underlagen skiljer sig åt, och ingen bedömare, mänsklig eller maskinell, träffar exakt rätt särskilt ofta.

BedömareExakt samma betygInom ett steg
Extern legitimerad bedömare, 30 973 prov37,8 procent78,8 procent
Kontrollmätning på ett nyare urval av vårt material, samma texter mätta två gånger46,5 procent83,3 procent

Därför ska en indikation, mänsklig eller maskinell, användas som ett andra par ögon, aldrig som facit.

Källa: Skolinspektionens ombedömning av nationella prov, de fyra sista åren av uppdraget (2016 till 2019), grunddata utlämnad av Skolinspektionen 2026. Slutrapport: Ombedömning av nationella prov 2019, dnr 2019:503.

Var Bedoma är försiktig

  • Kort-text-flagga. Texter under 500 tecken får en gul varning så du själv granskar om eleven besvarat hela uppgiften innan du litar på AI:ns betyg.
  • BETA-flagga. Som allt annat i verktyget är vissa ämnen under fortsatt utveckling, de är tydligt märkta BETA i analysen. Använd dem som diskussionsunderlag.
  • F, D och B är svårare än E, C och A.Skolinspektionens ombedömningar visar samma sak för människor: externa bedömare träffade skolans D exakt i 29 procent av fallen och B i 21 procent. Vi visar därför pil-vyn där C kan vara "C med pil upp mot A" istället för att hårdsätta B.
  • F-beslut kräver alltid din egen läsning. AI:n är svagast på att identifiera F-texter på egen hand. Kort-text-flaggan fångar en del, men lita aldrig på AI:n för F-beslut, där är din bedömning avgörande.

Hur vi mäter

Bedoma är kalibrerat mot tusentals bedömda elevtexter och elevsvar. En del kommer från er lärare, som bidragit via /bidra eller gett tillstånd i tjänsten. Resten är expertbedömda exempel som provgrupperna och Skolverket har publicerat öppet: NAFS-projektet vid Göteborgs universitet (engelska och moderna språk), Gruppen för nationella prov i svenska och svenska som andraspråk vid Uppsala universitet, SO-provgrupperna vid Göteborgs, Uppsala och Malmö universitet, NO-provgruppen vid Umeå universitet samt Skolverkets bedömningsstöd, kommentarmaterial och frisläppta kursprovsexempel. Därtill bedömda elevtexter ur forskningspublikationer i DiVA. Vi använder aldrig AI-genererat material, och vi samlar hela tiden in fler bedömda texter. Som mänsklig referenspunkt använder vi grunddata från Skolinspektionens ombedömningsuppdrag, utlämnad till oss som allmän handling 2026.

Vi kör hela testbanken genom bedömningsmotorn vid varje större kalibreringsändring och uppdaterar siffrorna här. Det som avgör träffsäkerheten är inte språkmodellen i sig utan kalibreringslagret: hur varje ämnes betygskriterier är mappade och hur bedömningen justeras mot Skolverkets krav. Vilka underleverantörer som behandlar elevtext framgår av vår integritetspolicy.

Vad konkurrenter gör

Vi har granskat flera ledande AI-bedömningsverktyg på den svenska marknaden.

Inget av dessa verktyg publicerar siffror per ämne. Inget visar sin testdata offentligt.

Vi tycker det är fel. Lärare har rätt att veta hur bra ett bedömnings-AI faktiskt är, ämne för ämne, innan de litar på det.

Hur du kan hjälpa

  1. Bidra med bedömda elevtexter via /bidra. Du får 1 till 5 bonusanalyser per text.
  2. Bidra extra om ditt ämne är BETA. Då hjälper du Bedoma bli starkare där det behövs mest.
  3. Klicka på "Justera betyg" efter varje analys så vi kan kalibrera där AI:n landade fel.

Siffrorna kommer från vår senaste fullständiga mätning mot exakt den bedömningsmotor som körs i produktion. Vi uppdaterar denna sida vid varje ny mätning eller större förändring.