Vänligen vänta medan sidan laddas…
Vänligen vänta medan sidan laddas…
Riksarkivet förvarar över 750 000 hyllmeter analogt arkivmaterial från medeltiden till nutid. Därutöver finns hos oss miljontals kartor och ritningar. En stor del av detta material utgörs av handskrivna dokument. För att göra dessa enorma mängder tillgängliga för forskning räcker det inte att bara skanna och fotografera sidorna. De måste också kunna läsas och sökas maskinellt. Hur gör vi århundraden av handskrift maskinläsbart?
Teknologin vi använder kallas HTR (Handwritten Text Recognition eller automatiserad handskriftstolkning). Till skillnad från traditionell OCR (Optical Character Recognition), som är anpassad för tryckta böcker med standardiserade typsnitt, bygger HTR på artificiell intelligens och maskininlärning. Modellerna tränas för att tolka variationerna i äldre tiders handstilar, språkformer och förkortningar med hänsyn till originalmaterialets struktur och form.
För att bygga en HTR-modell med hög kvalitet och som klarar att tolka handskrift av olika slag från olika tidsperioder krävs stora mängder träningsdata (även kallat Ground Truth). Det är detta facit som visar modellen vad som faktiskt står på sidan och vad den ska lära sig att efterlikna. I vårt arbete består träningsdata av tre sammanlänkade komponenter:
Tekniken möjliggör inte endast texttolkning, utan även en direkt koppling mellan modellens tolkning och den exakta positionen i originalbilden. Koordinater kopplar varje rad och ord direkt till dess fysiska placering i bildfilen. Informationen lagras i XML-filer enligt standarden PAGE XML (Page Analysis and Ground Truth Elements), ett etablerat format inom digitala metoder och dokumentanalys.
Våra modeller tränas för unika arkivhandlingar som i utgångsläget är svårtillgängliga och sällan sökbara via internet. De kan därför inte lära sig automatiskt, utan bygger på träningsdata och transkriptioner skapade av mänskliga experter. Vi samarbetar därför nära med handskriftsexperter, historiker och språkvetare. Vi arbetar också med data scientists och forskningsingenjörer som kan tyda svårlästa handstilar och förstår hur modellerna bäst anpassas för att tolka dokumentens uppbyggnad.
I arbetet med att skapa och kvalitetssäkra träningsdata använder vi plattformen Transkribus, som erbjuder ett flexibelt gränssnitt för att märka upp bildregioner, radsegmentera och transkribera källor. Riksarkivet är partner i READ-COOP SCE som utvecklar verktyget.
För att driva utvecklingen framåt arbetar vi parallellt på tre nivåer:
Swedish Lion är en basmodell för maskinell handskriftstolkning som under Riksarkivets ledning har byggts genom institutionella samarbeten, insatser från enskilda forskare och engagerad medborgarforskning.
Swedish Lion i siffror:
Modellens träffsäkerhet beror på vilka historiska texter den har mött under träningen. Träningsdatan bakom Swedish Lion är klassificerad efter domän och proveniens, alltså vilka slags institutioner och handlingar som ingår.
Domstolsprotokoll från hovrätter, häradsrätter och rådhusrätter samt särskilda kommissioner.
Protokoll och utskottshandlingar från de fyra stånden.
Handlingar från Kungliga kansliet och historiska kollegier (1600–1900).
Läns- och stadsadministration (till exempel ärenden om handel och byggnation).
Förhör, protokoll och rannsakningar från församlingar, stift och domkapitel.
Enskilda personers brev, receptböcker och dagböcker.
Eftersom träningsdatan främst speglar historisk stats- och kyrkoförvaltning finns det i dagsläget tydliga begränsningar. Bland annat är skolor, universitet, militära arkiv, vetenskapliga, skönlitterära och privata texter underrepresenterade. Att täcka in dessa luckor och utöka träningsdatan till äldre epoker (som medeltid och 1500-tal) är ett prioriterade mål för infrastrukturen framöver.
Karsvall, Olof. Praeteritum transcriptum. A Transkribus Tribute: Celebrating our First Five Years as a Cooperative, ”Building the Swedish Lion”, Romein, Christel Annemieke (red.), 2025, 46–48. Länk till artikeln hos Zenodo.
Forskningssamordnare Oliver Blomqvist, oliver.blomqvist@riksarkivet.se