Nya AI-modeller kan transkribera historiska handskrifter med förvånansvärt hög precision, till och med utan att först tränas på en viss handstil.
Att få maskiner att läsa handstil har länge varit en av de svåraste uppgifterna inom textigenkänning. Tryckt text kan numera avläsas med stor säkerhet, men handskrifter är betydligt besvärligare. Varje skribent har sin egen stil, och historiska dokument innehåller ofta blekt bläck, förkortningar, marginalanteckningar och skadat papper.
Under det senaste året har situationen förändrats. Fritt tillgängliga AI-modeller kan i många fall transkribera handskrivna dokument med en kvalitet som tidigare krävde specialtränade modeller och stora mängder manuellt arbete.
Hur väl klarar AI komplicerade handskrifter?
I privatpersoners arkiv består handskrivna texter sällan enbart av prydliga textrader. Anteckningar kan finnas i marginalerna, mellan raderna eller skrivna upp och ned längst uppe på sidan. Text kan vara överstruken, infogad i efterhand eller placerad i en helt annan riktning än huvudtexten.
Även sådana komplicerade sidlayouter kan dagens AI-modeller ofta tolka förvånansvärt väl.

Nedan kan du läsa en transkription gjord med Gemini 3 Flash.
Högst upp till höger, med annan handstil]
Till Emilie o. Zachris Topelius
från Eva Topelius
[Högst upp till höger, understruket]
Stockholm den 18 Okt. 71.
[Högst upp till vänster, skrivet diagonalt och upp och ned]
Farbror Göranson hade
börjat ett bref till pappa
men blef afbruten af
en främmande.
Han skrifver
med nästa
post.
Mina allrakäraste föräldrar!
En varm helsning från Stockholm från
pappas och mammas små öfvergifna pullor,
som nu första gången finna sig utom edra
vingar! Nog är det allt litet underligt
och ovant att måste tänka för sig sjelf i
allt och icke ha pappa och mamma att stän-
digt rådfråga, men nog måste det ju gå
med Guds hjelp, när man bjuder till och
icke tappar modet genast. Herr och fru
Göranson äro också utmärkt snälla och
vänliga, isynnerhet tante, som vi redan
äro fullkomligt bekanta med. De tre små
barnen, Gösta, 6 år, Elsa 4 år och Villhelm
2 år, äro mycket roliga och nyfikna och vi
bli nog snart goda vänner. Vi ha ett så
trefligt litet rum bredvid salen, med
[Marginalanteckning, vänster sida, skriven vertikalt]
Skrif snart, vi längta så efter bref. Gud vare med
oss alla!
Transkribus var föregångaren
Transkribus har länge varit ett av de viktigaste verktygen för AI-transkribering av historiska handskrifter. På SLS arbetade vi intensivt med verktyget kring 2020. I utgåvan Albert Edelfelts brev användes Transkribus för att transkribera breven från Albert Edelfelt till hans mamma Alexandra i fulltext, det vill säga de blev helt maskinellt sökbara.
Transkribus kan ge mycket goda resultat, men den stora nackdelen har varit arbetsinsatsen. För att uppnå hög kvalitet på transkriptionen behövde man först ofta träna en modell på en viss handstil. För Edelfeltutgåvan krävdes flera hundra sidor manuellt transkriberad text. Trots det blev resultaten långt ifrån felfria.
Transkribus erbjuder också generiska modeller som kan användas utan särskild träning. Vår erfarenhet är dock att resultaten varierar och att modellerna inte alltid är tillräckligt tillförlitliga för mer krävande material.

Språkmodeller förändrar spelplanen
Under de senaste åren har vi på SLS experimenterat med fritt tillgängliga språkmodeller.
Skillnaden jämfört med äldre verktyg är betydande:
- Ingen särskild förhandsträning krävs.
- Modellerna är enkla att använda.
- Kostnaderna är lägre.
- Samma modell kan användas på alla handstilar och språk.
Redan i fjol fick vi hyfsade resultat med Open AI:s GPT-4o-modell, särskilt på prydligare handstilar. Med Googles lansering av Gemini 3 i november 2025 tog utvecklingen ytterligare ett rejält steg framåt.
Den kanadensiske historieprofessorn Mark Humphries, som driver bloggen Generative History, har gått så långt som att hävda att handstilsigenkänningsproblemet i praktiken är löst och att de bästa modellerna i genomsnitt och i stor skala presterar bättre än mänskliga transkriberare.
Vi har gjort omfattande tester med Gemini och bland annat transkriberat merparten av Edith Södergrans arkiv med mycket gott resultat. Fel förekommer fortfarande, men på en nivå som i många fall är acceptabel, särskilt med tanke på den låga arbetsinsatsen och den förbättrade sökbarheten för användarna.
Genombrottet består inte i att varje bokstav alltid blir rätt. Det nya är att vi utan särskild modellträning kan skapa användbara transkriptioner av stora och varierande material till en mycket låg kostnad. För sökning, överblick och vidare bearbetning är kvaliteten redan i många fall tillräckligt hög.

Transkription:
Kära fröken! Det gladde
mig ofantligt att Ni skref, Ni är ju
så långt borta och det är ju så lätt att
glömma flyktiga sanatorie bekantskaper.
Nu skall jag berätta: Järvinen bad helsa
och sade att han går sina riktigt långa
promenader med Villgren och Ramsay. Boyer
är den ende bland de gamla, som ämnar
stanna här öfver sommarn. Jussi, kornetten,
kaptenen ha farit, de andra fara alla
snart. Vi ge oss i väg den femtonde Juni.
Alftan mår bra, önskar fröken detsamma.
Fröken Säisä får vara oppe igen.
Prompten är avgörande
För att språkmodeller ska fungera som tillförlitliga transkriberare behöver de tydliga instruktioner, det vill säga prompter.
Modellen behöver bland annat instrueras att återge texten rad för rad, behålla originalets stavning, grammatik, interpunktion och radbrytningar samt ta med marginalanteckningar, insättningar och sidnummer. Den ska också undvika att modernisera språket eller fylla i ord som inte går att läsa.
Nedan finns den prompt som Mark Humphries har publicerat och som vi använt som utgångspunkt i våra egna experiment:
”Your task is to accurately transcribe handwritten historical documents, minimizing the CER and WER. Work character by character, word by word, line by line, transcribing the text exactly as it appears on the page. To maintain the authenticity of the historical text, retain spelling errors, grammar, syntax, capitalization, and punctuation as well as line breaks. Transcribe all the text on the page including headers, footers, marginalia, insertions, page numbers, etc. If insertions or marginalia are present, insert them where indicated by the author (as applicable). Exclude archival stamps and document references from your transcription. In your final response write Transcription: followed only by your transcription.”
Utöver prompten bör modellen ställas in för att ge så återhållsamma svar som möjligt. Kreativiteten bör hållas låg, liksom modellens så kallade resonemangsnivå. Ju större utrymme modellen får att tolka och komplettera texten, desto större blir risken att den gissar fel i onödan.
Ett oväntat problem i de första testerna var tomma sidor där text från papprets baksida lyste igenom. Modellen försökte då transkribera den svaga och ofta spegelvända texten.
Problemet kunde i stor utsträckning förebyggas genom följande tillägg till prompten:
”BLANK PAGES & BLEED-THROUGH:
• If the page appears blank or nearly blank, write [TOM SIDA]
• If you see faint text that appears to be from the OTHER SIDE of the paper (bleed-through/show-through), DO NOT transcribe it. Write [TOM SIDA: GENOMSKINLIG TEXT].”
Låga kostnader möjliggör stora volymer
En annan avgörande skillnad jämfört med äldre lösningar för handstilsigenkänning är kostnaden.
I våra tester har det grovt uppskattat kostat omkring en cent att transkribera en sida med Gemini Pro. Geminis Flash-modell kostar betydligt mindre och har i många fall gett nästan lika goda resultat. Kostnaden kan då sjunka till en bråkdel av en cent per sida.
Detta kombinerat med att modellen funkar bra på så gott som alla språk och handstilar gör storskalig transkribering möjlig på ett helt annat sätt än tidigare.
Vad betyder detta för forskningen?
När allt mer digitaliserat handskrivet material blir sökbart kan forskare arbeta med arkivmaterial på nya sätt. En transkription behöver inte vara felfri för att vara värdefull som sökingång.
Det blir exempelvis möjligt att söka efter personnamn och orter i tusentals brev, följa hur ett begrepp används över tid eller snabbt identifiera dokument som är relevanta för en viss frågeställning.
Transkriptionerna förbättrar också tillgängligheten. När de publiceras i ett tekniskt tillgängligt format kan materialet bli mer användbart för personer med synnedsättning och för en bredare allmänhet.
Källkritiken försvinner inte
Språkmodeller är kraftfulla verktyg, men de är inte ofelbara.
Forskare behöver därför även i framtiden kontrollera transkriptioner mot originalen, särskilt när det gäller centrala citat, personnamn och nya forskningsupptäckter.
Vad händer härnäst?
En stor del av Edith Södergrans arkiv har redan transkriberats med hjälp av AI och finns nu tillgängligt digitalt på sls.finna.fi.
Arbetet avstannar dock inte här. Vår ambition är att fortsätta med de övriga litterära modernisterna, vars arkiv finns i SLS samlingar. Tekniken har passerat en viktig gräns. Den är nu tillräckligt bra, billig och lättillgänglig för att användas i stor skala.
För arkiven innebär det att material som man tidigare bara kunde bläddra i sida för sida nu kan bli sökbart och därmed öppnas på nytt för forskning, upptäckter och nya läsare.
Johan Pyy
Enhetschef, SLS arkiv
