Öppen källkods-OCR

22 bästa OCR-dataset med öppen källkod för att träna dina ML-modeller år 2026

Optisk teckenigenkänning möjliggör nu kvittoläsning, ID-verifiering, fakturaautomation, digitalisering av historiska arkiv och stylusbaserade anteckningsappar. OCR-marknaden förväntas nå 32.90 miljarder dollar år 2030 med en årlig tillväxttakt på 14.8 % (Grand View Research, 2024), med intelligent teckenigenkänning – handskriftsläsningsgrenen inom OCR – som växer snabbast. Oavsett om du bygger dokumentparsning, scentextdetektering eller handskriftstranskription, sätter den OCR-datauppsättning du tränar på din noggrannhetsgräns. Den här guiden täcker 22 kostnadsfria OCR-datauppsättningar med öppen källkod – inklusive de bästa handskriftsdatauppsättningarna – organiserade efter användningsfall och uppdaterade med de starkaste utgåvorna fram till 2024.

Key Takeaways

  • OCR (Optical Character Recognition): teknik som omvandlar bilder av tryckt, scen- eller handskriven text till maskinläsbar data.
  • OCR-datamängder är indelade i fem grupper: dokument/formulär, scentext, siffror/tecken, handstil och flerspråkiga.
  • Dokument OCR-datauppsättningar fånga strukturerade sidor som blanketter och kvitton; scentextdatauppsättningar fånga text "i det vilda".
  • IAM, MNIST, ICDAR och SROIE är fortfarande de mest citerade OCR-riktmärkena inom forskningen.
  • Licensvillkoren varierar kraftigt – verifiera varje OCR-datauppsättning före kommersiell utbildning.

Vad är OCR (Optical Character Recognition)?

OCR är teknik som konverterar olika typer av dokument, som skannade pappersdokument, PDF-filer eller bilder av text, till redigerbara och sökbara data. Det fungerar av:

  • Analysera strukturen av text i en bild
  • Dela upp texten i rader och tecken
  • Konvertera dessa visuella tecken till maskinläsbar text

Vanliga användningsområden inkluderar:

  • Konvertera skannade dokument till redigerbara textfiler
  • Digitalisera tryckta böcker
  • Extrahera text från foton
  • Konvertera handskrivna recept till digital text
  • Nummerplåtigenkänning

Hur väljer man rätt OCR-dataset?

Att välja en OCR-datauppsättning beror på fyra faktorer: texttyp, inspelningsmiljö, annoteringsgranularitet och licens. OCR för tryckta dokument behöver andra träningsdata än handskriven kursiv eller böjd scentext. Dokumentdatauppsättningar passar för fakturor, blanketter och kvitton; scentextdatauppsättningar passar för skyltning och produktläsning; handskrivna datauppsättningar passar för anteckningar, manuskript och inmatning med stylus. Annoteringar på ordnivå och radnivå stöder fullständiga OCR-pipelines, medan teckennivåuppsättningar passar klassificeringsbaslinjer. Bekräfta alltid licensvillkoren, eftersom vissa OCR-datauppsättningar endast är avsedda för forskning eller kräver registrering.

Vilka är de bästa OCR-datauppsättningarna för dokument och formulär?

Dokument-OCR-datauppsättningar tränar modeller för att analysera strukturerade sidor som fakturor, formulär, kvitton och ID:n. Dessa driver automatisering av affärsdokument och nyckelvärdesutvinning.

  1. FUNSD — 199 kommenterade skannade formulär med brusigt, verklighetstroget utseende. Standardriktmärket för formulärförståelse och nyckelvärdesutvinning.
  2. SROIE — ICDAR 2019-dataset med skannade kvitton och ungefär 1 000 kvitton, som stöder textdetektering, igenkänning och informationsutvinning i en enda uppsättning.
  3. SLADD — En konsoliderad kvittodatauppsättning byggd för efter-OCR-parsning, med omfattande fältnivåetiketter för faktura- och kvittoautomation.
  4. XFUND — Flerspråkig utökning av FUNSD som täcker sju språk (tyska, spanska, franska, italienska, japanska, portugisiska, kinesiska) med 199 sidor vardera. Idealisk för flerspråkig dokument-AI.
  5. DDI-100 — Omkring 100 000 förvrängda dokumentbilder för detektering och igenkänning under verklig försämring som skevhet, oskärpa och brus.

Vilka är de bästa OCR-datauppsättningarna för scentext?

Scentext-OCR-dataset tränar modeller att läsa text i naturliga bilder som skyltar, produkter och gatubilder. Dessa är viktiga för OCR i verkligheten där bakgrunder är röriga.

  1. ICDAR Robust avläsning — Referentfamiljen bakom det mesta av scentextforskningen, inklusive utmaningarna med fokuserad och incidental scentext med avgränsande rutor och transkriptioner på ordnivå.
  2. COCO-text — Storskaliga scentextanteckningar lager på MS-COCO-bilder. Starkt för textdetektering i stor skala i naturliga scener.
  3. Totaltext — Specialiserar sig på böjd och godtyckligt orienterad text, en känd svag punkt för äldre OCR-modeller.
  4. SVT (Street View Text) — Word-bilder hämtade från Google Street View, ofta låg upplösning och hög variabilitet. Tillgängliga via Papers med Code-speglar.
  5. HärText — Hierarkisk anteckning från stycke till rad till ord, som täcker både handskriven och tryckt scentext. Användbart för layoutmedveten OCR.

Vilka är de bästa OCR-datauppsättningarna för siffror och tecken?

OCR-dataset för siffror och tecken tränar modeller att känna igen enskilda symboler i kontrollerade miljöer. Dessa är standardutgångspunkterna för klassificeringsbaslinjer.

  1. MNIST — 70 000 handskrivna siffror i gråskala. Den snabbaste baslinjen för att validera en sifferklassificerare.
  2. EMNIST — Utökar MNIST med 814 255 handskrivna bokstäver och siffror härledda från NIST Special Database 19.
  3. SVHN (husnummer i gatuvyn) — Över 600 000 verkliga siffror från husnummer. Ett praktiskt steg upp från MNIST för bullriga förhållanden.
  4. Tecken74K — 74 107 bilder som täcker engelska och kannadaska tecken från naturliga bilder och datortypsnitt.
  5. NIST Special Database 19 — Över 810 000 handtryckta karaktärsbilder från 3 600 skribenter. Källan som många engelska OCR-riktmärken kommer ifrån.

Vilka är de bästa handskriftsdatauppsättningarna för OCR?

Handskriftsdataset tränar OCR-modeller att läsa kursiv, tryckt och historisk handskriven text. De starkaste öppna handskriftsdataseten är fortfarande de mest citerade riktmärkena för handskriven textigenkänning (HTR).

  1. IAM handskriftsdatabas — Den engelska handstilens guldstandard, med 13 353 textrader från 657 skribenter. Fortfarande den mest citerade handstilsdatauppsättningen i OCR-forskning 2024–2025.
  2. IAM-OnDB — Onlineversionen av IAM med pennstreck, som samlar in bandata. Den kanoniska handskriftsdatauppsättningen för igenkänning av pennor och surfplattor.
  3. Bentham-dokumenten — Transkriberade historiska engelska manuskript av filosofen Jeremy Bentham. Den ledande riktmärket för historisk handskrifts-OCR, tillgänglig via Transkribus.
  4. GNHK (GoodNotes Handwriting Kollection) — En datauppsättning från 2021 med obegränsade handskrivna anteckningar från verkligheten på engelska. Närmare rörig produktionsdata än labbren IAM.

Vilka är de bästa flerspråkiga och icke-latinska OCR-datauppsättningarna?

 

Flerspråkiga OCR-dataset tränar modeller på skrifttyper utöver engelska, inklusive kinesiska, arabiska och matematiska notationer. Dessa är viktiga för global dokument- och handskriftsigenkänning.

  1. CASIA-HWDB — Standard kinesisk OCR-riktmärke, med 1.17 miljoner handskrivna teckenprover från 1 020 skribenter.
  2. KHATT — 1 000 arabiska handskrivna formulär från 1 000 olika skribenter, skannade med flera upplösningar. Den mest omfattande öppna arabiska OCR-datauppsättningen.
  3. CROHME — Tävling i igenkänning av handskrivna matematiska uttryck online: 10 000+ uttryck fördelade på över 101 matematiska symboler, i både online- och offlinevarianter. OCR för handskrivna ekvationer.

Vilka är de vanliga fallgroparna när man använder gratis OCR-datauppsättningar?

Tre fallgropar drabbar de flesta lag.

Domänmatchningsfel: Utbildning på ren IAM eller COCO-Text och implementering på skrynkliga fakturor garanterar dålig noggrannhet.

Körkortsblindhet: Flera scentext- och historiska OCR-datamängder är endast för forskning eller kräver registrering före kommersiell användning.

Annoteringsluckor: Många OCR-datamängder saknar de layoutmetadata, avgränsningsrutor på radnivå eller fältetiketter som produktionssystem behöver.

Föreställ dig ett medelstort logistikföretag som automatiserar läsning av fraktetiketter. Utbildning i offentlig scentext ger dem 80 % av riktmärkena, men riktiga etiketter med bländning och veck sänker dem till 58 %. Att minska det gapet kräver målinriktat arbete. dataanmärkning av 6 000 etikettbilder inom domänen före lansering.

Fördelar och utmaningar med datauppsättningar med öppen källkod

Fördelar och utmaningar med öppen källkodsdata

Företag måste ställa fördelarna och utmaningarna mot varandra för att förstå om de måste välja fri att använda data för sina ML-applikationer.

Fördelar

  • Uppgifterna är lättillgängliga. På grund av datatillgänglighet minskar kostnaden för att utveckla applikationen avsevärt.
  • Tiden och ansträngningen som läggs ner på att samla in data för applikationen minskar avsevärt eftersom datasetet är lättillgängligt.
  • Det finns ett överflöd av gemenskapsforum eller hjälpgrupper som hjälper till att lära sig, anpassa och optimera datamängden.
  • En av de stora fördelarna med datamängden med öppen källkod är att den inte lägger några begränsningar för anpassning.
  • Data med öppen källkod är tillgänglig för en stor del av befolkningen, vilket gör analys och innovation möjlig utan monetära barriärer.

Utmaningar

  • Projektspecifika data är svåra att få tag på. Dessutom finns det en möjlighet att information saknas och att tillgänglig data används felaktigt.
  • Att skaffa egen data tar tid och ansträngning och är kostsamt
  • Även om det kan vara lättare att skaffa data, kan kunskap och analyskostnader uppväga den initiala fördelen.
  • Andra utvecklare använder också samma data för att utveckla applikationer.
  • Dessa datauppsättningar är mycket sårbara för säkerhetsintrång, integritet och samtycke.

Hur stöder Shaip OCR- och handskriftsigenkänningsprojekt?

Shaips OCR-utbildningsdatatjänster para ihop öppna datamängder med anpassade datainsamling över 60+ språk, inklusive tryckta dokument, handstil, kvitton och ID-handlingar. Shaips annoteringsarbetsflöden lägger till de lager som offentliga OCR-datauppsättningar saknar: avgränsningsramar på radnivå, etiketter på fältnivå, transkriptionskvalitetskontroll och skribentmetadata.

Slutsats

De 22 OCR-dataseten ovan ger dig en komplett öppen källkodsgrund för dokument, scentext, siffror, handstil och flerspråkig igenkänning för 2026. Börja med OCR-datasetet som matchar din texttyp och inspelningsmiljö, validera mot ett begränsat urval av dina faktiska data och budgetera för anpassade annoteringar för att täcka domängapet. Den kombinationen levereras snabbare än att bygga från grunden.

Vilket gratis OCR-dataset som är bäst att använda beror på uppgiften. ICDAR Robust Reading leder till scentext, FUNSD och SROIE leder till dokument- och kvitto-OCR, och IAM leder till handskrift. För sifferigenkänning är MNIST och SVHN standard. De flesta team kombinerar två eller tre OCR-dataset över olika kategorier snarare än att förlita sig på en.

OCR-datauppsättningar med öppen källkod är inte alla fria för kommersiellt bruk. MNIST, SVHN och COCO-Text använder tillåtna licenser, medan IAM, ICDAR-uppsättningar och historiska handskriftsdatauppsättningar ofta kräver registrering eller begränsar användningen till forskning. Granska alltid varje datauppsättnings licens innan du tränar en kommersiell modell.

OCR-datauppsättningar täcker all maskinläsbar textigenkänning, inklusive tryckta dokument, scentext och siffror, medan handskriftsdatauppsättningar är den delmängd som fokuserar på handskrivet innehåll. Handskriftsdatauppsättningar som IAM och Bentham tränar HTR-modeller, medan OCR-datauppsättningar för dokument och scentext hanterar tryckt och färdig text.

Flerspråkiga OCR-datauppsättningar inkluderar XFUND för sju språk med formulär, CASIA-HWDB för kinesiska, KHATT för arabiska och ICDAR MLT för flerspråkig scentext. Att kombinera skriptspecifika OCR-datauppsättningar med syntetisk förstärkning ger vanligtvis bättre resultat än träning på en enskild datauppsättning.

Behovet av anpassade anteckningar beror på hur långt dina dokument är från offentliga data. Rena utskrivna formulär kan behöva 1 000–5 000 exempel inom domänen, medan slarvig handstil, kvitton eller sällsynta manus ofta behöver 10 000–50 000. Shaips anteckningspipelines ger vanligtvis en ökning av noggrannheten på 15–30 % jämfört med endast offentlig OCR-träning.

Gillade du den här artikeln? Följ Shaip på LinkedIn för fler uppdateringar.

Social Dela