Optisk teckenigenkänning (OCR)

Optisk teckenigenkänning (OCR)

Definition

Optisk teckenigenkänning (OCR) är processen att konvertera tryckt eller handskriven text i bilder till maskinläsbar digital text.

Syfte

Syftet är att digitalisera dokument för sökning, redigering och analys. OCR stöder tillämpningar inom digitalisering, tillgänglighet och automatisering av datainmatning.

Betydelse

  • Möjliggör konvertering av papper till sökbar text.
  • Förbättrar effektiviteten inom branscher som bank och sjukvård.
  • Har problem med skanningar av dålig kvalitet eller ovanliga teckensnitt.
  • Ligger till grund för textutvinning i skannade arkiv.

Så fungerar det

  1. Skanna eller ta en bild av texten.
  2. Förbehandla bilden för att ta bort brus.
  3. Identifiera och segmentera tecken eller ord.
  4. Tolka text med hjälp av ML-modeller.
  5. Skriv ut redigerbar digital text.

Exempel (verkliga världen)

  • Google Cloud Vision OCR: textigenkänningstjänst.
  • ABBYY FineReader: kommersiell OCR-programvara.
  • Digitalisering av Project Gutenberg: OCR för böcker.

Referenser / Vidare läsning

  • Smith, R. “En översikt över Tesseract OCR-motorn.” ICDAR.
  • ISO/IEC 15938-4: Gränssnitt för beskrivning av multimediainnehåll.
  • IEEE-transaktioner om mönsteranalys och maskinintelligens.
  • Vad är OCR?

Berätta hur vi kan hjälpa till med ditt nästa AI-initiativ.