OCR-textidentifiering och transkriptionsannotering

Hur Shaip levererade transkriptionsannoteringar på ordnivå och teckennivå för olika textkällor – tryckta dokument, handstil, skyltar, registreringsskyltar, kvitton – byggda som en OCR- och dokumentinformationsdatauppsättning i produktionsklass med 99 % noggrannhet.

OCR-textdetektering och transkriptionsannotering

Projektöversikt

I takt med att OCR går bortom rena tryckta dokument till verklighetstrogen text och dokumentintelligens, behövde klienten en anteckningspipeline som kunde hantera olika texttyper, teckensnitt, orienteringar, språk och ytförhållanden med både spatial precision och precision på teckennivå.

Shaip byggde en heltäckande annoteringspipelin som omfattar placering av avgränsande rutor på ordnivå, exakt teckentranskription, taggning av flera attribut och dubbel spatial + transkriptionskvalitetssäkring – och producerade modellklara OCR-datamängder för fler än 10 textkälltyper.

Nyckelstatistik

Annotering per bild

Hundratals ord

Noggrannhetsgräns

99%

Textkällor

10+

Attributlager

5

Utmaningar

  • Anteckningar varje synlig textinstans på ordnivå — hundratals per tät bild
  • Kombinera precision i den spatiala avgränsningsrutan med exakt transkription på teckennivå parallellt
  • Arbetsmiljö böjd, perspektivförvrängd och roterad text på skyltar och produktetiketter
  • transkribera blekt, lågkontrast och delvis dold ord utan att gissa oläsliga tecken
  • Hantering blandspråkig och flerskriftstext inom samma bild

Lösning

Spatial annotation på ordnivå

Varje synlig textförekomst i varje bild annoterades individuellt med en tätt anpassad avgränsningsram på ordnivå – vilket fångade den exakta rumsliga platsen för varje textelement. För täta bilder som kvitton eller blanketter innebar detta hundratals individuella annoteringar per bild, där var och en bibehöll baslinjejusteringens precision.

Transkription på teckennivå

Bredvid avgränsningsrutan transkriberade annotatorer det exakta textinnehållet i varje ord, inklusive siffror, specialtecken, interpunktion och alfanumeriska kombinationer. Detta dubbla arbetsflöde – spatial + transkription – utfördes parallellt med konsekvensregler över båda lagren.

Täckning från flera källor

Bevakningen omfattade en mycket varierad mängd källor: tryckta dokument, handskrivna anteckningar, gatuskyltar, produktetiketter, registreringsskyltar, butiksfasader, reklamskyltar, kvitton, fakturor, menyer och formulärfält. Varje källtyp hade sina egna anteckningsriktlinjer anpassade till dess visuella egenskaper.

5-lagers attributtaggning

Varje kommenterad textregion berikades med attribut som täcker textorientering (horisontell, vertikal, diagonal), språk och skrifttyp, textens tydlighet (tydligt läsbar, delvis läsbar, helt oläslig), teckensnittsstil (tryckt kontra handskriven) och textbakgrundstyp (enkel, mönstrad, komplex). Detta rika attributlager gör det möjligt för den tränade modellen att hantera olika verkliga textförhållanden långt utöver standarddokument-OCR.

Synlighetströskel och dubbel kvalitetssäkring

Strikta riktlinjer styrde minimigränsvärden för synlighet – oläslig text flaggades snarare än gissades, vilket bibehöll datasetets integritet. Varje kommenterad bild genomgick en tvånivås kvalitetssäkringsprocess som kombinerade precisionsgranskning av avgränsningsrutor och validering av transkriptionsnoggrannhet, med en noggrannhetströskel på 99 % över båda lagren.

Projektets omfattning

Dataset typ Annoteringsnivå Källor attribut QA Noggrannhet
OCR-textdetektering + transkription Ordrutor + teckentranskription 10+ källtyper 5 attributlager Dubbel spatial + transkriptions-QC 99%

Utkomster

  • Etablerade en dubbel ordnivå spatial + teckennivå transkriptionspipeline för OCR AI
  • standardiserad 10+ textkälltäckning som spänner över dokument, scentext och handstil
  • Levererat 5 attributlager för orientering, språk, tydlighet, typsnitt och bakgrund
  • Bibehållen 99 % noggrannhetsgrind över både rumsliga och transkriptions-QA-lager
  • Aktiverade klientens dokumentdigitalisering, OCR för detaljhandel, navigering, bank och juridik AI-applikationer

Sammantaget hjälpte Shaip till att omvandla ett krav på textannotering från flera källor till en strukturerad, produktionsklar OCR-pipeline – en som kan stödja dokumentdigitalisering, scentextdetektering, detaljhandelsinformation, bankautomation och AI för juridisk efterlevnad med dubbel spatial precision och transkriptionsprecision.

Citat ikon

Shaip hanterade OCR-problem i utkanten av applikationen som de flesta leverantörer inte kan – böjd skylttext, blandade skript, bleknade kvitton, handskrivna anteckningar. Deras dubbla kvalitetssäkring av både avgränsningsramar och transkriptioner gav oss träningsdata som vi kunde driftsätta.

— Direktör, Dokument AI

★ ★ ★ ★ ★
Citat ikon