Ljudtranskription och annotering på indiskt språk: Fallstudie om konversationell AI
Erbjöd högkvalitativa ljudtranskriptions- och annoteringstjänster för att träna sin AI-drivna talbehandlingsmotor.
Projektöversikt: Bygga en flerspråkig talmotor för indiska språk
Kunden är Indiens banbrytande AI-produktlabb med marknadsnärvaro i USA, Indien, Kanada och flera andra länder. Deras vision är att öka mänsklig potential genom teknologi. De har mer än tio års erfarenhet av banbrytande NLP, vetenskaplig forskning inom artificiell intelligens, ML, analys, visualiseringar och tillhörande teknologier.
De tänjer på gränserna inom människa-maskin-interaktion med sina AI-produkter, dvs. ICOG och Autovox. ICOG är en AI-baserad personlig intelligent virtuell inlärningsassistent för arbetskraftens lärande och transformationsmål, medan Autovox är en AI-driven talassistent.
Processormotor för indiska språk.
Viktiga resultat: 1 200 timmar kommenterade på 6 språk
Ljudtranskriberat och kommenterat
1,200 Hrs
Antal
Språk
6 (200 timmar x 6 språk)
Språk transkriberade och kommenterade
Indisk engelska, hindi, tamil, telugu, kannada, malayalam
Projekt
tidslinje
10 veckor
Utmaningen: Att hitta expertlingvister för ljudannotering på indiska språk
Brist på tillgång till kvalificerade lingvister, experter på dataannotering och leveranstid har varit en flaskhals i utvecklingen och införandet av konversationsbaserad AI. Att hitta lingvister, transkribera och annotera datamängder i stora volymer med den kvalitet som krävs, tillräckligt för att bygga AI-kapacitet, har alltid varit en tidskrävande och dyr uppgift som kräver skickliga resurser från olika områden. Trots att de hade ett internt team av annotatörer hade de problem med leverans i tid och kvaliteten på annoteringarna.
Kundens kritiska krav var:
- Tillgång till kvalificerade lingvister: Brist på tillgång till expertlingvister för indiska språk som indisk engelska, hindi, tamil, telugu, kannada och malayalam
- Ljudtranskription och annotering: Komplexa riktlinjer för ljudannotering och transkription med en minsta noggrannhet på 95 %
- Dataleverans: Transkriptionsfiler ska levereras i JSON-format inom 10 veckor.
Lösningen: Ljudtranskription och annotering av expertlingvister
Med vår djupa förståelse av konversationsbaserad AI hjälpte vi klienten att transkribera och annotera de tillhandahållna datamängderna genom att utnyttja ett team av experter inom lingvistvetenskap och annotering för att träna deras AI-drivna talbehandlingsmotor för indiska språk.
Efter att ha utvärderat många leverantörer (inklusive några tungviktare inom branschen) valde kunden Shaip på grund av vår expertis att slutföra stora konversationsbaserade AI-projekt inom strikta tidsramar och den kvalitet vi erbjöd till konkurrenskraftiga priser.
- Riktlinjer för ljudtranskription och annotering följs
- Annoterad ljudtyp som tal och icke-tal
- Om ljudtypen för det valda segmentet är markerad som tal, måste taltypen väljas, dvs. rent tal, tal+musik, tal+brus, obegripligt tal.
- Det valda talsegmentet bör vara specifikt taggat till det språk som talaren talar.
- Annotatorn bör markera regionerna med talartaggar. Olika talare bör vara
märkta med olika högtalaretiketter. - Annotatören måste välja talarens kön, dvs. man eller kvinna.
- Texten ska vara skriven som den talas upp i ljudet och ska vara grammatiskt korrekt.
- Om den valda ljudtypen är icke-tal, bör den tilldelas en av etiketterna – inget tal, musik, läppsmack, andedräkt, hosta, skratt, ringsignal, DTMF, babbel, fordonsbuller och intermittent förgrundsbuller.
- Alla segment i ljudet ska vara markerade med taggar och kan först därefter laddas upp till systemet.
- Dataleverans
Alla transkriptionsfiler levererades i JSON-format i enlighet med de angivna metadatakraven inom 10 veckor.
Resultatet: En produktionsklar flerspråkig konversationsmotor för AI
Högkvalitativa, kommenterade ljuddata från expertlingvister gjorde det möjligt för klienten att träna sin AI-drivna talbehandlingsmotor korrekt på 6 indiska språk, dvs. indisk engelska, hindi, tamil, telugu, kannada och malayalam, inom den angivna tiden.
Med guldstandardiserade träningsdataset kommer klienten att kunna erbjuda ett intelligent och robust talsystem med flerspråkig kapacitet som använder end-to-end (E2E) och hybridmodeller för att lösa verkliga problem. Enkelt uttryckt, bygga konversations-AI (som Alexa, Siri) specifikt för indiska konsumenter.
Vi blev positivt överraskade av Shaips robusta arbetsflödeshantering, snabba handläggningstid, deras erfarenhet av konversationsbaserad AI och deras nätverk av experter inom lingvister. Dessutom är det kostnads- och värdeledarskap de erbjuder oöverträffat.