Hur Shaip levererade ett skalbart kvalitetsutvärderingsprogram för röstkloning för en AI-talklient

Från demokvalitet till driftsättningsklar – hur strukturerad mänsklig utvärdering hjälpte en AI-talklient att minska gapet mellan labmetri och verklig prestanda.

Röstkloning

Projektöversikt

Röstkloningsmodeller kan låta imponerande i demonstrationer men har fortfarande problem i verkligheten. Klienten behövde ett tillförlitligt sätt att mäta om deras modell faktiskt förbättrades – särskilt för indisk engelska, vilket var en prioriterad marknad för implementering.

Shaip anlitades för att utforma och hantera ett mänskligt utvärderingsprogram som kunde besvara tre viktiga affärsfrågor:

  • Låter talet naturligt?
  • Låter det fortfarande som originalhögtalaren?
  • Är den tillräckligt säker och tillförlitlig för produktionsbruk?

Istället för att enbart förlita sig på automatiserade mätvärden använde projektet utbildade mänskliga granskare för att utvärdera verkliga ljudutgångar och identifiera var modellen fortfarande var till brister.

Röstkloningskvalitet

Viktiga datamängdsmått

Användningsfall

Kvalitetsbedömning av röstkloning

Projektets längd

12 veckor

Granskade prover

12 400 syntetiserade ljudklipp

Annotatörer utplacerade

48 utbildade engelska utvärderare

Utmaningar vid bedömning av TTS och röstkloningskvalitet

  • Modellen behövde fungera bra över hela flera engelska accenter, särskilt indisk engelska.
  • Ljudkvaliteten var tvungen att förbättras på sätt som är viktiga för slutanvändarna, inte bara i labbets mätvärden.
  • Teamet behövde ett tydligt sätt att identifiera vad gick fel i talutgången.
  • Långa ljudklipp förlorade ibland den ursprungliga talarens identitet med tiden.
  • Kunden behövde också kontroller för säkerhet, risk för identitetsstöld och närvaro av vattenmärke.

Lösning: Mänskligt utvärderingsramverk för AI-röstkvalitet

Utvärderingsstrategi

Shaip byggde ett strukturerat granskningsramverk för att bedöma naturlighet, tydlighet, röstlikhet, konsekvens och säkerhet.

Mänsklig granskning i stor skala

48 utbildade utvärderare granskade 12 400 ljudprover från indisk engelska, neutral amerikansk engelska och ett underspår på hingliska.

Tredelad bedömning

  • Recensenterna betygsatte hur naturligt och förståeligt varje klipp lät.
  • De jämförde par av klipp för att identifiera vilken version som var bättre.
  • De taggade återkommande kvalitetsproblem som onaturlig rytm, tonhöjdsproblem och högtalardrift.

Kvalitetskontroll

Shaip använde kalibreringsuppgifter, guldstandardkontroller, upprepade granskningar och kvalitetssäkringsövervakning för att hålla poängen konsekvent och tillförlitlig.

Åtgärdbar feedbackloop

Resultaten från varje sprint matades tillbaka till klientens finjusteringsprocess, vilket hjälpte modellen att förbättras över flera omgångar.

Projektomfattning: Språk, accenter och granskningstäckning

Area Omfattning
Språk Engelska
Prioriterade accenter Indisk engelska , neutral amerikansk engelska
Sekundär täckning Brittisk engelska, hingliska underspår
Exempeltyper Korta referensklipp, få exempel, långt tal
Granska utdata Kvalitetsbetyg, preferensetiketter, problemmärkning
Förlovningslängd 12 veckor

Resultat: Mätbara förbättringar av röstkloning

  • Tydlig förbättring av röstkvaliteten: Modellens övergripande kvalitetspoäng förbättrades från 3.41 till 4.12, vilket visar att talet blev mer naturligt och produktionsklart.
  • Bättre högtalarmatchning: Systemet blev mycket bättre på att bevara den ursprungliga talarens röst och förbättrade likheten från 0.71 till 0.87.
  • Färre märkbara fel: Talproblem minskade från 31 % av urvalen vid baslinjen till 11 % i den slutliga sprinten.
  • Stark förståelighet: Den slutliga felfrekvensen för indisk engelska nådde 4.8 %, vilket översteg målgränsen.
  • Säkrare driftsättningsberedskap: Utvärderingen bekräftade också starka resultat på viktiga säkerhetskontroller, inklusive riskbedömning av personidentifiering och verifiering av vattenmärken.
Viktigast av allt fick klienten ett repeterbart utvärderingssystem som de kunde använda inte bara för att bedöma modellkvaliteten, utan för att kontinuerligt förbättra den. Det som började som ett tekniskt granskningsprogram blev ett praktiskt beslutsverktyg för produktteam, modellteam och intressenter i implementeringen.
Citat ikon

Shaip hjälpte oss att omvandla subjektiv ljudkvalitet till ett mätbart förbättringsprogram. Deras utvärderingsramverk gav oss tydliga signaler om vad som behövde åtgärdas, var det behövde förbättras och hur vi med tillförsikt kunde närma oss produktionen.

— Produktledare inom AI-tal

★ ★ ★ ★ ★
Citat ikon