Hur Shaip levererade ett skalbart kvalitetsutvärderingsprogram för röstkloning för en AI-talklient
Från demokvalitet till driftsättningsklar – hur strukturerad mänsklig utvärdering hjälpte en AI-talklient att minska gapet mellan labmetri och verklig prestanda.
Projektöversikt
Röstkloningsmodeller kan låta imponerande i demonstrationer men har fortfarande problem i verkligheten. Klienten behövde ett tillförlitligt sätt att mäta om deras modell faktiskt förbättrades – särskilt för indisk engelska, vilket var en prioriterad marknad för implementering.
Shaip anlitades för att utforma och hantera ett mänskligt utvärderingsprogram som kunde besvara tre viktiga affärsfrågor:
- Låter talet naturligt?
- Låter det fortfarande som originalhögtalaren?
- Är den tillräckligt säker och tillförlitlig för produktionsbruk?
Istället för att enbart förlita sig på automatiserade mätvärden använde projektet utbildade mänskliga granskare för att utvärdera verkliga ljudutgångar och identifiera var modellen fortfarande var till brister.
Viktiga datamängdsmått
Användningsfall
Kvalitetsbedömning av röstkloning
Projektets längd
12 veckor
Granskade prover
12 400 syntetiserade ljudklipp
Annotatörer utplacerade
48 utbildade engelska utvärderare
Utmaningar vid bedömning av TTS och röstkloningskvalitet
- Modellen behövde fungera bra över hela flera engelska accenter, särskilt indisk engelska.
- Ljudkvaliteten var tvungen att förbättras på sätt som är viktiga för slutanvändarna, inte bara i labbets mätvärden.
- Teamet behövde ett tydligt sätt att identifiera vad gick fel i talutgången.
- Långa ljudklipp förlorade ibland den ursprungliga talarens identitet med tiden.
- Kunden behövde också kontroller för säkerhet, risk för identitetsstöld och närvaro av vattenmärke.
Lösning: Mänskligt utvärderingsramverk för AI-röstkvalitet
Utvärderingsstrategi
Shaip byggde ett strukturerat granskningsramverk för att bedöma naturlighet, tydlighet, röstlikhet, konsekvens och säkerhet.
Mänsklig granskning i stor skala
48 utbildade utvärderare granskade 12 400 ljudprover från indisk engelska, neutral amerikansk engelska och ett underspår på hingliska.
Tredelad bedömning
- Recensenterna betygsatte hur naturligt och förståeligt varje klipp lät.
- De jämförde par av klipp för att identifiera vilken version som var bättre.
- De taggade återkommande kvalitetsproblem som onaturlig rytm, tonhöjdsproblem och högtalardrift.
Kvalitetskontroll
Shaip använde kalibreringsuppgifter, guldstandardkontroller, upprepade granskningar och kvalitetssäkringsövervakning för att hålla poängen konsekvent och tillförlitlig.
Åtgärdbar feedbackloop
Resultaten från varje sprint matades tillbaka till klientens finjusteringsprocess, vilket hjälpte modellen att förbättras över flera omgångar.
Projektomfattning: Språk, accenter och granskningstäckning
| Area | Omfattning |
|---|---|
| Språk | Engelska |
| Prioriterade accenter | Indisk engelska , neutral amerikansk engelska |
| Sekundär täckning | Brittisk engelska, hingliska underspår |
| Exempeltyper | Korta referensklipp, få exempel, långt tal |
| Granska utdata | Kvalitetsbetyg, preferensetiketter, problemmärkning |
| Förlovningslängd | 12 veckor |
Resultat: Mätbara förbättringar av röstkloning
- Tydlig förbättring av röstkvaliteten: Modellens övergripande kvalitetspoäng förbättrades från 3.41 till 4.12, vilket visar att talet blev mer naturligt och produktionsklart.
- Bättre högtalarmatchning: Systemet blev mycket bättre på att bevara den ursprungliga talarens röst och förbättrade likheten från 0.71 till 0.87.
- Färre märkbara fel: Talproblem minskade från 31 % av urvalen vid baslinjen till 11 % i den slutliga sprinten.
- Stark förståelighet: Den slutliga felfrekvensen för indisk engelska nådde 4.8 %, vilket översteg målgränsen.
- Säkrare driftsättningsberedskap: Utvärderingen bekräftade också starka resultat på viktiga säkerhetskontroller, inklusive riskbedömning av personidentifiering och verifiering av vattenmärken.
Shaip hjälpte oss att omvandla subjektiv ljudkvalitet till ett mätbart förbättringsprogram. Deras utvärderingsramverk gav oss tydliga signaler om vad som behövde åtgärdas, var det behövde förbättras och hur vi med tillförsikt kunde närma oss produktionen.
— Produktledare inom AI-tal