Validators assess outputs across four dimensions to reward balanced, natural voices.
Scoring Formula
Overall = (Text Accuracy × 0.3) + (Voice Similarity × 0.3) + (Intonation × 0.3) + (Audio Quality × 0.1)
| Dimension | Weight | Tools Used | What It Measures |
|---|---|---|---|
| Text Accuracy | 30% | Whisper ASR | Correct words, no omissions/additions |
| Voice Similarity | 30% | ECAPA-TDNN + MFCC + Pitch | Timbre, style match to reference |
| Intonation | 30% | YIN pitch/energy correlation | Natural prosody, emphasis, rhythm |
| Audio Quality | 30% | SNR, clipping, dynamic range | Clean, artifact-free listening |
This encourages natural-sounding clones over robotic perfection in one area.