Validators assess outputs across four dimensions to reward balanced, natural voices.

Scoring Formula

Overall = (Text Accuracy × 0.3) + (Voice Similarity × 0.3) + (Intonation × 0.3) + (Audio Quality × 0.1)

DimensionWeightTools UsedWhat It Measures
Text Accuracy30%Whisper ASRCorrect words, no omissions/additions
Voice Similarity30%ECAPA-TDNN + MFCC + PitchTimbre, style match to reference
Intonation30%YIN pitch/energy correlationNatural prosody, emphasis, rhythm
Audio Quality30%SNR, clipping, dynamic rangeClean, artifact-free listening

This encourages natural-sounding clones over robotic perfection in one area.

← Previous Architecture Overview Next → API Reference