Brainiall Pronunciation
Les chiffres de niveau téléphonique qui dépassent l'accord humain
La seule API de prononciation commerciale oĂč le modĂšle est plus cohĂ©rent que les raters humains formĂ©s. 0.590 sur notre production LumiĂšre et 0.682 AWS et GCP n'ont pas de produit Ă©quivalent; Azure propose 33 locaux sans publier des chiffres d'exactitude.
Interactive Phoneme Scoring Demo
Click on individual phonemes below to inspect acoustic scores, ARPAbet alignment, and diagnostic feedback generated at runtime.
Pourquoi ce score est important
Traditional speech apps rely on vague sentence-level grades or subjective human reviews. Human raters only achieve a 0.555 Pearson Correlation Coefficient (PCC) with each other. Brainiall delivers objective, phone-level scoring that exceeds human agreement ceilings.
LâintĂ©gration Ă deux lignes
Envoyer de l'audio brut (base64) plus le texte attendu.Retourner par tĂ©lĂ©phone, par mot et par sentence scores â un appel HTTP, pas de streaming requis.
curl -X POST https://api.brainiall.com/v1/pronunciation/assess \
-H "Authorization: Bearer $BRAINIALL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"audio": "<base64-wav-or-mp3>",
"text": "She sells seashells by the seashore",
"tier": "premium",
"locale": "en-US"
}'
# Response (deterministic score breakdown):
# {
# "sentenceScore": 86,
# "accuracyScore": 88,
# "fluencyScore": 84,
# "completenessScore": 100,
# "wordScores": [
# { "word": "she", "score": 96, "phonemes": [{ "phone": "SH", "score": 98 }, { "phone": "IY", "score": 94 }] },
# { "word": "sells", "score": 84, "phonemes": [{ "phone": "S", "score": 92 }, { "phone": "EH", "score": 88 }, { "phone": "L", "score": 81 }, { "phone": "Z", "score": 75 }] }
# ],
# "latency_ms": 382
# }When NOT to Use Pronunciation Assessment
- Open-ended unstructured conversations without reference text: Pronunciation scoring requires the target text to compare acoustic phonemes against canonical alignment. For freeform transcription, use our Streaming STT engine in the Audio family.
- Clinical motor speech disorder diagnosis: While acoustic scores provide objective metrics, clinical neurological evaluations require a licensed speech-language pathologist.
- Tonal pitch or musical singing grading: Our scoring models are optimized for natural spoken linguistic phonemes, not musical melody or operatic pitch scales.
méthodologie
Le niveau Light est un ensemble de 9 modĂšles (4Ă MLP + 4Ă XGBoost + 1Ă PhoneTransformer) sur les caractĂ©ristiques extraites d'un modĂšle acoustique Brainiall Speech (Edge tier) - le mĂȘme backbone que nous utilisons pour notre produit STT. Le niveau Premium ajoute un moteur Brainiall Speech (Premium) affinĂ©, avec somme pondĂ©rĂ©e apprenable sur ses 24 couches de transformateur, plus un objectif de scoring ordinal-contrastif. Tous les chiffres viennent du public mĂ©thodologie de rĂ©fĂ©rence page ; le test est Notre test public (la rĂ©fĂ©rence SOTA pour la prononciation L2 en anglais).
prix
Le niveau Light atteint une qualitĂ© de production avec infĂ©rence CPU ; le niveau Premium utilise un moteur Brainiall Speech (Premium) affinĂ© pour la plus haute prĂ©cision publiĂ©e sur notre ensemble d'essai public. RĂšgle de rĂ©duction : 50% sous la moyenne du marchĂ© lorsque notre qualitĂ© est supĂ©rieure â ce qui est le cas, sur les deux niveaux.
libre
100 minutes/mois · Light tier · Gratuit pour toujours
Démarrage
1000 minutes/mois · Niveau de lumiÚre · Paroles + scores de phrase
Pro
10 000 minutes/mois · Light + Premium · Scores de niveau téléphonique · 99.5% SLA
Les affaires
50 000 minutes/mois · Capacité dédiée · Ligne directe au fondateur