Brainiall Pronunciation
Pontuações em nível de fonema que superam a concordância humana
A única API comercial de pronúncia em que o modelo é mais consistente que avaliadores humanos treinados. PCC por fonema 0.590 em nosso tier Light de produção e 0.682 no tier Premium com fine-tuning — ambos acima do teto inter-anotadores de 0,555 em nosso conjunto de testes público. AWS e GCP não têm produto equivalente; o Azure oferece 33 idiomas sem publicar números de precisão.
Interactive Phoneme Scoring Demo
Click on individual phonemes below to inspect acoustic scores, ARPAbet alignment, and diagnostic feedback generated at runtime.
Por que essa classificação é importante
Traditional speech apps rely on vague sentence-level grades or subjective human reviews. Human raters only achieve a 0.555 Pearson Correlation Coefficient (PCC) with each other. Brainiall delivers objective, phone-level scoring that exceeds human agreement ceilings.
Integração de duas linhas
Envie áudio bruto (base64) e o texto esperado. Receba pontuações por fonema, por palavra e por frase — uma chamada HTTP, sem streaming.
curl -X POST https://api.brainiall.com/v1/pronunciation/assess \
-H "Authorization: Bearer $BRAINIALL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"audio": "<base64-wav-or-mp3>",
"text": "She sells seashells by the seashore",
"tier": "premium",
"locale": "en-US"
}'
# Response (deterministic score breakdown):
# {
# "sentenceScore": 86,
# "accuracyScore": 88,
# "fluencyScore": 84,
# "completenessScore": 100,
# "wordScores": [
# { "word": "she", "score": 96, "phonemes": [{ "phone": "SH", "score": 98 }, { "phone": "IY", "score": 94 }] },
# { "word": "sells", "score": 84, "phonemes": [{ "phone": "S", "score": 92 }, { "phone": "EH", "score": 88 }, { "phone": "L", "score": 81 }, { "phone": "Z", "score": 75 }] }
# ],
# "latency_ms": 382
# }When NOT to Use Pronunciation Assessment
- Open-ended unstructured conversations without reference text: Pronunciation scoring requires the target text to compare acoustic phonemes against canonical alignment. For freeform transcription, use our Streaming STT engine in the Audio family.
- Clinical motor speech disorder diagnosis: While acoustic scores provide objective metrics, clinical neurological evaluations require a licensed speech-language pathologist.
- Tonal pitch or musical singing grading: Our scoring models are optimized for natural spoken linguistic phonemes, not musical melody or operatic pitch scales.
Metodologia
O tier Light é um ensemble de 9 modelos (4× MLP + 4× XGBoost + 1× PhoneTransformer) sobre features extraídas de um modelo acústico Brainiall Speech (tier Edge) — o mesmo backbone que usamos no nosso produto STT. O tier Premium adiciona um motor Brainiall Speech (Premium) ajustado, com soma ponderada aprendível das suas 24 camadas de transformer, mais um objetivo de pontuação ordinal-contrastivo. Todos os números vêm do metodologia do benchmark página; o conjunto de testes está nosso conjunto de testes público (a referência SOTA para pronúncia de inglês L2).
Preço
O tier Light pontua com qualidade de produção usando inferência em CPU; o tier Premium usa um motor Brainiall Speech (Premium) ajustado para a maior precisão publicada em nosso conjunto de testes público. Regra de desconto: 50% abaixo da média de mercado quando nossa qualidade é superior — o que ocorre em ambos os tiers.
Grátis
100 minutos/mês · Tier Light · Grátis para sempre
Inicial
1.000 minutos/mês · Tier Light · Pontuações por palavra e frase
Pro
10.000 minutos/mês · Light + Premium · Pontuações por fonema · SLA de 99,5%
Negócios
50.000 minutos/mês · Capacidade dedicada · Linha direta para o fundador