Brainiall Pronunciation
Puntuaciones a nivel de fonema que superan el acuerdo humano
La única API comercial de evaluación de pronunciación donde el modelo es más consistente que evaluadores humanos entrenados. PCC por fonema 0.590 en nuestro tier Light de producción y 0.682 en el tier Premium fine-tuned — ambos por encima del techo inter-anotador de 0.555 en nuestro conjunto de pruebas público. AWS y GCP no tienen producto equivalente; Azure ofrece 33 locales sin publicar cifras de precisión.
Interactive Phoneme Scoring Demo
Click on individual phonemes below to inspect acoustic scores, ARPAbet alignment, and diagnostic feedback generated at runtime.
Por qué importa esta puntuación
Traditional speech apps rely on vague sentence-level grades or subjective human reviews. Human raters only achieve a 0.555 Pearson Correlation Coefficient (PCC) with each other. Brainiall delivers objective, phone-level scoring that exceeds human agreement ceilings.
Integración de dos líneas
Envía audio crudo (base64) junto con el texto esperado. Recibe puntuaciones por fonema, por palabra y por oración: una sola llamada HTTP, sin streaming.
curl -X POST https://api.brainiall.com/v1/pronunciation/assess \
-H "Authorization: Bearer $BRAINIALL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"audio": "<base64-wav-or-mp3>",
"text": "She sells seashells by the seashore",
"tier": "premium",
"locale": "en-US"
}'
# Response (deterministic score breakdown):
# {
# "sentenceScore": 86,
# "accuracyScore": 88,
# "fluencyScore": 84,
# "completenessScore": 100,
# "wordScores": [
# { "word": "she", "score": 96, "phonemes": [{ "phone": "SH", "score": 98 }, { "phone": "IY", "score": 94 }] },
# { "word": "sells", "score": 84, "phonemes": [{ "phone": "S", "score": 92 }, { "phone": "EH", "score": 88 }, { "phone": "L", "score": 81 }, { "phone": "Z", "score": 75 }] }
# ],
# "latency_ms": 382
# }When NOT to Use Pronunciation Assessment
- Open-ended unstructured conversations without reference text: Pronunciation scoring requires the target text to compare acoustic phonemes against canonical alignment. For freeform transcription, use our Streaming STT engine in the Audio family.
- Clinical motor speech disorder diagnosis: While acoustic scores provide objective metrics, clinical neurological evaluations require a licensed speech-language pathologist.
- Tonal pitch or musical singing grading: Our scoring models are optimized for natural spoken linguistic phonemes, not musical melody or operatic pitch scales.
Metodología
El nivel Light es un ensamble de 9 modelos (4× MLP + 4× XGBoost + 1× PhoneTransformer) sobre características extraídas de un modelo acústico Brainiall Speech (nivel Edge): la misma base que usamos para nuestro producto STT. El nivel Premium añade un motor Brainiall Speech (Premium) ajustado, con suma ponderada aprendible a través de sus 24 capas de transformador, más un objetivo de puntuación ordinal-contrastivo. Todos los números provienen del conjunto público Metodología de referencia página; el conjunto de pruebas es nuestro conjunto de pruebas público (la referencia SOTA para la pronunciación L2 en inglés).
Precios
El tier Light obtiene calidad de producción con inferencia en CPU; el tier Premium usa un motor Brainiall Speech (Premium) ajustado para la mayor precisión publicada en nuestro conjunto de pruebas público. Regla de descuento: 50% por debajo del promedio del mercado cuando nuestra calidad es superior — y lo es, en ambos tiers.
Gratis
100 minutos/mes · Nivel Light · Gratis para siempre
Inicial
1.000 minutos/mes · Nivel Light · Puntuaciones por palabra y oración
Pro
10.000 minutos/mes · Light + Premium · Puntuaciones a nivel de fonema · SLA 99,5%
Empresa
50.000 minutos/mes · Capacidad dedicada · Línea directa con el fundador