Saltar al contenido principal
0.682 PCC · Puntuaciones a nivel de fonema que superan el acuerdo humano

Brainiall Pronunciation
Puntuaciones a nivel de fonema que superan el acuerdo humano

La única API comercial de evaluación de pronunciación donde el modelo es más consistente que evaluadores humanos entrenados. PCC por fonema 0.590 en nuestro tier Light de producción y 0.682 en el tier Premium fine-tuned — ambos por encima del techo inter-anotador de 0.555 en nuestro conjunto de pruebas público. AWS y GCP no tienen producto equivalente; Azure ofrece 33 locales sin publicar cifras de precisión.

Interactive Phoneme Scoring Demo

Click on individual phonemes below to inspect acoustic scores, ARPAbet alignment, and diagnostic feedback generated at runtime.

Interactive Phoneme Inspector
Sentence Score: 90 / 100
96
She
84
sells
91
seashells
98
by
76
the
93
seashore
Active Phoneme
/ʃ/
ARPAbet: SH
Acoustic Score
98/100
PCC Confidence: 0.682 (Exceeds 0.555 Human Agreement)
Diagnostic Feedback
Native-like articulation. Formant frequencies align with canonical reference.
Context word: “She

Por qué importa esta puntuación

Traditional speech apps rely on vague sentence-level grades or subjective human reviews. Human raters only achieve a 0.555 Pearson Correlation Coefficient (PCC) with each other. Brainiall delivers objective, phone-level scoring that exceeds human agreement ceilings.

PCC de fonema (Light)
0.590
+3,5pp por encima del humano (0,555). Ensemble de 9 modelos, corre en CPU.
PCC de fonema (Premium)
0.682
+12,7pp por encima del humano, +2,5pp por encima de SOTA (HIA 0,657). El nivel Premium está ajustado sobre el motor Brainiall Speech (Premium).
PCC por oración
0.711
+3,6pp por encima del humano (0,675). Nivel de oración mediante XGBoost apilado sobre características de fonema y palabra.
Latencia p95
423ms
Nivel Light en GPU compartida; Premium ~530ms en caliente. Ambos sincrónicos — sin espera por lotes.

Integración de dos líneas

Envía audio crudo (base64) junto con el texto esperado. Recibe puntuaciones por fonema, por palabra y por oración: una sola llamada HTTP, sin streaming.

POST /v1/pronunciation/assessJSON / Base64 Audio
curl -X POST https://api.brainiall.com/v1/pronunciation/assess \
  -H "Authorization: Bearer $BRAINIALL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "audio": "<base64-wav-or-mp3>",
    "text": "She sells seashells by the seashore",
    "tier": "premium",
    "locale": "en-US"
  }'

# Response (deterministic score breakdown):
# {
#   "sentenceScore": 86,
#   "accuracyScore": 88,
#   "fluencyScore": 84,
#   "completenessScore": 100,
#   "wordScores": [
#     { "word": "she", "score": 96, "phonemes": [{ "phone": "SH", "score": 98 }, { "phone": "IY", "score": 94 }] },
#     { "word": "sells", "score": 84, "phonemes": [{ "phone": "S", "score": 92 }, { "phone": "EH", "score": 88 }, { "phone": "L", "score": 81 }, { "phone": "Z", "score": 75 }] }
#   ],
#   "latency_ms": 382
# }

When NOT to Use Pronunciation Assessment

  • Open-ended unstructured conversations without reference text: Pronunciation scoring requires the target text to compare acoustic phonemes against canonical alignment. For freeform transcription, use our Streaming STT engine in the Audio family.
  • Clinical motor speech disorder diagnosis: While acoustic scores provide objective metrics, clinical neurological evaluations require a licensed speech-language pathologist.
  • Tonal pitch or musical singing grading: Our scoring models are optimized for natural spoken linguistic phonemes, not musical melody or operatic pitch scales.

Metodología

El nivel Light es un ensamble de 9 modelos (4× MLP + 4× XGBoost + 1× PhoneTransformer) sobre características extraídas de un modelo acústico Brainiall Speech (nivel Edge): la misma base que usamos para nuestro producto STT. El nivel Premium añade un motor Brainiall Speech (Premium) ajustado, con suma ponderada aprendible a través de sus 24 capas de transformador, más un objetivo de puntuación ordinal-contrastivo. Todos los números provienen del conjunto público Metodología de referencia página; el conjunto de pruebas es nuestro conjunto de pruebas público (la referencia SOTA para la pronunciación L2 en inglés).

Precios

El tier Light obtiene calidad de producción con inferencia en CPU; el tier Premium usa un motor Brainiall Speech (Premium) ajustado para la mayor precisión publicada en nuestro conjunto de pruebas público. Regla de descuento: 50% por debajo del promedio del mercado cuando nuestra calidad es superior — y lo es, en ambos tiers.

Gratis

$0/mes

100 minutos/mes · Nivel Light · Gratis para siempre

Inicial

$19/mes

1.000 minutos/mes · Nivel Light · Puntuaciones por palabra y oración

Pro

$99/mes

10.000 minutos/mes · Light + Premium · Puntuaciones a nivel de fonema · SLA 99,5%

Empresa

$299/mes

50.000 minutos/mes · Capacidad dedicada · Línea directa con el fundador

Pronunciación, puntuada con más consistencia que los humanos

Integrate phoneme-accurate speech scoring in minutes with instant API key issuance and zero monthly minimum.

Iniciar prueba gratuita
Brainiall Pronunciation — PCC de fonema 0.59 / 0.68 (supera al humano) · Brainiall | Brainiall