Aller au contenu principal
Brainiall
Se connecterCommencer
★ 0.682 PCC · Les chiffres de niveau tĂ©lĂ©phonique qui dĂ©passent l'accord humain

Brainiall Pronunciation
Les chiffres de niveau téléphonique qui dépassent l'accord humain

La seule API de prononciation commerciale oĂč le modĂšle est plus cohĂ©rent que les raters humains formĂ©s. 0.590 sur notre production LumiĂšre et 0.682 AWS et GCP n'ont pas de produit Ă©quivalent; Azure propose 33 locaux sans publier des chiffres d'exactitude.

Interactive Phoneme Scoring Demo

Click on individual phonemes below to inspect acoustic scores, ARPAbet alignment, and diagnostic feedback generated at runtime.

Interactive Phoneme Inspector
Sentence Score: 90 / 100
96
She
84
sells
91
seashells
98
by
76
the
93
seashore
Active Phoneme
/ʃ/
ARPAbet: SH
Acoustic Score
98/100
PCC Confidence: 0.682 (Exceeds 0.555 Human Agreement)
Diagnostic Feedback
Native-like articulation. Formant frequencies align with canonical reference.
Context word: “She”

Pourquoi ce score est important

Traditional speech apps rely on vague sentence-level grades or subjective human reviews. Human raters only achieve a 0.555 Pearson Correlation Coefficient (PCC) with each other. Brainiall delivers objective, phone-level scoring that exceeds human agreement ceilings.

Téléphone PCC (Light)
0.590
+3.5pp au-dessus de l'homme (0.555). ensemble de 9 modĂšles, fonctionne sur la CPU.
Téléphone PCC (Prémium)
0.682
+12.7pp au-dessus de l'homme, +2.5pp au-dessus de SOTA (HIA 0.657).
La sentence du PCC
0.711
+3.6pp au-dessus de l'homme (0.675). niveau de jugement via XGBoost étiqueté sur les fonctionnalités de téléphone + parole.
Lateur P95
423ms
Niveau de lumiĂšre sur GPU partagĂ©; Premium ~530ms chaud. Les deux synchronisĂ©s — pas d'attente de batch.

L’intĂ©gration Ă  deux lignes

Envoyer de l'audio brut (base64) plus le texte attendu.Retourner par tĂ©lĂ©phone, par mot et par sentence scores — un appel HTTP, pas de streaming requis.

POST /v1/pronunciation/assessJSON / Base64 Audio
curl -X POST https://api.brainiall.com/v1/pronunciation/assess \
  -H "Authorization: Bearer $BRAINIALL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "audio": "<base64-wav-or-mp3>",
    "text": "She sells seashells by the seashore",
    "tier": "premium",
    "locale": "en-US"
  }'

# Response (deterministic score breakdown):
# {
#   "sentenceScore": 86,
#   "accuracyScore": 88,
#   "fluencyScore": 84,
#   "completenessScore": 100,
#   "wordScores": [
#     { "word": "she", "score": 96, "phonemes": [{ "phone": "SH", "score": 98 }, { "phone": "IY", "score": 94 }] },
#     { "word": "sells", "score": 84, "phonemes": [{ "phone": "S", "score": 92 }, { "phone": "EH", "score": 88 }, { "phone": "L", "score": 81 }, { "phone": "Z", "score": 75 }] }
#   ],
#   "latency_ms": 382
# }

When NOT to Use Pronunciation Assessment

  • Open-ended unstructured conversations without reference text: Pronunciation scoring requires the target text to compare acoustic phonemes against canonical alignment. For freeform transcription, use our Streaming STT engine in the Audio family.
  • Clinical motor speech disorder diagnosis: While acoustic scores provide objective metrics, clinical neurological evaluations require a licensed speech-language pathologist.
  • Tonal pitch or musical singing grading: Our scoring models are optimized for natural spoken linguistic phonemes, not musical melody or operatic pitch scales.

méthodologie

Le niveau Light est un ensemble de 9 modĂšles (4× MLP + 4× XGBoost + 1× PhoneTransformer) sur les caractĂ©ristiques extraites d'un modĂšle acoustique Brainiall Speech (Edge tier) - le mĂȘme backbone que nous utilisons pour notre produit STT. Le niveau Premium ajoute un moteur Brainiall Speech (Premium) affinĂ©, avec somme pondĂ©rĂ©e apprenable sur ses 24 couches de transformateur, plus un objectif de scoring ordinal-contrastif. Tous les chiffres viennent du public mĂ©thodologie de rĂ©fĂ©rence page ; le test est Notre test public (la rĂ©fĂ©rence SOTA pour la prononciation L2 en anglais).

prix

Le niveau Light atteint une qualitĂ© de production avec infĂ©rence CPU ; le niveau Premium utilise un moteur Brainiall Speech (Premium) affinĂ© pour la plus haute prĂ©cision publiĂ©e sur notre ensemble d'essai public. RĂšgle de rĂ©duction : 50% sous la moyenne du marchĂ© lorsque notre qualitĂ© est supĂ©rieure — ce qui est le cas, sur les deux niveaux.

libre

0 €/mo

100 minutes/mois · Light tier · Gratuit pour toujours

Démarrage

19 € / mois

1000 minutes/mois · Niveau de lumiÚre · Paroles + scores de phrase

Pro

99 € / mois

10 000 minutes/mois · Light + Premium · Scores de niveau téléphonique · 99.5% SLA

Les affaires

299 € / mois

50 000 minutes/mois · Capacité dédiée · Ligne directe au fondateur

Prononciation, plus cohérente que les humains

Integrate phoneme-accurate speech scoring in minutes with instant API key issuance and zero monthly minimum.

Démarrer l'essai gratuit
Brainiall Pronunciation — PCC tĂ©lĂ©phonique 0.59 / 0.68 (plus humain) · Brainiall | Brainiall