Zum Hauptinhalt springen
Brainiall
0.682 PCC · Telefonspiegel, die die menschliche Vereinbarung überschreiten

Brainiall Pronunciation
Telefonspiegel, die die menschliche Vereinbarung überschreiten

Die einzige kommerzielle Aussprache API, in der das Modell konsistent ist als trainierte menschliche Raters. 0.590 auf unserer Produktion Licht-Tier und 0.682 auf dem Premium-Fine-Tuned-Level – beide über dem 0.555 Inter-Notator-Gebäude auf unserem öffentlichen Testset. AWS und GCP haben kein gleichwertiges Produkt; Azure bietet 33 Standorte ohne präzise Zahlen zu veröffentlichen.

Interactive Phoneme Scoring Demo

Click on individual phonemes below to inspect acoustic scores, ARPAbet alignment, and diagnostic feedback generated at runtime.

Interactive Phoneme Inspector
Sentence Score: 90 / 100
96
She
84
sells
91
seashells
98
by
76
the
93
seashore
Active Phoneme
/ʃ/
ARPAbet: SH
Acoustic Score
98/100
PCC Confidence: 0.682 (Exceeds 0.555 Human Agreement)
Diagnostic Feedback
Native-like articulation. Formant frequencies align with canonical reference.
Context word: “She

Warum diese Werte wichtig sind

Traditional speech apps rely on vague sentence-level grades or subjective human reviews. Human raters only achieve a 0.555 Pearson Correlation Coefficient (PCC) with each other. Brainiall delivers objective, phone-level scoring that exceeds human agreement ceilings.

Telefon PCC (Licht)
0.590
+3.5pp über dem menschlichen (0.555). 9-Modell ensemble, läuft auf CPU.
Telefon PCC (Premium)
0.682
+12.7pp über den Menschen, +2.5pp über SOTA (HIA 0.657). Premium-Tier feinabgestimmt auf dem Brainiall Speech (Premium)-Motor.
Strafe der PCC
0.711
+3.6pp über menschlich (0.675). Urteilsgrad über XGBoost über Telefon+Word-Funktionen.
Verzögerung P95
423ms
Lichtstufe auf geteilter GPU; Premium ~530ms warm. Beide synchronisieren — keine batch warten.

Zwei-Linie-Integration

Send raw audio (base64) plus den erwarteten text. Get back per-phone, per-word and per-sentence scores — one HTTP call, no streaming required.

POST /v1/pronunciation/assessJSON / Base64 Audio
curl -X POST https://api.brainiall.com/v1/pronunciation/assess \
  -H "Authorization: Bearer $BRAINIALL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "audio": "<base64-wav-or-mp3>",
    "text": "She sells seashells by the seashore",
    "tier": "premium",
    "locale": "en-US"
  }'

# Response (deterministic score breakdown):
# {
#   "sentenceScore": 86,
#   "accuracyScore": 88,
#   "fluencyScore": 84,
#   "completenessScore": 100,
#   "wordScores": [
#     { "word": "she", "score": 96, "phonemes": [{ "phone": "SH", "score": 98 }, { "phone": "IY", "score": 94 }] },
#     { "word": "sells", "score": 84, "phonemes": [{ "phone": "S", "score": 92 }, { "phone": "EH", "score": 88 }, { "phone": "L", "score": 81 }, { "phone": "Z", "score": 75 }] }
#   ],
#   "latency_ms": 382
# }

When NOT to Use Pronunciation Assessment

  • Open-ended unstructured conversations without reference text: Pronunciation scoring requires the target text to compare acoustic phonemes against canonical alignment. For freeform transcription, use our Streaming STT engine in the Audio family.
  • Clinical motor speech disorder diagnosis: While acoustic scores provide objective metrics, clinical neurological evaluations require a licensed speech-language pathologist.
  • Tonal pitch or musical singing grading: Our scoring models are optimized for natural spoken linguistic phonemes, not musical melody or operatic pitch scales.

Methodologie

Die Light-Tier ist ein 9-Modell-Ensemble (4× MLP + 4× XGBoost + 1× PhoneTransformer) über Funktionen, die aus einem Brainiall Speech (Edge-Tier) akustischen Modell extrahiert werden - dasselbe Backbone, das wir für unser STT-Produkt verwenden. Die Premium-Tier fügt einen feinabgestimmten Brainiall Speech (Premium)-Motor hinzu, mit lernbarer gewichteter Summe über seine 24 Transformer-Schichten, plus einem ordinal-kontrastiven Scoring-Ziel. Benchmark Methodologie Seite; der Testsatz ist Unser öffentliches Test Set (Die SOTA-Referenz für L2-Englisch Aussprache).

Preise

Light-Level erreicht Produktionsqualität mit CPU-Inferenz; Premium-Level verwendet einen feinabgestimmten Brainiall Speech (Premium)-Motor für die höchste veröffentlichte Genauigkeit auf unserem öffentlichen Testset. Rabattregel: 50% unter dem Marktdurchschnitt, wenn unsere Qualität überlegen ist - was sie ist, auf beiden Ebenen.

Freie

1 € / €

100 Minuten/Monat · Light tier · Forever free

Starten

19 € / Monat

1000 Minuten/Monat · Licht-Ebene · Wörter + Satzpunkte

Pro

$99 / Monat

10.000 Minuten/Monat · Licht + Premium · Telefonspiegel · 99.5% SLA

Geschäfte

299 € / Monat

50.000 Minuten/Monat · Dedizierte Kapazität · Direkt an den Gründer

Aussprache, die konsistenter als Menschen geschätzt wurde

Integrate phoneme-accurate speech scoring in minutes with instant API key issuance and zero monthly minimum.

Freie API-Schlüssel erhalten
Brainiall Pronunciation — Telefon PCC 0.59 / 0.68 (über Mensch) · Brainiall | Brainiall