Brainiall Pronunciation
Telefonspiegel, die die menschliche Vereinbarung überschreiten
Die einzige kommerzielle Aussprache API, in der das Modell konsistent ist als trainierte menschliche Raters. 0.590 auf unserer Produktion Licht-Tier und 0.682 auf dem Premium-Fine-Tuned-Level – beide über dem 0.555 Inter-Notator-Gebäude auf unserem öffentlichen Testset. AWS und GCP haben kein gleichwertiges Produkt; Azure bietet 33 Standorte ohne präzise Zahlen zu veröffentlichen.
Interactive Phoneme Scoring Demo
Click on individual phonemes below to inspect acoustic scores, ARPAbet alignment, and diagnostic feedback generated at runtime.
Warum diese Werte wichtig sind
Traditional speech apps rely on vague sentence-level grades or subjective human reviews. Human raters only achieve a 0.555 Pearson Correlation Coefficient (PCC) with each other. Brainiall delivers objective, phone-level scoring that exceeds human agreement ceilings.
Zwei-Linie-Integration
Send raw audio (base64) plus den erwarteten text. Get back per-phone, per-word and per-sentence scores — one HTTP call, no streaming required.
curl -X POST https://api.brainiall.com/v1/pronunciation/assess \
-H "Authorization: Bearer $BRAINIALL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"audio": "<base64-wav-or-mp3>",
"text": "She sells seashells by the seashore",
"tier": "premium",
"locale": "en-US"
}'
# Response (deterministic score breakdown):
# {
# "sentenceScore": 86,
# "accuracyScore": 88,
# "fluencyScore": 84,
# "completenessScore": 100,
# "wordScores": [
# { "word": "she", "score": 96, "phonemes": [{ "phone": "SH", "score": 98 }, { "phone": "IY", "score": 94 }] },
# { "word": "sells", "score": 84, "phonemes": [{ "phone": "S", "score": 92 }, { "phone": "EH", "score": 88 }, { "phone": "L", "score": 81 }, { "phone": "Z", "score": 75 }] }
# ],
# "latency_ms": 382
# }When NOT to Use Pronunciation Assessment
- Open-ended unstructured conversations without reference text: Pronunciation scoring requires the target text to compare acoustic phonemes against canonical alignment. For freeform transcription, use our Streaming STT engine in the Audio family.
- Clinical motor speech disorder diagnosis: While acoustic scores provide objective metrics, clinical neurological evaluations require a licensed speech-language pathologist.
- Tonal pitch or musical singing grading: Our scoring models are optimized for natural spoken linguistic phonemes, not musical melody or operatic pitch scales.
Methodologie
Die Light-Tier ist ein 9-Modell-Ensemble (4× MLP + 4× XGBoost + 1× PhoneTransformer) über Funktionen, die aus einem Brainiall Speech (Edge-Tier) akustischen Modell extrahiert werden - dasselbe Backbone, das wir für unser STT-Produkt verwenden. Die Premium-Tier fügt einen feinabgestimmten Brainiall Speech (Premium)-Motor hinzu, mit lernbarer gewichteter Summe über seine 24 Transformer-Schichten, plus einem ordinal-kontrastiven Scoring-Ziel. Benchmark Methodologie Seite; der Testsatz ist Unser öffentliches Test Set (Die SOTA-Referenz für L2-Englisch Aussprache).
Preise
Light-Level erreicht Produktionsqualität mit CPU-Inferenz; Premium-Level verwendet einen feinabgestimmten Brainiall Speech (Premium)-Motor für die höchste veröffentlichte Genauigkeit auf unserem öffentlichen Testset. Rabattregel: 50% unter dem Marktdurchschnitt, wenn unsere Qualität überlegen ist - was sie ist, auf beiden Ebenen.
Freie
100 Minuten/Monat · Light tier · Forever free
Starten
1000 Minuten/Monat · Licht-Ebene · Wörter + Satzpunkte
Pro
10.000 Minuten/Monat · Licht + Premium · Telefonspiegel · 99.5% SLA
Geschäfte
50.000 Minuten/Monat · Dedizierte Kapazität · Direkt an den Gründer