ブレイニアの声 (プロ・テア)
ゼロショットクローニング、感情コントロール、および99言語カバーを備えたプレミアム音声合成 スタジオ品質48kHz出力 リアルタイムの音声エージェントのためのSub-500ms TTFT。 平等品質で ElevenLabs Multilingual v2 より 83% 安い。
Interactive Speech Synthesis & Cloning Demo
Switch presets to test audio dynamic range, language prosody, and streaming time-to-first-byte (TTFT).
The Voice Infrastructure Problem
Traditional speech synthesis forces developers to choose between robotic low-quality endpoints or exorbitant per-character enterprise rates ($0.18 per 1K characters) that break conversational agent unit economics. Brainiall Voice provides uncompressed 48 kHz studio PCM, instant zero-shot voice cloning, and sub-500ms streaming chunks starting at $0.008 per 1K characters.
二分の三、一の API 表面
Brainiall Voice は単一の端点として、2 つの質のテアが要求に応じて選択されます。 tier デフォルト:デフォルト edge (12英語の音、24kHz、~150msの遅延)。 トップ > プロ > クローニング、感情コントロール、99言語、および48kHzのスタジオパフォーマンスは、選択するリクエストのみで請求されます。
デフォルト(デフォルト)
12 クリーート英語の音、24 kHz モノ、 ~150 ms TTFT. CPU フレンドリーな概要、市場で最も安価な生産品質の音。
プレミアム(プレミアム)
ゼロショット音声クローニング、感情コントロール、99言語、48kHzスタジオ出力。 ~500ms TTFT ストリーミングチューン. オーディオブック、ブランド音声、ダビング、音声エージェントのためのダウンイン。
Quickstart - 2 つのリクエストで声をクローンする
Clone a voice identity and generate audio in two simple HTTP requests.
# 1. Create a voice clone from a 5-second reference audio clip
curl -X POST https://api.brainiall.com/v1/voice/clones \
-H "Authorization: Bearer $BRAINIALL_KEY" \
-F "name=brand_spokesperson" \
-F "audio=@reference_5s.wav"
# -> { "voice_id": "vc_a3f92b", "name": "brand_spokesperson", "ready": true }
# 2. Synthesize natural speech with emotional style directive
curl -X POST https://api.brainiall.com/v1/tts/synthesize \
-H "Authorization: Bearer $BRAINIALL_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "Welcome to our global platform launch.",
"voice": "vc_a3f92b",
"tier": "pro",
"language": "en",
"style": "warm",
"format": "wav_48khz"
}' \
--output speech.wav正直なセクション - プロテアがやらないこと
- 歌やミュージカル演奏。: プロレベルは自然なスピーチをターゲットにします ピッチコントロールはSSMLを通じて
「プロソディー」歌ってますが、メロディックな歌ではありません。 - リアルタイム サブ100ms TTFT: プロレベルのストリームは ~500 ms TTFT で割り当てられます. エージェントの使用の場合には、最初の音声フレーム <200 ms を必要とする場合は、Edge レベル (~150 ms TTFT) を使用します。
- 公衆人物や著作権を有する声のクローン化。: 音声クローンは、ソーススピーカーの書面による同意を必要とします(クローン作成中に認証フォームを通じて確認)。公衆人物の声、財産の同意なしで亡くなった人々の声、著作権メディアのキャラクターは、測定層にブロックされます。
- 100パーセントの実感的な結論: ☆☆☆☆
styleパラメーターは指令であり、保証ではありません - 極端な状態(テロ、エクスタシー)は、不幸な生産を避けるために、屈辱的な自然主義的解釈に向かって傾いている。 - Sub-1 s は現在のCPU フライトの端から端へ。: 上記のストリーミングタイム・ファースト・ビット番号(~150 ms Edge、~500 ms Pro)は、最初のオーディオチャンクがサーバーを離れるとき、完全な出力がリリースされるときではなく、説明します。 3.8 s 頻繁に再利用されたコンテンツ(IVR プロンプト、アプリ 警告、音声 エージェント キャニード 回答)のために、あなたの側にリリースされたオーディオをキャッシュします - 第二のヒットは、ファイル フェッチではなく合成です。
Verified Performance & Methodology
All latency measurements reflect bare-metal dedicated GPU clusters with direct HTTP chunked transfer. Read full metrics on our Benchmark Methodology page.
価格
エンドレイヤー
1K 文字 · 12 英語の音 · 24 kHz · ~150 ms TTFT
プロレベル
1K キャラクター · クローニング + 感情コントロール · 99 言語 · 48 kHz · ~500 ms TTFT
音声クローン
フラット料金 クローンごとに · 保存 90 日間 · クローンごとに無制限の合成
ボリュームテア
10M+ キャラクター/月 · 割り当て率 · 多地域 SLA · sales@brainiall.com