メインコンテンツへスキップ
99 Languages · 48 kHz Studio PCM · 5s Voice Clone

ブレイニアの声 (プロ・テア)

ゼロショットクローニング、感情コントロール、および99言語カバーを備えたプレミアム音声合成 スタジオ品質48kHz出力 リアルタイムの音声エージェントのためのSub-500ms TTFT。 平等品質で ElevenLabs Multilingual v2 より 83% 安い。

Interactive Speech Synthesis & Cloning Demo

Switch presets to test audio dynamic range, language prosody, and streaming time-to-first-byte (TTFT).

Live Neural Synthesis & Voice Clone Inspector
Output: 48 kHz · 24-bit PCM
Input Text:
Chapter 12: In the quiet corridors of the research lab, the signals began to align.
Voice Style Directive
Stream TTFT Latency
160ms
Streaming chunks delivered over HTTP chunked transfer
Acoustic Characteristics
48 kHz PCM output with rich acoustic dynamic range and deep timbre.
Target Locale: en
# Synthesize audio with style directive + cloned voice curl -X POST https://api.brainiall.com/v1/tts/synthesize \ -H "Authorization: Bearer $BRAINIALL_KEY" \ -H "Content-Type: application/json" \ -d '{ "text": "Chapter 12: In the quiet corridors of the research lab, the signals began to align.", "voice": "vc_narrator_48k", "tier": "pro", "language": "en", "style": "warm", "format": "wav_48khz" }' \ --output output.wav

The Voice Infrastructure Problem

Traditional speech synthesis forces developers to choose between robotic low-quality endpoints or exorbitant per-character enterprise rates ($0.18 per 1K characters) that break conversational agent unit economics. Brainiall Voice provides uncompressed 48 kHz studio PCM, instant zero-shot voice cloning, and sub-500ms streaming chunks starting at $0.008 per 1K characters.

Edge Tier Rate
$0.008
per 1K characters (~150ms TTFT)
Pro Tier Rate
$0.029
per 1K characters (48 kHz PCM + Cloning)
Language Support
99
Native cross-lingual prosody
Audio Resolution
48 kHz
24-bit uncompressed PCM output

二分の三、一の API 表面

Brainiall Voice は単一の端点として、2 つの質のテアが要求に応じて選択されます。 tier デフォルト:デフォルト edge (12英語の音、24kHz、~150msの遅延)。 トップ > プロ > クローニング、感情コントロール、99言語、および48kHzのスタジオパフォーマンスは、選択するリクエストのみで請求されます。

デフォルト(デフォルト)

12 クリーート英語の音、24 kHz モノ、 ~150 ms TTFT. CPU フレンドリーな概要、市場で最も安価な生産品質の音。

✓ Sub-150ms latency · 24 kHz · English optimized

プレミアム(プレミアム)

ゼロショット音声クローニング、感情コントロール、99言語、48kHzスタジオ出力。 ~500ms TTFT ストリーミングチューン. オーディオブック、ブランド音声、ダビング、音声エージェントのためのダウンイン。

✓ 5s zero-shot clone · 99 languages · 48 kHz studio audio

Quickstart - 2 つのリクエストで声をクローンする

Clone a voice identity and generate audio in two simple HTTP requests.

POST /v1/voice/clones & POST /v1/tts/synthesizecURL Integration
# 1. Create a voice clone from a 5-second reference audio clip
curl -X POST https://api.brainiall.com/v1/voice/clones \
  -H "Authorization: Bearer $BRAINIALL_KEY" \
  -F "name=brand_spokesperson" \
  -F "audio=@reference_5s.wav"
# -> { "voice_id": "vc_a3f92b", "name": "brand_spokesperson", "ready": true }

# 2. Synthesize natural speech with emotional style directive
curl -X POST https://api.brainiall.com/v1/tts/synthesize \
  -H "Authorization: Bearer $BRAINIALL_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Welcome to our global platform launch.",
    "voice": "vc_a3f92b",
    "tier": "pro",
    "language": "en",
    "style": "warm",
    "format": "wav_48khz"
  }' \
  --output speech.wav

正直なセクション - プロテアがやらないこと

  • 歌やミュージカル演奏。: プロレベルは自然なスピーチをターゲットにします ピッチコントロールはSSMLを通じて 「プロソディー」 歌ってますが、メロディックな歌ではありません。
  • リアルタイム サブ100ms TTFT: プロレベルのストリームは ~500 ms TTFT で割り当てられます. エージェントの使用の場合には、最初の音声フレーム <200 ms を必要とする場合は、Edge レベル (~150 ms TTFT) を使用します。
  • 公衆人物や著作権を有する声のクローン化。: 音声クローンは、ソーススピーカーの書面による同意を必要とします(クローン作成中に認証フォームを通じて確認)。公衆人物の声、財産の同意なしで亡くなった人々の声、著作権メディアのキャラクターは、測定層にブロックされます。
  • 100パーセントの実感的な結論: ☆☆☆☆ style パラメーターは指令であり、保証ではありません - 極端な状態(テロ、エクスタシー)は、不幸な生産を避けるために、屈辱的な自然主義的解釈に向かって傾いている。
  • Sub-1 s は現在のCPU フライトの端から端へ。: 上記のストリーミングタイム・ファースト・ビット番号(~150 ms Edge、~500 ms Pro)は、最初のオーディオチャンクがサーバーを離れるとき、完全な出力がリリースされるときではなく、説明します。 3.8 s 頻繁に再利用されたコンテンツ(IVR プロンプト、アプリ 警告、音声 エージェント キャニード 回答)のために、あなたの側にリリースされたオーディオをキャッシュします - 第二のヒットは、ファイル フェッチではなく合成です。

Verified Performance & Methodology

All latency measurements reflect bare-metal dedicated GPU clusters with direct HTTP chunked transfer. Read full metrics on our Benchmark Methodology page.

価格

エンドレイヤー

$0.008

1K 文字 · 12 英語の音 · 24 kHz · ~150 ms TTFT

プロレベル

$0.029

1K キャラクター · クローニング + 感情コントロール · 99 言語 · 48 kHz · ~500 ms TTFT

音声クローン

$0.50

フラット料金 クローンごとに · 保存 90 日間 · クローンごとに無制限の合成

ボリュームテア

カスタマイズ

10M+ キャラクター/月 · 割り当て率 · 多地域 SLA · sales@brainiall.com

声をクローンする準備はできていますか?

Start synthesizing studio-quality audio with zero monthly commitments.

Try Growth plan
Brainiall Voice(プロレベル) - 音声クローン付きプレミアムTTS · Brainiall | Brainiall