Brainiall Voice (nível Pro)
Síntese de voz premium com clonagem zero-shot, controle emocional e cobertura de 99 idiomas. Saída de qualidade de estúdio em 48 kHz. TTFT abaixo de 500 ms para agentes de voz em tempo real. Até 83% mais barato que o ElevenLabs Multilingual v2 com qualidade equivalente.
Interactive Speech Synthesis & Cloning Demo
Switch presets to test audio dynamic range, language prosody, and streaming time-to-first-byte (TTFT).
The Voice Infrastructure Problem
Traditional speech synthesis forces developers to choose between robotic low-quality endpoints or exorbitant per-character enterprise rates ($0.18 per 1K characters) that break conversational agent unit economics. Brainiall Voice provides uncompressed 48 kHz studio PCM, instant zero-shot voice cloning, and sub-500ms streaming chunks starting at $0.008 per 1K characters.
Dois níveis, uma única API
Brainiall Voice é entregue como um único endpoint com dois níveis de qualidade selecionados por requisição via o tier parâmetro. O padrão é edge (12 vozes em inglês, 24 kHz, ~150 ms de latência). tier="pro" para clonagem, controle emocional, 99 idiomas e saída de estúdio em 48 kHz — cobrado apenas em requisições que ativarem.
Nível Edge (padrão)
12 vozes em inglês selecionadas, 24 kHz mono, ~150 ms TTFT. Inferência amigável à CPU, a voz com qualidade de produção mais barata do mercado. Plug-and-play para TTS in-app, URA e alertas.
Nível Pro (premium)
Clonagem de voz zero-shot, controle emocional, 99 idiomas, saída de estúdio 48 kHz. ~500 ms TTFT com streaming em chunks. Pronto para audiobooks, vozes de marca, dublagem e agentes de voz.
Quickstart – clone uma voz em duas solicitações
Clone a voice identity and generate audio in two simple HTTP requests.
# 1. Create a voice clone from a 5-second reference audio clip
curl -X POST https://api.brainiall.com/v1/voice/clones \
-H "Authorization: Bearer $BRAINIALL_KEY" \
-F "name=brand_spokesperson" \
-F "audio=@reference_5s.wav"
# -> { "voice_id": "vc_a3f92b", "name": "brand_spokesperson", "ready": true }
# 2. Synthesize natural speech with emotional style directive
curl -X POST https://api.brainiall.com/v1/tts/synthesize \
-H "Authorization: Bearer $BRAINIALL_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "Welcome to our global platform launch.",
"voice": "vc_a3f92b",
"tier": "pro",
"language": "en",
"style": "warm",
"format": "wav_48khz"
}' \
--output speech.wavSeção Honestidade — o que o nível Pro NÃO faz
- Canto ou performance musical.: O nível Pro foca em fala natural. Controle de pitch via SSML
productsVoicePro.prosodyé suportado, mas não canto melódico. - Em tempo real sub-100 ms TTFT.: O nível Pro transmite chunks com TTFT de ~500 ms. Para casos de uso de agente que exigem primeiro frame de áudio em <200 ms, use o nível Edge (TTFT ~150 ms).
- Clonagem de voz de figuras públicas ou vozes protegidas por direitos autorais.: Clones de voz exigem consentimento escrito do locutor original (verificado via formulário de atestado durante a criação do clone). Vozes de figuras públicas, pessoas falecidas sem consentimento do espólio e personagens de mídia protegida por direitos autorais são bloqueadas na camada de moderação.
- Inferência emocional 100% factual.: O
styleO parâmetro é uma diretiva, não uma garantia — estados extremos (terror, êxtase) tendem a interpretações naturalistas contidas para evitar saídas estranhas (uncanny). - Inferior a 1 s ponta a ponta na frota atual de CPU.: Os números de time-to-first-byte de streaming acima (~150 ms Edge, ~500 ms Pro) descrevem quando o primeiro chunk de áudio sai do servidor, não quando o enunciado completo é renderizado. Na frota de CPU, uma frase curta em cache termina a síntese em aproximadamente 3.8 s e textos mais longos escalam com o comprimento. Para conteúdo reutilizado com frequência (prompts de URA, alertas de app, respostas prontas de agentes de voz), faça cache do áudio renderizado do seu lado — o segundo acesso passa a ser um fetch de arquivo, não uma síntese.
Verified Performance & Methodology
All latency measurements reflect bare-metal dedicated GPU clusters with direct HTTP chunked transfer. Read full metrics on our Benchmark Methodology page.
Preço
Nível Edge
por 1K caracteres · 12 vozes em inglês · 24 kHz · ~150 ms TTFT
Nível Pro
por 1K caracteres · clonagem + controle emocional · 99 idiomas · 48 kHz · ~500 ms TTFT
Clone de voz
taxa fixa por clone · armazenado por 90 dias · síntese ilimitada a partir de cada clone
Faixa de volume
10M+ caracteres/mês · taxa dedicada · SLA multi-região · sales@brainiall.com