Vozes sintéticas

Uma voz que respira antes de responder.

Trinta e duas vozes prontas em português, com entonação que muda conforme o assunto e o primeiro áudio saindo em 85 milissegundos. Escute a diferença no painel ao lado.

85 msaté o primeiro áudio
32vozes prontas em pt-BR
8conversas ao mesmo tempo
Tocando · Helenapt-BR
85 ms até o primeiro áudio32 vozes prontas
Latência

O número que decide é o primeiro áudio

Duas ferramentas podem levar o mesmo tempo para sintetizar uma frase inteira e soar completamente diferentes na conversa. O que separa as duas é quando o primeiro byte de som existe.

Gerar enquanto fala, não falar depois de gerar

Motores de síntese antigos precisam terminar a frase inteira antes de existir um único byte de áudio. É por isso que uma frase curta e uma frase longa têm silêncios tão diferentes: você espera pela última palavra para ouvir a primeira.

O nosso decodificador é causal: ele emite áudio enquanto ainda está gerando o resto. O começo da frase já está tocando no seu ouvido enquanto o fim ainda está sendo escrito.

Na prática, isso tirou o turno de conversa de 1.217 ms para cerca de 930 ms, abaixo de um segundo, que é o limiar em que uma pausa deixa de parecer travamento.

Síntese em bloco684 ms
Síntese em nuvem412 ms
VoiceSpeak85 ms

Tempo até o primeiro áudio, medido em execuções repetidas com a mesma frase.

85 ms
Até o primeiro áudio

Faixa observada de 85 a 134 ms. O pior caso ainda é 3× melhor que a nuvem.

930 ms
Turno completo de conversa

Da última palavra dela à primeira palavra da resposta.

8
Conversas simultâneas

Com o pior caso ainda dentro do orçamento de 300 ms.

32
Vozes prontas em português

Mais variantes de Portugal, e o catálogo cresce a cada mês.

Três camadas

O que faz soar humano

Nenhuma delas é “um modelo melhor”. São decisões sobre o que acontece com o texto antes de virar som.

1

O tom vem do momento

A entonação sai da etapa da conversa: abertura, descoberta, proposta, fechamento. Perguntar a um modelo “qual o tom desta frase?” custaria uma chamada no caminho crítico, e o caminho crítico é exatamente o silêncio que a pessoa sente.

custo: 0 ms
2

A frase vence o momento

Quando a frase é inequívoca, ela manda. Um “sinto muito” dito com entusiasmo é pior que um dito em tom neutro, e detectar isso é casamento de padrão, não inteligência artificial.

1 ms
3

O texto vira fala antes de virar som

Valores, horas, datas, CPF, CNPJ e siglas são reescritos como uma pessoa os diria. “R$ 1.290,00” é lido como valor, não como dígitos soltos.

2 ms
4

Os nomes próprios são corrigidos

A última passada troca a grafia pela que soa certo em português, e só em nomes reconhecidos como tal. O texto original continua intacto em todo o resto do sistema.

sem custo de rede

Escolha o tom na mão quando quiser

O automático acerta na maioria das vezes. Quando não acerta, você escreve como quer, em português, não em parâmetros.

“Fale devagar, em tom grave.” “Empolgada, como quem dá boa notícia.” “Contida, sem pressa.” O texto que você digitou vence a decisão automática naquela frase.

Tom automático · neutro

Seu certificado está pronto para retirada. 3,12 s

“fale com calma”

Seu certificado está pronto para retirada. 3,60 s

Ela realmente desacelera. Custo em latência: 4 ms.

A voz nunca fica muda

Uma síntese que falha no meio de um atendimento não é um erro técnico: é um cliente ouvindo silêncio na linha e desligando.

Por isso existe uma escada de motores. Se o escolhido cair, o seguinte assume, e a troca só acontece antes de qualquer coisa ter sido dita, porque refazer no meio faria o ouvinte escutar o começo duas vezes, com timbres diferentes.

Se todos falharem, o atendimento continua por texto. A síntese nunca derruba a conversa.

motor principal85 ms · em usoativo
reserva em nuvem412 ms · prontoem espera
textoúltimo recursoem espera
Na API

Como chamar

const ws = new WebSocket(
  "wss://api.voicespeak.app/v1/falar", ["bearer", chave])

ws.onopen = () => ws.send(JSON.stringify({
  voz: "helena",
  formato: "pcm_24000",      // ou ulaw_8000, mp3_44100
  tom: "acolhedor, sem pressa",
  texto: "Seu certificado está pronto. Posso confirmar a retirada?"
}))

// o primeiro pedaço chega em ~85 ms; toque assim que chegar
ws.onmessage = (e) => tocar(e.data)
curl -X POST https://api.voicespeak.app/v1/falar \
  -H "Authorization: Bearer sk_live_…" \
  -H "Content-Type: application/json" \
  -o resposta.mp3 \
  -d '{
    "voz": "otavio",
    "formato": "mp3_44100",
    "texto": "O boleto de R$ 1.290,00 vence em 22/09."
  }'

# sai falado: "mil duzentos e noventa reais", "vinte e dois de setembro"
from voicespeak import Cliente

vs = Cliente(chave="sk_live_…")

with vs.falar_stream(
    voz="beatriz",
    texto="Bom dia! Aqui é da Biz Certificadora.",
    tom="animada, como quem dá boa notícia",
) as fluxo:
    for pedaco in fluxo:
        alto_falante.write(pedaco)   # toca enquanto gera

Perguntas frequentes

Por que 85 ms importa se a frase inteira leva mais que isso?
Porque o que a pessoa sente como silêncio é o intervalo entre ela parar de falar e a voz começar. O resto do áudio chega enquanto o começo já está tocando. É por isso que medimos o primeiro áudio, e não o tempo total de síntese, são números diferentes e só um deles aparece na conversa.
A voz muda de tom conforme o assunto?
Sim, frase a frase. Acolhedora na abertura, curiosa na descoberta, contida ao falar de uma dívida, animada ao fechar. O tom vem do momento da conversa, que já é conhecido quando a voz é sintetizada, então não custa nem uma chamada extra nem um milissegundo. E quando a frase é inequívoca, ela vence o momento: um “sinto muito” não sai animado.
Quantas vozes podem falar ao mesmo tempo?
Oito conversas simultâneas ficam dentro do orçamento de 300 ms no pior caso. Acima disso a fila começa e a nona espera, ela não fica muda, fica mais lenta. Para volume maior, o plano Business dimensiona a capacidade em contrato.
Posso escrever como quero que uma frase soe?
Pode. Você escreve o tom em português, “fale devagar, em tom grave”, e ele vence o automático naquela frase. Medimos: a mesma fala sai em 3,12 s no tom neutro e 3,60 s com “fale com calma”. Ela realmente desacelera.
Números, horas e documentos saem certos?
Saem. R$ 1.290,00 vira “mil duzentos e noventa reais”, 14:30 vira “duas e meia da tarde”, e CPF e CNPJ saem em blocos, como uma pessoa dita. Sem essa camada, a voz lê “um dois nove zero” e o cliente anota o valor errado.
O que acontece se o motor de síntese falhar no meio da frase?
Ela continua falando. Há uma escada de motores por trás: se o escolhido cair, o seguinte assume, e a troca acontece antes de qualquer coisa ter sido dita, para o ouvinte não escutar o começo duas vezes com timbres diferentes. A síntese não derruba o atendimento.

Ouça a sua própria frase

Escreva qualquer texto e escute nas trinta e duas vozes. O plano gratuito já dá dez mil caracteres por mês.