Fale e o texto já está lá.
Pontuação, parágrafos e a separação de quem falou o quê, no mesmo instante, com o vocabulário do seu negócio. Abaixo de 300 ms mesmo com ruído de fundo.
Como 368 ms de espera viraram zero
O ganho não veio de um modelo mais rápido. Veio de parar de fazer as etapas em fila indiana.
Detecção de fala
Um detector por energia acompanha o áudio quadro a quadro e sabe quando a frase fechou. É o único ajuste que se sente na conversa: apertar demais corta quem pausa para pensar.
Reconhecimento especulativo
Aos 200 ms de silêncio o reconhecimento já dispara, em paralelo com o resto da detecção. Quando o detector confirma que a frase acabou, o texto já voltou.
Pontuação e parágrafo
Vírgula, ponto, interrogação e quebra de parágrafo saem do próprio reconhecimento. Não é um segundo passe de correção, seria mais um tempo de ida e volta.
Separação de locutor
Cada trecho ganha dono pelas características da voz. Renomear Locutor 1 uma vez ensina a plataforma para as próximas gravações.
Vocabulário do seu negócio
Antes de entregar, os termos que você ensinou são conferidos: e-CNPJ, SoluxID, o nome do seu produto, o sobrenome do seu cliente.
A ordem importa: as duas primeiras etapas se sobrepõem de propósito. Fazer o reconhecimento só depois de o detector fechar a frase é o que custava os 368 ms que sumiram.
Configurável. Menos responde mais rápido e corta quem pensa alto.
Ele roda em paralelo com o fim da detecção: o tempo já foi pago.
Mediana medida de ouvir, entender e começar a responder.
Com troca de idioma detectada no meio da conversa.
Ruído de fundo não é desculpa
Ar-condicionado, teclado, a rua pela janela, duas pessoas conversando na mesa ao lado. O reconhecimento foi ajustado com áudio real de escritório brasileiro, não com estúdio.
No navegador, a supressão de ruído e o cancelamento de eco do próprio sistema entram antes de nós, e como não há eco de linha para tratar, o limiar pode ser mais sensível. Quem fala baixo continua sendo ouvido, em vez de ser engolido por um limiar alto.
- Não decapita a primeira palavra: os últimos 200 ms antes do início da fala entram no buffer. Sem isso, “Oi, tudo bem?” virava “Maravilha, tudo bem?”.
- Não transcreve a si mesma: num atendimento por voz, a plataforma sabe quando a própria fala ainda está tocando e sobe o limiar nessa janela.
- Fala de fundo não abre turno: a conversa da mesa ao lado é registrada como ambiente, não como participante.
…então o contrato da Kroma vence dia dez.
ar-condicionado · teclado · rua
Quem falou o quê, sem microfone por pessoa
A separação é por voz, não por canal. Um celular no meio da mesa basta: quatro pessoas no mesmo áudio saem em quatro blocos identificados.
Você renomeia Locutor 1 para Ana uma vez. Da próxima gravação em diante, a Ana já vem com nome, e a busca por “tudo que a Ana disse sobre preço” passa a existir.
Fechamos o mês com quatrocentos e doze certificados.
Desses, quantos foram e-CNPJ?
Duzentos e oitenta e sete.
Um microfone. Três pessoas. Três blocos.
Sai no formato que o seu fluxo já usa
| Formato | Traz o quê | Serve para |
|---|---|---|
TXT | Texto corrido com parágrafos | Colar num documento, num e-mail, num chamado |
DOCX | Texto com locutor em negrito e marcas de tempo | Ata para revisar e assinar |
SRT | Blocos numerados com entrada e saída | YouTube, Vimeo, editores de vídeo |
VTT | Igual ao SRT, com posicionamento e estilo | Player HTML5, streaming na web |
JSON | Palavra a palavra, com confiança e milissegundo | Busca dentro do áudio, análise, seu próprio player |
CSV | Uma linha por trecho: início, fim, locutor, texto | Planilha, BI, auditoria |
{
"idioma": "pt-BR",
"duracao_ms": 2547310,
"locutores": [{ "id": "L1", "nome": "Ana" }],
"trechos": [
{
"inicio_ms": 4120, "fim_ms": 7480,
"locutor": "L1", "confianca": 0.97,
"texto": "Fechamos o mês com 412 certificados emitidos.",
"palavras": [
{ "t": "Fechamos", "inicio_ms": 4120, "conf": 0.99 }
]
}
]
}100:00:04,120 --> 00:00:07,480 Ana: Fechamos o mês com 412 certificados emitidos.200:00:07,900 --> 00:00:10,240 Rafael: Desses, quantos foram e-CNPJ pela videoconferência?
const ws = new WebSocket(
"wss://api.voicespeak.app/v1/transcrever?idioma=pt-BR&locutores=auto",
["bearer", chave]
)
ws.onmessage = (e) => {
const t = JSON.parse(e.data)
// parcial chega enquanto a pessoa fala; final quando a frase fecha
if (t.tipo === "final") escrever(t.locutor, t.texto)
}
// áudio cru: PCM 16 bits, 16 kHz, mono
ws.send(pedacoDeAudio)Quem usa, e para quê
Reuniões e comitês
A ata deixa de depender de quem se ofereceu para anotar. Todo mundo participa da conversa em vez de digitar durante ela.
Entrevistas e pesquisa
Duas horas de entrevista viram texto pesquisável em minutos, com cada fala apontando o segundo exato do áudio.
Atendimento e qualidade
Cem ligações transcritas por dia, com busca por termo. “Quantas vezes prometemos prazo de 24 h?” vira uma consulta.
Aulas e treinamentos
Conteúdo falado vira material lido, e acessível a quem não ouve, sem alguém legendando à mão.
Ditado e notas
Pensar em voz alta no carro e chegar com o texto pronto. É o uso mais banal e o que mais gente mantém.
Conformidade
Registro do que foi dito, com hora, participante e áudio original guardado pelo prazo que você definir.
Perguntas frequentes
Os 300 ms valem para qualquer áudio?
Como funciona a separação de quem falou?
O áudio é usado para treinar modelos?
Dá para transcrever uma chamada do Meet, Zoom ou Teams?
Quantos participantes ele separa?
E se alguém falar em outro idioma no meio?
Continua em
Duas horas de áudio, sem cartão
Crie a conta, grave qualquer coisa e veja o texto aparecer. Se não servir, você fechou a aba e não gastou nada.
Precisa de volume, contrato e residência de dados? Fale com o time.