Transcrição em tempo real

Fale e o texto já está lá.

Pontuação, parágrafos e a separação de quem falou o quê, no mesmo instante, com o vocabulário do seu negócio. Abaixo de 300 ms mesmo com ruído de fundo.

<300 msdo fim da fala ao texto
40+idiomas e variantes
10vozes separadas por gravação
Transcrevendo · 3 participantes00:00
Latência do trecho
0 ms150 ms300 ms
pt-BRSeparação de locutor ligadaPontuação automática
O caminho do áudio

Como 368 ms de espera viraram zero

O ganho não veio de um modelo mais rápido. Veio de parar de fazer as etapas em fila indiana.

1

Detecção de fala

Um detector por energia acompanha o áudio quadro a quadro e sabe quando a frase fechou. É o único ajuste que se sente na conversa: apertar demais corta quem pausa para pensar.

400 ms
2

Reconhecimento especulativo

Aos 200 ms de silêncio o reconhecimento já dispara, em paralelo com o resto da detecção. Quando o detector confirma que a frase acabou, o texto já voltou.

0 ms percebido
3

Pontuação e parágrafo

Vírgula, ponto, interrogação e quebra de parágrafo saem do próprio reconhecimento. Não é um segundo passe de correção, seria mais um tempo de ida e volta.

incluído
4

Separação de locutor

Cada trecho ganha dono pelas características da voz. Renomear Locutor 1 uma vez ensina a plataforma para as próximas gravações.

fora do caminho
5

Vocabulário do seu negócio

Antes de entregar, os termos que você ensinou são conferidos: e-CNPJ, SoluxID, o nome do seu produto, o sobrenome do seu cliente.

1,5 ms

A ordem importa: as duas primeiras etapas se sobrepõem de propósito. Fazer o reconhecimento só depois de o detector fechar a frase é o que custava os 368 ms que sumiram.

400 ms
Silêncio que fecha a frase

Configurável. Menos responde mais rápido e corta quem pensa alto.

0 ms
Custo do reconhecimento

Ele roda em paralelo com o fim da detecção: o tempo já foi pago.

1.217 ms
Turno completo, ponta a ponta

Mediana medida de ouvir, entender e começar a responder.

40+
Idiomas e variantes

Com troca de idioma detectada no meio da conversa.

Ruído de fundo não é desculpa

Ar-condicionado, teclado, a rua pela janela, duas pessoas conversando na mesa ao lado. O reconhecimento foi ajustado com áudio real de escritório brasileiro, não com estúdio.

No navegador, a supressão de ruído e o cancelamento de eco do próprio sistema entram antes de nós, e como não há eco de linha para tratar, o limiar pode ser mais sensível. Quem fala baixo continua sendo ouvido, em vez de ser engolido por um limiar alto.

  • Não decapita a primeira palavra: os últimos 200 ms antes do início da fala entram no buffer. Sem isso, “Oi, tudo bem?” virava “Maravilha, tudo bem?”.
  • Não transcreve a si mesma: num atendimento por voz, a plataforma sabe quando a própria fala ainda está tocando e sobe o limiar nessa janela.
  • Fala de fundo não abre turno: a conversa da mesa ao lado é registrada como ambiente, não como participante.
Sala

…então o contrato da Kroma vence dia dez.

Ruído

ar-condicionado · teclado · rua

Sinal sobre ruído+18 dB

Quem falou o quê, sem microfone por pessoa

A separação é por voz, não por canal. Um celular no meio da mesa basta: quatro pessoas no mesmo áudio saem em quatro blocos identificados.

Você renomeia Locutor 1 para Ana uma vez. Da próxima gravação em diante, a Ana já vem com nome, e a busca por “tudo que a Ana disse sobre preço” passa a existir.

Ana

Fechamos o mês com quatrocentos e doze certificados.

Rafael

Desses, quantos foram e-CNPJ?

Marina

Duzentos e oitenta e sete.

Um microfone. Três pessoas. Três blocos.

Exportação

Sai no formato que o seu fluxo já usa

FormatoTraz o quêServe para
TXTTexto corrido com parágrafosColar num documento, num e-mail, num chamado
DOCXTexto com locutor em negrito e marcas de tempoAta para revisar e assinar
SRTBlocos numerados com entrada e saídaYouTube, Vimeo, editores de vídeo
VTTIgual ao SRT, com posicionamento e estiloPlayer HTML5, streaming na web
JSONPalavra a palavra, com confiança e milissegundoBusca dentro do áudio, análise, seu próprio player
CSVUma linha por trecho: início, fim, locutor, textoPlanilha, BI, auditoria
{
  "idioma": "pt-BR",
  "duracao_ms": 2547310,
  "locutores": [{ "id": "L1", "nome": "Ana" }],
  "trechos": [
    {
      "inicio_ms": 4120, "fim_ms": 7480,
      "locutor": "L1", "confianca": 0.97,
      "texto": "Fechamos o mês com 412 certificados emitidos.",
      "palavras": [
        { "t": "Fechamos", "inicio_ms": 4120, "conf": 0.99 }
      ]
    }
  ]
}
1
00:00:04,120 --> 00:00:07,480
Ana: Fechamos o mês com 412 certificados emitidos.

2
00:00:07,900 --> 00:00:10,240
Rafael: Desses, quantos foram e-CNPJ pela videoconferência?
const ws = new WebSocket(
  "wss://api.voicespeak.app/v1/transcrever?idioma=pt-BR&locutores=auto",
  ["bearer", chave]
)

ws.onmessage = (e) => {
  const t = JSON.parse(e.data)
  // parcial chega enquanto a pessoa fala; final quando a frase fecha
  if (t.tipo === "final") escrever(t.locutor, t.texto)
}

// áudio cru: PCM 16 bits, 16 kHz, mono
ws.send(pedacoDeAudio)
Na prática

Quem usa, e para quê

Reuniões e comitês

A ata deixa de depender de quem se ofereceu para anotar. Todo mundo participa da conversa em vez de digitar durante ela.

Entrevistas e pesquisa

Duas horas de entrevista viram texto pesquisável em minutos, com cada fala apontando o segundo exato do áudio.

Atendimento e qualidade

Cem ligações transcritas por dia, com busca por termo. “Quantas vezes prometemos prazo de 24 h?” vira uma consulta.

Aulas e treinamentos

Conteúdo falado vira material lido, e acessível a quem não ouve, sem alguém legendando à mão.

Ditado e notas

Pensar em voz alta no carro e chegar com o texto pronto. É o uso mais banal e o que mais gente mantém.

Conformidade

Registro do que foi dito, com hora, participante e áudio original guardado pelo prazo que você definir.

Perguntas frequentes

Os 300 ms valem para qualquer áudio?
Não. O número vale para áudio em streaming a 16 kHz com conexão estável: microfone de headset, celular, ou o áudio de uma sala de reunião com captação decente. Arquivo enviado depois é processado em lote e a fila manda no tempo. Ligação telefônica trafega em 8 kHz por limitação da rede, não nossa: o texto sai igualmente bom, mas o piso de latência é outro.
Como funciona a separação de quem falou?
Por características da voz, não por microfone. Isso significa que funciona numa gravação de celular no meio da mesa, com todo mundo no mesmo canal. Você renomeia Locutor 1 para Ana uma vez e a plataforma passa a reconhecê-la nas gravações seguintes da mesma conta.
O áudio é usado para treinar modelos?
Não. Seu áudio e seu texto não entram em treinamento de modelo nenhum, nem nosso, nem de fornecedor. No plano Business você configura a retenção, inclusive zero retenção, em que nada é gravado depois que a transcrição é entregue. Está escrito na Política de Privacidade, não só aqui.
Dá para transcrever uma chamada do Meet, Zoom ou Teams?
Sim. O VoiceSpeak entra na reunião como participante e transcreve o que ouve, ou recebe o áudio pela gravação da própria plataforma quando você prefere não ter um convidado a mais na sala. Ver Integrações.
Quantos participantes ele separa?
Até dez vozes distintas com boa margem. Acima disso a precisão cai, principalmente quando duas pessoas têm timbre parecido e falam por cima uma da outra. Numa reunião grande, o resultado costuma ser melhor se cada pessoa estiver no próprio canal de áudio.
E se alguém falar em outro idioma no meio?
Ele acompanha. A troca de idioma no meio da frase é detectada e o trecho sai no idioma em que foi dito, marcado como tal. É útil em reunião com fornecedor estrangeiro, em que o preço vem em inglês e o resto da conversa é em português.

Duas horas de áudio, sem cartão

Crie a conta, grave qualquer coisa e veja o texto aparecer. Se não servir, você fechou a aba e não gastou nada.

Precisa de volume, contrato e residência de dados? Fale com o time.