Por que as legendas automáticas quebram em pontos estranhos
Por que legendas automáticas quebram em pontos estranhos e como o CaptionBolt cria um rascunho legível que você ainda pode ajustar no Editor.

Kevin Li

Tem algo que me incomodou por meses.
Você sobe um vídeo onde alguém diz: "Eu fui ao mercado ontem comprar alguns ovos."
Um divisor de legendas baseado em uma quantidade fixa de palavras pode separar assim:
Linha 1: "Eu fui ao"
Linha 2: "mercado ontem"
Linha 3: "comprar alguns ovos"
Leia de novo. "Eu fui ao" — ao quê? Seu cérebro precisa segurar esse fragmento na memória de trabalho até a próxima linha aparecer. É como ler um livro onde alguém cortou cada linha com tesoura em intervalos aleatórios.
Esse é o problema de segmentação de legendas. Ele pode passar despercebido em uma demonstração curta, mas fica evidente quando uma frase é interrompida antes de a pessoa ter contexto suficiente. É um dos motivos para tratarmos legendas como um fluxo de edição, não como uma transcrição colada sobre o vídeo.
Por Que É Mais Difícil Do Que Parece
Dividir a cada número fixo de palavras é consistente, mas costuma criar fragmentos estranhos. A pontuação oferece pontos melhores, embora a pontuação gerada a partir da fala nem sempre seja perfeita. O tempo também ajuda: uma pausa clara pode indicar uma quebra natural, enquanto uma respiração rápida talvez não.
O trabalho prático é equilibrar esses sinais com um tamanho confortável de ler. Nenhuma regra automática funciona para todos os falantes, idiomas e ritmos, por isso o resultado precisa continuar fácil de editar.
O Que Usamos Hoje
Melhoramos a segmentação em torno de alguns sinais simples e verificáveis:
Pontuação quando disponível. Um fim de frase claro é um bom candidato de quebra. Não presumimos que todo sinal gerado esteja correto.
Pausas evidentes no tempo. Um intervalo significativo entre palavras pode servir de alternativa quando falta pontuação.
Um limite rígido para o tamanho do bloco. O segmentador atual divide quando um bloco montado atinge ou ultrapassa 60 caracteres. Pontuação ou pausa ainda podem produzir fragmentos curtos; por isso, o resultado continua editável em vez de ser apresentado como definitivo.
O Editor dá a palavra final. A segmentação é um primeiro rascunho. Antes de exportar, você pode corrigir o texto e dividir ou unir blocos quando a fala pedir algo diferente.
Antes / Depois
Mesma transcrição, algoritmo antigo vs. novo:
Antes:
"Então o que eu tenho"
"feito ultimamente é trabalhar"
"nesse novo projeto"
"que estou muito animado"
Depois:
"Então o que eu tenho feito ultimamente"
"é trabalhar nesse novo projeto"
"que estou muito animado"
A diferença parece pequena no texto. Neste exemplo, o agrupamento revisado é mais fácil de acompanhar no ritmo da fala porque cada bloco carrega uma frase mais completa. Ainda é um exemplo, não uma promessa de que uma regra produzirá a melhor quebra para toda pessoa ou idioma.
Por que o problema é fácil de não perceber
Demonstrações curtas costumam ter falas ensaiadas e poucos blocos de legenda. Uma fala mais longa e menos roteirizada expõe mais combinações de pontuação, pausas e limites de frase, tornando as quebras estranhas mais fáceis de notar.
Percebemos esse padrão ao testar o CaptionBolt em nossos próprios clipes e ajustamos o segmentador com sinais explícitos que podíamos inspecionar. A lógica atual usa, nesta ordem, pontuação de fim de frase, pausas superiores a 300 ms, pontuação de oração e um limite rígido de 60 caracteres.
Novos envios já usam essa segmentação. Trate o resultado como um primeiro rascunho editável: revise no Editor e divida ou una qualquer bloco que não acompanhe bem a fala.
Leituras relacionadas
Se quiser ver o lado prático desse problema, leia como adicionar legendas a um vídeo ou como editar arquivos SRT. Para corrigir na prática, use o gerador automático de legendas e o editor de legendas.


