Texto para fala

5 de 2 avaliações

O Texto para fala é uma ferramenta gratuita que envia o teu texto e o código de idioma escolhido para um servidor, utiliza a API do tradutor da Google para gerar áudio de voz e permite ouvir o resultado.

Como transformar texto em voz?

Indica o código de idioma adequado, gera o áudio e ouve o resultado. O código informa o serviço de síntese de voz sobre a forma de interpretar e pronunciar o texto.

  1. Prepara o texto exatamente como pretendes que seja lido.
  2. Introduz um código correspondente ao idioma do texto.
  3. Gera o áudio de voz.
  4. Verifica se os nomes, as abreviaturas, as datas e os números são pronunciados corretamente.
  5. Se a versão falada não for clara, altera o texto e volta a gerar o áudio.

Por exemplo, a entrada Please close the window. com um código de idioma inglês produz um áudio que lê a frase em voz alta. Se o texto estiver em francês, utiliza um código de idioma francês em vez de esperar que uma voz inglesa interprete a ortografia francesa.

A ferramenta devolve áudio, não uma versão reescrita ou traduzida do texto. Se precisares de outro idioma, começa por traduzir o conteúdo e gera depois a voz com o código de idioma correspondente.

O que muda o código de idioma?

O código de idioma altera as regras de pronúncia utilizadas para produzir a voz. Pode afetar os sons, o ritmo e a forma como os números ou as abreviaturas são interpretados, mesmo que o texto visível não mude.

O campo documentado que deve ser preenchido pelo utilizador é Código de idioma. O código deve corresponder ao idioma do texto.

Um código de idioma não é uma instrução de tradução. Introduzir texto em inglês com um código francês não converte a frase para francês de forma fiável. Apenas pede ao motor de síntese de voz que leia os caracteres existentes segundo as regras de pronúncia do francês, o que pode gerar um resultado pouco natural.

Para que serve o áudio de voz gerado?

A voz gerada é útil quando precisas de ouvir um texto sem gravares uma pessoa a lê-lo. Entre as utilizações mais comuns estão a verificação de guiões, a preparação de alternativas de acessibilidade e a avaliação de como um texto soa quando é lido em voz alta.

  • Rascunhos de vídeo: podem ter uma narração temporária enquanto ajustas a duração das cenas, as legendas ou a edição de um vídeo para o YouTube.
  • Verificação da pronúncia: pode revelar formulações pouco naturais em anúncios, instruções e exercícios de aprendizagem de línguas.
  • Revisões de acessibilidade: podem ajudar os autores a detetar frases difíceis de acompanhar quando são ouvidas em vez de lidas.
  • Guiões telefónicos: podem ser verificados para identificar frases longas, números pouco claros e abreviaturas antes da gravação da mensagem final.

A voz sintética pode ser adequada para um rascunho ou uma tarefa simples de audição. Não substitui uma gravação humana quando são importantes a emoção, a ênfase cuidada, a interpretação de uma personagem ou um sotaque regional específico.

Detalhes da entrada e textos difíceis

A implementação utiliza a função strlen do PHP, que devolve o comprimento de uma cadeia em bytes, e aplica codificação de URL ao enviar os valores. Assim, os espaços e os caracteres reservados dos URL podem ser transmitidos como dados, em vez de serem confundidos com partes de um endereço Web. Os caracteres sensíveis em HTML também são escapados durante o processamento. Estes passos técnicos não determinam como o motor de síntese de voz pronuncia o texto.

A pontuação influencia muitas vezes as pausas, pelo que um ponto final ou uma vírgula pode tornar uma frase mais fácil de acompanhar. A pontuação excessiva pode criar pausas estranhas ou ser ignorada. Os números também podem ser ambíguos. Por exemplo, 03/04/2026 pode ser lido como números separados, e a data pretendida não é clara sem se indicar a convenção utilizada. Escrever 3 April 2026 dá ao motor uma indicação mais clara.

Os caracteres acentuados e não latinos devem ser utilizados com um código de idioma adequado. Ainda assim, a pronúncia depende do suporte disponibilizado pelo serviço subjacente. Uma entrada vazia não permite gerar voz com conteúdo. Quando necessário, divide os textos longos em frases ou parágrafos curtos.

Quais são as limitações da conversão de texto em voz?

Não é possível garantir que a pronúncia, a ênfase ou o sotaque regional estejam corretos. Nomes de pessoas e de locais, siglas e termos especializados são fontes frequentes de erros, porque a ortografia, por si só, pode não tornar a pronúncia evidente.

A entrada documentada inclui um código de idioma, mas não permite concluir que existam controlos para selecionar a voz, a velocidade de leitura, o tom ou o formato de áudio. Não planeies um fluxo de trabalho de produção com base nessas opções, a menos que estejam visivelmente disponíveis quando utilizares a ferramenta.

O processamento é feito no servidor. O conteúdo introduzido é enviado para o servidor através de HTTPS e não é armazenado. O serviço depende da API do tradutor da Google, por isso evita introduzir informações confidenciais, sujeitas a restrições legais ou pessoais sensíveis, exceto se a sua utilização for permitida pelas regras aplicáveis à tua organização e ao serviço externo.

Perguntas frequentes

Posso usar comercialmente o áudio gerado?

A ferramenta não define direitos de utilização comercial para áudio de conversão de texto em voz gerado através da API do tradutor da Google. Consulta os termos aplicáveis do serviço da Google e quaisquer requisitos contratuais relativos à publicação, anúncio, curso ou produto em que pretendes utilizar o áudio.

A ferramenta consegue ler emojis?

O tratamento de emojis varia consoante o motor de síntese de voz, o idioma e o símbolo. Um emoji pode ser descrito, ignorado ou pronunciado de forma inesperada. Se for importante ouvir claramente o seu significado, substitui-o por palavras comuns.

Porque é que as abreviaturas são mal pronunciadas?

Um motor de síntese de voz pode interpretar uma abreviatura como uma palavra ou ler cada letra em separado. Adiciona espaços ou pontos entre as letras, ou escreve o termo por extenso, e compara os resultados. Por exemplo, escrever o nome completo de um departamento costuma ser mais claro do que utilizar uma sigla pouco conhecida.

A ferramenta aceita marcação SSML?

Os campos documentados não incluem uma entrada SSML, por isso não pressuponhas que serão interpretadas etiquetas para pausas, ênfase ou pronúncia. Em alternativa, utiliza pontuação normal e uma formulação mais clara, ou escolhe uma plataforma de voz dedicada que indique explicitamente ser compatível com Speech Synthesis Markup Language.

Que campo do formulário tenho de preencher?

O campo documentado que deve ser preenchido pelo utilizador é Código de idioma.

Verificações finais

Ouve o resultado completo antes de o utilizares. Compara nomes, moradas, preços, horas e datas com o texto original e reformula tudo o que o motor leia de forma ambígua. Mantém o texto original disponível para poderes corrigir e voltar a gerar pequenas secções sem teres de reconstruir todo o guião.

Ferramentas Populares