BrowserTools
Início / Diversos / Texto para voz, leitor de texto online gratuito

Texto para voz, leitor de texto online gratuito

Cola qualquer texto e ouve-o lido em voz alta no teu navegador. Escolhe uma voz, ajusta a velocidade e o tom. Privado, gratuito, nada é enviado para lado nenhum.

A carregar Texto para voz, leitor de texto online gratuito… Se nada acontecer, ativa o JavaScript.

Esta ferramenta gratuita de texto para voz transforma texto escrito em áudio falado diretamente no teu navegador. Cola ou escreve o que quiseres, um artigo que queiras ouvir, o rascunho de um email, apontamentos de estudo, um capítulo de um livro, e carrega em Reproduzir para o ouvires lido em voz alta com uma voz natural. Não há nada para instalar nem conta para criar: o leitor funciona de imediato no computador e no telemóvel e aguenta desde uma única frase até várias páginas de texto.

Perguntas frequentes

Posso descarregar a fala como ficheiro MP3 ou WAV?
Não, e isto é uma limitação honesta da tecnologia e não uma funcionalidade em falta. A Web Speech API reproduz o áudio através do motor de voz do sistema e não expõe o fluxo de áudio à página, pelo que não há nada que a ferramenta possa capturar e guardar. Produzir um MP3 ou WAV descarregável exige um serviço de texto para voz em servidor ou na nuvem, o que significaria enviar o teu texto. Esta ferramenta, deliberadamente, mantém tudo no teu dispositivo.
Que vozes estão disponíveis?
As que o teu sistema operativo e navegador fornecerem. O Windows traz vozes da Microsoft, o macOS e o iOS trazem vozes da Apple, o Android traz vozes da Google, e o Chrome de computador acrescenta vozes Google extra. O seletor lista todas as vozes que a tua configuração expõe, agrupadas por idioma, e mostra a contagem total. Podes acrescentar mais vozes instalando idiomas ou vozes adicionais nas definições do teu sistema operativo.
Porque é que as vozes diferem entre os meus dispositivos?
Porque a fala é gerada localmente pelo motor de cada dispositivo, não por um servidor partilhado. O teu portátil com Windows, o teu telemóvel Android e o teu iPad trazem conjuntos de vozes diferentes de fabricantes diferentes, pelo que o mesmo texto pode soar bastante diferente de um dispositivo para outro. É o preço de um leitor instantâneo, gratuito e completamente privado.
O meu texto é enviado para um servidor?
Não. A ferramenta inteira corre localmente no teu navegador. O teu texto é passado ao motor de voz integrado no teu dispositivo e nunca sai dele. Não há servidor, nem registos, nem conta, o que torna a ferramenta segura para notas privadas, rascunhos não publicados e material confidencial.
Como é que a ferramenta lida com textos longos?
O texto longo é automaticamente dividido em blocos do tamanho de uma frase que são postos em fila e falados um a seguir ao outro. Isto importa porque muitos motores de voz cortam ou abortam silenciosamente locuções únicas muito longas. Com a divisão em blocos, até documentos de várias páginas são reproduzidos de forma fiável, e um indicador de progresso mostra que bloco está a ser lido em cada momento.
Como funciona o realce de palavras?
Enquanto fala, o navegador pode disparar eventos de fronteira que indicam a posição da palavra que está a ser pronunciada, e a ferramenta usa-os para realçar essa palavra no texto. No entanto, nem todas as vozes emitem estes eventos; algumas vozes remotas ou neuronais simplesmente não o fazem. Se a voz escolhida não reportar as posições das palavras, a ferramenta apercebe-se e mostra uma pequena nota em vez de fingir que realça.
O que fazem os controlos de velocidade, tom e volume?
A velocidade controla o ritmo da fala, de 0.5 (metade da velocidade, boa para escuta atenta ou aprendizagem de línguas) a 2 (o dobro da velocidade, boa para leitura na diagonal). O tom torna a voz mais grave ou mais aguda numa escala de 0 a 2 sem alterar a velocidade. O volume define a intensidade de 0 a 1, independentemente do volume do teu sistema. Um botão de repor devolve os valores por omissão de 1, 1 e 1 num clique.
Que navegadores suportam texto para voz?
Todos os navegadores modernos suportam a parte de síntese da Web Speech API: Chrome, Edge, Safari e Firefox, tanto em computador como em telemóvel. Os pormenores variam: o Chrome carrega a lista de vozes de forma assíncrona e oferece vozes Google extra, o Safari usa as vozes de sistema da Apple, e o suporte ao realce por fronteiras de palavra depende da voz específica. Se o teu navegador não tiver suporte de todo, a ferramenta avisa-te em vez de falhar em silêncio.
Esta ferramenta de texto para voz é gratuita?
Sim, completamente gratuita, sem limites de carateres, subscrições ou registos. Como o áudio é gerado pelo teu próprio dispositivo e não por um serviço de nuvem pago, não há custo por palavra para repercutir. Podes ler tanto texto quanto quiseres, as vezes que quiseres.
Consegue ler idiomas além do inglês?
Sim. A lista de vozes está agrupada por idioma, e escolher uma voz que corresponda ao idioma do teu texto dá a pronúncia correta. A maioria dos sistemas inclui de origem vozes para os idiomas principais, como espanhol, francês, alemão, português, italiano, chinês e japonês. Ler um texto com uma voz desajustada funciona tecnicamente, mas soa mal, por isso escolhe uma voz correspondente para obteres o melhor resultado.

Sobre Texto para voz, leitor de texto online gratuito

Por baixo do capô, a ferramenta usa a Web Speech API, o motor de síntese de voz que já vem integrado no teu navegador e sistema operativo. Esse desenho tem uma grande vantagem de privacidade: o teu texto nunca é enviado para servidor nenhum. As palavras que colas ficam no teu dispositivo, são faladas pelo motor de voz local e desaparecem quando fechas a página. Não há limites de palavras impostos por um serviço remoto, nem contas, nem fila de processamento, porque não existe serviço remoto nenhum.

Ficas com controlo total sobre como o texto soa. Escolhe qualquer voz instalada no teu sistema, agrupadas por idioma para encontrares rapidamente inglês, espanhol, francês, alemão, português e dezenas de outras opções. Afina a velocidade de fala desde uns lentos 0.5x para uma escuta atenta até uns rápidos 2x para leitura na diagonal, sobe ou desce o tom e define o volume independentemente do misturador do teu sistema. Isto torna a ferramenta útil muito para além da simples leitura: os escritores reveem de ouvido e apanham frases desajeitadas que os olhos deixam passar, os estudantes de línguas ouvem a pronúncia correta de textos estrangeiros, as pessoas com deficiência visual ou dislexia consomem conteúdo escrito com conforto, e qualquer pessoa pode transformar um artigo longo em algo para ouvir enquanto faz outras coisas.

Uma ressalva honesta: como as vozes vêm do teu navegador e sistema operativo, a seleção varia entre dispositivos. O Windows, o macOS, o Android e o iOS trazem cada um os seus próprios conjuntos de vozes, e o Chrome acrescenta vozes Google próprias, pelo que a mesma página pode soar diferente no teu telemóvel e no teu portátil. Algumas vozes são naturais e agradáveis, outras são visivelmente robóticas, e funcionalidades como o realce palavra a palavra dependem de quanta informação cada voz devolve. A ferramenta deteta o que a tua configuração suporta e trabalha com as vozes que tiveres, mas se faltar um idioma, a solução é instalá-lo nas definições do teu sistema operativo.

Do Voder às vozes neuronais: uma breve história das máquinas que falam

A primeira máquina a falar em público não era de todo um computador. Na Feira Mundial de Nova Iorque de 1939, os Laboratórios Bell demonstraram o Voder, uma volumosa consola eletrónica tocada como um instrumento musical. Uma operadora treinada, normalmente uma de cerca de vinte mulheres que tinham praticado durante um ano, premia teclas e uma barra de pulso para moldar fontes de zumbidos e assobios em palavras reconhecíveis. O Voder não conseguia falar sozinho; era uma prova de que a fala humana podia ser montada a partir de blocos eletrónicos, e as multidões faziam fila para o ouvir dizer frases a pedido.

Os computadores aprenderam a falar nas décadas seguintes, e destacam-se dois marcos. Em 1978, a Texas Instruments meteu a síntese de voz num brinquedo: o Speak & Spell comprimiu um modelo completo do trato vocal num único chip, para que um brinquedo infantil de soletração pudesse pronunciar palavras em voz alta, um marco na eletrónica de consumo. Entretanto, no MIT, Dennis Klatt passou anos a aperfeiçoar a síntese por formantes, trabalho que se tornou o DECtalk em 1984. O utilizador mais famoso do DECtalk foi o físico Stephen Hawking, que falou durante décadas através de uma voz derivada das gravações do próprio Klatt. Quando lhe ofereceram vozes mais novas e suaves, Hawking recusou: a voz robótica do DECtalk tinha-se tornado a voz dele, e manteve-a até à sua morte, em 2018.

O texto para voz moderno deu uma viragem brusca na década de 2010, quando as redes neuronais substituíram as regras acústicas construídas à mão. Sistemas como o WaveNet, publicado pela DeepMind em 2016, geravam formas de onda de áudio em bruto, amostra a amostra, e de repente soavam espantosamente humanos, com ritmo de respiração e entoação naturais. Os sistemas operativos de hoje incluem dezenas de vozes neuronais em muitos idiomas, e a mesma tecnologia alimenta leitores de ecrã, indicações de navegação e assistentes virtuais. As vozes que ouves nesta ferramenta assentam em toda essa linhagem, desde uma consola tocada à mão numa Feira Mundial até redes que aprenderam a falar com milhares de horas de gravações.

Apoiar