Skip to main content
  1. Início
  2. API
  3. Como a API de Text to Speech da Speechify Suporta 13 Emoções
Updated on •API

Como a API de Text to Speech da Speechify Suporta 13 Emoções

Cliff Weitzman

CEO e fundador da Speechify

A API Speechify oferece latência de 300 ms, vozes com qualidade humana e mais de 50 idiomas

AppleApple Design Award 2025
Mais de 50M de usuários

Por Que a Emoção É a Nova Fronteira da Síntese de Voz

Vai criar você mesmo? A API de text-to-speech e clonagem de voz da Speechify está disponível em speechify.ai, com documentação e chave gratuita em docs.speechify.ai.

O TTS moderno resolveu a inteligibilidade há anos. O Blizzard Challenge, referência anual que acompanha o progresso da síntese de voz desde 2005, mostrou que, em 2021, a fala sintética já era indistinguível da natural em inteligibilidade — e quase indistinguível em naturalidade também (Perrotin et al., 2024). O campo evoluiu. A questão deixou de ser se você entende a voz para ser se a voz soa como se realmente quisesse dizer o que está dizendo. Agora, a Speechify oferece não só text to speech, mas também text to speech com emoção.

Speechify Oferece Text to Speech Emocional

A linha emocional da Speechify inclui: Irritado, Alegre, Triste, Aterrorizado, Relaxado, Receoso, Surpreso, Calmo, Assertivo, Energético, Acolhedor, Direto e Brilhante. O conjunto foi pensado para cobrir a variedade tonal de um narrador, ator ou apresentador real ao longo de um projeto. Um vídeo explicativo pode começar Brilhante, seguir Calmo na parte técnica e terminar Acolhedor. Um personagem de jogo pode mudar de Assertivo para Aterrorizado em poucas falas.

Usando Emoções no Gerador de Voz com IA da Speechify

O Gerador de Voz com IA está disponível no Speechify Studio e é a ferramenta usada por criadores para locuções, vídeos de marketing, audiolivros e quadros de podcast. Basta colar seu roteiro, escolher uma voz e aplicar o estilo emocional em todo o trecho ou em uma seleção específica. Como as emoções são aplicadas por seleção, a mesma locução pode começar Alegre, ter uma proposta de valor Assertiva e terminar com uma despedida Acolhedora, sem trocar de voz.

Alguns fluxos de trabalho em que isso faz diferença:

Vídeos de marketing editados em ferramentas como o CapCut normalmente exigem dois ou três tons, como chamar atenção, apresentar a promessa e fazer a chamada para ação. Em vez de três gravações, gere uma única locução variando a emoção linha por linha. Audiolivros e narrativas de ficção ganham ainda mais, pois os diálogos podem assumir emoções diferentes sem exigir vários leitores. Em conteúdos explicativos, uma voz simplesmente Calma lendo trechos densos costuma ser mais clara do que tentar soar "engajada" o tempo todo.

Usando Emoções na API da Speechify

Para desenvolvedores, as mesmas 13 emoções estão disponíveis na API da Speechify por meio da tag SSML <speechify:style>. Basta envolver o texto desejado, indicar a emoção, e a API retorna o áudio com esse tom aplicado só àquele trecho. Assim, assistentes virtuais podem soar Assertivos ao confirmar pagamentos e Acolhedores ao receber usuários recorrentes, sem precisar trocar de voz na mesma sessão.

Plataformas de e-learning usam o mesmo recurso para marcar feedbacks de testes: Alegre para acertos, Direto para correções, Calmo para dicas. Criadores de ficção interativa aplicam emoções por fala nos diálogos via API, o que permite que a voz clonada de um ator cubra todo o elenco.

Speechify AI Voice Generator vs API da Speechify: Qual Usar?

Caso de uso

Gerador de Voz com IA (Studio)

API

Locuções, marketing, audiolivros

Sim, editor visual, emoções por seleção

Possível, mas é mais do que o necessário

Voz no produto para apps, assistentes e e-learning

Não é a melhor opção

Sim, com tags SSML <speechify:style>

Formato

Interface web

API REST

Melhor quando

Você quer um áudio finalizado

Você gera áudio sob demanda no seu produto

Onde as Vozes Emocionais Ampliam Seu Potencial Criativo

O TTS emocional era o que faltava para produções criativas. Uma única voz de celebridade narrando todo o audiolivro, um personagem animado alternando entre piadas e tristeza, uma abertura de podcast no tom exato — tudo isso era difícil com a síntese tradicional. Agora, isso funciona porque a emoção faz parte da voz, não da direção do roteiro. Para quem já utiliza as vozes de celebridades e personagens da Speechify, os estilos emocionais transformam a voz “referência” em uma voz de fato interpretada.

A Entonação Emocional Melhora a Compreensão?

Sim, e isso é mensurável também fora do universo da IA. Em um estudo de 2022 com jovens de 11 a 13 anos, e em uma réplica de 2025, os pesquisadores Dylman e Champoux-Larsson constataram que os ouvintes acertaram mais questões de conteúdo quando o mesmo material foi lido com prosódia positiva em vez de neutra (Dylman et al., 2025). O ganho de compreensão foi significativo, tanto na lembrança imediata quanto na tardia. Para conteúdo educacional, tutoriais de produto e qualquer áudio extenso em que a retenção importa, uma voz emocionalmente adequada realmente ajuda na compreensão.

Perguntas Frequentes

O que é text to speech com emoções?

É a fala sintética que transmite o tom emocional escolhido (como alegre ou triste), além das palavras, permitindo que a mesma frase seja dita de formas diferentes. No Speechify, você pode escolher a emoção para cada seleção.

Quantas emoções a Speechify suporta?

Treze: Irritado, Alegre, Triste, Aterrorizado, Relaxado, Receoso, Surpreso, Calmo, Assertivo, Energético, Acolhedor, Direto e Brilhante — disponíveis tanto no Gerador de Voz com IA da Speechify quanto na API da Speechify.

Onde controlo a emoção no Gerador de Voz com IA?

No Speechify Studio, depois de inserir seu roteiro, um seletor de emoções aparece ao lado da escolha de voz. Aplique na faixa inteira ou em uma seleção destacada e renderize novamente.

Como uso emoções na API da Speechify?

Envolva o texto com a tag SSML <speechify:style>, usando o nome da emoção como atributo. A API retorna o áudio com aquela emoção apenas no trecho marcado.

Posso combinar emoções em uma mesma locução?

Sim. As emoções podem ser aplicadas por seleção no Speechify Studio e por trecho SSML na API, permitindo variar o tom linha por linha sem trocar de voz.

As vozes emocionais soam tão naturais quanto as neutras?

Muito próximas. Modelos de TTS emocional revisados por pares já alcançam 3,94/5,0 em expressividade e 3,98/5,0 em naturalidade, o que mostra que os ouvintes avaliam ambos os quesitos de forma quase equivalente.

Locuções emocionais realmente ajudam na retenção de conteúdo?

Pesquisas com oradores humanos mostram que sim. A prosódia positiva aumentou a recordação de fatos em estudos controlados. O mesmo vale para boas locuções de IA.

Posso usar vozes emocionais para locuções comerciais?

A licença da Speechify cobre o uso comercial das locuções geradas, inclusive dos estilos emocionais. Consulte seu plano para verificar os limites de duração do áudio.

A emoção funciona com vozes clonadas ou de celebridades?

Sim. Os estilos emocionais são aplicados sobre a voz base na Speechify, assim uma voz clonada pode apresentar todas as 13 emoções sem precisar gravar cada uma separadamente.

Qual a diferença entre emoção e ajustes de velocidade ou tom?

As emoções afetam toda a prosódia — pausas, ênfase, entonação e energia. Por isso, uma versão "irritada" não soa apenas mais rápida ou mais aguda do que a neutra.


Acesse as vozes favoritas da Speechify via API — rápido, escalável e com foco no desenvolvedor

Solicitar acesso à API
Sparse JavaScript keywords import, from, const, await on a white background

Compartilhe este artigo

Cliff Weitzman

CEO e fundador da Speechify

Cliff Weitzman é um defensor da causa da dislexia e o CEO e fundador da Speechify, o aplicativo número 1 de conversão de texto em fala do mundo, com mais de 100.000 avaliações 5 estrelas e líder de downloads na App Store na categoria Notícias & Revistas. Em 2017, Weitzman foi incluído na lista Forbes 30 under 30 por seu trabalho para tornar a internet mais acessível a pessoas com dificuldades de aprendizagem. Cliff Weitzman já foi destaque em veículos como EdSurge, Inc., PC Mag, Entrepreneur, Mashable, entre outros importantes meios de comunicação.

Speechify

Sobre a Speechify

Leitor de texto para fala nº 1

Speechify é a principal plataforma de texto para fala do mundo, confiável por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em suas versões para iOS, Android, extensão para Chrome, web app e aplicativos para Mac desktop. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando-a de “um recurso essencial que ajuda as pessoas a viverem melhor”. A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas e é usada em quase 200 países. As vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo o Gerador de Voz IA, Clonagem de Voz IA, Dublagem de IA e seu próprio Alterador de Voz IA. A Speechify também integra grandes produtos com sua API de texto para fala de alta qualidade e custo acessível. Em destaque no The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de mídia, a Speechify é a maior provedora de texto para fala do mundo. Visite speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.