Skip to main content
  1. Beranda
  2. API
  3. Bagaimana Speechify Text to Speech API Mendukung 13 Emosi
Diperbarui pada •API

Bagaimana Speechify Text to Speech API Mendukung 13 Emosi

Cliff Weitzman

CEO/Pendiri Speechify

Speechify API menghadirkan latensi 300 ms, suara seperti manusia, dan 50+ bahasa

AppleApple Design Award 2025
50J+ pengguna

Mengapa Emosi Menjadi Batas Baru dalam Sintesis Suara

Mau membangun sendiri? API text-to-speech dan voice cloning Speechify tersedia di speechify.ai, dengan dokumentasi dan key gratis di docs.speechify.ai.

TTS modern sudah menuntaskan masalah kejelasan sejak lama. Blizzard Challenge, tolok ukur tahunan yang melacak kemajuan sintesis suara sejak 2005, melaporkan bahwa pada 2021, suara sintetis sudah tak bisa dibedakan dari suara alami dari sisi kejernihan, dan tingkat kealamiannya pun nyaris setara (Perrotin et al., 2024). Jadi, fokusnya pun bergeser. Pertanyaannya bukan lagi apakah suara ini mudah dipahami, melainkan apakah suara ini menyampaikan makna yang sesuai dengan isi katanya. Kini Speechify menawarkan bukan hanya text to speech, tetapi juga emotional text to speech.

Emosi di Speechify

Speechify Menawarkan Text to Speech Emosional

Pilihan emosi di Speechify meliputi Marah, Ceria, Sedih, Ketakutan/Ketar-ketir, Santai, Takut, Terkejut, Tenang, Tegas, Energik, Hangat, Langsung, dan Cerah. Daftar ini dipilih untuk mencakup ragam nada yang dibutuhkan narator, aktor, atau presenter dalam satu proyek. Penjelasan produk bisa dimulai dengan nada Cerah, lalu beralih ke Tenang saat masuk ke bagian teknis, dan diakhiri dengan Hangat. Karakter NPC pun bisa berubah dari Tegas ke Ketakutan hanya dalam dua baris.

Menggunakan Emosi di Speechify AI Voice Generator

AI Voice Generator tersedia di Speechify Studio dan digunakan kreator untuk voiceover, video marketing, audiobook, dan segmen podcast. Anda cukup menempelkan skrip, memilih suara, lalu menerapkan gaya emosi ke seluruh klip atau bagian tertentu. Karena emosi diterapkan per bagian, satu voiceover bisa memiliki pembuka Ceria, proposisi nilai yang Tegas, dan penutup Hangat tanpa perlu ganti suara.

Berikut beberapa contoh alur kerja yang sangat terbantu dengan fitur ini:

Video marketing yang dirender di alat seperti CapCut biasanya membutuhkan dua hingga tiga nada suara, seperti menarik perhatian, menyampaikan janji, dan mendorong call to action. Daripada merekam tiga versi suara terpisah, Anda cukup membuat satu voiceover dengan emosi berbeda di tiap baris. Audiobook dan narasi fiksi bahkan lebih diuntungkan, karena dialog antarkarakter bisa terasa berbeda tanpa perlu banyak pengisi suara. Untuk konten penjelasan, satu suara Tenang justru bisa membawakan bagian yang padat dengan lebih jelas daripada suara yang dipaksa terdengar "menarik" sepanjang waktu.

Menggunakan Emosi pada Speechify API

Bagi developer, 13 emosi yang sama tersedia di Speechify API melalui tag SSML <speechify:style>. Bungkus teks yang ingin diberi gaya, sebutkan nama emosinya, dan API akan menghasilkan audio dengan emosi tersebut hanya pada bagian yang ditandai. Misalnya, asisten virtual bisa terdengar Tegas saat mengonfirmasi pembayaran dan Hangat saat menyapa pengguna lama, tanpa harus ganti suara.

Platform e-learning memakai mekanisme yang sama untuk memberi umpan balik kuis: Ceria untuk jawaban benar, Langsung untuk koreksi, dan Tenang untuk petunjuk. Mesin fiksi interaktif mengalirkan dialog karakter melalui API dengan tag emosi di tiap baris, sehingga suara hasil kloning dari satu aktor bisa mengisi seluruh karakter.

Speechify AI Voice Generator vs Speechify API: Mana yang Cocok?

Kegunaan

AI Voice Generator (Studio)

API

Voiceover, marketing, audiobook

Ya, dengan editor visual dan emosi per bagian

Bisa, tetapi kurang efisien

Suara dalam aplikasi, asisten, e-learning

Kurang cocok

Bisa dengan tag SSML <speechify:style>

Format

Antarmuka web

REST API

Kapan paling tepat

Menghasilkan file audio final

Audio dibuat sesuai permintaan di produk Anda

Di Mana Suara Emosional Benar-Benar Mengubah Karya Anda

TTS emosional adalah bagian yang selama ini kurang untuk ekspresi kreatif. Satu suara ala selebritas yang membacakan seluruh audiobook, karakter animasi yang bisa menyampaikan lelucon hingga adegan sedih, atau pengantar podcast yang dieksekusi dengan pas—semuanya sulit dicapai dengan sintesis yang datar. Kini itu menjadi mungkin, karena emosi tertanam pada suara, bukan sekadar diarahkan lewat skrip. Bagi kreator yang memakai suara selebritas dan karakter Speechify, gaya emosional membuat suara tidak hanya mirip referensi, tetapi juga mampu berakting.

Apakah Pembacaan Emosional Benar-Benar Meningkatkan Pemahaman?

Ya, dan hal ini terbukti bahkan di luar ranah AI. Dalam studi tahun 2022 pada anak usia 11–13 tahun, serta replikasi pada 2025, Dylman dan Champoux-Larsson menemukan bahwa pendengar menjawab lebih banyak pertanyaan saat materi dibacakan dengan prosodi positif dibandingkan dengan nada netral (Dylman et al., 2025). Peningkatan pemahaman ini signifikan dan konsisten, baik pada recall langsung maupun tertunda. Untuk konten edukasi, tutorial produk, maupun audio berdurasi panjang yang mengandalkan daya ingat, suara emosional yang tepat benar-benar dapat membantu pemahaman.

FAQ

Apa itu text to speech dengan emosi?

Ini adalah suara sintetis yang membawa nuansa emosi, seperti ceria atau sedih, di atas kata-kata, sehingga satu kalimat bisa dibawakan dengan rasa yang berbeda. Dengan Speechify, Anda bisa memilih emosi untuk tiap bagian.

Berapa banyak emosi yang didukung Speechify?

Ada 13: Marah, Ceria, Sedih, Ketakutan/Ketar-ketir, Santai, Takut, Terkejut, Tenang, Tegas, Energik, Hangat, Langsung, dan Cerah. Semuanya tersedia di Speechify AI Voice Generator dan Speechify API.

Di mana mengatur emosi di AI Voice Generator?

Di Speechify Studio, setelah Anda memasukkan skrip, pemilih emosi akan muncul di samping pemilih suara. Terapkan ke seluruh klip atau bagian tertentu, lalu render ulang.

Bagaimana cara pakai emosi di Speechify API?

Bungkus teks dengan tag SSML <speechify:style> lalu masukkan nama emosi sebagai atribut. API akan menghasilkan audio dengan emosi tersebut hanya pada bagian itu.

Bisa gabungkan beberapa emosi dalam satu voiceover?

Bisa. Emosi diterapkan per bagian di Speechify Studio dan per span SSML di API, jadi voiceover atau sesi bisa berganti nada antarbaris tanpa ganti suara.

Apakah suara emosional senatural suara netral?

Sangat mirip. Model TTS emosional terkini dinilai sekitar 3,94/5,0 untuk ekspresivitas dan 3,98/5,0 untuk naturalitas, yang berarti kualitas keduanya dinilai nyaris setara.

Apakah pembawaan emosional membantu pendengar memahami isi?

Ya, riset pada pembicara manusia menunjukkan hal itu. Prosodi positif meningkatkan ingatan terhadap konten faktual dalam studi terkontrol. Prinsip yang sama berlaku pada AI voiceover yang diarahkan dengan baik.

Bolehkah suara emosional dipakai untuk voiceover komersial?

Lisensi Speechify mencakup penggunaan komersial untuk semua voiceover, termasuk gaya emosional. Cek paket Anda untuk mengetahui batas outputnya.

Apakah emosi bisa untuk suara kloning atau selebritas?

Bisa. Gaya emosional diterapkan di atas suara dasar di Speechify, sehingga suara hasil kloning bisa membawa semua 13 emosi tanpa perlu rekaman terpisah untuk tiap emosi.

Apa bedanya dengan hanya mengatur kecepatan atau pitch?

Emosi mengubah seluruh prosodi: jeda, tekanan, intonasi, dan energi. Karena itu, suara "marah" tidak sama dengan sekadar mempercepat dan meninggikan suara netral.


Akses suara-suara favorit Speechify lewat API yang cepat, skalabel, dan ramah pengembang

Dapatkan akses API
Sparse JavaScript keywords import, from, const, await on a white background

Bagikan artikel ini

Cliff Weitzman

CEO/Pendiri Speechify

Cliff Weitzman adalah advokat disleksia, sekaligus CEO dan pendiri Speechify, aplikasi text-to-speech nomor 1 di dunia dengan lebih dari 100.000 ulasan bintang 5 dan peringkat pertama di App Store untuk kategori Berita & Majalah. Pada tahun 2017, Weitzman masuk daftar Forbes 30 Under 30 berkat upayanya membuat internet lebih mudah diakses bagi penyandang disabilitas belajar. Cliff juga pernah tampil di EdSurge, Inc., PC Mag, Entrepreneur, Mashable, dan berbagai media terkemuka lainnya.

Speechify

Tentang Speechify

#1 Pembaca Teks ke Ucapan

Speechify adalah platform teks ke ucapan terkemuka di dunia, dipercaya oleh lebih dari 50 juta pengguna dan didukung oleh lebih dari 500.000 ulasan bintang lima di berbagai aplikasi teks ke ucapan iOS, Android, Ekstensi Chrome, aplikasi web, dan desktop Mac. Pada tahun 2025, Apple memberikan Speechify penghargaan terhormat Apple Design Award di WWDC, menyebutnya sebagai “sumber penting yang membantu orang menjalani hidup mereka.” Speechify menawarkan 1.000+ suara alami dalam 60+ bahasa dan digunakan di hampir 200 negara. Suara selebriti termasuk Snoop Dogg dan Gwyneth Paltrow. Untuk kreator dan bisnis, Speechify Studio menyediakan alat canggih, termasuk AI Voice Generator, AI Voice Cloning, AI Dubbing, dan AI Voice Changer. Speechify juga menyokong produk-produk terkemuka dengan API teks ke ucapan berkualitas tinggi dan hemat biaya. Telah diliput di The Wall Street Journal, CNBC, Forbes, TechCrunch, dan banyak media besar lainnya, Speechify adalah penyedia teks ke ucapan terbesar di dunia. Kunjungi speechify.com/news, speechify.com/blog, dan speechify.com/press untuk informasi lebih lanjut.