Skip to main content
  1. Pagrindinis
  2. API
  3. Kaip Speechify Text to Speech API perteikia 13 emocijų
Atnaujinta •API

Kaip Speechify Text to Speech API perteikia 13 emocijų

Cliff Weitzman

„Speechify“ generalinis direktorius / įkūrėjas

Speechify API užtikrina 300 ms delsą, žmogaus kokybės balsus ir daugiau nei 50 kalbų

Apple2025 m. Apple dizaino apdovanojimas
50 mln.+ vartotojų

Kodėl emocijos – naujoji kalbos sintezės riba

Kuriate patys? Speechify teksto skaitymo ir balso klonavimo API rasite adresu speechify.ai, o dokumentaciją ir nemokamą raktą – docs.speechify.ai.

Šiuolaikinės TTS sistemos jau seniai užtikrina aiškumą. „Blizzard Challenge“, nuo 2005 m. kasmet atliekamas balso sintezės vertinimas, 2021 m. parodė, kad pagal suprantamumą sintetinė kalba tapo nebeatskiriama nuo natūralios, o pagal natūralumą – beveik jai prilygo (Perrotin ir kt., 2024). Todėl sritis žengė toliau. Svarbiausias klausimas nebebuvo ar suprantate balsą, bet tapo ar balsas skamba taip, lyg iš tiesų perteiktų tai, ką sako. Dabar Speechify siūlo ne tik teksto skaitymą balsu, bet ir emociškai išraiškingą skaitymą.

Speechify siūlo emociškai išraiškingą teksto skaitymą balsu

Speechify emocijų rinkinys apima Pyktį, Džiaugsmą, Liūdesį, Baimę, Atsipalaidavimą, Gąsdinimą, Nuostabą, Ramybę, Užtikrintumą, Energiją, Šilumą, Tiesumą ir Šviesą. Šis sąrašas sudarytas taip, kad aprėptų toninius atspalvius, reikalingus pasakojimui, vaidybai ir pristatymams. Pavyzdžiui, produkto pristatymas gali prasidėti Šviesiai, vėliau pereiti į Ramų techninį paaiškinimą ir baigtis Šiltai. Žaidimo personažas gali iš Užtikrinto tapti Išsigandusiu vos per kelias eilutes.

Emocijų naudojimas su Speechify AI Voice Generator

AI Voice Generator veikia Speechify Studio aplinkoje ir leidžia kurti įgarsinimus, rinkodaros vaizdo įrašus, audioknygas ir tinklalaidžių ištraukas. Tiesiog įklijuokite scenarijų, pasirinkite balsą ir pritaikykite emocinį stilių visam klipui arba konkrečiai jo daliai. Kadangi emocijos taikomos pasirinktoms vietoms, tas pats įgarsinimas gali turėti Džiaugsmingą pradžią, Užtikrintą vertės pasiūlymą ir Šiltą pabaigą, nekeičiant balso.

Keletas aiškių naudojimo scenarijų, kur tai ypač svarbu:

Rinkodaros vaizdo įrašams, kuriamiems tokiose platformose kaip CapCut, dažnai reikia dviejų ar trijų toninių atspalvių: dėmesio patraukimo, pažado ir raginimo veikti. Užuot kūrus tris skirtingus įgarsinimus, pakanka vieno, keičiant emociją pagal eilutes. Audioknygoms ar prozos įgarsinimui nauda dar didesnė – skirtingi dialogai gali skambėti emociškai, nepasitelkiant kelių skaitovų. Aiškinamuosiuose įrašuose Ramus balsas, skaitantis tankią techninę dalį, dažnai skamba aiškiau nei nuolat „įtraukiantis“ tonas.

Emocijų naudojimas su Speechify API

Kūrėjams tos pačios 13 emocijų pasiekiamos per Speechify API, naudojant <speechify:style> SSML žymą. Tereikia apgaubti tekstą, nurodyti emociją, ir API grąžins įgarsinimą su ta emocija tik tai daliai. Taip virtualūs asistentai gali skambėti Užtikrintai, kai patvirtina mokėjimą, ir Šiltai, kai pasveikina sugrįžusį naudotoją, nekeičiant balso pokalbio metu.

E. mokymosi platformose ši funkcija leidžia emociškai pažymėti grįžtamąjį ryšį vertinant užduotis: Džiaugsmingai – už teisingą atsakymą, Tiesiai – už pataisymą, Ramiai – už užuominą. Interaktyvios prozos varikliai gali perduoti veikėjų dialogus per API su kiekvienos eilutės emocijos žyma – tas pats klonuotas balso aktorius gali „suvaidinti“ visą personažų ansamblį.

Speechify AI Voice Generator ar Speechify API: ką rinktis?

Naudojimo atvejis

AI Voice Generator (Studio)

API

Įgarsinimai, rinkodara, audioknygos

Taip, vaizdinis redaktorius, emocijos atskiroms dalims

Įmanoma, bet pernelyg sudėtinga

Balso atkūrimas programose, asistentuose, e. mokymesi

Netinka

Taip, su SSML <speechify:style> žymomis

Formatas

Žiniatinklio sąsaja

REST API

Kada geriausia rinktis

Kai kuriate galutinį garso failą

Kai jūsų produkte garsas generuojamas pagal užklausą

Kur emocinis balso skaitymas iš tiesų keičia rezultatą

Emocinis TTS užpildo svarbią kūrybinių projektų spragą. Vienas išraiškingas balsas gali įgarsinti visą audioknygą, animacijos personažas – perteikti pokštus ar liūdesį, o tinklalaidės įžanga – išryškinti pagrindinę mintį. Anksčiau to nebuvo galima pasiekti naudojant monotonišką sintezę. Dabar emocija slypi pačiame balse, o ne vien scenarijaus pastabose. Tiems, kas jau naudoja Speechify garsenybių ar unikalius balsus, emociniai stiliai yra skirtumas tarp balso, kuris tik skamba panašiai, ir balso, kuris „vaidina“ kaip originalas.

Ar emocinis perteikimas iš tiesų pagerina suvokimą?

Taip, ir tai išmatuojama ne tik AI srityje. 2022 m. ir 2025 m. tyrimuose su 11–13 m. vaikais Dylman ir Champoux-Larsson nustatė, kad tie patys faktai, perskaityti su pozityvia emocine prozodija, buvo įsimenami geriau nei skaitomi neutraliai (Dylman ir kt., 2025). Suvokimo pagerėjimas buvo ryškus ir išliko tiek iškart, tiek po kurio laiko. Mokymuose, produktų instrukcijose ar ilgesniuose garso įrašuose, kur svarbus įsiminimas, emociškai tinkamas balsas iš tiesų padeda geriau suvokti turinį.

DUK

Kas yra teksto skaitymas su emocijomis?

Tai sintetinė kalba, perteikianti pasirinktą emociją (pvz., džiaugsmą ar liūdesį) be papildomų žodžių, todėl ta pati frazė gali skambėti visiškai skirtingai. Su Speechify galite pasirinkti norimą emociją pagal poreikį.

Kiek emocijų palaiko Speechify?

Trylika: Pyktis, Džiaugsmas, Liūdesys, Gąsdinimas, Atsipalaidavimas, Baimė, Nuostaba, Ramybė, Užtikrintumas, Energija, Šiluma, Tiesumas ir Šviesa. Jos prieinamos tiek Speechify AI Voice Generator, tiek Speechify API.

Kur keičiamas emocijos tonas AI Voice Generator?

Speechify Studio įvedus scenarijų, šalia balso pasirinkimo atsiranda emocijos parinkiklis. Jį galite taikyti visam klipui arba pažymėtai daliai ir tada pergeneruoti.

Kaip naudoti emocijas su Speechify API?

Apgaubkite tekstą <speechify:style> SSML žyma ir kaip atributą nurodykite emociją. API grąžins įgarsinimą su ta emocija tik pažymėtai daliai.

Ar galiu viename įgarsinime derinti kelias emocijas?

Taip. Emocijos taikomos pasirinktoms vietoms Speechify Studio ir žymoms API, tad viename įgarsinime galima keisti toną eilutė po eilutės, nekeičiant balso.

Ar emociniai balsai skamba taip natūraliai kaip neutralūs?

Labai panašiai. Recenzuojami emocinio TTS modeliai surenka apie 3,94/5,0 už išraiškingumą ir 3,98/5,0 už natūralumą, tad klausytojai juos vertina beveik taip pat gerai.

Ar emocinis perteikimas padeda įsiminti turinį?

Žmogaus kalbos tyrimai rodo, kad taip. Pozityvi prozodija pagerina faktų įsiminimą kontroliuojamuose tyrimuose. Tas pats principas galioja ir kokybiškai režisuotiems AI įgarsinimams.

Ar galiu emocinius balsus naudoti komerciniams įgarsinimams?

Speechify licencija apima komercinius įgarsinimus, įskaitant emocinius stilius. Pasitikrinkite savo plano garso trukmės apribojimus.

Ar emocijos veikia su klonuotais ar garsenybių balsais?

Taip. Emociniai stiliai Speechify sistemoje taikomi baziniam balsui, todėl klonuotas balsas gali perteikti visas 13 emocijų be atskiro įrašymo kiekvienai iš jų.

Kuo emocijos skiriasi nuo greičio ar tono keitimo?

Emocijos keičia visą prozodiją – pauzes, kirčius, intonaciją ir energiją. Todėl „pykčio“ versija neskamba tiesiog greičiau ar aukštesniu tonu nei neutrali.


Pasiekite mėgstamus Speechify balsus per API – greita, lengvai plečiama ir draugiška kūrėjams

Gauti API prieigą
Sparse JavaScript keywords import, from, const, await on a white background

Pasidalykite šiuo straipsniu

Cliff Weitzman

„Speechify“ generalinis direktorius / įkūrėjas

Cliff Weitzman – disleksijos šalininkas, „Speechify“ vadovas ir įkūrėjas. „Speechify“ – pirmaujanti pasaulyje teksto į kalbą programa, turinti daugiau nei 100 000 penkių žvaigždučių įvertinimų ir lyderiaujanti „App Store“ naujienų ir žurnalų kategorijoje. 2017 m. „Forbes“ jį įtraukė į „30 iki 30“ sąrašą už indėlį didinant interneto prieinamumą žmonėms su mokymosi sutrikimais. Apie jį rašė „EdSurge“, „Inc.“, „PC Mag“, „Entrepreneur“, „Mashable“ ir kt.

Speechify

Apie Speechify

#1 teksto į kalbą skaitytuvas

Speechify yra pirmaujanti pasaulyje teksto į kalbą platforma, kuria pasitiki daugiau nei 50 milijonų vartotojų ir kurią pagrindžia daugiau nei 500 000 penkių žvaigždučių atsiliepimų skirtingose teksto į kalbą iOS, Android, Chrome plėtinio, internetinės programėlės ir Mac darbalaukio programose. 2025 m. Apple apdovanojo Speechify prestižiniu Apple dizaino apdovanojimu per WWDC, pavadindama jį „esminiu ištekliumi, padedančiu žmonėms gyventi visavertį gyvenimą“. Speechify siūlo daugiau nei 1 000 natūraliai skambančių balsų daugiau nei 60 kalbų ir naudojamas beveik 200 šalių. Tarp įžymybių balsų – Snoop Dogg ir Gwyneth Paltrow. Kūrėjams ir verslui Speechify Studio suteikia išplėstinius įrankius, tarp kurių yra AI balso generatorius, AI balso klonavimas, AI dubliavimas ir AI balso keitiklis. Speechify taip pat aprūpina pažangius produktus kokybišku ir ekonomišku teksto į kalbą API. Apie mus rašė The Wall Street Journal, CNBC, Forbes, TechCrunch ir kiti didieji naujienų portalai, todėl Speechify yra didžiausias teksto į kalbą teikėjas pasaulyje. Apsilankykite speechify.com/news, speechify.com/blog ir speechify.com/press ir sužinokite daugiau.