Speechify erbjuder ett mindre urval av text-till-tal-modeller. Att välja rätt handlar om att väga svarstid, språktäckning och röstkvalitet mot varandra. Den här guiden hjälper dig att matcha varje modell med rätt användningsområde, så att du slipper testa allt själv.
Inläggen om modeller på speechify.ai går djupare in på varje lansering. Lanseringen av Simba 3.2 förklarar varför den nu är den rekommenderade modellen.
Läs vår snabbstartsguide om du vill komma igång med Speechify text-till-tal API.
Bygger du själv? Speechify text-till-tal- och röstklonings-API finns på speechify.ai, med dokumentation och gratis API-nyckel på docs.speechify.ai.
Vilka modeller erbjuder Speechify?
Tre modellfamiljer.
- Simba 3.2
- : den rekommenderade modellen för engelska. Optimerad för streaming, snabbast till första byte och med utvalda engelska röster. Använd den för allt interaktivt.
- Simba 3.0
- : nuvarande API-standard. Optimerad för streaming och flerspråkig: engelska samt tyska, spanska, franska, italienska och brasiliansk portugisiska. Något högre svarstid än 3.2 men bredare täckning.
- Äldre modeller (
- simba-english
- ,
- simba-multilingual
- ): Simba 1.6-serien. Tas bort från API-version 2026-09-21 och stängs av 2026-11-21. Använd bara om en befintlig integration kräver en äldre specifik röst eller språkvariant, och planera migreringen redan nu.
Vilken modell är snabbast?
Simba 3.2. Modellen är byggd för streaming, så ljudet börjar levereras nästan direkt. För engelska röstagenter är det här rätt val.
Simba 3.0 är nästan lika snabb men har extra overhead för flera språk. Äldre modeller är långsammast och bör fasas ut där det går.
Vilken modell stöder flest språk?
Simba 3.0. Den stöder officiellt engelska, tyska, spanska (Spanien och Mexiko), franska, italienska och brasiliansk portugisiska. Skicka parametern language med POST /v1/audio/speech för att välja språk, så returneras en inbyggd röst för det valda språket. Äldre simba-multilingual täcker totalt fler än 30 språkvarianter, men tas bort från API-version 2026-09-21 och stängs av 2026-11-21.
Om din produkt bara används på ett språk har Simba 3.2 bäst hastighet och kvalitet. För flera språk är Simba 3.0 det bästa valet just nu tack vare den bredare täckningen.
Läs mer om språkstöd i dokumentationen.
Vilken modell har bäst ljudkvalitet?
Kvaliteten följer modellgenerationen. Simba 3.2 låter mest naturlig på engelska. Simba 3.0 presterar också bra på sina språk. Äldre modeller låter äldre och mer robotlika.
För publikt tal bör du välja Simba 3.2 eller Simba 3.0.
Hur listar jag tillgängliga röster?
Anropa GET /v1/voices. Filtrera på typ, språk, kön och modell för att hitta rätt röst innan du syntetiserar. Inläggen på speechify.ai visar svarsexempel.
Streaming eller batch?
Båda Simba 3-modellerna stöder streaming. Använd POST /v1/audio/stream för direktuppspelning, POST /v1/audio/stream/with-timestamps för ljud med tidsstämplar och ordmarkeringar, och POST /v1/audio/speech för en fil. Modellen väljs oberoende av leveranssätt.
FAQ
Vilken Speechify TTS-modell rekommenderas?
Simba 3.2. Det är standardvalet för nya projekt: streaming först, snabbast till första ljud och högst kvalitet för engelska.
Simba 3.2 för engelska: streaming först, snabbast till första ljud och högst kvalitet på engelska. API-standarden är Simba 3.0 om model saknas, så ange model: "simba-3.2" uttryckligen om du vill välja den.
Ja. Simba 3.0 tar en språkparameter och returnerar inbyggda röster på flera språk. Simba 3.2 fokuserar på utvalda engelska röster.
Ja. Simba 3.0 tar en språkparameter och erbjuder inbyggda röster för engelska och sex europeiska språk. Simba 3.2 fokuserar på utvalda engelska röster.
Bara om en befintlig integration behöver en specifik äldre röst. Annars bör du gå över till Simba 3.2 eller Simba 3.0.
Använd dem bara så länge en integration kräver en specifik äldre röst. De försvinner i API-version 2026-09-21 och stängs ned 2026-11-21, så migrera till Simba 3.2 eller Simba 3.0 innan dess.
Välj Simba 3.2 för snabbast start. Strömma utdata för liveanvändning.

