Hoppa till innehållet

ReadSpeaker speechCloud API

API för text-till-tal till varje app, enhet eller arbetsflöde

Skicka text till en enda REST-endpoint och få tillbaka naturligt tal på 90 språk och 300 röster. SSML, anpassat uttal och sex ljudformat, redo för produktion från första anropet.

Redan kund? Logga in i kundportalen
  • 90 språk
  • 300 röster
  • Baserad i EU, GDPR, ISO 27001

Anlitat av 12 000 kunder världen över

Platshållare för partnerlogotyp 1
Platshållare för partnerlogotyp 2
Platshållare för partnerlogotyp 3
Platshållare för partnerlogotyp 4
Platshållare för partnerlogotyp 5
Platshållare för partnerlogotyp 6
Platshållare för partnerlogotyp 7
Platshållare för partnerlogotyp 8

Prova en röst

Lyssna på vad ditt API kommer att returnera

Fyra röster på fyra språk. Samma motor som du integrerar via API:et.

Adam

Man

Engelska (Storbritannien)

Roxane

Kvinna

Français (France)

Lena

Kvinna

Deutsch (Deutschland)

Sayaka

Kvinna

日本語 (Japan)

Vill ni ha en skräddarsydd röst eller ett språk som inte finns med i listan? Bläddra bland alla 300 röster →

Kundberättelser

Varumärken som bygger röstprodukter med ReadSpeaker

Sonos

ReadSpeakers arbetssätt för skräddarsydda röster är innovativt och ytterst grundligt, precis det vi behövde för det här projektet.

Joseph DureauVice President, Voice Experience · Sonos
Läs hela berättelsen

Molnbaserad talgenerering

I realtid eller satsvis, överallt där er produkt behöver en röst

speechCloud API är en molnbaserad text-till-tal-tjänst från server till server. Anropa den inifrån er egen applikation för att generera ljud direkt till slutanvändare, eller för att producera ljud i stor skala för senare uppspelning. Den ersätter kostsamma manuella inspelningar och körs dygnet runt, så att ni aldrig själva behöver drifta eller skala en text-till-tal-motor.

Realtidsappar och enheter

Lägg till text-till-tal i en mobilapp, en uppkopplad bil, en medicinsk eller industriell apparat, en bärbar enhet eller en kiosk. Strömma ljud vid behov utan att paketera en TTS-motor på enheten, så att fotavtryck och batteriförbrukning förblir låga. Få naturligt tal på 90 språk med ett enda REST-anrop.

  • Mobil
  • IoT
  • Kiosker
  • Bärbara enheter
  • Uppkopplade bilar
  • Medicintekniska produkter

Satsvis ljudproduktion

Generera ljud i stor skala för e-lärandekurser, prov, utbildningsinnehåll, ljudböcker, ljudguider och dialog för film eller animation. Strömmat ljud kan levereras vidare till slutanvändare från er egen infrastruktur när ert avtal tillåter det. Anpassade uttalslexikon ser till att varumärkesnamn och facktermer läses korrekt i varje spår.

  • e-learning
  • Ljudböcker
  • Bedömningar
  • Utbildning
  • Ljudguider
  • Film och animation

Telefoni, IVR och röstagenter

Driv telefonisystem, kontaktcenter och LLM-drivna röstagenter med naturliga röster. Utdataformaten A-law och μ-law är de G.711-kodekar som används i telefonisystem. Använd SSML för att styra tempot, byta språk i flödet och uttala varumärkesnamn via ert anpassade lexikon. Antalet samtidiga realtidskanaler skalar med ert avtal.

  • IVR
  • G.711
  • Röstagenter
  • SSML
  • A-law / μ-law

Funktioner

Text-till-tal i produktion, hela vägen

Allt din produkt behöver för att svara med röst.

90 språk, 300 röster

Välj ur en djup, professionell röstkatalog per språk. Röster licensieras individuellt; lägg till fler när som helst.

SSML som indata

Använd SSML för pauser, fonetiska transkriptioner och byte av röst eller språk inom en och samma text. Standardmärkning i SSML stöds.

Anpassade uttalslexikon

Varje kund kan redigera ett röstspecifikt lexikon i kundportalen för att styra hur varumärkesnamn, facktermer och ovanliga ord uttalas. ReadSpeakers lingvister kan rätta felaktiga uttal på begäran.

Tidsdata (RSDS)

RSDS returnerar ljud och tidsmarkörer i ett och samma svar, vilket sparar krediter jämfört med två separata anrop. Användbart för markering av ord och meningar i ert gränssnitt. Finns endast i MP3 48 kbit/s, och inte för alla röster.

Sex format för ljudutdata

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, rå PCM, WAV. PCM och WAV i 22050, 16000 eller 8000 Hz, 16 bitars djup. Ställs in per förfrågan via API-parametrar.

Strömning eller nedladdning

Sätt streaming=1 för att starta uppspelningen så snart ljudet är klart, perfekt för direktanvändning. Eller hämta den färdiga filen som en enda nedladdning.

REST-API över HTTPS

API-nyckel ingår i varje anrop. Fråga efter tillgängliga språk, röster, aktuell användning och återstående krediter via samma REST-gränssnitt.

SCAPI-kundportalen

Redigera ditt uttalslexikon, följ användning och återstående krediter och byt ut API-nyckeln så snart missbruk misstänks, allt från en och samma portal.

Driftad och redundant infrastruktur

Driftas av ReadSpeaker i en högsäkerhetsmiljö med redundans och failover. Inget att ladda ner eller installera.

Prova det i er miljö

Från text till ljud med en enda förfrågan

En titt på hur ett anrop ser ut på fyra språk. Autentisera med din API-nyckel, som skickas med varje förfrågan.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

Endpointens form är illustrativ. Se den senaste Produktspecifikation and the Customer Portal documentation for the current endpoint URL and parameter names.

Tekniska specifikationer

Alla specifikationer er säkerhetsgranskning kommer att fråga om

Autentisering, transport, språktäckning, genomströmningsgränser och ljudformat. Svaren som era säkerhets- och driftteam behöver före integrationen.

Tekniska specifikationer för speechCloud API
SpecificationValue
AutentiseringAPI-nyckel, som ingår i varje förfrågan
TransportREST över HTTPS
Språk som stöds90 språk
Tillgängliga röster300 röster
Max text per förfrågan5 000 tecken (exklusive blanksteg), standard
Avsedd användningsgräns≤ 25 000 förfrågningar/dag · toppar ≤ 2 000 förfrågningar inom en enskild timme
Format för ljudutdataMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
MP3-bithastigheter16, 24, 32, 48, 64, 128 kbit/s
Samplingsfrekvenser för PCM/WAV22050, 16000, 8000 Hz @ 16 bitar
Teckenkodning för indataUTF-8 rekommenderas; de flesta vanliga teckenkodningar stöds
Stöd för SSMLJa, pauser, fonetiska transkriptioner och byte av röst eller språk i flödet
Tidsdata (RSDS)Ljud + tidsdata i ett och samma svar · för närvarande endast MP3 48 kbit/s · inte alla röster
Strömningslägestreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Regler för lagring av ljudIngen lagring, återanvändning eller vidaredistribution om det inte uttryckligen avtalats i orderbekräftelsen
TelefoniintegrationUtdataformaten A-law och μ-law (G.711-kodekar)
DokumentationProduktspecifikation (PDF)

Prissättning

Betala för det ni genererar, skala när ni behöver

speechCloud API använder en kreditmodell. Produktionskrediter beställs genom er ReadSpeaker Account Manager och läggs till på ert konto av ReadSpeakers supportteam. Nya konton får normalt en begränsad mängd testkrediter för inledande tester.

Begär en offert

Börja kostnadsfritt: nya konton får normalt testkrediter. Begär åtkomst via kontaktformuläret.

Credits

speechCloud API

Kreditmodell1 kredit = 1 tecken, exklusive blanksteg

Så fungerar krediterna

  • 1 kredit = 1 tecken, exklusive blanksteg, inklusive eventuella ändringar från poster i uttalslexikonet
  • Variant per talad sekund available via order confirmation for predictable cost on long audio
  • Testkrediter när kontot skapas so you can evaluate before committing

Licensierad kapacitet mäts i

  • Antal tecken over the contract period
  • Antal förfrågningar and total speech time
  • Samtidiga realtidskanaler for telephony and live use cases
  • Genereringshastighet when responsiveness is critical

Efterlevnad

Efterlevnad du kan lämna direkt till din revisor

ReadSpeaker är en organisation certifierad enligt ISO/IEC 27001:2022, GDPR-förenlig, med standardavtalsklausuler för dataöverföringar över landsgränser.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022, ledningssystem för informationssäkerhet)

    Organisationen ReadSpeaker

  • GDPR (Dataskyddsförordningen)

    Integritetspolicy publicerad

  • EU:s standardavtalsklausuler (EU:s standardavtalsklausuler)

    För överföringar över landsgränser

  • Baserad i EU (Organisation baserad i Europeiska unionen)

    Huvudkontor i Sverige (ReadSpeaker AB, Uppsala)

Vanliga frågor

Frågor om speechCloud API

  • speechCloud API (SCAPI) är ett molndriftat REST-API för text-till-tal från ReadSpeaker. Du skickar text till ReadSpeakers servrar via HTTPS och får tillbaka ljud av hög kvalitet i det format du väljer (MP3, Ogg, PCM, WAV, A-law eller μ-law). Det stöder 90 språk och 300 röster, SSML-märkning, anpassade uttalslexikon och tidsdata för synkroniserad markering. Det är serverbaserat utan någon programvara att installera; integrationen sker via API-nyckel och HTTP-förfrågningar.

  • webReader och docReader är slutanvändarprodukter med ett eget användargränssnitt. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • speechCloud API returnerar ljud i sex format: MP3 (konfigurerbar bithastighet 16, 24, 32, 48, 64 eller 128 kbit/s), Ogg VBR, μ-law, A-law, rå PCM och WAV. PCM och WAV stöder samplingsfrekvenserna 22050, 16000 eller 8000 Hz med 16 bitars djup. Val av format och ljudparametrar sätts per förfrågan via API-parametrarna.

  • Varje förfrågan tar som standard upp till 5 000 tecken, där allt utom blanksteg räknas. Standardtjänsten är dimensionerad för upp till 25 000 förfrågningar per dag, med timtoppar upp till 2 000. Har ni högre eller ihållande trafik? Prata med ReadSpeaker om en dedikerad konfiguration byggd för er volym.

  • Ja. Indata i SSML stöds, inklusive pauser, fonetiska transkriptioner och byte av röst eller språk inom en och samma text. Anpassade uttalslexikon finns också: varje kund kan redigera ett röstspecifikt lexikon i kundportalen för att styra hur varumärkesnamn, facktermer eller ovanliga ord uttalas.

  • Ja. speechCloud API kan returnera RSDS, som kombinerar ljudet och tidsinformationen i ett och samma svar och sparar krediter jämfört med två separata förfrågningar. RSDS finns för närvarande med MP3 i 48 kbit/s och är inte tillgängligt för alla språk eller röster; kontakta ReadSpeaker för den aktuella listan.

  • speechCloud API bygger på krediter: en kredit täcker ett tecken, där allt utom blanksteg räknas, plus eventuella tecken som ert uttalslexikon lägger till. Ni beställer produktionskrediter genom er ReadSpeaker Account Manager, och nya konton börjar vanligtvis med testkrediter. En modell per talad sekund finns på begäran. Kapaciteten kan licensieras efter tecken, förfrågningar, taltid, samtidiga kanaler eller genereringshastighet. Kontakta ReadSpeaker för en offert anpassad till er volym.

  • ReadSpeaker är som organisation certifierat enligt ISO/IEC 27001:2022 och GDPR-förenligt. All API-trafik använder HTTPS. För EU-kunder och dataöverföringar över landsgränser förlitar sig ReadSpeaker på standardavtalsklausuler (SCC). Enligt ReadSpeakers integritetspolicy är ReadSpeakers syntetiserade röster blandade röstmodeller som inte utgör personuppgifter enligt GDPR. Ljuddata får inte lagras, återanvändas eller vidaredistribueras om det inte uttryckligen avtalats i orderbekräftelsen.

  • speechCloud API stöder användningsfall i realtid. Som standard använder förfrågningar strömningsläge (streaming=1), där svaret omdirigeras till en strömningsserver som börjar leverera ljud så snart som möjligt, för kortast möjliga tid till ljud. För satsvis leverans, sätt streaming=0, så returneras filen när den är helt genererad. Antalet samtidiga realtidskanaler ingår i er licensierade kapacitet och kan skalas i orderbekräftelsen.

  • Skapa ett konto hos ReadSpeaker. Nya konton får vanligtvis en begränsad mängd testkrediter så att du kan utvärdera speechCloud API. Din API-nyckel finns i SCAPI-kundportalen och måste skickas med varje förfrågan. Instruktioner för implementering och användning, exempelkod i populära programmeringsspråk och ditt redigerbara uttalslexikon finns också i portalen. Kontakta ReadSpeaker to start your account.

VoiceLab

Behöver du en egen varumärkesröst?

speechCloud API levereras med vår professionella röstkatalog.

En rösttalang som spelar in framför en studiomikrofon

En varumärkesröst som byggs tillsammans med dig i studio

För en helt skräddarsydd varumärkesröst som byggs tillsammans med dig i studio, utforska VoiceLab. ReadSpeakers datorlingvister har skapat varumärkesröster sedan 1999.

Redo att lägga en röst i er produkt?

Testkrediter tillhandahålls normalt när kontot skapas, så att ni kan utvärdera innan ni binder er. Vårt team hjälper er att avgränsa volym, språk och antal samtidiga realtidskanaler för produktion. Certifierat enligt ISO/IEC 27001:2022, GDPR-anpassat med EU:s standardavtalsklausuler.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.