Gå til innholdet

ReadSpeaker speechCloud API

API for tekst til tale, til enhver app, enhet eller arbeidsflyt

Send tekst til ett REST-endepunkt, og få naturlig tale tilbake på 90 språk og 300 stemmer. SSML, egendefinert uttale og seks lydformater, klart for produksjon fra første kall.

Allerede kunde? Logg inn i kundeportalen
  • 90 språk
  • 300 stemmer
  • Basert i EU, GDPR, ISO 27001

Brukt av 12 000 kunder over hele verden

Plassholder for partnerlogo 1
Plassholder for partnerlogo 2
Plassholder for partnerlogo 3
Plassholder for partnerlogo 4
Plassholder for partnerlogo 5
Plassholder for partnerlogo 6
Plassholder for partnerlogo 7
Plassholder for partnerlogo 8

Prøv en stemme

Hør hva API-et ditt kommer til å returnere

Fire stemmer på fire språk. Samme motor som du integrerer via API-et.

Adam

Mann

Engelsk (Storbritannia)

Roxane

Kvinne

Français (France)

Lena

Kvinne

Deutsch (Deutschland)

Sayaka

Kvinne

日本語 (Japan)

Vil du ha en skreddersydd stemme eller et språk som ikke står på listen? Se alle 300 stemmene →

Kundehistorier

Merkevarer som bygger taleprodukter med ReadSpeaker

Sonos

ReadSpeakers tilnærming til skreddersydde stemmer er nyskapende og svært grundig, akkurat det vi trengte til dette prosjektet.

Joseph DureauVice President, Voice Experience · Sonos
Les hele historien

Skybasert talegenerering

Sanntid eller batch, overalt hvor produktet ditt trenger en stemme

speechCloud API er en skybasert tekst-til-tale-tjeneste fra server til server. Kall den inne i deres egen applikasjon for å generere lyd fortløpende til sluttbrukere, eller for å produsere lyd i stort omfang til avspilling senere. Den erstatter kostbare manuelle innspillinger og kjører døgnet rundt, slik at dere aldri trenger å drifte eller skalere en tekst-til-tale-motor selv.

Sanntidsapper og enheter

Legg tekst til tale til en mobilapp, en tilkoblet bil, et medisinsk eller industrielt apparat, en bærbar enhet eller en kiosk. Strøm lyd ved behov uten å pakke en TTS-motor inn på enheten, slik at fotavtrykk og batteriforbruk holdes lavt. Få naturlig tale på 90 språk med ett enkelt REST-kall.

  • Mobil
  • IoT
  • Kiosker
  • Bærbare enheter
  • Tilkoblede biler
  • Medisinsk utstyr

Batchproduksjon av lyd

Generer lyd i stort omfang til e-læringskurs, vurderinger, opplæringsinnhold, lydbøker, lydguider og dialog til filmer eller animasjoner. Strømmet lyd kan serveres videre til sluttbrukere fra deres egen infrastruktur når kontrakten tillater det. Egne uttaleordbøker sørger for at merkenavn og fagtermer leses riktig i hvert eneste spor.

  • e-learning
  • Lydbøker
  • Vurderinger
  • Opplæring
  • Lydguider
  • Film og animasjon

Telefoni, IVR og taleagenter

Gi telefonsystemer, kontaktsentre og taleagenter drevet av språkmodeller naturlige stemmer. Utdataformatene A-law og μ-law er G.711-kodekene som brukes i telefonisystemer. Bruk SSML til å styre tempoet, bytte språk underveis og uttale merkenavn via din egen ordbok. Antall samtidige sanntidskanaler skalerer med kontrakten deres.

  • IVR
  • G.711
  • Taleagenter
  • SSML
  • A-law / μ-law

Funksjoner

Tekst til tale i produksjon, hele veien

Alt produktet ditt trenger for å svare med stemme.

90 språk, 300 stemmer

Velg fra en bred, profesjonell stemmekatalog per språk. Stemmene lisensieres enkeltvis, og dere kan legge til flere når som helst.

SSML som inndata

Bruk SSML til pauser, fonetiske transkripsjoner og bytte av stemme eller språk underveis i én og samme tekst. Standard SSML-oppmerking støttes.

Egne uttaleordbøker

Hver kunde kan redigere en stemmespesifikk ordbok i kundeportalen for å styre hvordan merkenavn, fagtermer og uvanlige ord uttales. ReadSpeakers lingvister kan rette feiluttale på forespørsel.

Tidsdata (RSDS)

RSDS returnerer lyd og tidsmarkører i ett og samme svar, og sparer kreditter sammenlignet med to separate kall. Nyttig for uthevning av ord og setninger i grensesnittet ditt. Kun tilgjengelig i MP3 48 kbit/s, og ikke på alle stemmer.

Seks lydformater ut

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, rå PCM, WAV. PCM og WAV på 22050, 16000 eller 8000 Hz, 16 bits dybde. Angis per forespørsel via API-parametere.

Strømming eller nedlasting

Sett streaming=1 for å starte avspillingen i det øyeblikket lyden er klar, ideelt for direktebruk. Eller ta den ferdige filen som én nedlasting.

REST-API over HTTPS

API-nøkkel følger med hvert kall. Spør etter tilgjengelige språk, stemmer, gjeldende forbruk og gjenstående kreditter via det samme REST-grensesnittet.

SCAPI-kundeportalen

Rediger uttaleordboken din, følg med på forbruk og gjenstående kreditter, og lag en ny API-nøkkel i det øyeblikket du mistenker misbruk, alt fra én portal.

Driftet og redundant infrastruktur

Driftet av ReadSpeaker i et høysikkerhetsmiljø med redundans og failover. Ingenting å laste ned eller installere.

Prøv det i systemene deres

Fra tekst til lyd med én forespørsel

Et innblikk i hvordan et kall ser ut på fire språk. Autentiser med API-nøkkelen din, som sendes med hver forespørsel.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

Formen på endepunktet er illustrerende. Se den nyeste Produktspesifikasjon and the Customer Portal documentation for the current endpoint URL and parameter names.

Tekniske spesifikasjoner

Alle spesifikasjoner sikkerhetsgjennomgangen deres vil spørre om

Autentisering, transport, språkdekning, kapasitetsgrenser og lydformater. Svarene sikkerhets- og driftsteamet trenger før integrasjon.

Tekniske spesifikasjoner for speechCloud API
SpecificationValue
AutentiseringAPI-nøkkel, sendt med hver forespørsel
TransportREST over HTTPS
Språk som støttes90 språk
Stemmer tilgjengelig300 stemmer
Maks tekst per forespørsel5 000 tegn (mellomrom ikke medregnet), standard
Tiltenkt bruksgrense≤ 25 000 forespørsler per dag · topper ≤ 2 000 forespørsler innenfor én time
Lydformater utMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
MP3-bitrater16, 24, 32, 48, 64, 128 kbit/s
Samplingsfrekvenser for PCM / WAV22050, 16000, 8000 Hz @ 16 bits
Tegnkoding innUTF-8 anbefales, de fleste vanlige tegnkodinger støttes
SSML-støtteJa: pauser, fonetiske transkripsjoner og bytte av stemme eller språk underveis
Tidsdata (RSDS)Lyd og tidsdata i ett svar · foreløpig kun MP3 48 kbit/s · ikke alle stemmer
Strømmemodusstreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Regler for lagring av lydIngen lagring, gjenbruk eller videredistribusjon med mindre det er uttrykkelig avtalt i ordrebekreftelsen
TelefoniintegrasjonA-law- og μ-law-utdataformater (G.711-kodeker)
DokumentasjonProduktspesifikasjon (PDF)

Priser

Betal for det du genererer, skaler når du trenger det

speechCloud API bruker en kredittmodell. Produksjonskreditter bestilles gjennom kundeansvarlig hos ReadSpeaker og legges til kontoen deres av ReadSpeakers supportteam. Nye kontoer får vanligvis en begrenset mengde prøvekreditter til den første testingen.

Be om et tilbud

Start gratis: nye kontoer får som regel prøvekreditter. Be om tilgang via kontaktskjemaet.

Credits

speechCloud API

Kredittmodell1 kreditt = 1 tegn, mellomrom ikke medregnet

Slik fungerer kreditter

  • 1 kreditt = 1 tegn, mellomrom ikke medregnet, inkludert eventuelle endringer fra oppføringer i uttaleordboken
  • Variant per talesekund available via order confirmation for predictable cost on long audio
  • Prøvekreditter ved oppstart av konto so you can evaluate before committing

Lisensiert kapasitet måles i

  • Antall tegn over the contract period
  • Antall forespørsler and total speech time
  • Samtidige sanntidskanaler for telephony and live use cases
  • Genereringshastighet when responsiveness is critical

Samsvar

Samsvarsdokumentasjon du kan gi rett til revisoren

ReadSpeaker er en organisasjon sertifisert etter ISO/IEC 27001:2022, i samsvar med GDPR, med standard personvernbestemmelser for overføringer på tvers av landegrenser.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022: styringssystem for informasjonssikkerhet)

    ReadSpeaker som organisasjon

  • GDPR (Personvernforordningen (GDPR))

    Personvernerklæring publisert

  • EUs standard personvernbestemmelser (EUs standard personvernbestemmelser (SCC))

    For overføringer på tvers av landegrenser

  • Basert i EU (Organisasjon basert i Den europeiske union)

    Hovedkontor i Sverige (ReadSpeaker AB, Uppsala)

Vanlige spørsmål

Spørsmål om speechCloud API

  • speechCloud API (SCAPI) er et skydriftet REST-API for tekst til tale fra ReadSpeaker. Dere sender tekst til ReadSpeakers servere via HTTPS og får tilbake lyd av høy kvalitet i det formatet dere velger (MP3, Ogg, PCM, WAV, A-law eller μ-law). Det støtter 90 språk og 300 stemmer, SSML-oppmerking, egne uttaleordbøker og tidsdata for synkronisert uthevning. Det er serverbasert, uten programvare å installere, og integrasjonen skjer via API-nøkkel og HTTP-forespørsler.

  • webReader og docReader er sluttbrukerprodukter med sitt eget brukergrensesnitt. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • speechCloud API returnerer lyd i seks formater: MP3 (konfigurerbar bitrate på 16, 24, 32, 48, 64 eller 128 kbit/s), Ogg VBR, μ-law, A-law, rå PCM og WAV. PCM og WAV støtter samplingsfrekvensene 22050, 16000 eller 8000 Hz med 16 bits dybde. Valg av format og lydparametere angis per forespørsel via API-parameterne.

  • Hver forespørsel tar som standard opptil 5 000 tegn, der alt utenom mellomrom telles med. Standardtjenesten er dimensjonert for opptil 25 000 forespørsler om dagen, med timestopper opp til 2 000. Har dere høyere eller vedvarende trafikk? Snakk med ReadSpeaker om et dedikert oppsett tilpasset volumet deres.

  • Ja. SSML støttes som inndata, inkludert pauser, fonetiske transkripsjoner og bytte av stemme eller språk underveis i én og samme tekst. Egne uttaleordbøker er også tilgjengelige: hver kunde kan redigere en stemmespesifikk ordbok i kundeportalen for å styre hvordan merkenavn, fagtermer eller uvanlige ord uttales.

  • Ja. speechCloud API kan returnere RSDS, som kombinerer lyden og tidsinformasjonen i ett og samme svar, og dermed sparer kreditter sammenlignet med to separate forespørsler. RSDS er foreløpig tilgjengelig med MP3 på 48 kbit/s og er ikke tilgjengelig for alle språk eller stemmer. Kontakt ReadSpeaker for den oppdaterte listen.

  • speechCloud API bruker kreditter: én kreditt dekker ett tegn, der alt utenom mellomrom telles med, pluss eventuelle tegn som uttaleordboken din legger til. Dere bestiller produksjonskreditter gjennom kundeansvarlig hos ReadSpeaker, og nye kontoer starter vanligvis med prøvekreditter. En modell basert på talesekunder er tilgjengelig på forespørsel. Kapasitet kan lisensieres etter tegn, forespørsler, taletid, samtidige kanaler eller genereringshastighet. Kontakt ReadSpeaker for et tilbud tilpasset volumet deres.

  • ReadSpeaker er som organisasjon sertifisert etter ISO/IEC 27001:2022 og i samsvar med GDPR. All API-trafikk går over HTTPS. For kunder i EU og for overføringer på tvers av landegrenser støtter ReadSpeaker seg på standard personvernbestemmelser (SCC). I henhold til ReadSpeakers personvernerklæring er ReadSpeakers syntetiserte stemmer sammensatte stemmemodeller som ikke utgjør personopplysninger etter GDPR. Lyddata skal ikke lagres, gjenbrukes eller videredistribueres med mindre det er uttrykkelig avtalt i ordrebekreftelsen.

  • speechCloud API støtter bruk i sanntid. Som standard bruker forespørsler strømmemodus (streaming=1), der svaret videresendes til en strømmeserver som begynner å levere lyd så raskt som mulig, for kortest mulig tid til første lyd. For batchlevering settes streaming=0, og filen returneres når den er ferdig generert. Antall samtidige sanntidskanaler inngår i den lisensierte kapasiteten deres og kan skaleres i ordrebekreftelsen.

  • Opprett en konto hos ReadSpeaker. Nye kontoer får vanligvis en begrenset mengde prøvekreditter, slik at du kan evaluere speechCloud API. API-nøkkelen din er tilgjengelig i SCAPI-kundeportalen og må sendes med hver forespørsel. Implementerings- og brukerveiledninger, eksempelkode i populære programmeringsspråk og din redigerbare uttaleordbok er også tilgjengelig fra portalen. Kontakt ReadSpeaker to start your account.

VoiceLab

Trenger du en egen merkevarestemme?

speechCloud API leveres med vår profesjonelle stemmekatalog.

En stemmeskuespiller som spiller inn foran en studiomikrofon

En merkevarestemme bygget sammen med deg i studio

For en helt skreddersydd merkevarestemme bygget sammen med deg i studio, utforsk VoiceLab. ReadSpeakers datalingvister har laget merkevarestemmer siden 1999.

Klar til å gi produktet ditt en stemme?

Prøvekreditter gis vanligvis når kontoen opprettes, slik at dere kan evaluere før dere forplikter dere. Teamet vårt hjelper dere med å dimensjonere volum, språk og samtidige sanntidskanaler for produksjon. Sertifisert etter ISO/IEC 27001:2022, i tråd med GDPR og med EUs standard personvernbestemmelser.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.