Gå til indhold

ReadSpeaker speechCloud API

Tekst-til-tale-API til enhver app, enhed eller arbejdsgang

Send tekst til ét REST-endpoint, og få naturlig tale tilbage på 90 sprog og med 300 stemmer. SSML, tilpasset udtale og seks lydformater, klar til produktion fra det første kald.

Er du allerede kunde? Log ind på kundeportalen
  • 90 sprog
  • 300 stemmer
  • Baseret i EU, GDPR, ISO 27001

12.000 kunder verden over har tillid til os

Pladsholder til partnerlogo 1
Pladsholder til partnerlogo 2
Pladsholder til partnerlogo 3
Pladsholder til partnerlogo 4
Pladsholder til partnerlogo 5
Pladsholder til partnerlogo 6
Pladsholder til partnerlogo 7
Pladsholder til partnerlogo 8

Prøv en stemme

Lyt til det, jeres API vil returnere

Fire stemmer på fire sprog. Samme motor, som I integrerer via API'et.

Adam

Mand

Engelsk (Storbritannien)

Roxane

Kvinde

Français (France)

Lena

Kvinde

Deutsch (Deutschland)

Sayaka

Kvinde

日本語 (Japan)

Ønsker I en skræddersyet stemme eller et sprog, der ikke står på listen? Gennemse alle 300 stemmer →

Kundehistorier

Brands, der bygger stemmeprodukter med ReadSpeaker

Sonos

ReadSpeakers tilgang til skræddersyede stemmer er innovativ og yderst grundig, præcis hvad vi havde brug for i dette projekt.

Joseph DureauVice President, Voice Experience · Sonos
Læs hele historien

Skybaseret talegenerering

I realtid eller som batch, overalt hvor jeres produkt har brug for en stemme

speechCloud API er en skybaseret tekst-til-tale-tjeneste fra server til server. Kald den inde i jeres egen applikation for at generere lyd i farten til slutbrugerne, eller for at producere lyd i store mængder til senere afspilning. Den erstatter dyre manuelle indspilninger og kører døgnet rundt, så I aldrig selv skal hoste eller skalere en tekst-til-tale-motor.

Realtidsapps og -enheder

Tilføj tekst-til-tale til en mobilapp, en opkoblet bil, et medicinsk eller industrielt apparat, en wearable eller en kiosk. Stream lyd efter behov uden at pakke en TTS-motor ind på enheden, så fodaftryk og batteriforbrug forbliver lave. Modtag naturlig tale på 90 sprog med ét enkelt REST-kald.

  • Mobil
  • IoT
  • Kiosker
  • Wearables
  • Opkoblede biler
  • Medicinsk udstyr

Batchproduktion af lyd

Generér lyd i store mængder til e-læringskurser, prøver, træningsindhold, lydbøger, lydguider og dialog til film eller animationer. Streamet lyd kan leveres videre til slutbrugerne fra jeres egen infrastruktur, når jeres kontrakt tillader det. Tilpassede udtaleordbøger sikrer, at mærkenavne og fagtermer læses korrekt op i hvert eneste spor.

  • e-learning
  • Lydbøger
  • Prøver og evalueringer
  • Træning
  • Lydguider
  • Film og animation

Telefoni, IVR og stemmeagenter

Driv telefonsystemer, kontaktcentre og LLM-drevne stemmeagenter med naturlige stemmer. A-law- og μ-law-outputformaterne er de G.711-codecs, der bruges i telefonisystemer. Brug SSML til at styre tempoet, skifte sprog undervejs og udtale mærkenavne via jeres egen ordbog. Antallet af samtidige realtidskanaler skalerer med jeres kontrakt.

  • IVR
  • G.711
  • Stemmeagenter
  • SSML
  • A-law / μ-law

Funktioner

Tekst-til-tale i produktion, hele vejen igennem

Alt, hvad jeres produkt har brug for for at kunne svare med tale.

90 sprog, 300 stemmer

Vælg fra et dybt og professionelt stemmekatalog pr. sprog. Stemmer licenseres enkeltvis; I kan tilføje flere når som helst.

SSML-input

Brug SSML til pauser, fonetiske transskriptioner og skift af stemme eller sprog undervejs i den samme tekst. Standard SSML-markup understøttes.

Tilpassede udtaleordbøger

Hver kunde kan redigere en stemmespecifik ordbog i kundeportalen for at styre, hvordan mærkenavne, fagtermer og usædvanlige ord udtales. ReadSpeakers lingvister kan rette fejludtale efter anmodning.

Timingdata (RSDS)

RSDS returnerer lyd og timingmarkører i ét enkelt svar og sparer kreditter sammenlignet med to separate kald. Nyttigt til fremhævning af ord og sætninger i jeres brugerflade. Findes kun i MP3 48 kbps og ikke på alle stemmer.

Seks lydoutputformater

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, rå PCM, WAV. PCM og WAV ved 22050, 16000 eller 8000 Hz, 16-bit dybde. Angives pr. anmodning via API-parametre.

Streaming eller download

Sæt streaming=1 for at starte afspilningen i samme øjeblik lyden er klar, ideelt til live brug. Eller hent den færdige fil som én download.

REST-API over HTTPS

API-nøgle medsendes ved hvert kald. Forespørg på tilgængelige sprog, stemmer, aktuelt forbrug og resterende kreditter via den samme REST-grænseflade.

SCAPI-kundeportalen

Redigér jeres udtaleordbog, følg forbrug og resterende kreditter, og udsted en ny API-nøgle i samme øjeblik I har mistanke om misbrug, alt sammen fra én portal.

Hostet og redundant infrastruktur

Hostet af ReadSpeaker i et miljø med høj sikkerhed, redundans og failover. Intet at downloade eller installere.

Prøv det i jeres stack

Fra tekst til lyd med én anmodning

Et kig på, hvordan et kald ser ud på fire sprog. Godkend med jeres API-nøgle, som sendes med hver anmodning.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

Endpointets form er vejledende. Se den seneste Produktspecifikation and the Customer Portal documentation for the current endpoint URL and parameter names.

Tekniske specifikationer

Alle de specifikationer, jeres sikkerhedsgennemgang vil spørge om

Godkendelse, transport, sprogdækning, gennemstrømningsgrænser og lydformater. De svar, jeres sikkerheds- og driftsteam har brug for før integrationen.

Tekniske specifikationer for speechCloud API
SpecificationValue
GodkendelseAPI-nøgle, medsendt ved hver anmodning
TransportREST over HTTPS
Understøttede sprog90 sprog
Tilgængelige stemmer300 stemmer
Maks. tekst pr. anmodning5.000 tegn (eksklusive mellemrum), standard
Forventet forbrugsgrænse≤ 25.000 anmodninger/dag · spidser ≤ 2.000 anmodninger inden for én time
LydoutputformaterMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
MP3-bitrater16, 24, 32, 48, 64, 128 kbit/s
PCM- og WAV-samplingsfrekvenser22050, 16000, 8000 Hz @ 16-bit
InputkodningUTF-8 anbefales; de fleste almindelige kodninger understøttes
SSML-understøttelseJa, pauser, fonetiske transskriptioner og skift af stemme eller sprog undervejs
Timingdata (RSDS)Lyd og timingdata i ét svar · i øjeblikket kun MP3 48 kbit/s · ikke alle stemmer
Streamingtilstandstreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Regler for lagring af lydIngen lagring, genbrug eller videredistribution, medmindre det udtrykkeligt er aftalt i ordrebekræftelsen
TelefoniintegrationA-law- og μ-law-outputformater (G.711-codecs)
DokumentationProduktspecifikation (PDF)

Priser

Betal for det, I genererer, og skalér når I har brug for det

speechCloud API bruger en kreditmodel. Produktionskreditter bestilles gennem jeres ReadSpeaker Account Manager og tilføjes jeres konto af ReadSpeakers supportteam. Nye konti får typisk et begrænset antal prøvekreditter til den indledende test.

Bed om et tilbud

Start gratis: nye konti får typisk prøvekreditter. Anmod om adgang via kontaktformularen.

Credits

speechCloud API

Kreditmodel1 kredit = 1 tegn, eksklusive mellemrum

Sådan fungerer kreditter

  • 1 kredit = 1 tegn, eksklusive mellemrum, inklusive eventuelle ændringer fra poster i udtaleordbogen
  • Variant pr. sekund tale available via order confirmation for predictable cost on long audio
  • Prøvekreditter ved oprettelse af konto so you can evaluate before committing

Den licenserede kapacitet måles på

  • Antal tegn over the contract period
  • Antal anmodninger and total speech time
  • Samtidige realtidskanaler for telephony and live use cases
  • Genereringshastighed when responsiveness is critical

Overholdelse

Dokumentation for overholdelse, som I kan give direkte til jeres revisor

ReadSpeaker er en ISO/IEC 27001:2022-certificeret organisation, GDPR-kompatibel og med standardkontraktbestemmelser til dataoverførsler på tværs af grænser.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022, styring af informationssikkerhed)

    ReadSpeaker som organisation

  • GDPR (Databeskyttelsesforordningen)

    Privatlivspolitik offentliggjort

  • EU SCC'er (EU's standardkontraktbestemmelser)

    Til overførsler på tværs af grænser

  • Baseret i EU (Organisation hjemmehørende i Den Europæiske Union)

    Hovedkontor i Sverige (ReadSpeaker AB, Uppsala)

FAQ

Spørgsmål om speechCloud API

  • speechCloud API (SCAPI) er en skyhostet REST-API til tekst-til-tale fra ReadSpeaker. I sender tekst til ReadSpeakers servere via HTTPS og modtager lyd af høj kvalitet retur i det format, I vælger (MP3, Ogg, PCM, WAV, A-law eller μ-law). Den understøtter 90 sprog og 300 stemmer, SSML-markup, tilpassede udtaleordbøger og timingdata til synkroniseret fremhævning. Den er serverbaseret uden software at installere; integrationen sker via API-nøgle og HTTP-anmodninger.

  • webReader og docReader er slutbrugerprodukter med deres egen brugerflade. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • speechCloud API returnerer lyd i seks formater: MP3 (bitrate kan konfigureres til 16, 24, 32, 48, 64 eller 128 kbit/s), Ogg VBR, μ-law, A-law, rå PCM og WAV. PCM og WAV understøtter samplingsfrekvenser på 22050, 16000 eller 8000 Hz ved 16-bit dybde. Valget af format og lydparametre angives pr. anmodning via API-parametrene.

  • Hver anmodning rummer som standard op til 5.000 tegn, hvor alt undtagen mellemrum tælles med. Standardtjenesten er dimensioneret til op til 25.000 anmodninger om dagen med timespidser på op til 2.000. Har I større eller vedvarende trafik? Tal med ReadSpeaker om en dedikeret konfiguration bygget til jeres volumen.

  • Ja. SSML-input understøttes, herunder pauser, fonetiske transskriptioner og skift af stemme eller sprog undervejs i den samme tekst. Der findes også tilpassede udtaleordbøger: hver kunde kan redigere en stemmespecifik ordbog i kundeportalen for at styre, hvordan mærkenavne, fagtermer eller usædvanlige ord udtales.

  • Ja. speechCloud API kan returnere RSDS, som kombinerer lyden og timingoplysningerne i ét enkelt svar og sparer kreditter sammenlignet med to separate anmodninger. RSDS findes i øjeblikket med MP3 ved 48 kbit/s og er ikke tilgængelig for alle sprog eller stemmer; kontakt ReadSpeaker for den aktuelle liste.

  • speechCloud API kører på kreditter: én kredit dækker ét tegn, hvor alt undtagen mellemrum tælles med, plus de tegn jeres udtaleordbog tilføjer. I bestiller produktionskreditter gennem jeres ReadSpeaker Account Manager, og nye konti starter som regel med prøvekreditter. En model pr. sekund tale er tilgængelig på forespørgsel. Kapaciteten kan licenseres efter tegn, anmodninger, taletid, samtidige kanaler eller genereringshastighed. Kontakt ReadSpeaker for et tilbud, der matcher jeres volumen.

  • ReadSpeaker er som organisation ISO/IEC 27001:2022-certificeret og GDPR-kompatibel. Al API-trafik bruger HTTPS. For EU-kunder og dataoverførsler på tværs af grænser bygger ReadSpeaker på standardkontraktbestemmelser (SCC'er). Ifølge ReadSpeakers privatlivspolitik er ReadSpeakers syntetiserede stemmer blandede stemmemodeller, der ikke udgør personoplysninger i henhold til GDPR. Lyddata må ikke lagres, genbruges eller videredistribueres, medmindre det udtrykkeligt er aftalt i ordrebekræftelsen.

  • speechCloud API understøtter anvendelser i realtid. Som standard bruger anmodninger streamingtilstand (streaming=1), hvor svaret omdirigerer til en streamingserver, der begynder at levere lyd hurtigst muligt, for den korteste tid til lyd. Til batchlevering sættes streaming=0, og filen returneres, når den er fuldt genereret. Antallet af samtidige realtidskanaler er en del af jeres licenserede kapacitet og kan skaleres i ordrebekræftelsen.

  • Opret en konto hos ReadSpeaker. Nye konti får typisk et begrænset antal prøvekreditter, så du kan evaluere speechCloud API. Din API-nøgle findes i SCAPI-kundeportalen og skal medsendes ved hver anmodning. Implementerings- og brugervejledninger, eksempelkode i populære programmeringssprog og din redigerbare udtaleordbog er også tilgængelige fra portalen. Kontakt ReadSpeaker to start your account.

VoiceLab

Har I brug for jeres egen brandstemme?

speechCloud API leveres med vores professionelle stemmekatalog.

En stemmeskuespiller, der indspiller foran en studiemikrofon

En brandstemme skabt sammen med jer i studiet

For en helt skræddersyet brandstemme skabt sammen med jer i studiet, udforsk VoiceLab. ReadSpeakers computerlingvister har skabt brandstemmer siden 1999.

Klar til at lægge en stemme ind i jeres produkt?

Der gives typisk prøvekreditter ved oprettelse af kontoen, så I kan evaluere, før I binder jer. Vores team hjælper jer med at afgrænse volumen, sprog og samtidige realtidskanaler til produktion. ISO/IEC 27001:2022-certificeret og GDPR-tilpasset med EU's standardkontraktbestemmelser.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.