Vai al contenuto

ReadSpeaker speechCloud API

API di sintesi vocale per qualsiasi app, dispositivo o flusso di lavoro

Invii il testo a un solo endpoint REST e riceva voce naturale in 90 lingue e 300 voci. SSML, pronuncia personalizzata e sei formati audio, pronti per la produzione già dalla prima chiamata.

È già cliente? Acceda al Portale Clienti
  • 90 lingue
  • 300 voci
  • Con sede nell'UE, GDPR, ISO 27001

Scelto da 12.000 clienti in tutto il mondo

Segnaposto logo partner 1
Segnaposto logo partner 2
Segnaposto logo partner 3
Segnaposto logo partner 4
Segnaposto logo partner 5
Segnaposto logo partner 6
Segnaposto logo partner 7
Segnaposto logo partner 8

Provi una voce

Ascolti che cosa restituirà la sua API

Quattro voci in quattro lingue. Lo stesso motore che integrerà tramite l'API.

Adam

Maschile

Inglese (Regno Unito)

Roxane

Femminile

Français (France)

Lena

Femminile

Deutsch (Deutschland)

Sayaka

Femminile

日本語 (Japan)

Le serve una voce su misura o una lingua non elencata? Scopra tutte le 300 voci →

Storie dei clienti

Marchi che costruiscono prodotti vocali con ReadSpeaker

Sonos

L'approccio di ReadSpeaker alla voce su misura è innovativo ed estremamente accurato, esattamente ciò di cui avevamo bisogno per questo progetto.

Joseph DureauVice President, Voice Experience · Sonos
Legga la storia completa

Generazione vocale basata sul cloud

In tempo reale o in blocco, ovunque il suo prodotto abbia bisogno di una voce

speechCloud API è un servizio di sintesi vocale basato sul cloud, da server a server. Lo richiami dentro la sua applicazione per generare audio al volo per gli utenti finali, oppure per produrre audio in blocco da riprodurre in seguito. Sostituisce registrazioni manuali costose e funziona 24 ore su 24, così non deve mai ospitare né dimensionare un motore di sintesi vocale.

App e dispositivi in tempo reale

Aggiunga la sintesi vocale a un'app mobile, un'auto connessa, un apparecchio medicale o industriale, un dispositivo indossabile o un chiosco. Trasmetta l'audio su richiesta senza integrare un motore TTS sul dispositivo, così ingombro e batteria restano contenuti. Riceva voce naturale in 90 lingue con una sola chiamata REST.

  • Mobile
  • IoT
  • Chioschi
  • Dispositivi indossabili
  • Auto connesse
  • Dispositivi medicali

Produzione audio in blocco

Generi audio in blocco per corsi e-learning, verifiche, contenuti formativi, audiolibri, audioguide e dialoghi per film o animazioni. L'audio in streaming può essere servito agli utenti finali dalla sua infrastruttura quando il contratto lo consente. I dizionari di pronuncia personalizzati garantiscono che nomi di marca e termini tecnici siano letti correttamente in ogni traccia.

  • e-learning
  • Audiolibri
  • Verifiche
  • Formazione
  • Audioguide
  • Film e animazione

Telefonia, IVR e agenti vocali

Dia una voce naturale a centralini telefonici, contact center e agenti vocali basati su LLM. I formati di uscita A-law e μ-law sono i codec G.711 usati nei sistemi telefonici. Usi SSML per controllare il ritmo, cambiare lingua al volo e pronunciare i nomi di marca tramite il suo dizionario personalizzato. I canali simultanei in tempo reale crescono con il suo contratto.

  • IVR
  • G.711
  • Agenti vocali
  • SSML
  • A-law / μ-law

Funzionalità

Sintesi vocale di produzione, dall'inizio alla fine

Tutto ciò che serve al suo prodotto per rispondere a voce.

90 lingue, 300 voci

Scelga da un catalogo di voci professionali ampio per ogni lingua. Le voci sono concesse in licenza singolarmente; può aggiungerne altre in qualsiasi momento.

Input SSML

Usi SSML per pause, trascrizioni fonetiche e cambio di voce o lingua all'interno di un unico testo. La marcatura SSML standard è supportata.

Dizionari di pronuncia personalizzati

Ogni cliente può modificare un dizionario specifico per voce nel portale clienti, per controllare la pronuncia di nomi di marca, termini tecnici e parole insolite. Su richiesta, i linguisti di ReadSpeaker possono correggere le pronunce errate.

Dati di sincronizzazione (RSDS)

RSDS restituisce audio e marcatori di sincronizzazione in un'unica risposta, facendole risparmiare crediti rispetto a due chiamate separate. Utile per evidenziare parole e frasi nella sua interfaccia. Disponibile solo in MP3 a 48 kbps e non su tutte le voci.

Sei formati di uscita audio

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, PCM raw, WAV. PCM e WAV a 22050, 16000 o 8000 Hz, profondità 16 bit. Impostabili per singola richiesta tramite i parametri dell'API.

Streaming o download

Imposti streaming=1 per avviare la riproduzione non appena l'audio è pronto, ideale per l'uso dal vivo. Oppure scarichi il file finito in un'unica soluzione.

API REST su HTTPS

Chiave API inclusa in ogni chiamata. Interroghi lingue disponibili, voci, consumo attuale e crediti residui tramite la stessa interfaccia REST.

Portale clienti SCAPI

Modifichi il suo dizionario di pronuncia, controlli consumo e crediti residui e rigeneri una nuova chiave API nel momento in cui sospetta un uso improprio, il tutto da un unico portale.

Infrastruttura ospitata e ridondante

Ospitato da ReadSpeaker in un ambiente ad alta sicurezza con ridondanza e failover. Nulla da scaricare o installare.

Lo provi nella sua infrastruttura

Dal testo all'audio con una sola richiesta

Ecco come si presenta una chiamata in quattro linguaggi. L'autenticazione avviene con la sua chiave API, inviata a ogni richiesta.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

La forma dell'endpoint è solo indicativa. Faccia riferimento alla versione più recente della Scheda tecnica di prodotto and the Customer Portal documentation for the current endpoint URL and parameter names.

Specifiche tecniche

Ogni specifica che la sua revisione di sicurezza chiederà

Autenticazione, trasporto, copertura linguistica, limiti di throughput e formati audio. Le risposte di cui i suoi team di sicurezza e operations hanno bisogno prima dell'integrazione.

Specifiche tecniche di speechCloud API
SpecificationValue
AutenticazioneChiave API, inclusa in ogni richiesta
TrasportiREST su HTTPS
Lingue supportate90 lingue
Voci disponibili300 voci
Testo massimo per richiesta5.000 caratteri (spazi esclusi), valore predefinito
Limite di utilizzo previsto≤ 25.000 richieste al giorno · picchi ≤ 2.000 richieste in una sola ora
Formati di uscita audioMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
Bitrate MP316, 24, 32, 48, 64, 128 kbit/s
Frequenze di campionamento PCM / WAV22050, 16000, 8000 Hz a 16 bit
Codifica di inputUTF-8 consigliato; supportate le codifiche più diffuse
Supporto SSMLSì: pause, trascrizioni fonetiche, cambio di voce e lingua al volo
Dati di sincronizzazione (RSDS)Audio e sincronizzazione in un'unica risposta · al momento solo MP3 a 48 kbit/s · non tutte le voci
Modalità streamingstreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Regole di conservazione dell'audioNessuna conservazione, riutilizzo o ridistribuzione, salvo accordo esplicito nella conferma d'ordine
Integrazione telefonicaFormati di uscita A-law e μ-law (codec G.711)
DocumentazioneScheda tecnica di prodotto (PDF)

Prezzi

Paghi quello che genera, cresca quando serve

speechCloud API usa un modello a crediti. I crediti di produzione si ordinano tramite il suo Account Manager ReadSpeaker e vengono aggiunti al suo account dal team di supporto ReadSpeaker. I nuovi account ricevono di norma una quantità limitata di crediti di prova per i primi test.

Richieda un preventivo

Cominci gratis: i nuovi account ricevono di norma crediti di prova. Richieda l'accesso tramite il modulo di contatto.

Credits

speechCloud API

Modello a crediti1 credito = 1 carattere, spazi esclusi

Come funzionano i crediti

  • 1 credito = 1 carattere, spazi esclusi, comprese le modifiche introdotte dalle voci del dizionario di pronuncia
  • Variante al secondo di parlato available via order confirmation for predictable cost on long audio
  • Crediti di prova all'apertura dell'account so you can evaluate before committing

La capacità in licenza si misura in base a

  • Numero di caratteri over the contract period
  • Numero di richieste and total speech time
  • Canali simultanei in tempo reale for telephony and live use cases
  • Velocità di generazione when responsiveness is critical

Conformità

Una conformità che può consegnare direttamente al suo auditor

ReadSpeaker è un'organizzazione certificata ISO/IEC 27001:2022, conforme al GDPR, con clausole contrattuali standard per i trasferimenti transfrontalieri di dati.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022, gestione della sicurezza delle informazioni)

    Organizzazione ReadSpeaker

  • GDPR (Regolamento generale sulla protezione dei dati)

    Informativa sulla privacy pubblicata

  • SCC dell'UE (Clausole contrattuali standard dell'UE)

    Per i trasferimenti transfrontalieri

  • Con sede nell'UE (Organizzazione con sede nell'Unione europea)

    Sede centrale in Svezia (ReadSpeaker AB, Uppsala)

FAQ

Domande su speechCloud API

  • speechCloud API (SCAPI) è un'API REST di sintesi vocale ospitata nel cloud di ReadSpeaker. Invia il testo ai server ReadSpeaker via HTTPS e riceve audio di alta qualità nel formato che preferisce (MP3, Ogg, PCM, WAV, A-law o μ-law). Supporta 90 lingue e 300 voci, la marcatura SSML, i dizionari di pronuncia personalizzati e i dati di sincronizzazione per l'evidenziazione sincronizzata. Funziona su server, senza software da installare; l'integrazione avviene tramite chiave API e richieste HTTP.

  • webReader e docReader sono prodotti per l'utente finale, con una loro interfaccia. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • speechCloud API restituisce l'audio in sei formati: MP3 (bitrate configurabile a 16, 24, 32, 48, 64 o 128 kbit/s), Ogg VBR, μ-law, A-law, PCM raw e WAV. PCM e WAV supportano frequenze di campionamento di 22050, 16000 o 8000 Hz con profondità a 16 bit. La scelta del formato e dei parametri audio si imposta per singola richiesta tramite i parametri dell'API.

  • Ogni richiesta accetta per impostazione predefinita fino a 5.000 caratteri, conteggiando tutto tranne gli spazi. Il servizio standard è dimensionato per un massimo di 25.000 richieste al giorno, con picchi orari fino a 2.000. Ha bisogno di volumi superiori o di traffico costante? Parli con ReadSpeaker di una configurazione dedicata, costruita sul suo volume.

  • Sì. L'input SSML è supportato, comprese pause, trascrizioni fonetiche e cambio di voce o lingua all'interno di un unico testo. Sono disponibili anche dizionari di pronuncia personalizzati: ogni cliente può modificare nel portale clienti un dizionario specifico per voce, per controllare la pronuncia di nomi di marca, termini tecnici o parole insolite.

  • Sì. speechCloud API può restituire RSDS, che unisce l'audio e le informazioni di sincronizzazione in un'unica risposta, facendo risparmiare crediti rispetto a due richieste separate. RSDS è attualmente disponibile con MP3 a 48 kbit/s e non per tutte le lingue o le voci; contatti ReadSpeaker per l'elenco aggiornato.

  • speechCloud API funziona a crediti: un credito copre un carattere, conteggiando tutto tranne gli spazi, più i caratteri aggiunti dal suo dizionario di pronuncia. I crediti di produzione si ordinano tramite il suo Account Manager ReadSpeaker, e i nuovi account partono di norma con crediti di prova. Su richiesta è disponibile un modello al secondo di parlato. La capacità può essere concessa in licenza a caratteri, richieste, tempo di parlato, canali simultanei o velocità di generazione. Contatti ReadSpeaker per un preventivo calibrato sul suo volume.

  • Come organizzazione, ReadSpeaker è certificata ISO/IEC 27001:2022 e conforme al GDPR. Tutto il traffico dell'API usa HTTPS. Per i clienti dell'UE e i trasferimenti transfrontalieri di dati, ReadSpeaker si basa sulle clausole contrattuali standard (SCC). Secondo l'informativa sulla privacy di ReadSpeaker, le voci sintetizzate di ReadSpeaker sono modelli vocali misti che non costituiscono dati personali ai sensi del GDPR. I dati audio non devono essere conservati, riutilizzati o ridistribuiti, salvo accordo esplicito nella conferma d'ordine.

  • speechCloud API supporta i casi d'uso in tempo reale. Per impostazione predefinita, le richieste usano la modalità streaming (streaming=1), in cui la risposta reindirizza a un server di streaming che comincia a fornire l'audio il prima possibile, per il tempo di attesa più breve. Per la consegna in blocco, imposti streaming=0 e il file viene restituito una volta generato per intero. Il numero di canali simultanei in tempo reale fa parte della capacità in licenza e può essere aumentato nella conferma d'ordine.

  • Crei un account ReadSpeaker. I nuovi account ricevono di norma una quantità limitata di crediti di prova per valutare speechCloud API. La sua chiave API è disponibile nel portale clienti SCAPI e va inclusa in ogni richiesta. Dal portale sono accessibili anche le istruzioni di implementazione e d'uso, esempi di codice nei principali linguaggi di programmazione e il suo dizionario di pronuncia modificabile. Contatti ReadSpeaker to start your account.

VoiceLab

Le serve una voce di marca tutta sua?

speechCloud API viene fornito con il nostro catalogo di voci professionali.

Un doppiatore registra davanti a un microfono da studio

Una voce di marca costruita con lei in studio

Per una voce di marca completamente su misura costruita con lei in studio, scopra VoiceLab. I linguisti computazionali di ReadSpeaker creano voci di marca dal 1999.

Pronto a dare una voce al suo prodotto?

Di norma vengono forniti crediti di prova alla creazione dell'account, così può valutare prima di impegnarsi. Il nostro team la aiuta a dimensionare volume, lingue e canali simultanei in tempo reale per la produzione. Certificata ISO/IEC 27001:2022, allineata al GDPR con le clausole contrattuali standard dell'UE.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.