Aller au contenu

ReadSpeaker speechCloud API

Une API de synthèse vocale pour toute application, tout appareil, tout processus

Envoyez du texte à un seul point d'accès REST et recevez une parole naturelle dans 90 langues et 300 voix. SSML, prononciation personnalisée et six formats audio, prêts pour la production dès le premier appel.

Déjà client ? Connectez-vous au portail client
  • 90 langues
  • 300 voix
  • Basé dans l'UE, RGPD, ISO 27001

La confiance de 12 000 clients dans le monde

Emplacement de logo partenaire 1
Emplacement de logo partenaire 2
Emplacement de logo partenaire 3
Emplacement de logo partenaire 4
Emplacement de logo partenaire 5
Emplacement de logo partenaire 6
Emplacement de logo partenaire 7
Emplacement de logo partenaire 8

Essayer une voix

Écoutez ce que votre API renverra

Quatre voix dans quatre langues. Le moteur même que vous intégrerez via l'API.

Adam

Masculine

Anglais (Royaume-Uni)

Roxane

Féminine

Français (France)

Lena

Féminine

Deutsch (Deutschland)

Sayaka

Féminine

日本語 (Japon)

Vous voulez une voix sur mesure ou une langue qui ne figure pas ici ? Parcourir les 300 voix →

Témoignages clients

Des marques qui construisent des produits vocaux avec ReadSpeaker

Sonos

L'approche de ReadSpeaker en matière de voix sur mesure est innovante et extrêmement rigoureuse, exactement ce dont nous avions besoin pour ce projet.

Joseph DureauVice President, Voice Experience · Sonos
Lire le témoignage complet

Génération de parole dans le cloud

En temps réel ou par lots, partout où votre produit a besoin d'une voix

speechCloud API est un service de synthèse vocale de serveur à serveur, dans le cloud. Appelez-le depuis votre propre application pour générer de l'audio à la volée pour vos utilisateurs finaux, ou pour produire de l'audio en masse en vue d'une lecture ultérieure. Il remplace des enregistrements manuels coûteux et fonctionne en continu : vous n'hébergez ni ne dimensionnez jamais vous-même un moteur de synthèse vocale.

Applications et appareils temps réel

Ajoutez la synthèse vocale à une application mobile, une voiture connectée, un appareil médical ou industriel, un objet connecté porté ou une borne. Diffusez l'audio à la demande sans embarquer de moteur de synthèse sur l'appareil : l'empreinte et la consommation de batterie restent faibles. Recevez une parole naturelle dans 90 langues avec un seul appel REST.

  • Mobile
  • IoT
  • Bornes
  • Objets connectés portés
  • Voitures connectées
  • Dispositifs médicaux

Production audio par lots

Générez de l'audio en masse pour des cours en ligne, des évaluations, des contenus de formation, des livres audio, des audioguides et les dialogues de films ou d'animations. L'audio diffusé peut être servi aux utilisateurs finaux depuis votre propre infrastructure lorsque votre contrat le permet. Des dictionnaires de prononciation personnalisés garantissent que les noms de marque et les termes techniques sont lus correctement sur chaque piste.

  • e-learning
  • Livres audio
  • Évaluations
  • Formation
  • Audioguides
  • Cinéma et animation

Téléphonie, SVI et agents vocaux

Donnez une voix naturelle à vos systèmes téléphoniques, à vos centres de contact et à vos agents vocaux propulsés par des LLM. Les formats de sortie A-law et μ-law sont les codecs G.711 employés dans les systèmes de téléphonie. Utilisez SSML pour maîtriser le rythme, changer de langue en cours de route et prononcer les noms de marque via votre dictionnaire personnalisé. Le nombre de canaux temps réel simultanés évolue avec votre contrat.

  • SVI
  • G.711
  • Agents vocaux
  • SSML
  • A-law / μ-law

Fonctionnalités

De la synthèse vocale de production, de bout en bout

Tout ce dont votre produit a besoin pour répondre à voix haute.

90 langues, 300 voix

Choisissez dans un catalogue de voix professionnelles riche pour chaque langue. Les voix sont licenciées individuellement ; ajoutez-en à tout moment.

Entrée SSML

Utilisez SSML pour les pauses, les transcriptions phonétiques et les changements de voix ou de langue au fil d'un même texte. Le balisage SSML standard est pris en charge.

Dictionnaires de prononciation personnalisés

Chaque client peut modifier un dictionnaire propre à chaque voix dans le portail client, pour maîtriser la prononciation des noms de marque, des termes techniques et des mots inhabituels. Les linguistes de ReadSpeaker peuvent corriger les prononciations fautives sur demande.

Données de synchronisation (RSDS)

RSDS renvoie l'audio et les repères de synchronisation dans une seule réponse, ce qui économise des crédits par rapport à deux appels distincts. Utile pour surligner les mots et les phrases dans votre interface. Disponible en MP3 48 kbit/s uniquement, et pas sur toutes les voix.

Six formats de sortie audio

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, PCM brut, WAV. PCM et WAV à 22050, 16000 ou 8000 Hz, sur 16 bits. Réglé requête par requête via les paramètres de l'API.

Diffusion ou téléchargement

Réglez streaming=1 pour démarrer la lecture dès que l'audio est prêt, idéal pour un usage en direct. Ou récupérez le fichier finalisé en un seul téléchargement.

API REST via HTTPS

Clé API incluse à chaque appel. Interrogez les langues disponibles, les voix, la consommation en cours et les crédits restants via la même interface REST.

Portail client SCAPI

Modifiez votre dictionnaire de prononciation, suivez votre consommation et vos crédits restants, et renouvelez une clé API dès qu'un usage abusif est suspecté, le tout depuis un seul portail.

Infrastructure hébergée et redondante

Hébergé par ReadSpeaker dans un environnement hautement sécurisé, avec redondance et bascule automatique. Rien à télécharger ni à installer.

Essayez-le dans votre environnement

Du texte à l'audio en une seule requête

Un aperçu de ce à quoi ressemble un appel dans quatre langages. L'authentification se fait avec votre clé API, envoyée à chaque requête.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

La forme du point d'accès est donnée à titre indicatif. Reportez-vous à la dernière Fiche produit and the Customer Portal documentation for the current endpoint URL and parameter names.

Spécifications techniques

Toutes les caractéristiques que votre revue de sécurité va demander

Authentification, transport, couverture linguistique, limites de débit et formats audio. Les réponses dont vos équipes sécurité et exploitation ont besoin avant l'intégration.

Spécifications techniques de speechCloud API
SpecificationValue
AuthentificationClé API, incluse à chaque requête
TransportREST via HTTPS
Langues prises en charge90 langues
Voix disponibles300 voix
Texte maximal par requête5 000 caractères (espaces non comprises), par défaut
Limite d'usage prévue≤ 25 000 requêtes par jour · pics ≤ 2 000 requêtes en une seule heure
Formats de sortie audioMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
Débits MP316, 24, 32, 48, 64, 128 kbit/s
Fréquences d'échantillonnage PCM / WAV22050, 16000, 8000 Hz en 16 bits
Encodage d'entréeUTF-8 recommandé ; la plupart des encodages courants sont pris en charge
Prise en charge de SSMLOui : pauses, transcriptions phonétiques, changement de voix et de langue en cours de texte
Données de synchronisation (RSDS)Audio et données de synchronisation dans une seule réponse · actuellement en MP3 48 kbit/s uniquement · pas pour toutes les voix
Mode diffusionstreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Règles de stockage de l'audioAucun stockage, aucune réutilisation ni redistribution, sauf accord explicite dans la confirmation de commande
Intégration téléphoniqueFormats de sortie A-law et μ-law (codecs G.711)
DocumentationFiche produit (PDF)

Tarifs

Payez ce que vous générez, montez en charge quand il le faut

speechCloud API fonctionne avec un modèle de crédits. Les crédits de production se commandent auprès de votre gestionnaire de compte ReadSpeaker et sont ajoutés à votre compte par l'équipe de support ReadSpeaker. Les nouveaux comptes reçoivent généralement un volume limité de crédits d'essai pour les premiers tests.

Demander un devis

Commencez gratuitement : les nouveaux comptes reçoivent généralement des crédits d'essai. Demandez un accès via le formulaire de contact.

Credits

speechCloud API

Modèle de crédits1 crédit = 1 caractère, espaces non comprises

Comment fonctionnent les crédits

  • 1 crédit = 1 caractère, espaces non comprises, y compris les modifications issues des entrées du dictionnaire de prononciation
  • Variante à la seconde de parole available via order confirmation for predictable cost on long audio
  • Crédits d'essai à l'ouverture du compte so you can evaluate before committing

La capacité sous licence se mesure par

  • Nombre de caractères over the contract period
  • Nombre de requêtes and total speech time
  • Canaux temps réel simultanés for telephony and live use cases
  • Vitesse de génération when responsiveness is critical

Conformité

Une conformité que vous pouvez transmettre directement à votre auditeur

ReadSpeaker est une organisation certifiée ISO/IEC 27001:2022, conforme au RGPD, avec des clauses contractuelles types pour les transferts de données hors frontières.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022 : management de la sécurité de l'information)

    L'organisation ReadSpeaker

  • RGPD (Règlement général sur la protection des données)

    Politique de confidentialité publiée

  • CCT de l'UE (Clauses contractuelles types de l'Union européenne)

    Pour les transferts hors frontières

  • Basé dans l'UE (Organisation basée dans l'Union européenne)

    Siège social en Suède (ReadSpeaker AB, Uppsala)

FAQ

Questions sur speechCloud API

  • speechCloud API (SCAPI) est une API REST de synthèse vocale hébergée dans le cloud, signée ReadSpeaker. Vous envoyez du texte aux serveurs ReadSpeaker via HTTPS et recevez en retour un audio de haute qualité dans le format de votre choix (MP3, Ogg, PCM, WAV, A-law ou μ-law). Elle prend en charge 90 langues et 300 voix, le balisage SSML, des dictionnaires de prononciation personnalisés et les données de synchronisation pour le surlignage. Elle fonctionne côté serveur, sans logiciel à installer ; l'intégration se fait par une clé API et des requêtes HTTP.

  • webReader et docReader sont des produits pour l'utilisateur final, avec leur propre interface. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • speechCloud API renvoie l'audio dans six formats : MP3 (débit configurable à 16, 24, 32, 48, 64 ou 128 kbit/s), Ogg VBR, μ-law, A-law, PCM brut et WAV. PCM et WAV prennent en charge les fréquences d'échantillonnage de 22050, 16000 ou 8000 Hz sur 16 bits. Le choix du format et des paramètres audio se fait requête par requête via les paramètres de l'API.

  • Chaque requête accepte jusqu'à 5 000 caractères par défaut, tout étant compté sauf les espaces. Le service standard est dimensionné pour 25 000 requêtes par jour, avec des pics horaires jusqu'à 2 000. Vous prévoyez un trafic plus élevé ou soutenu ? Parlez-en à ReadSpeaker pour une configuration dédiée à votre volume.

  • Oui. L'entrée SSML est prise en charge, avec les pauses, les transcriptions phonétiques et le changement de voix ou de langue au fil d'un même texte. Des dictionnaires de prononciation personnalisés sont également disponibles : chaque client peut modifier un dictionnaire propre à une voix dans le portail client, pour maîtriser la prononciation des noms de marque, des termes techniques ou des mots inhabituels.

  • Oui. speechCloud API peut renvoyer le format RSDS, qui réunit l'audio et les informations de synchronisation dans une seule réponse, ce qui économise des crédits par rapport à deux requêtes distinctes. RSDS est actuellement disponible en MP3 à 48 kbit/s et n'existe pas pour toutes les langues ni pour toutes les voix ; contactez ReadSpeaker pour la liste à jour.

  • speechCloud API fonctionne avec des crédits : un crédit couvre un caractère, tout étant compté sauf les espaces, auxquels s'ajoutent les caractères ajoutés par votre dictionnaire de prononciation. Vous commandez vos crédits de production auprès de votre gestionnaire de compte ReadSpeaker, et les nouveaux comptes démarrent généralement avec des crédits d'essai. Un modèle à la seconde de parole est disponible sur demande. La capacité peut être licenciée en caractères, en requêtes, en temps de parole, en canaux simultanés ou en vitesse de génération. Contactez ReadSpeaker pour un devis adapté à votre volume.

  • ReadSpeaker, en tant qu'organisation, est certifié ISO/IEC 27001:2022 et conforme au RGPD. Tout le trafic de l'API passe par HTTPS. Pour les clients européens et les transferts de données hors frontières, ReadSpeaker s'appuie sur les clauses contractuelles types (CCT). Conformément à la politique de confidentialité de ReadSpeaker, les voix de synthèse de ReadSpeaker sont des modèles de voix composites qui ne constituent pas des données à caractère personnel au sens du RGPD. Les données audio ne doivent pas être stockées, réutilisées ni redistribuées, sauf accord explicite dans la confirmation de commande.

  • speechCloud API prend en charge les cas d'usage en temps réel. Par défaut, les requêtes utilisent le mode diffusion (streaming=1) : la réponse redirige vers un serveur de diffusion qui commence à livrer l'audio dès que possible, pour le délai le plus court avant le son. Pour une livraison par lots, réglez streaming=0 et le fichier est renvoyé une fois entièrement généré. Le nombre de canaux temps réel simultanés fait partie de votre capacité sous licence et peut être ajusté dans la confirmation de commande.

  • Créez un compte chez ReadSpeaker. Les nouveaux comptes reçoivent généralement un volume limité de crédits d'essai pour évaluer speechCloud API. Votre clé API est disponible dans le portail client SCAPI et doit être incluse à chaque requête. Les instructions d'implémentation et d'utilisation, des exemples de code dans les langages de programmation courants et votre dictionnaire de prononciation modifiable sont également accessibles depuis le portail. Contacter ReadSpeaker to start your account.

VoiceLab

Besoin d'une voix de marque à vous ?

speechCloud API est livré avec notre catalogue de voix professionnelles.

Un comédien voix enregistre devant un microphone de studio

Une voix de marque construite avec vous en studio

Pour une voix de marque entièrement sur mesure, construite avec vous en studio, découvrez VoiceLab. Les linguistes informaticiens de ReadSpeaker façonnent des voix de marque depuis 1999.

Prêt à mettre une voix dans votre produit ?

Des crédits d'essai sont généralement fournis à la création du compte, pour évaluer avant de s'engager. Notre équipe vous aide à cadrer le volume, les langues et le nombre de canaux temps réel simultanés pour la production. Certifié ISO/IEC 27001:2022, aligné sur le RGPD avec les clauses contractuelles types de l'Union européenne.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.