Zum Inhalt springen

ReadSpeaker speechCloud API

Text-to-Speech-API für jede Anwendung, jedes Gerät und jeden Arbeitsablauf

Schicken Sie Text an einen REST-Endpunkt und erhalten Sie natürliche Sprache in 90 Sprachen und 300 Stimmen zurück. SSML, individuelle Aussprache und sechs Audioformate, vom ersten Aufruf an produktionsreif.

Sie sind bereits Kunde? Melden Sie sich im Kundenportal an
  • 90 Sprachen
  • 300 Stimmen
  • Mit Sitz in der EU, DSGVO, ISO 27001

Weltweit von 12.000 Kunden genutzt

Platzhalter für Partnerlogo 1
Platzhalter für Partnerlogo 2
Platzhalter für Partnerlogo 3
Platzhalter für Partnerlogo 4
Platzhalter für Partnerlogo 5
Platzhalter für Partnerlogo 6
Platzhalter für Partnerlogo 7
Platzhalter für Partnerlogo 8

Eine Stimme ausprobieren

Hören Sie, was Ihre API zurückgeben wird

Vier Stimmen in vier Sprachen. Dieselbe Engine, die Sie über die API integrieren.

Adam

Männlich

Englisch (Vereinigtes Königreich)

Roxane

Weiblich

Français (France)

Lena

Weiblich

Deutsch (Deutschland)

Sayaka

Weiblich

日本語 (Japan)

Sie brauchen eine Individualstimme oder eine Sprache, die nicht aufgeführt ist? Alle 300 Stimmen ansehen →

Kundengeschichten

Marken, die mit ReadSpeaker Sprachprodukte entwickeln

Sonos

Der Ansatz von ReadSpeaker bei Individualstimmen ist innovativ und außerordentlich gründlich, genau das, was wir für dieses Projekt gebraucht haben.

Joseph DureauVice President, Voice Experience · Sonos
Die ganze Geschichte lesen

Cloudbasierte Spracherzeugung

In Echtzeit oder im Stapel, überall dort, wo Ihr Produkt eine Stimme braucht

speechCloud API ist ein cloudbasierter Text-to-Speech-Dienst von Server zu Server. Rufen Sie ihn in Ihrer eigenen Anwendung auf, um Audio für Endnutzer im laufenden Betrieb zu erzeugen oder Audio in großer Menge für die spätere Wiedergabe zu produzieren. Er ersetzt teure manuelle Aufnahmen und läuft rund um die Uhr, sodass Sie nie selbst eine Text-to-Speech-Engine betreiben oder skalieren.

Echtzeit-Anwendungen und Geräte

Ergänzen Sie eine mobile App, ein vernetztes Fahrzeug, ein Medizin- oder Industriegerät, ein Wearable oder einen Kiosk um Text-to-Speech. Streamen Sie Audio bei Bedarf, ohne eine TTS-Engine auf dem Gerät mitzuliefern, sodass Speicherbedarf und Akkuverbrauch niedrig bleiben. Sie erhalten natürliche Sprache in 90 Sprachen mit einem einzigen REST-Aufruf.

  • Mobil
  • IoT
  • Kioske
  • Wearables
  • Vernetzte Fahrzeuge
  • Medizingeräte

Audioproduktion im Stapelbetrieb

Erzeugen Sie Audio in großen Mengen für E-Learning-Kurse, Prüfungen, Schulungsinhalte, Hörbücher, Audioguides und Dialoge für Filme oder Animationen. Gestreamtes Audio kann aus Ihrer eigenen Infrastruktur an Endnutzer ausgeliefert werden, sofern Ihr Vertrag das erlaubt. Individuelle Aussprachewörterbücher sorgen dafür, dass Markennamen und Fachbegriffe in jeder Aufnahme korrekt gelesen werden.

  • e-learning
  • Hörbücher
  • Prüfungen
  • Schulung
  • Audioguides
  • Film und Animation

Telefonie, IVR und Sprachassistenten

Statten Sie Telefonanlagen, Contact Center und LLM-gestützte Sprachassistenten mit natürlichen Stimmen aus. Die Ausgabeformate A-law und μ-law sind die in Telefoniesystemen genutzten G.711-Codecs. Mit SSML steuern Sie das Tempo, wechseln mitten im Text die Sprache und sprechen Markennamen über Ihr eigenes Wörterbuch korrekt aus. Die Zahl gleichzeitiger Echtzeitkanäle skaliert mit Ihrem Vertrag.

  • IVR
  • G.711
  • Sprachassistenten
  • SSML
  • A-law / μ-law

Funktionen

Text-to-Speech für den Produktivbetrieb, durchgängig

Alles, was Ihr Produkt braucht, um zu antworten.

90 Sprachen, 300 Stimmen

Wählen Sie aus einem umfangreichen, professionellen Stimmenkatalog je Sprache. Stimmen werden einzeln lizenziert; Sie können jederzeit weitere hinzunehmen.

SSML-Eingabe

Nutzen Sie SSML für Pausen, phonetische Transkriptionen und den Wechsel von Stimme oder Sprache innerhalb eines Textes. Die Standard-SSML-Auszeichnung wird unterstützt.

Individuelle Aussprachewörterbücher

Jeder Kunde kann im Kundenportal ein stimmenspezifisches Wörterbuch bearbeiten, um zu bestimmen, wie Markennamen, Fachbegriffe und ungewöhnliche Wörter ausgesprochen werden. Die Linguistinnen und Linguisten von ReadSpeaker korrigieren falsche Aussprachen auf Anfrage.

Timing-Daten (RSDS)

RSDS liefert Audio und Timing-Marker in einer einzigen Antwort und spart damit Credits gegenüber zwei getrennten Aufrufen. Nützlich für die Wort- und Satzhervorhebung in Ihrer Oberfläche. Nur in MP3 mit 48 kbit/s verfügbar, nicht bei allen Stimmen.

Sechs Audioausgabeformate

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, raw PCM, WAV. PCM und WAV mit 22050, 16000 oder 8000 Hz, 16 Bit Auflösung. Pro Anfrage über API-Parameter festgelegt.

Streaming oder Download

Setzen Sie streaming=1, damit die Wiedergabe beginnt, sobald Audio bereitsteht, ideal für den Live-Einsatz. Oder nehmen Sie die fertige Datei als einzelnen Download.

REST-API über HTTPS

API-Schlüssel bei jedem Aufruf enthalten. Fragen Sie verfügbare Sprachen, Stimmen, den aktuellen Verbrauch und verbleibende Credits über dieselbe REST-Schnittstelle ab.

SCAPI-Kundenportal

Bearbeiten Sie Ihr Aussprachewörterbuch, verfolgen Sie Verbrauch und verbleibende Credits und erneuern Sie den API-Schlüssel, sobald ein Missbrauch vermutet wird, alles in einem Portal.

Gehostete und redundante Infrastruktur

Von ReadSpeaker in einer Hochsicherheitsumgebung mit Redundanz und Ausfallsicherung betrieben. Nichts herunterzuladen, nichts zu installieren.

In Ihrer Umgebung ausprobieren

Von Text zu Audio in einer Anfrage

Ein Blick darauf, wie ein Aufruf in vier Sprachen aussieht. Die Authentifizierung erfolgt über Ihren API-Schlüssel, der mit jeder Anfrage gesendet wird.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

Die Form des Endpunkts dient der Veranschaulichung. Maßgeblich ist die aktuelle Produktspezifikation and the Customer Portal documentation for the current endpoint URL and parameter names.

Technische Spezifikationen

Jede Angabe, nach der Ihre Sicherheitsprüfung fragen wird

Authentifizierung, Transport, Sprachabdeckung, Durchsatzgrenzen und Audioformate. Die Antworten, die Ihre Sicherheits- und Betriebsteams vor der Integration brauchen.

Technische Spezifikationen von speechCloud API
SpecificationValue
AuthentifizierungAPI-Schlüssel, mit jeder Anfrage gesendet
TransportREST über HTTPS
Unterstützte Sprachen90 Sprachen
Verfügbare Stimmen300 Stimmen
Maximaler Text pro Anfrage5.000 Zeichen (ohne Leerzeichen), Standard
Vorgesehene Nutzungsgrenze≤ 25.000 Anfragen/Tag · Spitzen ≤ 2.000 Anfragen innerhalb einer Stunde
AudioausgabeformateMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
MP3-Bitraten16, 24, 32, 48, 64, 128 kbit/s
Abtastraten für PCM / WAV22050, 16000, 8000 Hz bei 16 Bit
EingabekodierungUTF-8 empfohlen; die gängigsten Kodierungen werden unterstützt
SSML-UnterstützungJa, Pausen, phonetische Transkriptionen, Wechsel von Stimme und Sprache im laufenden Text
Timing-Daten (RSDS)Audio und Timing in einer Antwort · derzeit nur MP3 48 kbit/s · nicht alle Stimmen
Streaming-Modusstreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Regeln zur AudiospeicherungKeine Speicherung, Wiederverwendung oder Weiterverbreitung, sofern nicht ausdrücklich in der Auftragsbestätigung vereinbart
Telefonie-IntegrationAusgabeformate A-law und μ-law (G.711-Codecs)
DokumentationProduktspezifikation (PDF)

Preise

Zahlen Sie für das, was Sie erzeugen, und skalieren Sie, wenn Sie es brauchen

speechCloud API nutzt ein Credit-Modell. Produktions-Credits werden über Ihren ReadSpeaker Account Manager bestellt und vom ReadSpeaker-Supportteam Ihrem Konto gutgeschrieben. Neue Konten erhalten in der Regel eine begrenzte Menge an Test-Credits für erste Versuche.

Angebot anfordern

Kostenlos starten: Neue Konten erhalten in der Regel Test-Credits. Zugang über das Kontaktformular anfragen.

Credits

speechCloud API

Credit-Modell1 Credit = 1 Zeichen, ohne Leerzeichen

So funktionieren Credits

  • 1 Credit = 1 Zeichen, ohne Leerzeichen, einschließlich aller Änderungen durch Einträge im Aussprachewörterbuch
  • Variante je Sekunde Sprache available via order confirmation for predictable cost on long audio
  • Test-Credits bei Kontoeröffnung so you can evaluate before committing

Die lizenzierte Kapazität bemisst sich nach

  • Anzahl der Zeichen over the contract period
  • Anzahl der Anfragen and total speech time
  • Gleichzeitige Echtzeitkanäle for telephony and live use cases
  • Erzeugungsgeschwindigkeit when responsiveness is critical

Konformität

Konformität, die Sie direkt an Ihre Prüfstelle weitergeben können

ReadSpeaker ist eine nach ISO/IEC 27001:2022 zertifizierte Organisation, DSGVO-konform, mit Standardvertragsklauseln für grenzüberschreitende Datenübermittlungen.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022, Informationssicherheits-Management)

    Organisation ReadSpeaker

  • DSGVO (Datenschutz-Grundverordnung)

    Datenschutzerklärung veröffentlicht

  • EU-Standardvertragsklauseln (EU-Standardvertragsklauseln)

    Für grenzüberschreitende Übermittlungen

  • Mit Sitz in der EU (Organisation mit Sitz in der Europäischen Union)

    Hauptsitz in Schweden (ReadSpeaker AB, Uppsala)

FAQ

Fragen zu speechCloud API

  • speechCloud API (SCAPI) ist eine in der Cloud betriebene Text-to-Speech-REST-API von ReadSpeaker. Sie senden Text über HTTPS an die ReadSpeaker-Server und erhalten hochwertiges Audio in dem Format Ihrer Wahl zurück (MP3, Ogg, PCM, WAV, A-law oder μ-law). Unterstützt werden 90 Sprachen und 300 Stimmen, SSML-Auszeichnung, individuelle Aussprachewörterbücher und Timing-Daten für die synchrone Hervorhebung. Der Dienst ist serverbasiert, es muss keine Software installiert werden; die Integration erfolgt über API-Schlüssel und HTTP-Anfragen.

  • webReader und docReader sind Produkte für Endnutzer mit eigener Benutzeroberfläche. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • speechCloud API liefert Audio in sechs Formaten zurück: MP3 (konfigurierbare Bitrate von 16, 24, 32, 48, 64 oder 128 kbit/s), Ogg VBR, μ-law, A-law, raw PCM und WAV. PCM und WAV unterstützen Abtastraten von 22050, 16000 oder 8000 Hz bei 16 Bit Auflösung. Format und Audioparameter werden pro Anfrage über die API-Parameter festgelegt.

  • Jede Anfrage nimmt standardmäßig bis zu 5.000 Zeichen auf, gezählt wird alles außer Leerzeichen. Der Standarddienst ist auf bis zu 25.000 Anfragen pro Tag ausgelegt, mit Spitzen von bis zu 2.000 pro Stunde. Sie erwarten höheren oder dauerhaften Datenverkehr? Sprechen Sie mit ReadSpeaker über eine dedizierte Konfiguration für Ihr Volumen.

  • Ja. Die SSML-Eingabe wird unterstützt, einschließlich Pausen, phonetischer Transkriptionen und des Wechsels von Stimme oder Sprache innerhalb eines Textes. Individuelle Aussprachewörterbücher stehen ebenfalls bereit: Jeder Kunde kann im Kundenportal ein stimmenspezifisches Wörterbuch bearbeiten, um zu bestimmen, wie Markennamen, Fachbegriffe oder ungewöhnliche Wörter ausgesprochen werden.

  • Ja. speechCloud API kann RSDS zurückgeben, das Audio und Timing-Informationen in einer einzigen Antwort verbindet und damit Credits gegenüber zwei getrennten Anfragen spart. RSDS ist derzeit mit MP3 bei 48 kbit/s verfügbar und nicht für jede Sprache und jede Stimme; wenden Sie sich an ReadSpeaker für die aktuelle Liste.

  • speechCloud API läuft auf Credits: Ein Credit deckt ein Zeichen ab, gezählt wird alles außer Leerzeichen, zuzüglich der Zeichen, die Ihr Aussprachewörterbuch ergänzt. Produktions-Credits bestellen Sie über Ihren ReadSpeaker Account Manager, und neue Konten starten in der Regel mit Test-Credits. Ein Modell je Sekunde Sprache ist auf Anfrage verfügbar. Die Kapazität kann nach Zeichen, Anfragen, Sprechzeit, gleichzeitigen Kanälen oder Erzeugungsgeschwindigkeit lizenziert werden. Wenden Sie sich an ReadSpeaker für ein auf Ihr Volumen zugeschnittenes Angebot.

  • ReadSpeaker ist als Organisation nach ISO/IEC 27001:2022 zertifiziert und DSGVO-konform. Der gesamte API-Verkehr läuft über HTTPS. Für Kunden in der EU und grenzüberschreitende Datenübermittlungen stützt sich ReadSpeaker auf Standardvertragsklauseln (SCCs). Gemäß der Datenschutzerklärung von ReadSpeaker sind die synthetisierten Stimmen von ReadSpeaker gemischte Stimmmodelle, die keine personenbezogenen Daten im Sinne der DSGVO darstellen. Audiodaten dürfen nicht gespeichert, wiederverwendet oder weiterverbreitet werden, sofern dies nicht ausdrücklich in der Auftragsbestätigung vereinbart ist.

  • speechCloud API unterstützt Echtzeitanwendungen. Standardmäßig nutzen Anfragen den Streaming-Modus (streaming=1), bei dem die Antwort auf einen Streaming-Server umleitet, der Audio so früh wie möglich ausliefert, für die kürzeste Zeit bis zum ersten Ton. Für die Auslieferung im Stapel setzen Sie streaming=0, und die Datei wird zurückgegeben, sobald sie vollständig erzeugt ist. Die Zahl gleichzeitiger Echtzeitkanäle gehört zu Ihrer lizenzierten Kapazität und kann in der Auftragsbestätigung angepasst werden.

  • Legen Sie ein Konto bei ReadSpeaker an. Neue Konten erhalten in der Regel eine begrenzte Menge an Test-Credits, damit Sie speechCloud API evaluieren können. Ihr API-Schlüssel steht im SCAPI-Kundenportal bereit und muss mit jeder Anfrage gesendet werden. Anleitungen zur Implementierung und Nutzung, Beispielcode in gängigen Programmiersprachen und Ihr bearbeitbares Aussprachewörterbuch sind ebenfalls über das Portal zugänglich. ReadSpeaker kontaktieren to start your account.

VoiceLab

Benötigen Sie eine eigene Markenstimme?

speechCloud API bringt unseren professionellen Stimmenkatalog mit.

Ein Sprecher nimmt vor einem Studiomikrofon auf

Eine Markenstimme, die gemeinsam mit Ihnen im Studio entsteht

Für eine vollständig individuelle Markenstimme, die gemeinsam mit Ihnen im Studio entsteht, entdecken Sie VoiceLab. Die Computerlinguistinnen und Computerlinguisten von ReadSpeaker gestalten seit 1999 Markenstimmen.

Bereit, Ihrem Produkt eine Stimme zu geben?

Bei der Kontoeröffnung werden in der Regel Test-Credits bereitgestellt, damit Sie vor einer Festlegung evaluieren können. Unser Team hilft Ihnen, Volumen, Sprachen und gleichzeitige Echtzeitkanäle für den Produktivbetrieb zu bestimmen. Zertifiziert nach ISO/IEC 27001:2022, DSGVO-konform mit EU-Standardvertragsklauseln.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.