Adam
MännlichEnglisch (Vereinigtes Königreich)
ReadSpeaker speechCloud API
Schicken Sie Text an einen REST-Endpunkt und erhalten Sie natürliche Sprache in 90 Sprachen und 300 Stimmen zurück. SSML, individuelle Aussprache und sechs Audioformate, vom ersten Aufruf an produktionsreif.
Sie sind bereits Kunde? Melden Sie sich im Kundenportal anWeltweit von 12.000 Kunden genutzt
Eine Stimme ausprobieren
Vier Stimmen in vier Sprachen. Dieselbe Engine, die Sie über die API integrieren.
Englisch (Vereinigtes Königreich)
Français (France)
Deutsch (Deutschland)
日本語 (Japan)
Sie brauchen eine Individualstimme oder eine Sprache, die nicht aufgeführt ist? Alle 300 Stimmen ansehen →
Kundengeschichten
Cloudbasierte Spracherzeugung
speechCloud API ist ein cloudbasierter Text-to-Speech-Dienst von Server zu Server. Rufen Sie ihn in Ihrer eigenen Anwendung auf, um Audio für Endnutzer im laufenden Betrieb zu erzeugen oder Audio in großer Menge für die spätere Wiedergabe zu produzieren. Er ersetzt teure manuelle Aufnahmen und läuft rund um die Uhr, sodass Sie nie selbst eine Text-to-Speech-Engine betreiben oder skalieren.
Ergänzen Sie eine mobile App, ein vernetztes Fahrzeug, ein Medizin- oder Industriegerät, ein Wearable oder einen Kiosk um Text-to-Speech. Streamen Sie Audio bei Bedarf, ohne eine TTS-Engine auf dem Gerät mitzuliefern, sodass Speicherbedarf und Akkuverbrauch niedrig bleiben. Sie erhalten natürliche Sprache in 90 Sprachen mit einem einzigen REST-Aufruf.
Erzeugen Sie Audio in großen Mengen für E-Learning-Kurse, Prüfungen, Schulungsinhalte, Hörbücher, Audioguides und Dialoge für Filme oder Animationen. Gestreamtes Audio kann aus Ihrer eigenen Infrastruktur an Endnutzer ausgeliefert werden, sofern Ihr Vertrag das erlaubt. Individuelle Aussprachewörterbücher sorgen dafür, dass Markennamen und Fachbegriffe in jeder Aufnahme korrekt gelesen werden.
Statten Sie Telefonanlagen, Contact Center und LLM-gestützte Sprachassistenten mit natürlichen Stimmen aus. Die Ausgabeformate A-law und μ-law sind die in Telefoniesystemen genutzten G.711-Codecs. Mit SSML steuern Sie das Tempo, wechseln mitten im Text die Sprache und sprechen Markennamen über Ihr eigenes Wörterbuch korrekt aus. Die Zahl gleichzeitiger Echtzeitkanäle skaliert mit Ihrem Vertrag.
Funktionen
Alles, was Ihr Produkt braucht, um zu antworten.
Wählen Sie aus einem umfangreichen, professionellen Stimmenkatalog je Sprache. Stimmen werden einzeln lizenziert; Sie können jederzeit weitere hinzunehmen.
Nutzen Sie SSML für Pausen, phonetische Transkriptionen und den Wechsel von Stimme oder Sprache innerhalb eines Textes. Die Standard-SSML-Auszeichnung wird unterstützt.
Jeder Kunde kann im Kundenportal ein stimmenspezifisches Wörterbuch bearbeiten, um zu bestimmen, wie Markennamen, Fachbegriffe und ungewöhnliche Wörter ausgesprochen werden. Die Linguistinnen und Linguisten von ReadSpeaker korrigieren falsche Aussprachen auf Anfrage.
RSDS liefert Audio und Timing-Marker in einer einzigen Antwort und spart damit Credits gegenüber zwei getrennten Aufrufen. Nützlich für die Wort- und Satzhervorhebung in Ihrer Oberfläche. Nur in MP3 mit 48 kbit/s verfügbar, nicht bei allen Stimmen.
MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, raw PCM, WAV. PCM und WAV mit 22050, 16000 oder 8000 Hz, 16 Bit Auflösung. Pro Anfrage über API-Parameter festgelegt.
Setzen Sie streaming=1, damit die Wiedergabe beginnt, sobald Audio bereitsteht, ideal für den Live-Einsatz. Oder nehmen Sie die fertige Datei als einzelnen Download.
API-Schlüssel bei jedem Aufruf enthalten. Fragen Sie verfügbare Sprachen, Stimmen, den aktuellen Verbrauch und verbleibende Credits über dieselbe REST-Schnittstelle ab.
Bearbeiten Sie Ihr Aussprachewörterbuch, verfolgen Sie Verbrauch und verbleibende Credits und erneuern Sie den API-Schlüssel, sobald ein Missbrauch vermutet wird, alles in einem Portal.
Von ReadSpeaker in einer Hochsicherheitsumgebung mit Redundanz und Ausfallsicherung betrieben. Nichts herunterzuladen, nichts zu installieren.
In Ihrer Umgebung ausprobieren
Ein Blick darauf, wie ein Aufruf in vier Sprachen aussieht. Die Authentifizierung erfolgt über Ihren API-Schlüssel, der mit jeder Anfrage gesendet wird.
# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
-d "key=YOUR_API_KEY" \
-d "voice=Adam" \
-d "lang=en_uk" \
-d "audioformat=mp3" \
-d "audiobitrate=48" \
-d "text=Welcome to ReadSpeaker." \
--output speech.mp3
# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
-d "key=YOUR_API_KEY" \
-d "voice=Adam" \
-d "lang=en_uk" \
-d "input=ssml" \
--data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
--output greeting.mp3# Python 3, requests library
import requests
resp = requests.post(
"https://tts.readspeaker.com/a/eg/v2.0",
data={
"key": "YOUR_API_KEY",
"voice": "Adam",
"lang": "en_uk",
"audioformat": "mp3",
"audiobitrate": 48,
"text": "Welcome to ReadSpeaker.",
},
)
if resp.status_code == 200:
with open("speech.mp3", "wb") as f:
f.write(resp.content)
else:
print("Error:", resp.status_code, resp.text)// Node.js 18+, native fetch + fs/promises
import { writeFile } from "node:fs/promises";
const body = new URLSearchParams({
key: "YOUR_API_KEY",
voice: "Adam",
lang: "en_uk",
audioformat: "mp3",
audiobitrate: "48",
text: "Welcome to ReadSpeaker.",
});
const resp = await fetch("https://tts.readspeaker.com/a/eg/v2.0", {
method: "POST",
body,
});
if (!resp.ok) throw new Error(`SCAPI ${resp.status}`);
await writeFile("speech.mp3", Buffer.from(await resp.arrayBuffer()));<?php
// PHP 8, cURL
$ch = curl_init("https://tts.readspeaker.com/a/eg/v2.0");
curl_setopt_array($ch, [
CURLOPT_POST => true,
CURLOPT_POSTFIELDS => http_build_query([
"key" => "YOUR_API_KEY",
"voice" => "Adam",
"lang" => "en_uk",
"audioformat" => "mp3",
"audiobitrate" => 48,
"text" => "Welcome to ReadSpeaker.",
]),
CURLOPT_RETURNTRANSFER => true,
]);
$audio = curl_exec($ch);
$code = curl_getinfo($ch, CURLINFO_HTTP_CODE);
curl_close($ch);
if ($code === 200) {
file_put_contents("speech.mp3", $audio);
} else {
error_log("SCAPI error: $code");
}Die Form des Endpunkts dient der Veranschaulichung. Maßgeblich ist die aktuelle Produktspezifikation and the Customer Portal documentation for the current endpoint URL and parameter names.
Technische Spezifikationen
Authentifizierung, Transport, Sprachabdeckung, Durchsatzgrenzen und Audioformate. Die Antworten, die Ihre Sicherheits- und Betriebsteams vor der Integration brauchen.
| Specification | Value |
|---|---|
| Authentifizierung | API-Schlüssel, mit jeder Anfrage gesendet |
| Transport | REST über HTTPS |
| Unterstützte Sprachen | 90 Sprachen |
| Verfügbare Stimmen | 300 Stimmen |
| Maximaler Text pro Anfrage | 5.000 Zeichen (ohne Leerzeichen), Standard |
| Vorgesehene Nutzungsgrenze | ≤ 25.000 Anfragen/Tag · Spitzen ≤ 2.000 Anfragen innerhalb einer Stunde |
| Audioausgabeformate | MP3 · Ogg VBR · μ-law · A-law · PCM · WAV |
| MP3-Bitraten | 16, 24, 32, 48, 64, 128 kbit/s |
| Abtastraten für PCM / WAV | 22050, 16000, 8000 Hz bei 16 Bit |
| Eingabekodierung | UTF-8 empfohlen; die gängigsten Kodierungen werden unterstützt |
| SSML-Unterstützung | Ja, Pausen, phonetische Transkriptionen, Wechsel von Stimme und Sprache im laufenden Text |
| Timing-Daten (RSDS) | Audio und Timing in einer Antwort · derzeit nur MP3 48 kbit/s · nicht alle Stimmen |
| Streaming-Modus | streaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation |
| Regeln zur Audiospeicherung | Keine Speicherung, Wiederverwendung oder Weiterverbreitung, sofern nicht ausdrücklich in der Auftragsbestätigung vereinbart |
| Telefonie-Integration | Ausgabeformate A-law und μ-law (G.711-Codecs) |
| Dokumentation | Produktspezifikation (PDF) |
Preise
speechCloud API nutzt ein Credit-Modell. Produktions-Credits werden über Ihren ReadSpeaker Account Manager bestellt und vom ReadSpeaker-Supportteam Ihrem Konto gutgeschrieben. Neue Konten erhalten in der Regel eine begrenzte Menge an Test-Credits für erste Versuche.
Kostenlos starten: Neue Konten erhalten in der Regel Test-Credits. Zugang über das Kontaktformular anfragen.
Credits
Credit-Modell1 Credit = 1 Zeichen, ohne Leerzeichen
So funktionieren Credits
Die lizenzierte Kapazität bemisst sich nach
Konformität
ReadSpeaker ist eine nach ISO/IEC 27001:2022 zertifizierte Organisation, DSGVO-konform, mit Standardvertragsklauseln für grenzüberschreitende Datenübermittlungen.
ISO/IEC 27001:2022 (ISO/IEC 27001:2022, Informationssicherheits-Management)
Organisation ReadSpeaker
DSGVO (Datenschutz-Grundverordnung)
Datenschutzerklärung veröffentlicht
EU-Standardvertragsklauseln (EU-Standardvertragsklauseln)
Für grenzüberschreitende Übermittlungen
Mit Sitz in der EU (Organisation mit Sitz in der Europäischen Union)
Hauptsitz in Schweden (ReadSpeaker AB, Uppsala)
Gemäß der Datenschutzerklärung von ReadSpeaker sind die synthetisierten Stimmen von ReadSpeaker gemischte Stimmmodelle, die keine personenbezogenen Daten im Sinne der DSGVO darstellen.
FAQ
speechCloud API (SCAPI) ist eine in der Cloud betriebene Text-to-Speech-REST-API von ReadSpeaker. Sie senden Text über HTTPS an die ReadSpeaker-Server und erhalten hochwertiges Audio in dem Format Ihrer Wahl zurück (MP3, Ogg, PCM, WAV, A-law oder μ-law). Unterstützt werden 90 Sprachen und 300 Stimmen, SSML-Auszeichnung, individuelle Aussprachewörterbücher und Timing-Daten für die synchrone Hervorhebung. Der Dienst ist serverbasiert, es muss keine Software installiert werden; die Integration erfolgt über API-Schlüssel und HTTP-Anfragen.
webReader und docReader sind Produkte für Endnutzer mit eigener Benutzeroberfläche. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.
speechCloud API liefert Audio in sechs Formaten zurück: MP3 (konfigurierbare Bitrate von 16, 24, 32, 48, 64 oder 128 kbit/s), Ogg VBR, μ-law, A-law, raw PCM und WAV. PCM und WAV unterstützen Abtastraten von 22050, 16000 oder 8000 Hz bei 16 Bit Auflösung. Format und Audioparameter werden pro Anfrage über die API-Parameter festgelegt.
Jede Anfrage nimmt standardmäßig bis zu 5.000 Zeichen auf, gezählt wird alles außer Leerzeichen. Der Standarddienst ist auf bis zu 25.000 Anfragen pro Tag ausgelegt, mit Spitzen von bis zu 2.000 pro Stunde. Sie erwarten höheren oder dauerhaften Datenverkehr? Sprechen Sie mit ReadSpeaker über eine dedizierte Konfiguration für Ihr Volumen.
Ja. Die SSML-Eingabe wird unterstützt, einschließlich Pausen, phonetischer Transkriptionen und des Wechsels von Stimme oder Sprache innerhalb eines Textes. Individuelle Aussprachewörterbücher stehen ebenfalls bereit: Jeder Kunde kann im Kundenportal ein stimmenspezifisches Wörterbuch bearbeiten, um zu bestimmen, wie Markennamen, Fachbegriffe oder ungewöhnliche Wörter ausgesprochen werden.
Ja. speechCloud API kann RSDS zurückgeben, das Audio und Timing-Informationen in einer einzigen Antwort verbindet und damit Credits gegenüber zwei getrennten Anfragen spart. RSDS ist derzeit mit MP3 bei 48 kbit/s verfügbar und nicht für jede Sprache und jede Stimme; wenden Sie sich an ReadSpeaker für die aktuelle Liste.
speechCloud API läuft auf Credits: Ein Credit deckt ein Zeichen ab, gezählt wird alles außer Leerzeichen, zuzüglich der Zeichen, die Ihr Aussprachewörterbuch ergänzt. Produktions-Credits bestellen Sie über Ihren ReadSpeaker Account Manager, und neue Konten starten in der Regel mit Test-Credits. Ein Modell je Sekunde Sprache ist auf Anfrage verfügbar. Die Kapazität kann nach Zeichen, Anfragen, Sprechzeit, gleichzeitigen Kanälen oder Erzeugungsgeschwindigkeit lizenziert werden. Wenden Sie sich an ReadSpeaker für ein auf Ihr Volumen zugeschnittenes Angebot.
ReadSpeaker ist als Organisation nach ISO/IEC 27001:2022 zertifiziert und DSGVO-konform. Der gesamte API-Verkehr läuft über HTTPS. Für Kunden in der EU und grenzüberschreitende Datenübermittlungen stützt sich ReadSpeaker auf Standardvertragsklauseln (SCCs). Gemäß der Datenschutzerklärung von ReadSpeaker sind die synthetisierten Stimmen von ReadSpeaker gemischte Stimmmodelle, die keine personenbezogenen Daten im Sinne der DSGVO darstellen. Audiodaten dürfen nicht gespeichert, wiederverwendet oder weiterverbreitet werden, sofern dies nicht ausdrücklich in der Auftragsbestätigung vereinbart ist.
speechCloud API unterstützt Echtzeitanwendungen. Standardmäßig nutzen Anfragen den Streaming-Modus (streaming=1), bei dem die Antwort auf einen Streaming-Server umleitet, der Audio so früh wie möglich ausliefert, für die kürzeste Zeit bis zum ersten Ton. Für die Auslieferung im Stapel setzen Sie streaming=0, und die Datei wird zurückgegeben, sobald sie vollständig erzeugt ist. Die Zahl gleichzeitiger Echtzeitkanäle gehört zu Ihrer lizenzierten Kapazität und kann in der Auftragsbestätigung angepasst werden.
Legen Sie ein Konto bei ReadSpeaker an. Neue Konten erhalten in der Regel eine begrenzte Menge an Test-Credits, damit Sie speechCloud API evaluieren können. Ihr API-Schlüssel steht im SCAPI-Kundenportal bereit und muss mit jeder Anfrage gesendet werden. Anleitungen zur Implementierung und Nutzung, Beispielcode in gängigen Programmiersprachen und Ihr bearbeitbares Aussprachewörterbuch sind ebenfalls über das Portal zugänglich. ReadSpeaker kontaktieren to start your account.
VoiceLab
speechCloud API bringt unseren professionellen Stimmenkatalog mit.

Für eine vollständig individuelle Markenstimme, die gemeinsam mit Ihnen im Studio entsteht, entdecken Sie VoiceLab. Die Computerlinguistinnen und Computerlinguisten von ReadSpeaker gestalten seit 1999 Markenstimmen.