Adam
MęskiAngielski (Zjednoczone Królestwo)
ReadSpeaker speechCloud API
Wyślij tekst do jednego punktu końcowego REST i odbierz naturalną mowę w 90 językach i 300 głosach. SSML, własna wymowa i sześć formatów audio, gotowe do produkcji od pierwszego wywołania.
Jesteś już klientem? Zaloguj się do Portalu KlientaZaufało nam 12 000 klientów na całym świecie
Posłuchaj głosu
Cztery głosy w czterech językach. Ten sam silnik, który zintegrujesz przez API.
Angielski (Zjednoczone Królestwo)
Français (France)
Deutsch (Deutschland)
日本語 (Japan)
Potrzebujesz głosu na zamówienie albo języka, którego nie ma na liście? Przejrzyj wszystkie 300 głosów →
Historie klientów
Generowanie mowy w chmurze
speechCloud API to działająca w chmurze usługa syntezy mowy w modelu serwer do serwera. Wywołuj ją we własnej aplikacji, aby generować dźwięk w locie dla użytkowników końcowych albo tworzyć nagrania masowo do późniejszego odtworzenia. Zastępuje kosztowne nagrania ręczne i działa całą dobę, więc nigdy nie hostujesz ani nie skalujesz silnika syntezy mowy samodzielnie.
Dodaj syntezę mowy do aplikacji mobilnej, samochodu podłączonego do sieci, urządzenia medycznego lub przemysłowego, urządzenia ubieralnego albo kiosku. Strumieniuj dźwięk na żądanie, bez instalowania silnika TTS na urządzeniu, dzięki czemu zajętość pamięci i zużycie baterii pozostają niskie. Naturalną mowę w 90 językach otrzymasz jednym wywołaniem REST.
Generuj nagrania masowo na potrzeby kursów e-learningowych, sprawdzianów, materiałów szkoleniowych, audiobooków, przewodników audio i dialogów do filmów lub animacji. Strumieniowany dźwięk możesz udostępniać użytkownikom końcowym z własnej infrastruktury, jeśli pozwala na to Twoja umowa. Własne słowniki wymowy dbają o to, aby nazwy marek i terminy techniczne były poprawnie odczytywane w każdym nagraniu.
Zasilaj systemy telefoniczne, centra kontaktowe i agentów głosowych opartych na dużych modelach językowych naturalnymi głosami. Formaty wyjściowe A-law i μ-law to kodeki G.711 stosowane w systemach telefonicznych. Używaj SSML, aby sterować tempem, zmieniać język w locie i wymawiać nazwy marek zgodnie z własnym słownikiem. Liczba równoczesnych kanałów czasu rzeczywistego skaluje się wraz z Twoją umową.
Funkcje
Wszystko, czego Twój produkt potrzebuje, aby przemówić.
Wybieraj z bogatego, profesjonalnego katalogu głosów dla każdego języka. Głosy licencjonowane są pojedynczo; kolejne możesz dodać w dowolnym momencie.
Używaj SSML do pauz, transkrypcji fonetycznych i zmiany głosu lub języka w obrębie jednego tekstu. Obsługiwane są standardowe znaczniki SSML.
Każdy klient może edytować w portalu klienta słownik przypisany do konkretnego głosu, aby kontrolować wymowę nazw marek, terminów technicznych i nietypowych słów. Lingwiści ReadSpeaker mogą na życzenie poprawić błędną wymowę.
RSDS zwraca dźwięk i znaczniki czasowe w jednej odpowiedzi, co oszczędza kredyty w porównaniu z dwoma osobnymi wywołaniami. Przydaje się do podświetlania słów i zdań w Twoim interfejsie. Dostępne wyłącznie w MP3 48 kbit/s i nie dla wszystkich głosów.
MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, surowy PCM, WAV. PCM i WAV przy 22050, 16000 lub 8000 Hz, z głębią 16 bitów. Ustawiane dla każdego żądania przez parametry API.
Ustaw streaming=1, aby odtwarzanie zaczęło się w chwili, gdy dźwięk jest gotowy, co idealnie sprawdza się na żywo. Albo pobierz gotowy plik w całości.
Klucz API dołączany do każdego wywołania. Przez ten sam interfejs REST sprawdzisz dostępne języki, głosy, bieżące zużycie i pozostałe kredyty.
Edytuj słownik wymowy, śledź zużycie i pozostałe kredyty oraz wygeneruj nowy klucz API w chwili, gdy podejrzewasz nadużycie, wszystko w jednym portalu.
Hostowane przez ReadSpeaker w środowisku o wysokim poziomie bezpieczeństwa, z nadmiarowością i przełączaniem awaryjnym. Nie ma nic do pobrania ani instalowania.
Wypróbuj w swoim środowisku
Zobacz, jak wygląda wywołanie w czterech językach. Uwierzytelnianie odbywa się kluczem API wysyłanym z każdym żądaniem.
# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
-d "key=YOUR_API_KEY" \
-d "voice=Adam" \
-d "lang=en_uk" \
-d "audioformat=mp3" \
-d "audiobitrate=48" \
-d "text=Welcome to ReadSpeaker." \
--output speech.mp3
# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
-d "key=YOUR_API_KEY" \
-d "voice=Adam" \
-d "lang=en_uk" \
-d "input=ssml" \
--data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
--output greeting.mp3# Python 3, requests library
import requests
resp = requests.post(
"https://tts.readspeaker.com/a/eg/v2.0",
data={
"key": "YOUR_API_KEY",
"voice": "Adam",
"lang": "en_uk",
"audioformat": "mp3",
"audiobitrate": 48,
"text": "Welcome to ReadSpeaker.",
},
)
if resp.status_code == 200:
with open("speech.mp3", "wb") as f:
f.write(resp.content)
else:
print("Error:", resp.status_code, resp.text)// Node.js 18+, native fetch + fs/promises
import { writeFile } from "node:fs/promises";
const body = new URLSearchParams({
key: "YOUR_API_KEY",
voice: "Adam",
lang: "en_uk",
audioformat: "mp3",
audiobitrate: "48",
text: "Welcome to ReadSpeaker.",
});
const resp = await fetch("https://tts.readspeaker.com/a/eg/v2.0", {
method: "POST",
body,
});
if (!resp.ok) throw new Error(`SCAPI ${resp.status}`);
await writeFile("speech.mp3", Buffer.from(await resp.arrayBuffer()));<?php
// PHP 8, cURL
$ch = curl_init("https://tts.readspeaker.com/a/eg/v2.0");
curl_setopt_array($ch, [
CURLOPT_POST => true,
CURLOPT_POSTFIELDS => http_build_query([
"key" => "YOUR_API_KEY",
"voice" => "Adam",
"lang" => "en_uk",
"audioformat" => "mp3",
"audiobitrate" => 48,
"text" => "Welcome to ReadSpeaker.",
]),
CURLOPT_RETURNTRANSFER => true,
]);
$audio = curl_exec($ch);
$code = curl_getinfo($ch, CURLINFO_HTTP_CODE);
curl_close($ch);
if ($code === 200) {
file_put_contents("speech.mp3", $audio);
} else {
error_log("SCAPI error: $code");
}Kształt punktu końcowego ma charakter poglądowy. Sięgnij do najnowszej Specyfikacja produktu and the Customer Portal documentation for the current endpoint URL and parameter names.
Specyfikacja techniczna
Uwierzytelnianie, transport, zasięg językowy, limity przepustowości i formaty audio. Odpowiedzi, których Twoje zespoły bezpieczeństwa i utrzymania potrzebują przed integracją.
| Specification | Value |
|---|---|
| Uwierzytelnianie | Klucz API, dołączany do każdego żądania |
| Transport | REST przez HTTPS |
| Obsługiwane języki | 90 języków |
| Dostępne głosy | 300 głosów |
| Maksymalna długość tekstu na żądanie | 5000 znaków (bez znaków odstępu), domyślnie |
| Zakładany limit użycia | ≤ 25 000 żądań dziennie · szczyty ≤ 2000 żądań w ciągu jednej godziny |
| Formaty wyjściowe audio | MP3 · Ogg VBR · μ-law · A-law · PCM · WAV |
| Przepływności MP3 | 16, 24, 32, 48, 64, 128 kbit/s |
| Częstotliwości próbkowania PCM / WAV | 22050, 16000, 8000 Hz przy 16 bitach |
| Kodowanie wejścia | Zalecane UTF-8; obsługiwana jest większość popularnych kodowań |
| Obsługa SSML | Tak: pauzy, transkrypcje fonetyczne, zmiana głosu i języka w locie |
| Dane czasowe (RSDS) | Dźwięk i dane czasowe w jednej odpowiedzi · obecnie tylko MP3 48 kbit/s · nie wszystkie głosy |
| Tryb strumieniowania | streaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation |
| Zasady przechowywania dźwięku | Bez przechowywania, ponownego wykorzystania i redystrybucji, o ile nie uzgodniono tego wyraźnie w potwierdzeniu zamówienia |
| Integracja z telefonią | Formaty wyjściowe A-law i μ-law (kodeki G.711) |
| Dokumentacja | Specyfikacja produktu (PDF) |
Cennik
speechCloud API korzysta z modelu kredytów. Kredyty produkcyjne zamawia się u opiekuna klienta w ReadSpeaker, a zespół wsparcia ReadSpeaker dodaje je do konta. Nowe konta zwykle otrzymują ograniczoną pulę kredytów próbnych na pierwsze testy.
Zacznij bezpłatnie: nowe konta zwykle otrzymują kredyty próbne. Poproś o dostęp przez formularz kontaktowy.
Credits
Model kredytów1 kredyt = 1 znak, bez znaków odstępu
Jak działają kredyty
Licencjonowana pojemność mierzona jest przez
Zgodność
ReadSpeaker jest organizacją z certyfikatem ISO/IEC 27001:2022, działającą zgodnie z RODO, ze standardowymi klauzulami umownymi dla transgranicznych transferów danych.
ISO/IEC 27001:2022 (ISO/IEC 27001:2022, zarządzanie bezpieczeństwem informacji)
Organizacja ReadSpeaker
RODO (Ogólne rozporządzenie o ochronie danych)
Opublikowana informacja o ochronie prywatności
Standardowe klauzule umowne UE (Standardowe klauzule umowne Unii Europejskiej)
Dla transferów transgranicznych
Z siedzibą w UE (Organizacja z siedzibą w Unii Europejskiej)
Siedziba w Szwecji (ReadSpeaker AB, Uppsala)
Zgodnie z informacją o ochronie prywatności ReadSpeaker syntetyczne głosy ReadSpeaker są mieszanymi modelami głosu, które nie stanowią danych osobowych w rozumieniu RODO.
Najczęstsze pytania
speechCloud API (SCAPI) to hostowane w chmurze API REST do syntezy mowy od ReadSpeaker. Wysyłasz tekst na serwery ReadSpeaker przez HTTPS i otrzymujesz wysokiej jakości dźwięk w wybranym formacie (MP3, Ogg, PCM, WAV, A-law lub μ-law). Obsługuje 90 języków i 300 głosów, znaczniki SSML, własne słowniki wymowy i dane czasowe do synchronicznego podświetlania. Działa po stronie serwera i nie wymaga instalowania oprogramowania; integracja odbywa się przez klucz API i żądania HTTP.
webReader i docReader to produkty dla użytkownika końcowego, z własnym interfejsem. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.
speechCloud API zwraca dźwięk w sześciu formatach: MP3 (z konfigurowalną przepływnością 16, 24, 32, 48, 64 lub 128 kbit/s), Ogg VBR, μ-law, A-law, surowy PCM i WAV. PCM i WAV obsługują częstotliwości próbkowania 22050, 16000 lub 8000 Hz przy głębi 16 bitów. Wybór formatu i parametrów dźwięku ustawiany jest dla każdego żądania przez parametry API.
Każde żądanie obejmuje domyślnie do 5000 znaków, liczonych bez znaków odstępu. Standardowa usługa jest przygotowana na maksymalnie 25 000 żądań dziennie, ze szczytami godzinowymi do 2000. Potrzebujesz większego lub stałego ruchu? Porozmawiaj z ReadSpeaker o dedykowanej konfiguracji dopasowanej do Twojego wolumenu.
Tak. Obsługiwane jest wejście SSML, w tym pauzy, transkrypcje fonetyczne oraz zmiana głosu lub języka w obrębie jednego tekstu. Dostępne są również własne słowniki wymowy: każdy klient może edytować w portalu klienta słownik przypisany do konkretnego głosu, aby kontrolować wymowę nazw marek, terminów technicznych i nietypowych słów.
Tak. speechCloud API może zwrócić RSDS, które łączy dźwięk i dane czasowe w jednej odpowiedzi, co oszczędza kredyty w porównaniu z dwoma osobnymi żądaniami. RSDS jest obecnie dostępne dla MP3 w jakości 48 kbit/s i nie dla każdego języka i głosu; aktualną listę otrzymasz od ReadSpeaker.
speechCloud API działa na kredytach: jeden kredyt odpowiada jednemu znakowi, licząc wszystko poza znakami odstępu, powiększonemu o znaki dodane przez Twój słownik wymowy. Kredyty produkcyjne zamawiasz u swojego opiekuna klienta w ReadSpeaker, a nowe konta zwykle zaczynają z kredytami próbnymi. Na życzenie dostępny jest model rozliczany za sekundę mowy. Pojemność można licencjonować według znaków, żądań, czasu mowy, równoczesnych kanałów albo szybkości generowania. Skontaktuj się z ReadSpeaker po wycenę dopasowaną do Twojego wolumenu.
ReadSpeaker jako organizacja ma certyfikat ISO/IEC 27001:2022 i działa zgodnie z RODO. Cały ruch API odbywa się przez HTTPS. Dla klientów z UE i transgranicznych transferów danych ReadSpeaker opiera się na standardowych klauzulach umownych. Zgodnie z informacją o ochronie prywatności ReadSpeaker syntetyczne głosy ReadSpeaker są mieszanymi modelami głosu, które nie stanowią danych osobowych w rozumieniu RODO. Danych dźwiękowych nie wolno przechowywać, ponownie wykorzystywać ani redystrybuować, o ile nie uzgodniono tego wyraźnie w potwierdzeniu zamówienia.
speechCloud API obsługuje zastosowania czasu rzeczywistego. Domyślnie żądania korzystają z trybu strumieniowania (streaming=1), w którym odpowiedź przekierowuje do serwera strumieniowego zaczynającego dostarczać dźwięk możliwie najszybciej, co daje najkrótszy czas do pierwszego dźwięku. Aby otrzymać plik wsadowo, ustaw streaming=0, a plik zostanie zwrócony po pełnym wygenerowaniu. Liczba równoczesnych kanałów czasu rzeczywistego jest częścią Twojej licencjonowanej pojemności i może zostać zwiększona w potwierdzeniu zamówienia.
Załóż konto w ReadSpeaker. Nowe konta zwykle otrzymują ograniczoną pulę kredytów próbnych, aby można było przetestować speechCloud API. Klucz API znajdziesz w portalu klienta SCAPI i musisz dołączać go do każdego żądania. W portalu dostępne są również instrukcje wdrożenia i obsługi, przykładowy kod w popularnych językach programowania oraz Twój edytowalny słownik wymowy. Skontaktuj się z ReadSpeaker to start your account.
VoiceLab
speechCloud API jest dostarczane wraz z naszym profesjonalnym katalogiem głosów.

Jeśli potrzebujesz w pełni autorskiego głosu marki, tworzonego wspólnie z Tobą w studiu, poznaj VoiceLab. Lingwiści komputerowi ReadSpeaker tworzą głosy marek od 1999 roku.