Przejdź do treści

ReadSpeaker speechCloud API

API syntezy mowy dla każdej aplikacji, urządzenia i procesu pracy

Wyślij tekst do jednego punktu końcowego REST i odbierz naturalną mowę w 90 językach i 300 głosach. SSML, własna wymowa i sześć formatów audio, gotowe do produkcji od pierwszego wywołania.

Jesteś już klientem? Zaloguj się do Portalu Klienta
  • 90 języków
  • 300 głosów
  • Z siedzibą w UE, RODO, ISO 27001

Zaufało nam 12 000 klientów na całym świecie

Miejsce na logo partnera 1
Miejsce na logo partnera 2
Miejsce na logo partnera 3
Miejsce na logo partnera 4
Miejsce na logo partnera 5
Miejsce na logo partnera 6
Miejsce na logo partnera 7
Miejsce na logo partnera 8

Posłuchaj głosu

Posłuchaj, co zwróci Twoje API

Cztery głosy w czterech językach. Ten sam silnik, który zintegrujesz przez API.

Adam

Męski

Angielski (Zjednoczone Królestwo)

Roxane

Żeński

Français (France)

Lena

Żeński

Deutsch (Deutschland)

Sayaka

Żeński

日本語 (Japan)

Potrzebujesz głosu na zamówienie albo języka, którego nie ma na liście? Przejrzyj wszystkie 300 głosów →

Historie klientów

Marki, które tworzą produkty głosowe z ReadSpeaker

Sonos

Podejście ReadSpeaker do głosu na zamówienie jest nowatorskie i wyjątkowo staranne, dokładnie takie, jakiego potrzebowaliśmy w tym projekcie.

Joseph DureauWiceprezes ds. doświadczeń głosowych · Sonos
Przeczytaj całą historię

Generowanie mowy w chmurze

W czasie rzeczywistym albo wsadowo, wszędzie tam, gdzie Twój produkt potrzebuje głosu

speechCloud API to działająca w chmurze usługa syntezy mowy w modelu serwer do serwera. Wywołuj ją we własnej aplikacji, aby generować dźwięk w locie dla użytkowników końcowych albo tworzyć nagrania masowo do późniejszego odtworzenia. Zastępuje kosztowne nagrania ręczne i działa całą dobę, więc nigdy nie hostujesz ani nie skalujesz silnika syntezy mowy samodzielnie.

Aplikacje i urządzenia czasu rzeczywistego

Dodaj syntezę mowy do aplikacji mobilnej, samochodu podłączonego do sieci, urządzenia medycznego lub przemysłowego, urządzenia ubieralnego albo kiosku. Strumieniuj dźwięk na żądanie, bez instalowania silnika TTS na urządzeniu, dzięki czemu zajętość pamięci i zużycie baterii pozostają niskie. Naturalną mowę w 90 językach otrzymasz jednym wywołaniem REST.

  • Urządzenia mobilne
  • IoT
  • Kioski
  • Urządzenia ubieralne
  • Samochody podłączone do sieci
  • Urządzenia medyczne

Wsadowa produkcja audio

Generuj nagrania masowo na potrzeby kursów e-learningowych, sprawdzianów, materiałów szkoleniowych, audiobooków, przewodników audio i dialogów do filmów lub animacji. Strumieniowany dźwięk możesz udostępniać użytkownikom końcowym z własnej infrastruktury, jeśli pozwala na to Twoja umowa. Własne słowniki wymowy dbają o to, aby nazwy marek i terminy techniczne były poprawnie odczytywane w każdym nagraniu.

  • e-learning
  • Audiobooki
  • Sprawdziany
  • Szkolenia
  • Przewodniki audio
  • Film i animacja

Telefonia, systemy IVR i agenci głosowi

Zasilaj systemy telefoniczne, centra kontaktowe i agentów głosowych opartych na dużych modelach językowych naturalnymi głosami. Formaty wyjściowe A-law i μ-law to kodeki G.711 stosowane w systemach telefonicznych. Używaj SSML, aby sterować tempem, zmieniać język w locie i wymawiać nazwy marek zgodnie z własnym słownikiem. Liczba równoczesnych kanałów czasu rzeczywistego skaluje się wraz z Twoją umową.

  • IVR
  • G.711
  • Agenci głosowi
  • SSML
  • A-law / μ-law

Funkcje

Produkcyjna synteza mowy, od początku do końca

Wszystko, czego Twój produkt potrzebuje, aby przemówić.

90 języków, 300 głosów

Wybieraj z bogatego, profesjonalnego katalogu głosów dla każdego języka. Głosy licencjonowane są pojedynczo; kolejne możesz dodać w dowolnym momencie.

Wejście SSML

Używaj SSML do pauz, transkrypcji fonetycznych i zmiany głosu lub języka w obrębie jednego tekstu. Obsługiwane są standardowe znaczniki SSML.

Własne słowniki wymowy

Każdy klient może edytować w portalu klienta słownik przypisany do konkretnego głosu, aby kontrolować wymowę nazw marek, terminów technicznych i nietypowych słów. Lingwiści ReadSpeaker mogą na życzenie poprawić błędną wymowę.

Dane czasowe (RSDS)

RSDS zwraca dźwięk i znaczniki czasowe w jednej odpowiedzi, co oszczędza kredyty w porównaniu z dwoma osobnymi wywołaniami. Przydaje się do podświetlania słów i zdań w Twoim interfejsie. Dostępne wyłącznie w MP3 48 kbit/s i nie dla wszystkich głosów.

Sześć formatów wyjściowych audio

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, surowy PCM, WAV. PCM i WAV przy 22050, 16000 lub 8000 Hz, z głębią 16 bitów. Ustawiane dla każdego żądania przez parametry API.

Strumieniowanie albo pobieranie

Ustaw streaming=1, aby odtwarzanie zaczęło się w chwili, gdy dźwięk jest gotowy, co idealnie sprawdza się na żywo. Albo pobierz gotowy plik w całości.

API REST przez HTTPS

Klucz API dołączany do każdego wywołania. Przez ten sam interfejs REST sprawdzisz dostępne języki, głosy, bieżące zużycie i pozostałe kredyty.

Portal klienta SCAPI

Edytuj słownik wymowy, śledź zużycie i pozostałe kredyty oraz wygeneruj nowy klucz API w chwili, gdy podejrzewasz nadużycie, wszystko w jednym portalu.

Infrastruktura hostowana i nadmiarowa

Hostowane przez ReadSpeaker w środowisku o wysokim poziomie bezpieczeństwa, z nadmiarowością i przełączaniem awaryjnym. Nie ma nic do pobrania ani instalowania.

Wypróbuj w swoim środowisku

Od tekstu do dźwięku w jednym żądaniu

Zobacz, jak wygląda wywołanie w czterech językach. Uwierzytelnianie odbywa się kluczem API wysyłanym z każdym żądaniem.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

Kształt punktu końcowego ma charakter poglądowy. Sięgnij do najnowszej Specyfikacja produktu and the Customer Portal documentation for the current endpoint URL and parameter names.

Specyfikacja techniczna

Każdy parametr, o który zapyta Twój przegląd bezpieczeństwa

Uwierzytelnianie, transport, zasięg językowy, limity przepustowości i formaty audio. Odpowiedzi, których Twoje zespoły bezpieczeństwa i utrzymania potrzebują przed integracją.

Specyfikacja techniczna speechCloud API
SpecificationValue
UwierzytelnianieKlucz API, dołączany do każdego żądania
TransportREST przez HTTPS
Obsługiwane języki90 języków
Dostępne głosy300 głosów
Maksymalna długość tekstu na żądanie5000 znaków (bez znaków odstępu), domyślnie
Zakładany limit użycia≤ 25 000 żądań dziennie · szczyty ≤ 2000 żądań w ciągu jednej godziny
Formaty wyjściowe audioMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
Przepływności MP316, 24, 32, 48, 64, 128 kbit/s
Częstotliwości próbkowania PCM / WAV22050, 16000, 8000 Hz przy 16 bitach
Kodowanie wejściaZalecane UTF-8; obsługiwana jest większość popularnych kodowań
Obsługa SSMLTak: pauzy, transkrypcje fonetyczne, zmiana głosu i języka w locie
Dane czasowe (RSDS)Dźwięk i dane czasowe w jednej odpowiedzi · obecnie tylko MP3 48 kbit/s · nie wszystkie głosy
Tryb strumieniowaniastreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Zasady przechowywania dźwiękuBez przechowywania, ponownego wykorzystania i redystrybucji, o ile nie uzgodniono tego wyraźnie w potwierdzeniu zamówienia
Integracja z telefoniąFormaty wyjściowe A-law i μ-law (kodeki G.711)
DokumentacjaSpecyfikacja produktu (PDF)

Cennik

Płać za to, co generujesz, i skaluj wtedy, gdy potrzebujesz

speechCloud API korzysta z modelu kredytów. Kredyty produkcyjne zamawia się u opiekuna klienta w ReadSpeaker, a zespół wsparcia ReadSpeaker dodaje je do konta. Nowe konta zwykle otrzymują ograniczoną pulę kredytów próbnych na pierwsze testy.

Poproś o wycenę

Zacznij bezpłatnie: nowe konta zwykle otrzymują kredyty próbne. Poproś o dostęp przez formularz kontaktowy.

Credits

speechCloud API

Model kredytów1 kredyt = 1 znak, bez znaków odstępu

Jak działają kredyty

  • 1 kredyt = 1 znak, bez znaków odstępu, z uwzględnieniem zmian wynikających z wpisów w słowniku wymowy
  • Wariant rozliczany za sekundę mowy available via order confirmation for predictable cost on long audio
  • Kredyty próbne przy założeniu konta so you can evaluate before committing

Licencjonowana pojemność mierzona jest przez

  • Liczba znaków over the contract period
  • Liczba żądań and total speech time
  • Równoczesne kanały czasu rzeczywistego for telephony and live use cases
  • Szybkość generowania when responsiveness is critical

Zgodność

Dokumentacja zgodności, którą przekażesz audytorowi bez zmian

ReadSpeaker jest organizacją z certyfikatem ISO/IEC 27001:2022, działającą zgodnie z RODO, ze standardowymi klauzulami umownymi dla transgranicznych transferów danych.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022, zarządzanie bezpieczeństwem informacji)

    Organizacja ReadSpeaker

  • RODO (Ogólne rozporządzenie o ochronie danych)

    Opublikowana informacja o ochronie prywatności

  • Standardowe klauzule umowne UE (Standardowe klauzule umowne Unii Europejskiej)

    Dla transferów transgranicznych

  • Z siedzibą w UE (Organizacja z siedzibą w Unii Europejskiej)

    Siedziba w Szwecji (ReadSpeaker AB, Uppsala)

Najczęstsze pytania

Pytania o speechCloud API

  • speechCloud API (SCAPI) to hostowane w chmurze API REST do syntezy mowy od ReadSpeaker. Wysyłasz tekst na serwery ReadSpeaker przez HTTPS i otrzymujesz wysokiej jakości dźwięk w wybranym formacie (MP3, Ogg, PCM, WAV, A-law lub μ-law). Obsługuje 90 języków i 300 głosów, znaczniki SSML, własne słowniki wymowy i dane czasowe do synchronicznego podświetlania. Działa po stronie serwera i nie wymaga instalowania oprogramowania; integracja odbywa się przez klucz API i żądania HTTP.

  • webReader i docReader to produkty dla użytkownika końcowego, z własnym interfejsem. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • speechCloud API zwraca dźwięk w sześciu formatach: MP3 (z konfigurowalną przepływnością 16, 24, 32, 48, 64 lub 128 kbit/s), Ogg VBR, μ-law, A-law, surowy PCM i WAV. PCM i WAV obsługują częstotliwości próbkowania 22050, 16000 lub 8000 Hz przy głębi 16 bitów. Wybór formatu i parametrów dźwięku ustawiany jest dla każdego żądania przez parametry API.

  • Każde żądanie obejmuje domyślnie do 5000 znaków, liczonych bez znaków odstępu. Standardowa usługa jest przygotowana na maksymalnie 25 000 żądań dziennie, ze szczytami godzinowymi do 2000. Potrzebujesz większego lub stałego ruchu? Porozmawiaj z ReadSpeaker o dedykowanej konfiguracji dopasowanej do Twojego wolumenu.

  • Tak. Obsługiwane jest wejście SSML, w tym pauzy, transkrypcje fonetyczne oraz zmiana głosu lub języka w obrębie jednego tekstu. Dostępne są również własne słowniki wymowy: każdy klient może edytować w portalu klienta słownik przypisany do konkretnego głosu, aby kontrolować wymowę nazw marek, terminów technicznych i nietypowych słów.

  • Tak. speechCloud API może zwrócić RSDS, które łączy dźwięk i dane czasowe w jednej odpowiedzi, co oszczędza kredyty w porównaniu z dwoma osobnymi żądaniami. RSDS jest obecnie dostępne dla MP3 w jakości 48 kbit/s i nie dla każdego języka i głosu; aktualną listę otrzymasz od ReadSpeaker.

  • speechCloud API działa na kredytach: jeden kredyt odpowiada jednemu znakowi, licząc wszystko poza znakami odstępu, powiększonemu o znaki dodane przez Twój słownik wymowy. Kredyty produkcyjne zamawiasz u swojego opiekuna klienta w ReadSpeaker, a nowe konta zwykle zaczynają z kredytami próbnymi. Na życzenie dostępny jest model rozliczany za sekundę mowy. Pojemność można licencjonować według znaków, żądań, czasu mowy, równoczesnych kanałów albo szybkości generowania. Skontaktuj się z ReadSpeaker po wycenę dopasowaną do Twojego wolumenu.

  • ReadSpeaker jako organizacja ma certyfikat ISO/IEC 27001:2022 i działa zgodnie z RODO. Cały ruch API odbywa się przez HTTPS. Dla klientów z UE i transgranicznych transferów danych ReadSpeaker opiera się na standardowych klauzulach umownych. Zgodnie z informacją o ochronie prywatności ReadSpeaker syntetyczne głosy ReadSpeaker są mieszanymi modelami głosu, które nie stanowią danych osobowych w rozumieniu RODO. Danych dźwiękowych nie wolno przechowywać, ponownie wykorzystywać ani redystrybuować, o ile nie uzgodniono tego wyraźnie w potwierdzeniu zamówienia.

  • speechCloud API obsługuje zastosowania czasu rzeczywistego. Domyślnie żądania korzystają z trybu strumieniowania (streaming=1), w którym odpowiedź przekierowuje do serwera strumieniowego zaczynającego dostarczać dźwięk możliwie najszybciej, co daje najkrótszy czas do pierwszego dźwięku. Aby otrzymać plik wsadowo, ustaw streaming=0, a plik zostanie zwrócony po pełnym wygenerowaniu. Liczba równoczesnych kanałów czasu rzeczywistego jest częścią Twojej licencjonowanej pojemności i może zostać zwiększona w potwierdzeniu zamówienia.

  • Załóż konto w ReadSpeaker. Nowe konta zwykle otrzymują ograniczoną pulę kredytów próbnych, aby można było przetestować speechCloud API. Klucz API znajdziesz w portalu klienta SCAPI i musisz dołączać go do każdego żądania. W portalu dostępne są również instrukcje wdrożenia i obsługi, przykładowy kod w popularnych językach programowania oraz Twój edytowalny słownik wymowy. Skontaktuj się z ReadSpeaker to start your account.

VoiceLab

Potrzebujesz własnego głosu marki?

speechCloud API jest dostarczane wraz z naszym profesjonalnym katalogiem głosów.

Lektor nagrywający przed mikrofonem studyjnym

Głos marki tworzony wspólnie z Tobą w studiu

Jeśli potrzebujesz w pełni autorskiego głosu marki, tworzonego wspólnie z Tobą w studiu, poznaj VoiceLab. Lingwiści komputerowi ReadSpeaker tworzą głosy marek od 1999 roku.

Gotowi, aby dodać głos do swojego produktu?

Kredyty próbne są zwykle przyznawane przy zakładaniu konta, aby można było przetestować usługę przed decyzją. Nasz zespół pomoże Ci oszacować wolumen, języki i liczbę równoczesnych kanałów czasu rzeczywistego na potrzeby produkcji. Certyfikat ISO/IEC 27001:2022, działanie zgodne z RODO i standardowymi klauzulami umownymi UE.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.