Użycie plug-inu syntezy mowy ReadSpeaker oszczędziło nam niezliczone godziny pracy i przybliżyło nas do naszej wizji gry naprawdę dostępnej dla każdego.
Przeczytaj całą historię Soft LeafReadSpeaker speechEngine SDK
Zestaw SDK do syntezy mowy działający na urządzeniu i offline, dla aplikacji komputerowych
Zainstaluj silnik mowy bezpośrednio na maszynie docelowej, gdzie generuje dźwięk lokalnie, bez wywołań sieciowych. Ponad 150 głosów AI w ponad 50 językach, z natywnymi wiązaniami dla C, C++ i Javy w systemach Windows i Linux oraz dla C# w systemie Windows.
- C/C++ · C# · Java
- Windows 10/11 i Linux
- Na urządzeniu
Historia klienta
Wbudowane w dostarczane oprogramowanie, na urządzeniu
Funkcje
Głos na urządzeniu, stworzony dla programistów
Wszystko, czego Twój zespół potrzebuje, aby umieścić naturalnie brzmiący głos w aplikacji komputerowej, z silnikiem działającym lokalnie.
Dostarcz głos, który nigdy nie opuszcza urządzenia
Silnik działa na maszynie Twojego klienta i generuje dźwięk bez żadnych wywołań sieciowych. Dobrze sprawdza się we wdrożeniach odciętych od sieci, regulowanych albo działających przede wszystkim offline, gdzie dane pozostają wewnątrz organizacji.
Ponad 150 głosów AI w ponad 50 językach
Naturalne, ludzko brzmiące głosy AI, a do katalogu regularnie dodawane są nowe głosy i języki. Wybierz akcent i ton pasujące do każdego rynku i wdrażaj je przy rozmiarze, który pozostaje lekki na dysku.
Twój zespół pisze w swoim środowisku
Natywne wiązania dla C i C++ w systemach Windows i Linux, dla C# w systemie Windows oraz dla Javy w systemach Windows i Linux. Przykładowy kod, dokumentacja i wsparcie wdrożeniowe naszego zespołu ułatwiają integrację.
Precyzyjna kontrola głosu dzięki SSML
Zmieniaj głos i język w środku zdania, steruj prozodią, wstawiaj pauzy i transkrypcje fonetyczne. Wejście w formacie Speech Synthesis Markup Language (SSML) jest w pełni obsługiwane, w kodowaniu UTF-8.
Poprawnie wymawiaj nazwy marek i żargon
Twórz słowniki wymowy dla każdego języka, dla nazw produktów, skrótów i nazw własnych, z możliwością prowadzenia kilku słowników na język. Gdy potrzebujesz precyzyjnej kontroli fonetycznej, użyj transkrypcji IPA.
Formaty audio do każdego potoku
16-bitowy liniowy PCM, 8-bitowy A-law i μ-law dla telefonii, Dialogic ADPCM dla starszych systemów IVR. Otrzymujesz format, którego oczekuje Twój potok, surowy lub w kontenerze WAV.
Dopracuj każdą wypowiedź
Ustaw tempo mowy, wysokość i głośność stosownie do sytuacji, od spokojnej narracji po pilne alerty. Skonfiguruj je według potrzeb dla każdego wdrożenia.
Przewidywalne licencjonowanie
Plik licencji zainstalowany razem z SDK zabezpiecza zamówione głosy i okres obowiązywania. Żadnych niespodziewanych aktualizacji, rozliczeń według użycia ani obaw przed audytem.
Prawdziwi ludzie pomagają Ci wdrożyć rozwiązanie
Zespół wsparcia ReadSpeaker towarzyszy Twoim programistom przez całą integrację. Przykładowy kod, dokumentacja i bezpośredni kontakt sprawiają, że nigdy nie utkniesz nad wiki o drugiej w nocy.
Wypróbuj w swoim środowisku
Prosty przykład integracji w C++
Natywne wiązania dostarczane są dla C i C++ w systemach Windows i Linux, dla C# w systemie Windows oraz dla Javy w systemach Windows i Linux. Wywołujesz silnik w tym samym procesie i generujesz mowę do lokalnego pliku audio, bez wywołań sieciowych.
// Representative example. The exact API and headers ship with the licensed SDK.
#include "speechengine.h"
int main() {
SpeechEngine engine;
engine.init("./license.lic"); // license file enforces voices + term
engine.selectVoice("en_US-neural"); // 150+ voices, 50+ languages
engine.setSpeechRate(90); // tune rate, pitch and volume per request
// Synthesise plain text or SSML to a local audio file, no server calls
engine.synthesizeToFile("Welcome to ReadSpeaker.", "welcome.wav");
engine.release(); // free the engine
return 0;
}Specyfikacja techniczna
Każdy parametr, o który zapytają Twoje zespoły programistów i utrzymania
Przygotowane do wdrożenia na urządzeniu i offline: mały rozmiar, szeroka obsługa systemów, dźwięk gotowy do telefonii.
| Specification | Detail |
|---|---|
| Języki programowania | C / C++ (Windows/Linux) · C# (Windows) · Java (Windows/Linux) |
| System Windows | Windows 10 i 11 |
| System Linux | CentOS Stream od 9.x do 10.x · Ubuntu od 18.x do 24.x · RHEL od 7.x do 9.x · inne systemy na życzenie |
| CPU | Intel x86/64, 1 GHz lub więcej. Na architekturach x64 wymagane jest AVX (skontaktuj się z ReadSpeaker, jeśli Twoje środowisko nie obsługuje AVX). |
| RAM | Od 6 do 30 MB |
| Rozmiar głosu | Od 9 do 35 MB na głos (technologia głębokich sieci neuronowych) |
| Pamięć w czasie działania | Od 20 do 30 MB (Neural Standard) |
| Formaty wejściowe | Zwykły tekst (wielobajtowy) · SSML (UTF-8) |
| Formaty wyjściowe audio | 16-bitowy liniowy PCM (raw/WAV) · 8-bitowy PCM A-law/μ-law (raw/WAV) · 8-bitowy liniowy PCM Wave bez znaku · 4-bitowy Dialogic ADPCM |
| Dokumentacja | Specyfikacja produktu (PDF) |
Model wdrożenia
Działa na Twojej infrastrukturze, zgodnie z Twoim plikiem licencji
speechEngine SDK instaluje się lokalnie na maszynie docelowej. Silnik syntezy mowy działa bez wywołań serwerowych. Umowa licencyjna i plik licencji egzekwują licencjonowaną platformę, głosy i okres obowiązywania. Dokumentację zgodności korporacyjnej (ISO/IEC 27001, RODO, standardowe klauzule umowne UE) znajdziesz w informacji o ochronie prywatności ReadSpeaker i na stronach o firmie.
Na urządzeniu (Silnik zainstalowany na urządzeniu docelowym)
Zainstalowane lokalnie
Bez wywołań sieciowych (Dźwięk generowany bez odpytywania serwera)
Silnik działa lokalnie
Egzekwowanie pliku licencji (Plik licencji dostarczany razem z SDK)
Głosy i okres obowiązywania
Dostarczenie SDK (SDK przygotowane dla platformy wskazanej w zamówieniu)
Według zamówienia klienta
Najczęstsze pytania
Pytania o speechEngine SDK
speechEngine SDK to zestaw SDK do syntezy mowy na urządzeniu, przeznaczony dla programistów tworzących aplikacje komputerowe. Silnik instaluje się lokalnie na maszynie docelowej i obsługuje ponad 150 głosów AI w ponad 50 językach. Działa bez łączności sieciowej, co odpowiada środowiskom odciętym od sieci i wrażliwym na prywatność.
speechEngine SDK dostarcza natywne wiązania dla C i C++ w systemach Windows i Linux, dla C# w systemie Windows oraz dla Javy w systemach Windows i Linux. SDK dostarczane jest dla platformy wskazanej w zamówieniu klienta.
speechEngine SDK działa w systemach Windows 10 i 11 oraz w dystrybucjach Linuksa, w tym CentOS Stream od 9.x do 10.x, Ubuntu od 18.x do 24.x i RHEL od 7.x do 9.x. Inne systemy operacyjne są obsługiwane na życzenie. Procesor: Intel x86/64 o taktowaniu 1 GHz lub wyższym (na x64 wymagane AVX). Pamięć RAM: od 6 do 30 MB.
Tak. Silnik syntezy mowy instaluje się lokalnie na maszynie docelowej i generuje dźwięk bez wywołań sieciowych, co odpowiada wdrożeniom odciętym od sieci i wrażliwym na prywatność. Jeśli celem jest ARM, urządzenia mobilne lub IoT, zobacz speechEngine SDK Embedded.
speechEngine SDK generuje cztery formaty audio: 16-bitowy liniowy PCM (raw/WAV), 8-bitowy PCM A-law/μ-law (raw/WAV), 8-bitowy liniowy PCM Wave bez znaku oraz 4-bitowy Dialogic ADPCM. Wyjście A-law i μ-law szczególnie dobrze nadaje się do integracji z telefonią.
Tak. speechEngine SDK przyjmuje wejście w postaci zwykłego tekstu (wielobajtowego) oraz SSML (UTF-8), dzięki czemu Twoja aplikacja może opisać potrzebną mowę znacznikami. SSML pozwala zmieniać głos i język w obrębie jednego tekstu, modyfikować prozodię, wstawiać pauzy i stosować transkrypcje fonetyczne.
speechEngine SDK podlega umowie licencyjnej, która określa licencjonowaną platformę, głosy i dozwolony kontekst użycia. Plik licencji dostarczany razem z SDK technicznie egzekwuje licencjonowane głosy oraz okres obowiązywania, czyli czas dozwolonego użycia.
Tak. Wsparcie wdrożeniowe zespołu wsparcia ReadSpeaker jest w cenie. Zespół pomaga klientom zrozumieć i przeprowadzić integrację zgodnie z dostarczoną dokumentacją i przykładowym kodem.