Przejdź do treści

ReadSpeaker speechEngine SDK

Zestaw SDK do syntezy mowy działający na urządzeniu i offline, dla aplikacji komputerowych

Zainstaluj silnik mowy bezpośrednio na maszynie docelowej, gdzie generuje dźwięk lokalnie, bez wywołań sieciowych. Ponad 150 głosów AI w ponad 50 językach, z natywnymi wiązaniami dla C, C++ i Javy w systemach Windows i Linux oraz dla C# w systemie Windows.

  • C/C++ · C# · Java
  • Windows 10/11 i Linux
  • Na urządzeniu

Historia klienta

Wbudowane w dostarczane oprogramowanie, na urządzeniu

Soft Leaf

Użycie plug-inu syntezy mowy ReadSpeaker oszczędziło nam niezliczone godziny pracy i przybliżyło nas do naszej wizji gry naprawdę dostępnej dla każdego.

Conor BradleyZałożyciel i dyrektor, Soft Leaf Studios · Stories of Blossom
Przeczytaj całą historię Soft Leaf

Funkcje

Głos na urządzeniu, stworzony dla programistów

Wszystko, czego Twój zespół potrzebuje, aby umieścić naturalnie brzmiący głos w aplikacji komputerowej, z silnikiem działającym lokalnie.

Dostarcz głos, który nigdy nie opuszcza urządzenia

Silnik działa na maszynie Twojego klienta i generuje dźwięk bez żadnych wywołań sieciowych. Dobrze sprawdza się we wdrożeniach odciętych od sieci, regulowanych albo działających przede wszystkim offline, gdzie dane pozostają wewnątrz organizacji.

Ponad 150 głosów AI w ponad 50 językach

Naturalne, ludzko brzmiące głosy AI, a do katalogu regularnie dodawane są nowe głosy i języki. Wybierz akcent i ton pasujące do każdego rynku i wdrażaj je przy rozmiarze, który pozostaje lekki na dysku.

Twój zespół pisze w swoim środowisku

Natywne wiązania dla C i C++ w systemach Windows i Linux, dla C# w systemie Windows oraz dla Javy w systemach Windows i Linux. Przykładowy kod, dokumentacja i wsparcie wdrożeniowe naszego zespołu ułatwiają integrację.

Precyzyjna kontrola głosu dzięki SSML

Zmieniaj głos i język w środku zdania, steruj prozodią, wstawiaj pauzy i transkrypcje fonetyczne. Wejście w formacie Speech Synthesis Markup Language (SSML) jest w pełni obsługiwane, w kodowaniu UTF-8.

Poprawnie wymawiaj nazwy marek i żargon

Twórz słowniki wymowy dla każdego języka, dla nazw produktów, skrótów i nazw własnych, z możliwością prowadzenia kilku słowników na język. Gdy potrzebujesz precyzyjnej kontroli fonetycznej, użyj transkrypcji IPA.

Formaty audio do każdego potoku

16-bitowy liniowy PCM, 8-bitowy A-law i μ-law dla telefonii, Dialogic ADPCM dla starszych systemów IVR. Otrzymujesz format, którego oczekuje Twój potok, surowy lub w kontenerze WAV.

Dopracuj każdą wypowiedź

Ustaw tempo mowy, wysokość i głośność stosownie do sytuacji, od spokojnej narracji po pilne alerty. Skonfiguruj je według potrzeb dla każdego wdrożenia.

Przewidywalne licencjonowanie

Plik licencji zainstalowany razem z SDK zabezpiecza zamówione głosy i okres obowiązywania. Żadnych niespodziewanych aktualizacji, rozliczeń według użycia ani obaw przed audytem.

Prawdziwi ludzie pomagają Ci wdrożyć rozwiązanie

Zespół wsparcia ReadSpeaker towarzyszy Twoim programistom przez całą integrację. Przykładowy kod, dokumentacja i bezpośredni kontakt sprawiają, że nigdy nie utkniesz nad wiki o drugiej w nocy.

Wypróbuj w swoim środowisku

Prosty przykład integracji w C++

Natywne wiązania dostarczane są dla C i C++ w systemach Windows i Linux, dla C# w systemie Windows oraz dla Javy w systemach Windows i Linux. Wywołujesz silnik w tym samym procesie i generujesz mowę do lokalnego pliku audio, bez wywołań sieciowych.

// Representative example. The exact API and headers ship with the licensed SDK.
#include "speechengine.h"

int main() {
    SpeechEngine engine;
    engine.init("./license.lic");          // license file enforces voices + term
    engine.selectVoice("en_US-neural");       // 150+ voices, 50+ languages
    engine.setSpeechRate(90);                 // tune rate, pitch and volume per request

    // Synthesise plain text or SSML to a local audio file, no server calls
    engine.synthesizeToFile("Welcome to ReadSpeaker.", "welcome.wav");

    engine.release();                          // free the engine
    return 0;
}

Specyfikacja techniczna

Każdy parametr, o który zapytają Twoje zespoły programistów i utrzymania

Przygotowane do wdrożenia na urządzeniu i offline: mały rozmiar, szeroka obsługa systemów, dźwięk gotowy do telefonii.

Specyfikacja techniczna speechEngine SDK 4.5
SpecificationDetail
Języki programowaniaC / C++ (Windows/Linux) · C# (Windows) · Java (Windows/Linux)
System WindowsWindows 10 i 11
System LinuxCentOS Stream od 9.x do 10.x · Ubuntu od 18.x do 24.x · RHEL od 7.x do 9.x · inne systemy na życzenie
CPUIntel x86/64, 1 GHz lub więcej. Na architekturach x64 wymagane jest AVX (skontaktuj się z ReadSpeaker, jeśli Twoje środowisko nie obsługuje AVX).
RAMOd 6 do 30 MB
Rozmiar głosuOd 9 do 35 MB na głos (technologia głębokich sieci neuronowych)
Pamięć w czasie działaniaOd 20 do 30 MB (Neural Standard)
Formaty wejścioweZwykły tekst (wielobajtowy) · SSML (UTF-8)
Formaty wyjściowe audio16-bitowy liniowy PCM (raw/WAV) · 8-bitowy PCM A-law/μ-law (raw/WAV) · 8-bitowy liniowy PCM Wave bez znaku · 4-bitowy Dialogic ADPCM
DokumentacjaSpecyfikacja produktu (PDF)

Model wdrożenia

Działa na Twojej infrastrukturze, zgodnie z Twoim plikiem licencji

speechEngine SDK instaluje się lokalnie na maszynie docelowej. Silnik syntezy mowy działa bez wywołań serwerowych. Umowa licencyjna i plik licencji egzekwują licencjonowaną platformę, głosy i okres obowiązywania. Dokumentację zgodności korporacyjnej (ISO/IEC 27001, RODO, standardowe klauzule umowne UE) znajdziesz w informacji o ochronie prywatności ReadSpeaker i na stronach o firmie.

  • Na urządzeniu (Silnik zainstalowany na urządzeniu docelowym)

    Zainstalowane lokalnie

  • Bez wywołań sieciowych (Dźwięk generowany bez odpytywania serwera)

    Silnik działa lokalnie

  • Egzekwowanie pliku licencji (Plik licencji dostarczany razem z SDK)

    Głosy i okres obowiązywania

  • Dostarczenie SDK (SDK przygotowane dla platformy wskazanej w zamówieniu)

    Według zamówienia klienta

Najczęstsze pytania

Pytania o speechEngine SDK

  • speechEngine SDK to zestaw SDK do syntezy mowy na urządzeniu, przeznaczony dla programistów tworzących aplikacje komputerowe. Silnik instaluje się lokalnie na maszynie docelowej i obsługuje ponad 150 głosów AI w ponad 50 językach. Działa bez łączności sieciowej, co odpowiada środowiskom odciętym od sieci i wrażliwym na prywatność.

  • speechEngine SDK dostarcza natywne wiązania dla C i C++ w systemach Windows i Linux, dla C# w systemie Windows oraz dla Javy w systemach Windows i Linux. SDK dostarczane jest dla platformy wskazanej w zamówieniu klienta.

  • speechEngine SDK działa w systemach Windows 10 i 11 oraz w dystrybucjach Linuksa, w tym CentOS Stream od 9.x do 10.x, Ubuntu od 18.x do 24.x i RHEL od 7.x do 9.x. Inne systemy operacyjne są obsługiwane na życzenie. Procesor: Intel x86/64 o taktowaniu 1 GHz lub wyższym (na x64 wymagane AVX). Pamięć RAM: od 6 do 30 MB.

  • Tak. Silnik syntezy mowy instaluje się lokalnie na maszynie docelowej i generuje dźwięk bez wywołań sieciowych, co odpowiada wdrożeniom odciętym od sieci i wrażliwym na prywatność. Jeśli celem jest ARM, urządzenia mobilne lub IoT, zobacz speechEngine SDK Embedded.

  • speechEngine SDK generuje cztery formaty audio: 16-bitowy liniowy PCM (raw/WAV), 8-bitowy PCM A-law/μ-law (raw/WAV), 8-bitowy liniowy PCM Wave bez znaku oraz 4-bitowy Dialogic ADPCM. Wyjście A-law i μ-law szczególnie dobrze nadaje się do integracji z telefonią.

  • Tak. speechEngine SDK przyjmuje wejście w postaci zwykłego tekstu (wielobajtowego) oraz SSML (UTF-8), dzięki czemu Twoja aplikacja może opisać potrzebną mowę znacznikami. SSML pozwala zmieniać głos i język w obrębie jednego tekstu, modyfikować prozodię, wstawiać pauzy i stosować transkrypcje fonetyczne.

  • speechEngine SDK podlega umowie licencyjnej, która określa licencjonowaną platformę, głosy i dozwolony kontekst użycia. Plik licencji dostarczany razem z SDK technicznie egzekwuje licencjonowane głosy oraz okres obowiązywania, czyli czas dozwolonego użycia.

  • Tak. Wsparcie wdrożeniowe zespołu wsparcia ReadSpeaker jest w cenie. Zespół pomaga klientom zrozumieć i przeprowadzić integrację zgodnie z dostarczoną dokumentacją i przykładowym kodem.

Gotowi, aby dodać głos do swojej aplikacji komputerowej?

Powiedz nam, jaka jest Twoja platforma i języki docelowe. Nasz zespół dobierze właściwe głosy, sposób dostarczenia i warunki licencji, a następnie przekaże SDK z przykładowym kodem i wsparciem wdrożeniowym.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.