Ir al contenido

ReadSpeaker speechEngine SDK

SDK de síntesis de voz en el dispositivo y sin conexión para aplicaciones de escritorio y PC

Instale el motor de voz directamente en la máquina de destino, donde genera el audio en local sin llamadas de red. Más de 150 voces de IA en más de 50 idiomas, con enlaces nativos para C, C++ y Java en Windows y Linux, y C# en Windows.

  • C/C++ · C# · Java
  • Windows 10/11 + Linux
  • En el dispositivo

Caso de cliente

Integrado en software comercial, en el propio dispositivo

Soft Leaf

Usar el plug-in de TTS de ReadSpeaker nos ahorró incontables horas de desarrollo y nos acercó a nuestra visión de un juego verdaderamente accesible.

Conor BradleyFundador y director, Soft Leaf Studios · Stories of Blossom
Lea el caso completo de Soft Leaf

Funcionalidades

Voz en el dispositivo, pensada para desarrolladores

Todo lo que su equipo necesita para poner voz de sonido natural dentro de una aplicación de escritorio o de PC, con el motor ejecutándose en local.

Entregue una voz que nunca sale del dispositivo

El motor funciona en la máquina de su cliente y genera el audio sin ninguna llamada de red. Encaja bien en despliegues aislados de la red, regulados o pensados primero para funcionar sin conexión, donde los datos se quedan dentro.

Más de 150 voces de IA en más de 50 idiomas

Voces de IA naturales, con sonido humano, y nuevas voces e idiomas que se añaden al catálogo con regularidad. Elija el acento y el tono que encajan en cada mercado y publíquelos con una huella que sigue siendo ligera en disco.

Su equipo escribe en su propia infraestructura

Enlaces nativos para C y C++ en Windows y Linux, C# en Windows y Java en Windows y Linux. El código de ejemplo, la documentación y el soporte de implementación de nuestro equipo facilitan la integración.

Control fino de la voz con SSML

Cambie de voz y de idioma a mitad de frase, controle la prosodia, inserte pausas y transcripciones fonéticas. La entrada en Speech Synthesis Markup Language (SSML) es totalmente compatible, en UTF-8.

Pronuncie correctamente los nombres de marca y la jerga

Cree diccionarios de pronunciación por idioma para nombres de producto, siglas y nombres propios, con varios diccionarios por idioma. Use la transcripción IPA cuando necesite un control fonético preciso.

Formatos de audio para cualquier cadena de procesamiento

PCM lineal de 16 bits, A-law y μ-law de 8 bits para telefonía, ADPCM Dialogic para IVR heredados. Genere el formato que espera su cadena de procesamiento, en bruto o encapsulado en WAV.

Ajuste cada enunciado

Ajuste la velocidad de habla, el tono y el volumen a cada momento, desde una narración pausada hasta alertas urgentes. Configúrelos según convenga en cada despliegue.

Licencias previsibles

Un archivo de licencia instalado junto al SDK fija las voces y el plazo que usted ha contratado. Sin actualizaciones inesperadas, sin facturación por uso, sin inquietud ante auditorías.

Personas de verdad le ayudan a entregar

El equipo de soporte de ReadSpeaker acompaña a sus desarrolladores durante la integración. El código de ejemplo, la documentación y el contacto directo hacen que nunca se quede leyendo un wiki a las 2 de la madrugada.

Pruébelo en su infraestructura

Un ejemplo sencillo de integración en C++

Se entregan enlaces nativos para C y C++ en Windows y Linux, C# en Windows y Java en Windows y Linux. Llame al motor dentro del proceso y sintetice texto a un archivo de audio local, sin llamadas de red.

// Representative example. The exact API and headers ship with the licensed SDK.
#include "speechengine.h"

int main() {
    SpeechEngine engine;
    engine.init("./license.lic");          // license file enforces voices + term
    engine.selectVoice("en_US-neural");       // 150+ voices, 50+ languages
    engine.setSpeechRate(90);                 // tune rate, pitch and volume per request

    // Synthesise plain text or SSML to a local audio file, no server calls
    engine.synthesizeToFile("Welcome to ReadSpeaker.", "welcome.wav");

    engine.release();                          // free the engine
    return 0;
}

Especificaciones técnicas

Todas las especificaciones que preguntarán sus equipos de desarrollo y operaciones

Dimensionado para un despliegue en el dispositivo y sin conexión: huella reducida, amplia compatibilidad de sistemas operativos y audio listo para telefonía.

Especificaciones técnicas de speechEngine SDK 4.5
SpecificationDetail
Lenguajes de programaciónC / C++ (Windows/Linux) · C# (Windows) · Java (Windows/Linux)
Sistema operativo WindowsWindows 10 y 11
Sistema operativo LinuxCentOS Stream 9.x a 10.x · Ubuntu 18.x a 24.x · RHEL 7.x a 9.x · otros SO a petición
CPUIntel x86/64, 1 GHz o superior. Se requiere AVX en arquitecturas x64 (contacte con ReadSpeaker si su entorno no admite AVX).
RAMDe 6 a 30 MB
Huella de la vozDe 9 a 35 MB por voz (tecnología de redes neuronales profundas)
Memoria en ejecuciónDe 20 a 30 MB (Neural Standard)
Formatos de entradaTexto sin formato (multibyte) · SSML (UTF-8)
Formatos de salida de audioPCM lineal de 16 bits (raw/WAV) · PCM A-law/μ-law de 8 bits (raw/WAV) · PCM lineal sin signo de 8 bits Wave · ADPCM Dialogic de 4 bits
DocumentaciónEspecificación de producto (PDF)

Modelo de despliegue

Funciona en su infraestructura, bajo su archivo de licencia

speechEngine SDK se instala en local en la máquina de destino. El motor TTS funciona sin llamadas al servidor. El acuerdo de licencia y el archivo de licencia imponen la plataforma, las voces y el plazo licenciados. Para la documentación de conformidad corporativa (ISO/IEC 27001, RGPD, CCT de la UE), consulte el aviso de privacidad de ReadSpeaker y las páginas de información sobre la empresa.

  • En el dispositivo (Motor instalado en la máquina de destino)

    Instalado en local

  • Sin llamadas de red (Audio generado sin viajes de ida y vuelta al servidor)

    El motor se ejecuta localmente

  • Aplicación del archivo de licencia (Archivo de licencia entregado con el SDK)

    Voces y duración

  • Entrega del SDK (SDK creado para la plataforma que figura en el pedido)

    Según el pedido de cada cliente

FAQ

Preguntas sobre speechEngine SDK

  • speechEngine SDK es un SDK de síntesis de voz en el dispositivo para desarrolladores que crean aplicaciones de escritorio y para PC. El motor se instala en local en la máquina de destino y admite más de 150 voces de IA en más de 50 idiomas. Funciona sin conectividad de red, algo que encaja con entornos aislados de la red y sensibles a la privacidad.

  • speechEngine SDK incluye enlaces nativos para C y C++ en Windows y Linux, C# en Windows y Java en Windows y Linux. El SDK se entrega para la plataforma indicada en el pedido del cliente.

  • speechEngine SDK funciona en Windows 10 y 11, y en distribuciones de Linux como CentOS Stream 9.x a 10.x, Ubuntu 18.x a 24.x y RHEL 7.x a 9.x. Otros sistemas operativos se admiten a petición. CPU: Intel x86/64 de 1 GHz o superior (se requiere AVX en x64). RAM: de 6 a 30 MB.

  • Sí. El motor TTS se instala en local en la máquina de destino y genera el audio sin llamadas de red, algo que encaja con despliegues sensibles a la privacidad y aislados de la red. Para destinos ARM, móviles o IoT, consulte speechEngine SDK Embedded.

  • speechEngine SDK genera cuatro formatos de audio: PCM lineal de 16 bits (raw/WAV), PCM A-law/μ-law de 8 bits (raw/WAV), PCM lineal sin signo de 8 bits Wave y ADPCM Dialogic de 4 bits. La salida A-law y μ-law resulta especialmente adecuada para la integración con telefonía.

  • Sí. speechEngine SDK acepta entrada de texto sin formato (multibyte) y entrada SSML (UTF-8), de modo que su aplicación puede marcar la voz que necesita. SSML permite cambiar de voz y de idioma dentro de un mismo texto, modificar la prosodia, insertar pausas y aplicar transcripciones fonéticas.

  • speechEngine SDK se rige por un acuerdo de licencia que define la plataforma, las voces y el contexto de uso autorizados. Un archivo de licencia entregado con el SDK impone técnicamente las voces licenciadas y el plazo, es decir, la duración del uso permitido.

  • Sí. El soporte de implementación del equipo de soporte de ReadSpeaker está incluido. El equipo ayuda a los clientes a entender y llevar a cabo la integración conforme a la documentación y al código de ejemplo facilitados.

¿Preparado para dar voz a su aplicación de escritorio?

Cuéntenos su plataforma y sus idiomas de destino. Nuestro equipo define las voces, la entrega y las condiciones de licencia adecuadas, y después le envía el SDK con código de ejemplo y soporte de implementación.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.