Usar el plug-in de TTS de ReadSpeaker nos ahorró incontables horas de desarrollo y nos acercó a nuestra visión de un juego verdaderamente accesible.
Lea el caso completo de Soft LeafReadSpeaker speechEngine SDK
SDK de síntesis de voz en el dispositivo y sin conexión para aplicaciones de escritorio y PC
Instale el motor de voz directamente en la máquina de destino, donde genera el audio en local sin llamadas de red. Más de 150 voces de IA en más de 50 idiomas, con enlaces nativos para C, C++ y Java en Windows y Linux, y C# en Windows.
- C/C++ · C# · Java
- Windows 10/11 + Linux
- En el dispositivo
Caso de cliente
Integrado en software comercial, en el propio dispositivo
Funcionalidades
Voz en el dispositivo, pensada para desarrolladores
Todo lo que su equipo necesita para poner voz de sonido natural dentro de una aplicación de escritorio o de PC, con el motor ejecutándose en local.
Entregue una voz que nunca sale del dispositivo
El motor funciona en la máquina de su cliente y genera el audio sin ninguna llamada de red. Encaja bien en despliegues aislados de la red, regulados o pensados primero para funcionar sin conexión, donde los datos se quedan dentro.
Más de 150 voces de IA en más de 50 idiomas
Voces de IA naturales, con sonido humano, y nuevas voces e idiomas que se añaden al catálogo con regularidad. Elija el acento y el tono que encajan en cada mercado y publíquelos con una huella que sigue siendo ligera en disco.
Su equipo escribe en su propia infraestructura
Enlaces nativos para C y C++ en Windows y Linux, C# en Windows y Java en Windows y Linux. El código de ejemplo, la documentación y el soporte de implementación de nuestro equipo facilitan la integración.
Control fino de la voz con SSML
Cambie de voz y de idioma a mitad de frase, controle la prosodia, inserte pausas y transcripciones fonéticas. La entrada en Speech Synthesis Markup Language (SSML) es totalmente compatible, en UTF-8.
Pronuncie correctamente los nombres de marca y la jerga
Cree diccionarios de pronunciación por idioma para nombres de producto, siglas y nombres propios, con varios diccionarios por idioma. Use la transcripción IPA cuando necesite un control fonético preciso.
Formatos de audio para cualquier cadena de procesamiento
PCM lineal de 16 bits, A-law y μ-law de 8 bits para telefonía, ADPCM Dialogic para IVR heredados. Genere el formato que espera su cadena de procesamiento, en bruto o encapsulado en WAV.
Ajuste cada enunciado
Ajuste la velocidad de habla, el tono y el volumen a cada momento, desde una narración pausada hasta alertas urgentes. Configúrelos según convenga en cada despliegue.
Licencias previsibles
Un archivo de licencia instalado junto al SDK fija las voces y el plazo que usted ha contratado. Sin actualizaciones inesperadas, sin facturación por uso, sin inquietud ante auditorías.
Personas de verdad le ayudan a entregar
El equipo de soporte de ReadSpeaker acompaña a sus desarrolladores durante la integración. El código de ejemplo, la documentación y el contacto directo hacen que nunca se quede leyendo un wiki a las 2 de la madrugada.
Pruébelo en su infraestructura
Un ejemplo sencillo de integración en C++
Se entregan enlaces nativos para C y C++ en Windows y Linux, C# en Windows y Java en Windows y Linux. Llame al motor dentro del proceso y sintetice texto a un archivo de audio local, sin llamadas de red.
// Representative example. The exact API and headers ship with the licensed SDK.
#include "speechengine.h"
int main() {
SpeechEngine engine;
engine.init("./license.lic"); // license file enforces voices + term
engine.selectVoice("en_US-neural"); // 150+ voices, 50+ languages
engine.setSpeechRate(90); // tune rate, pitch and volume per request
// Synthesise plain text or SSML to a local audio file, no server calls
engine.synthesizeToFile("Welcome to ReadSpeaker.", "welcome.wav");
engine.release(); // free the engine
return 0;
}Especificaciones técnicas
Todas las especificaciones que preguntarán sus equipos de desarrollo y operaciones
Dimensionado para un despliegue en el dispositivo y sin conexión: huella reducida, amplia compatibilidad de sistemas operativos y audio listo para telefonía.
| Specification | Detail |
|---|---|
| Lenguajes de programación | C / C++ (Windows/Linux) · C# (Windows) · Java (Windows/Linux) |
| Sistema operativo Windows | Windows 10 y 11 |
| Sistema operativo Linux | CentOS Stream 9.x a 10.x · Ubuntu 18.x a 24.x · RHEL 7.x a 9.x · otros SO a petición |
| CPU | Intel x86/64, 1 GHz o superior. Se requiere AVX en arquitecturas x64 (contacte con ReadSpeaker si su entorno no admite AVX). |
| RAM | De 6 a 30 MB |
| Huella de la voz | De 9 a 35 MB por voz (tecnología de redes neuronales profundas) |
| Memoria en ejecución | De 20 a 30 MB (Neural Standard) |
| Formatos de entrada | Texto sin formato (multibyte) · SSML (UTF-8) |
| Formatos de salida de audio | PCM lineal de 16 bits (raw/WAV) · PCM A-law/μ-law de 8 bits (raw/WAV) · PCM lineal sin signo de 8 bits Wave · ADPCM Dialogic de 4 bits |
| Documentación | Especificación de producto (PDF) |
Modelo de despliegue
Funciona en su infraestructura, bajo su archivo de licencia
speechEngine SDK se instala en local en la máquina de destino. El motor TTS funciona sin llamadas al servidor. El acuerdo de licencia y el archivo de licencia imponen la plataforma, las voces y el plazo licenciados. Para la documentación de conformidad corporativa (ISO/IEC 27001, RGPD, CCT de la UE), consulte el aviso de privacidad de ReadSpeaker y las páginas de información sobre la empresa.
En el dispositivo (Motor instalado en la máquina de destino)
Instalado en local
Sin llamadas de red (Audio generado sin viajes de ida y vuelta al servidor)
El motor se ejecuta localmente
Aplicación del archivo de licencia (Archivo de licencia entregado con el SDK)
Voces y duración
Entrega del SDK (SDK creado para la plataforma que figura en el pedido)
Según el pedido de cada cliente
FAQ
Preguntas sobre speechEngine SDK
speechEngine SDK es un SDK de síntesis de voz en el dispositivo para desarrolladores que crean aplicaciones de escritorio y para PC. El motor se instala en local en la máquina de destino y admite más de 150 voces de IA en más de 50 idiomas. Funciona sin conectividad de red, algo que encaja con entornos aislados de la red y sensibles a la privacidad.
speechEngine SDK incluye enlaces nativos para C y C++ en Windows y Linux, C# en Windows y Java en Windows y Linux. El SDK se entrega para la plataforma indicada en el pedido del cliente.
speechEngine SDK funciona en Windows 10 y 11, y en distribuciones de Linux como CentOS Stream 9.x a 10.x, Ubuntu 18.x a 24.x y RHEL 7.x a 9.x. Otros sistemas operativos se admiten a petición. CPU: Intel x86/64 de 1 GHz o superior (se requiere AVX en x64). RAM: de 6 a 30 MB.
Sí. El motor TTS se instala en local en la máquina de destino y genera el audio sin llamadas de red, algo que encaja con despliegues sensibles a la privacidad y aislados de la red. Para destinos ARM, móviles o IoT, consulte speechEngine SDK Embedded.
speechEngine SDK genera cuatro formatos de audio: PCM lineal de 16 bits (raw/WAV), PCM A-law/μ-law de 8 bits (raw/WAV), PCM lineal sin signo de 8 bits Wave y ADPCM Dialogic de 4 bits. La salida A-law y μ-law resulta especialmente adecuada para la integración con telefonía.
Sí. speechEngine SDK acepta entrada de texto sin formato (multibyte) y entrada SSML (UTF-8), de modo que su aplicación puede marcar la voz que necesita. SSML permite cambiar de voz y de idioma dentro de un mismo texto, modificar la prosodia, insertar pausas y aplicar transcripciones fonéticas.
speechEngine SDK se rige por un acuerdo de licencia que define la plataforma, las voces y el contexto de uso autorizados. Un archivo de licencia entregado con el SDK impone técnicamente las voces licenciadas y el plazo, es decir, la duración del uso permitido.
Sí. El soporte de implementación del equipo de soporte de ReadSpeaker está incluido. El equipo ayuda a los clientes a entender y llevar a cabo la integración conforme a la documentación y al código de ejemplo facilitados.