Usar o plug-in de conversão de texto em voz da ReadSpeaker poupou-nos imensas horas de desenvolvimento e aproximou-nos da nossa visão de um jogo verdadeiramente acessível.
Ler o caso completo da Soft LeafReadSpeaker speechEngine SDK
SDK de conversão de texto em voz offline, no dispositivo, para aplicações de computador e de PC
Instale o motor de voz diretamente na máquina de destino, onde gera áudio localmente, sem chamadas de rede. Mais de 150 vozes de IA em mais de 50 idiomas, com ligações nativas para C, C++ e Java em Windows e Linux, e C# em Windows.
- C/C++ · C# · Java
- Windows 10/11 + Linux
- No dispositivo
Caso de cliente
Integrado no software distribuído, no dispositivo
Funcionalidades
Voz no dispositivo, pensada para programadores
Tudo o que a sua equipa precisa para colocar uma voz de som natural dentro de uma aplicação de computador ou de PC, com o motor a funcionar localmente.
Distribua uma voz que nunca sai do dispositivo
O motor funciona na máquina do seu cliente e gera áudio sem qualquer chamada de rede. É adequado a implementações isoladas da rede, reguladas ou pensadas primeiro para offline, em que os dados ficam em casa.
Mais de 150 vozes de IA em mais de 50 idiomas
Vozes de IA naturais, próximas da voz humana, com novas vozes e novos idiomas acrescentados regularmente ao catálogo. Escolha o sotaque e o tom adequados a cada mercado e distribua-os com uma ocupação que se mantém leve em disco.
A sua equipa escreve na sua própria infraestrutura
Ligações nativas para C e C++ em Windows e Linux, C# em Windows, e Java em Windows e Linux. O código de exemplo, a documentação e o apoio à implementação da nossa equipa facilitam a integração.
Controlo fino da voz com SSML
Mude de voz e de idioma a meio da frase, controle a prosódia, insira pausas e transcrições fonéticas. A entrada em Speech Synthesis Markup Language (SSML) é totalmente suportada, em UTF-8.
Pronuncie corretamente os nomes de marca e o jargão
Crie dicionários de pronúncia por idioma para nomes de produtos, siglas e nomes próprios, com vários dicionários por idioma. Use a transcrição IPA quando precisar de um controlo fonético preciso.
Formatos de áudio para qualquer pipeline
PCM linear de 16 bits, A-law e μ-law de 8 bits para telefonia, ADPCM Dialogic para IVR antigos. Produza o formato que o seu pipeline espera, raw ou encapsulado em WAV.
Afine cada enunciado
Ajuste o ritmo de leitura, o tom e o volume ao momento, da narração calma aos alertas urgentes. Configure-os conforme necessário para cada implementação.
Licenciamento previsível
Um ficheiro de licença instalado junto ao SDK fixa as vozes e o prazo que encomendou. Sem atualizações inesperadas, sem faturação por utilização, sem receios de auditoria.
Pessoas reais ajudam-no a lançar
A equipa de suporte da ReadSpeaker trabalha com os seus programadores ao longo da integração. O código de exemplo, a documentação e o contacto direto significam que nunca fica preso a ler uma wiki às duas da manhã.
Experimente na sua infraestrutura
Um exemplo simples de integração em C++
São fornecidas ligações nativas para C e C++ em Windows e Linux, C# em Windows, e Java em Windows e Linux. Chame o motor no mesmo processo e sintetize texto para um ficheiro de áudio local, sem chamadas de rede.
// Representative example. The exact API and headers ship with the licensed SDK.
#include "speechengine.h"
int main() {
SpeechEngine engine;
engine.init("./license.lic"); // license file enforces voices + term
engine.selectVoice("en_US-neural"); // 150+ voices, 50+ languages
engine.setSpeechRate(90); // tune rate, pitch and volume per request
// Synthesise plain text or SSML to a local audio file, no server calls
engine.synthesizeToFile("Welcome to ReadSpeaker.", "welcome.wav");
engine.release(); // free the engine
return 0;
}Especificações técnicas
Todas as especificações que as suas equipas de desenvolvimento e de operações vão querer saber
Dimensionado para implementação offline, no dispositivo: pouca ocupação, amplo suporte de sistemas operativos, áudio pronto para telefonia.
| Specification | Detail |
|---|---|
| Linguagens de programação | C / C++ (Windows/Linux) · C# (Windows) · Java (Windows/Linux) |
| Sistema operativo Windows | Windows 10 e 11 |
| Sistema operativo Linux | CentOS Stream 9.x a 10.x · Ubuntu 18.x a 24.x · RHEL 7.x a 9.x · Outros sistemas operativos a pedido |
| CPU | Intel x86/64, 1 GHz ou superior. AVX necessário em arquiteturas x64 (contacte a ReadSpeaker se o seu ambiente não suportar AVX). |
| RAM | 6 a 30 MB |
| Ocupação de cada voz | 9 a 35 MB por voz (tecnologia de redes neuronais profundas) |
| Memória em execução | 20 a 30 MB (Neural Standard) |
| Formatos de entrada | Texto simples (multibyte) · SSML (UTF-8) |
| Formatos de saída de áudio | PCM linear de 16 bits (raw/WAV) · PCM de 8 bits A-law/μ-law (raw/WAV) · PCM linear sem sinal de 8 bits Wave · ADPCM Dialogic de 4 bits |
| Documentação | Especificação do produto (PDF) |
Modelo de implementação
Funciona na sua infraestrutura, ao abrigo do seu ficheiro de licença
O speechEngine SDK é instalado localmente na máquina de destino. O motor de conversão de texto em voz funciona sem chamadas ao servidor. O contrato de licença e o ficheiro de licença impõem a plataforma, as vozes e o prazo licenciados. Para a documentação de conformidade da empresa (ISO/IEC 27001, RGPD, CCT da UE), consulte o Aviso de Privacidade da ReadSpeaker e as páginas sobre a empresa.
No dispositivo (Motor instalado na máquina de destino)
Instalado localmente
Sem chamadas de rede (Áudio gerado sem idas e voltas ao servidor)
O motor funciona localmente
Aplicação do ficheiro de licença (Ficheiro de licença entregue com o SDK)
Vozes + prazo
Entrega do SDK (SDK criado para a plataforma indicada na encomenda)
Por encomenda do cliente
FAQ
Perguntas sobre o speechEngine SDK
O speechEngine SDK é um SDK de conversão de texto em voz no dispositivo, para programadores que criam aplicações de computador e de PC. O motor instala-se localmente na máquina de destino e suporta mais de 150 vozes de IA em mais de 50 idiomas. Funciona sem ligação à rede, o que se adequa a ambientes isolados da rede e sensíveis à privacidade.
O speechEngine SDK traz ligações nativas para C e C++ em Windows e Linux, C# em Windows, e Java em Windows e Linux. O SDK é entregue para a plataforma indicada na encomenda do cliente.
O speechEngine SDK funciona em Windows 10 e 11, e em distribuições Linux como CentOS Stream 9.x a 10.x, Ubuntu 18.x a 24.x e RHEL 7.x a 9.x. Outros sistemas operativos são suportados mediante pedido. CPU: Intel x86/64 a 1 GHz ou superior (AVX necessário em x64). RAM: 6 a 30 MB.
Sim. O motor de conversão de texto em voz instala-se localmente na máquina de destino e gera áudio sem chamadas de rede, o que se adequa a implementações sensíveis à privacidade e isoladas da rede. Para destinos ARM, móveis ou IoT, consulte speechEngine SDK Embedded.
O speechEngine SDK produz quatro formatos de áudio: PCM linear de 16 bits (raw/WAV), PCM de 8 bits A-law/μ-law (raw/WAV), PCM linear sem sinal de 8 bits Wave e ADPCM Dialogic de 4 bits. A saída A-law e μ-law é particularmente adequada à integração com telefonia.
Sim. O speechEngine SDK aceita entrada em texto simples (multibyte) e em SSML (UTF-8), para que a sua aplicação possa marcar a voz de que precisa. O SSML permite mudar de voz e de idioma dentro de um mesmo texto, alterar a prosódia, inserir pausas e aplicar transcrições fonéticas.
O speechEngine SDK é regido por um contrato de licença que define a plataforma licenciada, as vozes e o contexto de utilização permitido. Um ficheiro de licença entregue com o SDK impõe tecnicamente as vozes licenciadas e o prazo, ou seja, a duração da utilização permitida.
Sim. O apoio à implementação da equipa de suporte da ReadSpeaker está incluído. A equipa ajuda os clientes a compreender e a executar a integração de acordo com a documentação e o código de exemplo fornecidos.