Ir para o conteúdo

ReadSpeaker speechEngine SDK Embedded

Conversão de texto em voz no dispositivo, para sistemas embebidos e dispositivos móveis

O ReadSpeaker speechEngine SDK Embedded acrescenta vozes de IA naturais a dispositivos assentes em ARM, a aplicações móveis e a sistemas embebidos. Funciona inteiramente no dispositivo, sem necessidade de ligação à rede. Mais de 150 vozes de IA em mais de 50 idiomas para iOS, Android e Embedded Linux.

  • Funciona inteiramente no dispositivo
  • ARM 32/64 bits
  • Mais de 150 vozes · mais de 50 idiomas

Porquê no dispositivo

Voz que funciona com ou sem ligação

Muitos dispositivos não podem depender da nuvem. Um monitor médico, um automóvel ou um controlador industrial tem de falar no momento exato em que é preciso, sempre. O speechEngine SDK Embedded sintetiza voz inteiramente no dispositivo, para que a saída de áudio se mantenha constante e imediata mesmo sem rede. Os seus dados nunca saem do equipamento e a latência nunca depende do sinal.

Pensado para sistemas embebidos

Voz natural em hardware onde a maioria das soluções de conversão de texto em voz não cabe

Uma ocupação reduzida, por conceção

Cada voz ocupa 6 a 35 MB de armazenamento e funciona com 20 a 30 MB de memória. Isso cabe no hardware limitado em que assentam os produtos embebidos, desde controladores ARM de 32 bits até chips móveis de 64 bits, sem abdicar do som natural.

Mais de 150 vozes de IA em mais de 50 idiomas

O speechEngine SDK Embedded assenta no catálogo ReadSpeaker de mais de 150 vozes de IA em mais de 50 idiomas. São acrescentadas regularmente novas vozes e novos idiomas, pelo que o mesmo SDK pode lançar um produto num mercado ou em cinquenta.

Afine cada palavra que é lida

Ajuste o ritmo de leitura, o tom e o volume ao dispositivo. Use SSML (Speech Synthesis Markup Language) para inserir pausas, mudar de voz ou de idioma a meio da frase e acrescentar transcrições fonéticas. Um dicionário de utilizador por idioma, com suporte de IPA, permite corrigir uma só vez, em todo o lado, a pronúncia dos nomes de produtos e dos termos do domínio.

Especificações técnicas

Pensado para hardware com recursos limitados

O speechEngine SDK Embedded foi concebido para sistemas de pequena ocupação. Os valores abaixo permitem-lhe dimensionar o seu hardware antes de se comprometer.

Especificações técnicas do speechEngine SDK Embedded
SpecificationValue
Sistemas operativosiOS · Android · Embedded Linux (outros sistemas operativos embebidos a pedido)
CPUARM 32/64 bits. Neural Standard: 1 GHz ou superior (apenas 64 bits) · Neural Lite: 800 MHz ou superior
RAM6 a 30 MB
Memória em execução20 a 30 MB (Neural Lite e Neural Standard)
Ocupação de cada voz6 a 32 MB (Neural Lite) · 9 a 35 MB (Neural Standard), tecnologia de redes neuronais profundas
Saída de áudio8 formatos: PCM linear de 16 bits, A-law de 8 bits, μ-law de 8 bits, PCM linear sem sinal de 8 bits Wave, ADPCM Dialogic de 4 bits e variantes Wave
Entrada de textoTexto simples (multibyte) · SSML (UTF-8)
DocumentaçãoEspecificação do produto (PDF)

Neural Standard e Neural Lite

Dois níveis de voz, um só SDK

Escolha o equilíbrio que serve o seu hardware. O Neural Standard funciona em ARM de 64 bits a partir de 1 GHz, com vozes de 9 a 35 MB para o som mais rico. O Neural Lite funciona em ARM a partir de 800 MHz, com vozes de 6 a 32 MB para os dispositivos mais limitados. Ambos usam tecnologia de redes neuronais profundas.

Neural Lite e Neural Standard comparados
Neural LiteNeural Standard
CPUARM 800 MHz ou superiorARM 1 GHz ou superior (apenas 64 bits)
Ocupação de cada voz6 a 32 MB9 a 35 MB
TecnologiaRedes neuronais profundasRedes neuronais profundas

Plataformas

Integre na linguagem que já utiliza

O speechEngine SDK Embedded vem com as API, o código de exemplo e a documentação para integrar depressa. Desenvolva em C/C++ no Embedded Linux, em Objective-C no iOS ou em Java no Android. Cada entrega inclui as bibliotecas do motor de voz, os ficheiros de vozes e a documentação de integração para a plataforma que licenciou, além do apoio da nossa equipa.

Plataformas suportadas e respetivas linguagens de integração
PlatformLanguage
Embedded LinuxC / C++
iOSObjective-C
AndroidJava

Integração

Algumas chamadas até à primeira fala

Inicialize o motor, carregue uma voz e sintetize. O SDK trata do resto no dispositivo.

/* Illustrative - confirm exact API against the SDK docs before use */
#include "rs_embedded_tts.h"

int main() {
    rsEngine *engine = rsEngineCreate("license.dat");
    rsEngineLoadVoice(engine, "en-US-neural-standard");
    rsEngineSetRate(engine, 1.0);
    rsEngineSpeak(engine, "Welcome aboard.", RS_AUDIO_PCM16);
    rsEngineDestroy(engine);
    return 0;
}

Forma apenas ilustrativa. Consulte a documentação do SDK e o código de exemplo para conhecer as assinaturas exatas da API da plataforma que lhe foi entregue.

Onde funciona

Vozes para dispositivos críticos

Das aplicações móveis ao hardware crítico, o speechEngine SDK Embedded dá aos produtos uma voz fiável onde quer que funcionem, incluindo na defesa e noutros ambientes com recursos limitados.

Sistemas de anúncios

Saída de voz nítida para sistemas de alarme e de notificação de emergência.

Dispositivos móveis

Audiolivros, aprendizagem de línguas e aplicações móveis que falam offline, sem necessidade de ligação à rede.

FAQ

Perguntas sobre o speechEngine SDK Embedded

  • Sim. O speechEngine SDK Embedded sintetiza voz inteiramente no dispositivo, sem necessidade de ligação à rede. Todo o processamento e todos os dados ficam no equipamento, pelo que a saída de voz é imediata e constante, mesmo em ambientes offline ou com recursos limitados.

  • Suporta iOS, Android e Embedded Linux de origem. Outros sistemas operativos embebidos podem ser suportados mediante pedido. Contacte a nossa equipa indicando a sua plataforma de destino.

  • Funciona em processadores ARM de 32 e 64 bits. As vozes Neural Standard precisam de uma CPU ARM de 64 bits a 1 GHz ou superior; as vozes Neural Lite funcionam a partir de 800 MHz. O SDK usa 6 a 30 MB de RAM e 20 a 30 MB em execução.

  • Cada voz ocupa 6 a 32 MB no Neural Lite e 9 a 35 MB no Neural Standard. Ambos os níveis usam tecnologia de redes neuronais profundas, pelo que obtém um som natural com uma ocupação adequada a sistemas embebidos.

  • O speechEngine SDK Embedded suporta mais de 150 vozes de IA em mais de 50 idiomas. São acrescentadas regularmente novas vozes e novos idiomas. A lista completa está disponível no site da ReadSpeaker.

  • Pode integrar em C/C++ no Embedded Linux, em Objective-C no iOS e em Java no Android. Cada pacote do SDK inclui as API, o código de exemplo e a documentação para começar.

  • Sim. Use SSML para ajustar a prosódia, inserir pausas, acrescentar transcrições fonéticas e mudar de voz ou de idioma no meio do texto. Um dicionário de utilizador por idioma, com suporte de IPA, permite definir pronúncias personalizadas para termos específicos do domínio.

  • Produz 8 formatos de áudio, incluindo PCM linear de 16 bits, A-law e μ-law de 8 bits, ADPCM Dialogic de 4 bits e várias variantes Wave. Assim consegue corresponder ao pipeline de áudio do dispositivo de destino.

  • O speechEngine SDK Embedded foi criado para sistemas no dispositivo, de pequena ocupação, em hardware ARM e móvel. speechEngine SDK targets desktop and PC-based applications on Windows and Linux. See speechEngine SDK if you're building for desktop.

Pronto para pôr uma voz no seu dispositivo?

Fale-nos do seu hardware, dos idiomas de destino e do seu calendário. A nossa equipa de sistemas embebidos ajuda-o a definir as vozes, a ocupação e a plataforma certas para o seu produto.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.