Ir para o conteúdo

ReadSpeaker speechCloud API

API de conversão de texto em voz para qualquer aplicação, dispositivo ou fluxo de trabalho

Envie texto para um único endpoint REST e receba voz natural em 90 idiomas e 300 vozes. SSML, pronúncia personalizada e seis formatos de áudio, prontos para produção desde a primeira chamada.

Já é cliente? Inicie sessão no Portal do Cliente
  • 90 idiomas
  • 300 vozes
  • Sediada na UE, RGPD, ISO 27001

A escolha de 12 000 clientes em todo o mundo

Marcador de posição do logótipo de parceiro 1
Marcador de posição do logótipo de parceiro 2
Marcador de posição do logótipo de parceiro 3
Marcador de posição do logótipo de parceiro 4
Marcador de posição do logótipo de parceiro 5
Marcador de posição do logótipo de parceiro 6
Marcador de posição do logótipo de parceiro 7
Marcador de posição do logótipo de parceiro 8

Experimentar uma voz

Ouça o que a sua API vai devolver

Quatro vozes em quatro idiomas. O mesmo motor que vai integrar através da API.

Adam

Masculina

Inglês (Reino Unido)

Roxane

Feminina

Français (France)

Lena

Feminina

Deutsch (Deutschland)

Sayaka

Feminina

日本語 (Japan)

Quer uma voz personalizada ou um idioma que não está na lista? Ver todas as 300 vozes →

Casos de clientes

Marcas que criam produtos de voz com a ReadSpeaker

Sonos

A abordagem da ReadSpeaker à voz personalizada é inovadora e extremamente rigorosa, exatamente o que precisávamos para este projeto.

Joseph DureauVice-presidente, Voice Experience · Sonos
Ler o caso completo

Geração de voz na nuvem

Em tempo real ou em lote, onde quer que o seu produto precise de voz

A speechCloud API é um serviço de conversão de texto em voz na nuvem, de servidor para servidor. Chame-a dentro da sua própria aplicação para gerar áudio na hora para os utilizadores finais, ou para produzir áudio em massa para reprodução posterior. Substitui gravações manuais dispendiosas e funciona 24 horas por dia, para que nunca tenha de alojar nem dimensionar um motor de conversão de texto em voz.

Aplicações e dispositivos em tempo real

Adicione conversão de texto em voz a uma aplicação móvel, a um automóvel ligado, a um aparelho médico ou industrial, a um dispositivo vestível ou a um quiosque. Transmita áudio a pedido sem incluir um motor de conversão de texto em voz no dispositivo, para que a ocupação e a bateria se mantenham baixas. Receba voz natural em 90 idiomas com uma única chamada REST.

  • Dispositivos móveis
  • IoT
  • Quiosques
  • Dispositivos vestíveis
  • Automóveis ligados
  • Dispositivos médicos

Produção de áudio em lote

Gere áudio em massa para cursos de e-learning, avaliações, conteúdos de formação, audiolivros, audioguias e diálogos para filmes ou animações. O áudio transmitido pode ser servido aos utilizadores finais a partir da sua própria infraestrutura, quando o seu contrato o permitir. Os dicionários de pronúncia personalizados garantem que os nomes de marca e os termos técnicos são lidos corretamente em todas as faixas.

  • e-learning
  • Audiolivros
  • Avaliações
  • Formação
  • Audioguias
  • Cinema e animação

Telefonia, IVR e agentes de voz

Dê voz natural a sistemas telefónicos, centros de contacto e agentes de voz assentes em LLM. Os formatos de saída A-law e μ-law são os codecs G.711 usados nos sistemas de telefonia. Use SSML para controlar o ritmo, mudar de idioma no meio do texto e pronunciar os nomes de marca a partir do seu dicionário personalizado. Os canais em tempo real em simultâneo acompanham o seu contrato.

  • IVR
  • G.711
  • Agentes de voz
  • SSML
  • A-law / μ-law

Funcionalidades

Conversão de texto em voz em produção, de ponta a ponta

Tudo o que o seu produto precisa para responder em voz.

90 idiomas, 300 vozes

Escolha num catálogo de vozes profissional e abrangente, por idioma. As vozes são licenciadas individualmente; pode acrescentar mais a qualquer momento.

Entrada em SSML

Use SSML para pausas, transcrições fonéticas e mudança de voz ou de idioma dentro de um mesmo texto. A marcação SSML padrão é suportada.

Dicionários de pronúncia personalizados

Cada cliente pode editar um dicionário específico de cada voz no portal do cliente, para controlar como são pronunciados os nomes de marca, os termos técnicos e as palavras invulgares. Os linguistas da ReadSpeaker podem corrigir pronúncias erradas mediante pedido.

Dados de sincronização (RSDS)

O RSDS devolve o áudio e as marcas de sincronização numa única resposta, o que poupa créditos face a duas chamadas separadas. É útil para o realce de palavras e de frases na sua interface. Disponível apenas em MP3 a 48 kbps e não em todas as vozes.

Seis formatos de saída de áudio

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, PCM raw, WAV. PCM e WAV a 22050, 16000 ou 8000 Hz, com 16 bits de profundidade. Definido por pedido através dos parâmetros da API.

Transmissão ou transferência

Defina streaming=1 para começar a reprodução assim que o áudio estiver pronto, ideal para uso ao vivo. Ou receba o ficheiro finalizado numa única transferência.

API REST sobre HTTPS

Chave de API incluída em cada chamada. Consulte os idiomas disponíveis, as vozes, a utilização atual e os créditos restantes através da mesma interface REST.

Portal do cliente SCAPI

Edite o seu dicionário de pronúncia, acompanhe a utilização e os créditos restantes, e gere uma nova chave de API assim que suspeitar de uma utilização indevida, tudo a partir de um único portal.

Infraestrutura alojada e redundante

Alojado pela ReadSpeaker num ambiente de alta segurança, com redundância e recuperação automática. Nada para transferir ou instalar.

Experimente na sua infraestrutura

De texto a áudio num único pedido

Veja como é uma chamada em quatro linguagens. Autentique-se com a sua chave de API, enviada em cada pedido.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

A forma do endpoint é ilustrativa. Consulte a Especificação do produto and the Customer Portal documentation for the current endpoint URL and parameter names.

Especificações técnicas

Todas as especificações que a sua análise de segurança vai querer saber

Autenticação, transporte, cobertura de idiomas, limites de débito e formatos de áudio. As respostas de que as suas equipas de segurança e de operações precisam antes da integração.

Especificações técnicas da speechCloud API
SpecificationValue
AutenticaçãoChave de API, incluída em cada pedido
TransportesREST sobre HTTPS
Idiomas suportados90 idiomas
Vozes disponíveis300 vozes
Texto máximo por pedido5000 caracteres (excluindo espaços em branco), por predefinição
Limite de utilização previsto≤ 25 000 pedidos/dia · picos ≤ 2000 pedidos numa única hora
Formatos de saída de áudioMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
Débitos de MP316, 24, 32, 48, 64, 128 kbit/s
Frequências de amostragem PCM / WAV22050, 16000, 8000 Hz a 16 bits
Codificação de entradaUTF-8 recomendado; as codificações mais comuns são suportadas
Suporte de SSMLSim: pausas, transcrições fonéticas e mudança de voz ou de idioma no meio do texto
Dados de sincronização (RSDS)Áudio e sincronização numa só resposta · atualmente apenas MP3 a 48 kbit/s · nem todas as vozes
Modo de transmissãostreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Regras de armazenamento do áudioSem armazenamento, reutilização ou redistribuição, salvo acordo explícito na confirmação da encomenda
Integração com telefoniaFormatos de saída A-law e μ-law (codecs G.711)
DocumentaçãoEspecificação do produto (PDF)

Preços

Pague o que gerar, cresça quando precisar

A speechCloud API usa um modelo de créditos. Os créditos de produção são encomendados através do seu Gestor de Conta ReadSpeaker e acrescentados à sua conta pela equipa de suporte da ReadSpeaker. As contas novas recebem normalmente uma quantidade limitada de créditos de avaliação para os primeiros testes.

Pedir um orçamento

Comece gratuitamente: as novas contas recebem normalmente créditos de avaliação. Peça acesso através do formulário de contacto.

Credits

speechCloud API

Modelo de créditos1 crédito = 1 caráter, excluindo espaços em branco

Como funcionam os créditos

  • 1 crédito = 1 caráter, excluindo espaços em branco, incluindo quaisquer alterações resultantes das entradas do dicionário de pronúncia
  • Variante por segundo de voz available via order confirmation for predictable cost on long audio
  • Créditos de avaliação na abertura da conta so you can evaluate before committing

A capacidade licenciada é medida por

  • Número de caracteres over the contract period
  • Número de pedidos and total speech time
  • Canais em tempo real em simultâneo for telephony and live use cases
  • Velocidade de geração when responsiveness is critical

Conformidade

Conformidade que pode entregar diretamente ao seu auditor

A ReadSpeaker é uma organização certificada ISO/IEC 27001:2022, em conformidade com o RGPD, com Cláusulas Contratuais-Tipo para as transferências transfronteiriças de dados.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022, gestão da segurança da informação)

    Organização ReadSpeaker

  • RGPD (Regulamento Geral sobre a Proteção de Dados)

    Aviso de Privacidade publicado

  • CCT da UE (Cláusulas Contratuais-Tipo da UE)

    Para transferências transfronteiriças

  • Sediada na UE (Organização sediada na União Europeia)

    Sede na Suécia (ReadSpeaker AB, Uppsala)

FAQ

Perguntas sobre a speechCloud API

  • A speechCloud API (SCAPI) é uma API REST de conversão de texto em voz alojada na nuvem, da ReadSpeaker. Envia texto para os servidores da ReadSpeaker através de HTTPS e recebe áudio de alta qualidade no formato que escolher (MP3, Ogg, PCM, WAV, A-law ou μ-law). Suporta 90 idiomas e 300 vozes, marcação SSML, dicionários de pronúncia personalizados e dados de sincronização para o realce sincronizado. Assenta em servidor, sem software para instalar; a integração faz-se através de uma chave de API e de pedidos HTTP.

  • O webReader e o docReader são produtos para o utilizador final, com a sua própria interface. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • A speechCloud API devolve áudio em seis formatos: MP3 (débito configurável de 16, 24, 32, 48, 64 ou 128 kbit/s), Ogg VBR, μ-law, A-law, PCM raw e WAV. O PCM e o WAV suportam frequências de amostragem de 22050, 16000 ou 8000 Hz, com 16 bits de profundidade. A escolha do formato e dos parâmetros de áudio é definida em cada pedido, através dos parâmetros da API.

  • Cada pedido aceita até 5000 caracteres por predefinição, contando tudo exceto os espaços em branco. O serviço padrão está dimensionado para até 25 000 pedidos por dia, com picos horários até 2000. Tem um tráfego mais elevado ou sustentado? Fale com a ReadSpeaker sobre uma configuração dedicada ao seu volume.

  • Sim. A entrada em SSML é suportada, incluindo pausas, transcrições fonéticas e mudança de voz ou de idioma dentro de um mesmo texto. Também estão disponíveis dicionários de pronúncia personalizados: cada cliente pode editar um dicionário específico de cada voz no portal do cliente, para controlar como são pronunciados os nomes de marca, os termos técnicos ou as palavras invulgares.

  • Sim. A speechCloud API pode devolver RSDS, que combina o áudio e a informação de sincronização numa única resposta, poupando créditos face a dois pedidos separados. O RSDS está atualmente disponível em MP3 a 48 kbit/s e não existe para todos os idiomas ou vozes; contacte a ReadSpeaker para conhecer a lista atual.

  • A speechCloud API funciona com créditos: um crédito cobre um caráter, contando tudo exceto os espaços em branco, mais quaisquer caracteres acrescentados pelo seu dicionário de pronúncia. Os créditos de produção são encomendados através do seu Gestor de Conta ReadSpeaker, e as contas novas começam normalmente com créditos de avaliação. Está disponível, mediante pedido, um modelo por segundo de voz. A capacidade pode ser licenciada por caracteres, por pedidos, por tempo de voz, por canais em simultâneo ou por velocidade de geração. Contacte a ReadSpeaker para obter um orçamento adequado ao seu volume.

  • A ReadSpeaker, enquanto organização, é certificada ISO/IEC 27001:2022 e está em conformidade com o RGPD. Todo o tráfego da API usa HTTPS. Para clientes da UE e para transferências transfronteiriças de dados, a ReadSpeaker assenta nas Cláusulas Contratuais-Tipo (CCT). De acordo com o Aviso de Privacidade da ReadSpeaker, as vozes sintetizadas da ReadSpeaker são modelos de voz combinados que não constituem Informação Pessoal ao abrigo do RGPD. Os dados de áudio não podem ser armazenados, reutilizados nem redistribuídos, salvo acordo explícito na confirmação da encomenda.

  • A speechCloud API suporta casos de utilização em tempo real. Por predefinição, os pedidos usam o modo de transmissão (streaming=1), em que a resposta remete para um servidor de transmissão que começa a entregar áudio o mais depressa possível, para o menor tempo até ao som. Para entrega em lote, defina streaming=0 e o ficheiro é devolvido depois de gerado por completo. O número de canais em tempo real em simultâneo faz parte da capacidade que licenciou e pode ser ajustado na confirmação da encomenda.

  • Crie uma conta na ReadSpeaker. As novas contas recebem normalmente uma quantidade limitada de créditos de avaliação para que possa testar a speechCloud API. A sua chave de API está disponível no portal do cliente SCAPI e deve ser incluída em cada pedido. As instruções de implementação e de utilização, os exemplos de código nas linguagens de programação mais comuns e o seu dicionário de pronúncia editável também estão acessíveis a partir do portal. Contactar a ReadSpeaker to start your account.

VoiceLab

Precisa de uma voz de marca própria?

A speechCloud API traz o nosso catálogo de vozes profissionais.

Um talento vocal a gravar diante de um microfone de estúdio

Uma voz de marca criada consigo em estúdio

Para uma voz de marca totalmente personalizada, criada consigo em estúdio, explore o VoiceLab. Os linguistas computacionais da ReadSpeaker criam vozes de marca desde 1999.

Pronto para pôr uma voz no seu produto?

Normalmente são atribuídos créditos de avaliação na criação da conta, para que possa avaliar antes de se comprometer. A nossa equipa ajuda-o a dimensionar o volume, os idiomas e os canais em tempo real em simultâneo para produção. Certificada ISO/IEC 27001:2022, alinhada com o RGPD e com as Cláusulas Contratuais-Tipo da UE.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.