Adam
MasculinaInglês (Reino Unido)
ReadSpeaker speechCloud API
Envie texto para um único endpoint REST e receba voz natural em 90 idiomas e 300 vozes. SSML, pronúncia personalizada e seis formatos de áudio, prontos para produção desde a primeira chamada.
Já é cliente? Inicie sessão no Portal do ClienteA escolha de 12 000 clientes em todo o mundo
Experimentar uma voz
Quatro vozes em quatro idiomas. O mesmo motor que vai integrar através da API.
Inglês (Reino Unido)
Français (France)
Deutsch (Deutschland)
日本語 (Japan)
Quer uma voz personalizada ou um idioma que não está na lista? Ver todas as 300 vozes →
Casos de clientes
Geração de voz na nuvem
A speechCloud API é um serviço de conversão de texto em voz na nuvem, de servidor para servidor. Chame-a dentro da sua própria aplicação para gerar áudio na hora para os utilizadores finais, ou para produzir áudio em massa para reprodução posterior. Substitui gravações manuais dispendiosas e funciona 24 horas por dia, para que nunca tenha de alojar nem dimensionar um motor de conversão de texto em voz.
Adicione conversão de texto em voz a uma aplicação móvel, a um automóvel ligado, a um aparelho médico ou industrial, a um dispositivo vestível ou a um quiosque. Transmita áudio a pedido sem incluir um motor de conversão de texto em voz no dispositivo, para que a ocupação e a bateria se mantenham baixas. Receba voz natural em 90 idiomas com uma única chamada REST.
Gere áudio em massa para cursos de e-learning, avaliações, conteúdos de formação, audiolivros, audioguias e diálogos para filmes ou animações. O áudio transmitido pode ser servido aos utilizadores finais a partir da sua própria infraestrutura, quando o seu contrato o permitir. Os dicionários de pronúncia personalizados garantem que os nomes de marca e os termos técnicos são lidos corretamente em todas as faixas.
Dê voz natural a sistemas telefónicos, centros de contacto e agentes de voz assentes em LLM. Os formatos de saída A-law e μ-law são os codecs G.711 usados nos sistemas de telefonia. Use SSML para controlar o ritmo, mudar de idioma no meio do texto e pronunciar os nomes de marca a partir do seu dicionário personalizado. Os canais em tempo real em simultâneo acompanham o seu contrato.
Funcionalidades
Tudo o que o seu produto precisa para responder em voz.
Escolha num catálogo de vozes profissional e abrangente, por idioma. As vozes são licenciadas individualmente; pode acrescentar mais a qualquer momento.
Use SSML para pausas, transcrições fonéticas e mudança de voz ou de idioma dentro de um mesmo texto. A marcação SSML padrão é suportada.
Cada cliente pode editar um dicionário específico de cada voz no portal do cliente, para controlar como são pronunciados os nomes de marca, os termos técnicos e as palavras invulgares. Os linguistas da ReadSpeaker podem corrigir pronúncias erradas mediante pedido.
O RSDS devolve o áudio e as marcas de sincronização numa única resposta, o que poupa créditos face a duas chamadas separadas. É útil para o realce de palavras e de frases na sua interface. Disponível apenas em MP3 a 48 kbps e não em todas as vozes.
MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, PCM raw, WAV. PCM e WAV a 22050, 16000 ou 8000 Hz, com 16 bits de profundidade. Definido por pedido através dos parâmetros da API.
Defina streaming=1 para começar a reprodução assim que o áudio estiver pronto, ideal para uso ao vivo. Ou receba o ficheiro finalizado numa única transferência.
Chave de API incluída em cada chamada. Consulte os idiomas disponíveis, as vozes, a utilização atual e os créditos restantes através da mesma interface REST.
Edite o seu dicionário de pronúncia, acompanhe a utilização e os créditos restantes, e gere uma nova chave de API assim que suspeitar de uma utilização indevida, tudo a partir de um único portal.
Alojado pela ReadSpeaker num ambiente de alta segurança, com redundância e recuperação automática. Nada para transferir ou instalar.
Experimente na sua infraestrutura
Veja como é uma chamada em quatro linguagens. Autentique-se com a sua chave de API, enviada em cada pedido.
# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
-d "key=YOUR_API_KEY" \
-d "voice=Adam" \
-d "lang=en_uk" \
-d "audioformat=mp3" \
-d "audiobitrate=48" \
-d "text=Welcome to ReadSpeaker." \
--output speech.mp3
# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
-d "key=YOUR_API_KEY" \
-d "voice=Adam" \
-d "lang=en_uk" \
-d "input=ssml" \
--data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
--output greeting.mp3# Python 3, requests library
import requests
resp = requests.post(
"https://tts.readspeaker.com/a/eg/v2.0",
data={
"key": "YOUR_API_KEY",
"voice": "Adam",
"lang": "en_uk",
"audioformat": "mp3",
"audiobitrate": 48,
"text": "Welcome to ReadSpeaker.",
},
)
if resp.status_code == 200:
with open("speech.mp3", "wb") as f:
f.write(resp.content)
else:
print("Error:", resp.status_code, resp.text)// Node.js 18+, native fetch + fs/promises
import { writeFile } from "node:fs/promises";
const body = new URLSearchParams({
key: "YOUR_API_KEY",
voice: "Adam",
lang: "en_uk",
audioformat: "mp3",
audiobitrate: "48",
text: "Welcome to ReadSpeaker.",
});
const resp = await fetch("https://tts.readspeaker.com/a/eg/v2.0", {
method: "POST",
body,
});
if (!resp.ok) throw new Error(`SCAPI ${resp.status}`);
await writeFile("speech.mp3", Buffer.from(await resp.arrayBuffer()));<?php
// PHP 8, cURL
$ch = curl_init("https://tts.readspeaker.com/a/eg/v2.0");
curl_setopt_array($ch, [
CURLOPT_POST => true,
CURLOPT_POSTFIELDS => http_build_query([
"key" => "YOUR_API_KEY",
"voice" => "Adam",
"lang" => "en_uk",
"audioformat" => "mp3",
"audiobitrate" => 48,
"text" => "Welcome to ReadSpeaker.",
]),
CURLOPT_RETURNTRANSFER => true,
]);
$audio = curl_exec($ch);
$code = curl_getinfo($ch, CURLINFO_HTTP_CODE);
curl_close($ch);
if ($code === 200) {
file_put_contents("speech.mp3", $audio);
} else {
error_log("SCAPI error: $code");
}A forma do endpoint é ilustrativa. Consulte a Especificação do produto and the Customer Portal documentation for the current endpoint URL and parameter names.
Especificações técnicas
Autenticação, transporte, cobertura de idiomas, limites de débito e formatos de áudio. As respostas de que as suas equipas de segurança e de operações precisam antes da integração.
| Specification | Value |
|---|---|
| Autenticação | Chave de API, incluída em cada pedido |
| Transportes | REST sobre HTTPS |
| Idiomas suportados | 90 idiomas |
| Vozes disponíveis | 300 vozes |
| Texto máximo por pedido | 5000 caracteres (excluindo espaços em branco), por predefinição |
| Limite de utilização previsto | ≤ 25 000 pedidos/dia · picos ≤ 2000 pedidos numa única hora |
| Formatos de saída de áudio | MP3 · Ogg VBR · μ-law · A-law · PCM · WAV |
| Débitos de MP3 | 16, 24, 32, 48, 64, 128 kbit/s |
| Frequências de amostragem PCM / WAV | 22050, 16000, 8000 Hz a 16 bits |
| Codificação de entrada | UTF-8 recomendado; as codificações mais comuns são suportadas |
| Suporte de SSML | Sim: pausas, transcrições fonéticas e mudança de voz ou de idioma no meio do texto |
| Dados de sincronização (RSDS) | Áudio e sincronização numa só resposta · atualmente apenas MP3 a 48 kbit/s · nem todas as vozes |
| Modo de transmissão | streaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation |
| Regras de armazenamento do áudio | Sem armazenamento, reutilização ou redistribuição, salvo acordo explícito na confirmação da encomenda |
| Integração com telefonia | Formatos de saída A-law e μ-law (codecs G.711) |
| Documentação | Especificação do produto (PDF) |
Preços
A speechCloud API usa um modelo de créditos. Os créditos de produção são encomendados através do seu Gestor de Conta ReadSpeaker e acrescentados à sua conta pela equipa de suporte da ReadSpeaker. As contas novas recebem normalmente uma quantidade limitada de créditos de avaliação para os primeiros testes.
Comece gratuitamente: as novas contas recebem normalmente créditos de avaliação. Peça acesso através do formulário de contacto.
Credits
Modelo de créditos1 crédito = 1 caráter, excluindo espaços em branco
Como funcionam os créditos
A capacidade licenciada é medida por
Conformidade
A ReadSpeaker é uma organização certificada ISO/IEC 27001:2022, em conformidade com o RGPD, com Cláusulas Contratuais-Tipo para as transferências transfronteiriças de dados.
ISO/IEC 27001:2022 (ISO/IEC 27001:2022, gestão da segurança da informação)
Organização ReadSpeaker
RGPD (Regulamento Geral sobre a Proteção de Dados)
Aviso de Privacidade publicado
CCT da UE (Cláusulas Contratuais-Tipo da UE)
Para transferências transfronteiriças
Sediada na UE (Organização sediada na União Europeia)
Sede na Suécia (ReadSpeaker AB, Uppsala)
De acordo com o Aviso de Privacidade da ReadSpeaker, as vozes sintetizadas da ReadSpeaker são modelos de voz combinados que não constituem Informação Pessoal ao abrigo do RGPD.
FAQ
A speechCloud API (SCAPI) é uma API REST de conversão de texto em voz alojada na nuvem, da ReadSpeaker. Envia texto para os servidores da ReadSpeaker através de HTTPS e recebe áudio de alta qualidade no formato que escolher (MP3, Ogg, PCM, WAV, A-law ou μ-law). Suporta 90 idiomas e 300 vozes, marcação SSML, dicionários de pronúncia personalizados e dados de sincronização para o realce sincronizado. Assenta em servidor, sem software para instalar; a integração faz-se através de uma chave de API e de pedidos HTTP.
O webReader e o docReader são produtos para o utilizador final, com a sua própria interface. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.
A speechCloud API devolve áudio em seis formatos: MP3 (débito configurável de 16, 24, 32, 48, 64 ou 128 kbit/s), Ogg VBR, μ-law, A-law, PCM raw e WAV. O PCM e o WAV suportam frequências de amostragem de 22050, 16000 ou 8000 Hz, com 16 bits de profundidade. A escolha do formato e dos parâmetros de áudio é definida em cada pedido, através dos parâmetros da API.
Cada pedido aceita até 5000 caracteres por predefinição, contando tudo exceto os espaços em branco. O serviço padrão está dimensionado para até 25 000 pedidos por dia, com picos horários até 2000. Tem um tráfego mais elevado ou sustentado? Fale com a ReadSpeaker sobre uma configuração dedicada ao seu volume.
Sim. A entrada em SSML é suportada, incluindo pausas, transcrições fonéticas e mudança de voz ou de idioma dentro de um mesmo texto. Também estão disponíveis dicionários de pronúncia personalizados: cada cliente pode editar um dicionário específico de cada voz no portal do cliente, para controlar como são pronunciados os nomes de marca, os termos técnicos ou as palavras invulgares.
Sim. A speechCloud API pode devolver RSDS, que combina o áudio e a informação de sincronização numa única resposta, poupando créditos face a dois pedidos separados. O RSDS está atualmente disponível em MP3 a 48 kbit/s e não existe para todos os idiomas ou vozes; contacte a ReadSpeaker para conhecer a lista atual.
A speechCloud API funciona com créditos: um crédito cobre um caráter, contando tudo exceto os espaços em branco, mais quaisquer caracteres acrescentados pelo seu dicionário de pronúncia. Os créditos de produção são encomendados através do seu Gestor de Conta ReadSpeaker, e as contas novas começam normalmente com créditos de avaliação. Está disponível, mediante pedido, um modelo por segundo de voz. A capacidade pode ser licenciada por caracteres, por pedidos, por tempo de voz, por canais em simultâneo ou por velocidade de geração. Contacte a ReadSpeaker para obter um orçamento adequado ao seu volume.
A ReadSpeaker, enquanto organização, é certificada ISO/IEC 27001:2022 e está em conformidade com o RGPD. Todo o tráfego da API usa HTTPS. Para clientes da UE e para transferências transfronteiriças de dados, a ReadSpeaker assenta nas Cláusulas Contratuais-Tipo (CCT). De acordo com o Aviso de Privacidade da ReadSpeaker, as vozes sintetizadas da ReadSpeaker são modelos de voz combinados que não constituem Informação Pessoal ao abrigo do RGPD. Os dados de áudio não podem ser armazenados, reutilizados nem redistribuídos, salvo acordo explícito na confirmação da encomenda.
A speechCloud API suporta casos de utilização em tempo real. Por predefinição, os pedidos usam o modo de transmissão (streaming=1), em que a resposta remete para um servidor de transmissão que começa a entregar áudio o mais depressa possível, para o menor tempo até ao som. Para entrega em lote, defina streaming=0 e o ficheiro é devolvido depois de gerado por completo. O número de canais em tempo real em simultâneo faz parte da capacidade que licenciou e pode ser ajustado na confirmação da encomenda.
Crie uma conta na ReadSpeaker. As novas contas recebem normalmente uma quantidade limitada de créditos de avaliação para que possa testar a speechCloud API. A sua chave de API está disponível no portal do cliente SCAPI e deve ser incluída em cada pedido. As instruções de implementação e de utilização, os exemplos de código nas linguagens de programação mais comuns e o seu dicionário de pronúncia editável também estão acessíveis a partir do portal. Contactar a ReadSpeaker to start your account.
VoiceLab
A speechCloud API traz o nosso catálogo de vozes profissionais.

Para uma voz de marca totalmente personalizada, criada consigo em estúdio, explore o VoiceLab. Os linguistas computacionais da ReadSpeaker criam vozes de marca desde 1999.