Adam
MasculinaInglés (Reino Unido)
ReadSpeaker speechCloud API
Envíe texto a un único endpoint REST y reciba voz natural en 90 idiomas y 300 voces. SSML, pronunciación personalizada y seis formatos de audio, listos para producción desde la primera llamada.
¿Ya es cliente? Inicie sesión en el Portal de ClientesLa confianza de 12 000 clientes en todo el mundo
Pruebe una voz
Cuatro voces en cuatro idiomas. El mismo motor que integrará mediante la API.
Inglés (Reino Unido)
Français (France)
Deutsch (Deutschland)
日本語 (Japan)
¿Quiere una voz personalizada o un idioma que no aparece? Ver las 300 voces →
Casos de clientes
Generación de voz en la nube
speechCloud API es un servicio de síntesis de voz en la nube, de servidor a servidor. Llámelo desde su propia aplicación para generar audio al vuelo para los usuarios finales, o para producir audio de forma masiva y reproducirlo después. Sustituye grabaciones manuales costosas y funciona a todas horas, de modo que usted nunca tiene que alojar ni escalar un motor de síntesis de voz.
Añada síntesis de voz a una aplicación móvil, un coche conectado, un equipo médico o industrial, un dispositivo ponible o un quiosco. Transmita audio bajo demanda sin incorporar un motor de TTS en el dispositivo, de modo que la huella y la batería se mantengan bajas. Reciba voz natural en 90 idiomas con una sola llamada REST.
Genere audio de forma masiva para cursos de e-learning, evaluaciones, contenidos de formación, audiolibros, audioguías y diálogos para películas o animaciones. El audio transmitido se puede servir a los usuarios finales desde su propia infraestructura cuando su contrato lo permita. Los diccionarios de pronunciación personalizados garantizan que los nombres de marca y los términos técnicos se lean correctamente en todas las pistas.
Dé voz natural a centralitas, centros de contacto y agentes de voz basados en LLM. Los formatos de salida A-law y μ-law son los códecs G.711 que se utilizan en los sistemas de telefonía. Use SSML para controlar el ritmo, cambiar de idioma sobre la marcha y pronunciar los nombres de marca mediante su diccionario personalizado. Los canales simultáneos en tiempo real crecen con su contrato.
Funcionalidades
Todo lo que su producto necesita para responder con voz.
Elija dentro de un catálogo de voces profesional y amplio para cada idioma. Las voces se licencian de forma individual; puede añadir más en cualquier momento.
Use SSML para pausas, transcripciones fonéticas y cambios de voz o de idioma dentro de un mismo texto. Se admite el marcado SSML estándar.
Cada cliente puede editar un diccionario específico de cada voz en el portal de clientes, para controlar cómo se pronuncian los nombres de marca, los términos técnicos y las palabras poco frecuentes. Los lingüistas de ReadSpeaker pueden corregir las pronunciaciones erróneas cuando se solicita.
RSDS devuelve el audio y los marcadores de sincronización en una sola respuesta, lo que ahorra créditos frente a dos llamadas separadas. Resulta útil para resaltar palabras y frases en su interfaz. Disponible solo en MP3 a 48 kbps y no en todas las voces.
MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, PCM sin procesar, WAV. PCM y WAV a 22050, 16000 u 8000 Hz, con profundidad de 16 bits. Se define en cada solicitud mediante parámetros de la API.
Ponga streaming=1 para que la reproducción empiece en cuanto el audio esté listo, ideal para uso en directo. O descargue el archivo terminado de una sola vez.
Clave de API incluida en cada llamada. Consulte los idiomas disponibles, las voces, el uso actual y los créditos restantes a través de la misma interfaz REST.
Edite su diccionario de pronunciación, siga el consumo y los créditos restantes, y renueve la clave de API en cuanto sospeche un uso indebido, todo desde un único portal.
Alojado por ReadSpeaker en un entorno de alta seguridad con redundancia y conmutación por error. Nada que descargar ni instalar.
Pruébelo en su infraestructura
Un vistazo a cómo es una llamada en cuatro lenguajes. Autentíquese con su clave de API, enviada con cada solicitud.
# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
-d "key=YOUR_API_KEY" \
-d "voice=Adam" \
-d "lang=en_uk" \
-d "audioformat=mp3" \
-d "audiobitrate=48" \
-d "text=Welcome to ReadSpeaker." \
--output speech.mp3
# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
-d "key=YOUR_API_KEY" \
-d "voice=Adam" \
-d "lang=en_uk" \
-d "input=ssml" \
--data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
--output greeting.mp3# Python 3, requests library
import requests
resp = requests.post(
"https://tts.readspeaker.com/a/eg/v2.0",
data={
"key": "YOUR_API_KEY",
"voice": "Adam",
"lang": "en_uk",
"audioformat": "mp3",
"audiobitrate": 48,
"text": "Welcome to ReadSpeaker.",
},
)
if resp.status_code == 200:
with open("speech.mp3", "wb") as f:
f.write(resp.content)
else:
print("Error:", resp.status_code, resp.text)// Node.js 18+, native fetch + fs/promises
import { writeFile } from "node:fs/promises";
const body = new URLSearchParams({
key: "YOUR_API_KEY",
voice: "Adam",
lang: "en_uk",
audioformat: "mp3",
audiobitrate: "48",
text: "Welcome to ReadSpeaker.",
});
const resp = await fetch("https://tts.readspeaker.com/a/eg/v2.0", {
method: "POST",
body,
});
if (!resp.ok) throw new Error(`SCAPI ${resp.status}`);
await writeFile("speech.mp3", Buffer.from(await resp.arrayBuffer()));<?php
// PHP 8, cURL
$ch = curl_init("https://tts.readspeaker.com/a/eg/v2.0");
curl_setopt_array($ch, [
CURLOPT_POST => true,
CURLOPT_POSTFIELDS => http_build_query([
"key" => "YOUR_API_KEY",
"voice" => "Adam",
"lang" => "en_uk",
"audioformat" => "mp3",
"audiobitrate" => 48,
"text" => "Welcome to ReadSpeaker.",
]),
CURLOPT_RETURNTRANSFER => true,
]);
$audio = curl_exec($ch);
$code = curl_getinfo($ch, CURLINFO_HTTP_CODE);
curl_close($ch);
if ($code === 200) {
file_put_contents("speech.mp3", $audio);
} else {
error_log("SCAPI error: $code");
}La forma del endpoint es ilustrativa. Consulte la última Especificación de producto and the Customer Portal documentation for the current endpoint URL and parameter names.
Especificaciones técnicas
Autenticación, transporte, cobertura de idiomas, límites de rendimiento y formatos de audio. Las respuestas que sus equipos de seguridad y operaciones necesitan antes de integrar.
| Specification | Value |
|---|---|
| Autenticación | Clave de API, incluida en cada solicitud |
| Transporte | REST sobre HTTPS |
| Idiomas admitidos | 90 idiomas |
| Voces disponibles | 300 voces |
| Texto máximo por solicitud | 5000 caracteres (sin contar los espacios en blanco), por defecto |
| Límite de uso previsto | ≤ 25 000 solicitudes/día · picos ≤ 2000 solicitudes en una misma hora |
| Formatos de salida de audio | MP3 · Ogg VBR · μ-law · A-law · PCM · WAV |
| Tasas de bits MP3 | 16, 24, 32, 48, 64, 128 kbit/s |
| Frecuencias de muestreo PCM / WAV | 22050, 16000, 8000 Hz a 16 bits |
| Codificación de entrada | Se recomienda UTF-8; se admiten las codificaciones más habituales |
| Compatibilidad con SSML | Sí: pausas, transcripciones fonéticas y cambio de voz o idioma sobre la marcha |
| Datos de sincronización (RSDS) | Audio y sincronización en una sola respuesta · actualmente solo MP3 a 48 kbit/s · no en todas las voces |
| Modo de transmisión | streaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation |
| Reglas de almacenamiento del audio | Sin almacenamiento, reutilización ni redistribución salvo acuerdo explícito en la confirmación del pedido |
| Integración con telefonía | Formatos de salida A-law y μ-law (códecs G.711) |
| Documentación | Especificación de producto (PDF) |
Precios
speechCloud API utiliza un modelo de créditos. Los créditos de producción se piden a su gestor de cuenta de ReadSpeaker y el equipo de soporte de ReadSpeaker los añade a su cuenta. Las cuentas nuevas suelen recibir una cantidad limitada de créditos de prueba para las primeras pruebas.
Empiece gratis: las cuentas nuevas suelen recibir créditos de prueba. Solicite acceso mediante el formulario de contacto.
Credits
Modelo de créditos1 crédito = 1 carácter, sin contar los espacios en blanco
Cómo funcionan los créditos
La capacidad con licencia se mide por
Conformidad
ReadSpeaker es una organización certificada según ISO/IEC 27001:2022, conforme al RGPD y con Cláusulas Contractuales Tipo para las transferencias internacionales de datos.
ISO/IEC 27001:2022 (ISO/IEC 27001:2022: gestión de la seguridad de la información)
Organización ReadSpeaker
RGPD (Reglamento General de Protección de Datos)
Aviso de privacidad publicado
CCT de la UE (Cláusulas Contractuales Tipo de la UE)
Para las transferencias internacionales
Con sede en la UE (Organización con sede en la Unión Europea)
Con sede en Suecia (ReadSpeaker AB, Uppsala)
Según el aviso de privacidad de ReadSpeaker, las voces sintetizadas de ReadSpeaker son modelos de voz combinados que no constituyen información personal con arreglo al RGPD.
FAQ
speechCloud API (SCAPI) es una API REST de síntesis de voz alojada en la nube de ReadSpeaker. Usted envía texto a los servidores de ReadSpeaker por HTTPS y recibe audio de alta calidad en el formato que elija (MP3, Ogg, PCM, WAV, A-law o μ-law). Admite 90 idiomas y 300 voces, marcado SSML, diccionarios de pronunciación personalizados y datos de sincronización para el resaltado sincronizado. Funciona en servidor, sin software que instalar; la integración se hace mediante una clave de API y solicitudes HTTP.
webReader y docReader son productos de usuario final con su propia interfaz. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.
speechCloud API devuelve el audio en seis formatos: MP3 (tasa de bits configurable de 16, 24, 32, 48, 64 o 128 kbit/s), Ogg VBR, μ-law, A-law, PCM sin procesar y WAV. PCM y WAV admiten frecuencias de muestreo de 22050, 16000 u 8000 Hz con profundidad de 16 bits. La elección del formato y de los parámetros de audio se define en cada solicitud mediante los parámetros de la API.
Cada solicitud admite hasta 5000 caracteres por defecto, contando todo salvo los espacios en blanco. El servicio estándar está dimensionado para un máximo de 25 000 solicitudes al día, con picos horarios de hasta 2000. ¿Necesita un tráfico mayor o sostenido? Hable con ReadSpeaker sobre una configuración dedicada a su volumen.
Sí. Se admite la entrada SSML, incluidas las pausas, las transcripciones fonéticas y el cambio de voz o de idioma dentro de un mismo texto. También hay diccionarios de pronunciación personalizados: cada cliente puede editar un diccionario específico de cada voz en el portal de clientes para controlar cómo se pronuncian los nombres de marca, los términos técnicos o las palabras poco frecuentes.
Sí. speechCloud API puede devolver RSDS, que combina el audio y la información de sincronización en una sola respuesta, con el consiguiente ahorro de créditos frente a dos solicitudes separadas. RSDS está disponible actualmente con MP3 a 48 kbit/s y no en todos los idiomas o voces; contacte con ReadSpeaker para conocer la lista actual.
speechCloud API funciona con créditos: un crédito cubre un carácter, contando todo salvo los espacios en blanco, más los caracteres que añada su diccionario de pronunciación. Los créditos de producción se piden a su gestor de cuenta de ReadSpeaker, y las cuentas nuevas suelen empezar con créditos de prueba. Hay disponible un modelo por segundo de voz a petición. La capacidad se puede licenciar por caracteres, por solicitudes, por tiempo de voz, por canales simultáneos o por velocidad de generación. Contacte con ReadSpeaker para recibir un presupuesto ajustado a su volumen.
ReadSpeaker, como organización, está certificada según ISO/IEC 27001:2022 y cumple el RGPD. Todo el tráfico de la API usa HTTPS. Para los clientes de la UE y las transferencias internacionales de datos, ReadSpeaker se apoya en las Cláusulas Contractuales Tipo (CCT). Según el aviso de privacidad de ReadSpeaker, las voces sintetizadas de ReadSpeaker son modelos de voz combinados que no constituyen información personal con arreglo al RGPD. Los datos de audio no se deben almacenar, reutilizar ni redistribuir salvo acuerdo explícito en la confirmación del pedido.
speechCloud API admite casos de uso en tiempo real. Por defecto, las solicitudes usan el modo de transmisión (streaming=1), en el que la respuesta redirige a un servidor de transmisión que empieza a entregar audio lo antes posible, para reducir al máximo el tiempo hasta el primer sonido. Para la entrega por lotes, ponga streaming=0 y el archivo se devuelve una vez generado por completo. El número de canales simultáneos en tiempo real forma parte de su capacidad con licencia y se puede ampliar en la confirmación del pedido.
Cree una cuenta en ReadSpeaker. Las cuentas nuevas suelen recibir una cantidad limitada de créditos de prueba para que pueda evaluar speechCloud API. Su clave de API está disponible en el portal de clientes SCAPI y debe incluirse en cada solicitud. Las instrucciones de implementación y de uso, el código de ejemplo en los lenguajes de programación más habituales y su diccionario de pronunciación editable también están accesibles desde el portal. Contacte con ReadSpeaker to start your account.
VoiceLab
speechCloud API se entrega con nuestro catálogo de voces profesionales.

Para una voz de marca totalmente personalizada, creada con usted en estudio, explore VoiceLab. Los lingüistas computacionales de ReadSpeaker crean voces de marca desde 1999.