Ir al contenido

ReadSpeaker speechCloud API

API de síntesis de voz para cualquier aplicación, dispositivo o flujo de trabajo

Envíe texto a un único endpoint REST y reciba voz natural en 90 idiomas y 300 voces. SSML, pronunciación personalizada y seis formatos de audio, listos para producción desde la primera llamada.

¿Ya es cliente? Inicie sesión en el Portal de Clientes
  • 90 idiomas
  • 300 voces
  • Con sede en la UE, RGPD, ISO 27001

La confianza de 12 000 clientes en todo el mundo

Espacio para el logotipo de socio 1
Espacio para el logotipo de socio 2
Espacio para el logotipo de socio 3
Espacio para el logotipo de socio 4
Espacio para el logotipo de socio 5
Espacio para el logotipo de socio 6
Espacio para el logotipo de socio 7
Espacio para el logotipo de socio 8

Pruebe una voz

Escuche lo que devolverá su API

Cuatro voces en cuatro idiomas. El mismo motor que integrará mediante la API.

Adam

Masculina

Inglés (Reino Unido)

Roxane

Femenina

Français (France)

Lena

Femenina

Deutsch (Deutschland)

Sayaka

Femenina

日本語 (Japan)

¿Quiere una voz personalizada o un idioma que no aparece? Ver las 300 voces →

Casos de clientes

Marcas que crean productos de voz con ReadSpeaker

Sonos

El enfoque de ReadSpeaker para la voz personalizada es innovador y extremadamente riguroso, justo lo que necesitábamos para este proyecto.

Joseph DureauVicepresidente de Experiencia de Voz · Sonos
Lea el caso completo

Generación de voz en la nube

En tiempo real o por lotes, allí donde su producto necesita una voz

speechCloud API es un servicio de síntesis de voz en la nube, de servidor a servidor. Llámelo desde su propia aplicación para generar audio al vuelo para los usuarios finales, o para producir audio de forma masiva y reproducirlo después. Sustituye grabaciones manuales costosas y funciona a todas horas, de modo que usted nunca tiene que alojar ni escalar un motor de síntesis de voz.

Aplicaciones y dispositivos en tiempo real

Añada síntesis de voz a una aplicación móvil, un coche conectado, un equipo médico o industrial, un dispositivo ponible o un quiosco. Transmita audio bajo demanda sin incorporar un motor de TTS en el dispositivo, de modo que la huella y la batería se mantengan bajas. Reciba voz natural en 90 idiomas con una sola llamada REST.

  • Móvil
  • IoT
  • Quioscos
  • Dispositivos ponibles
  • Coches conectados
  • Dispositivos médicos

Producción de audio por lotes

Genere audio de forma masiva para cursos de e-learning, evaluaciones, contenidos de formación, audiolibros, audioguías y diálogos para películas o animaciones. El audio transmitido se puede servir a los usuarios finales desde su propia infraestructura cuando su contrato lo permita. Los diccionarios de pronunciación personalizados garantizan que los nombres de marca y los términos técnicos se lean correctamente en todas las pistas.

  • e-learning
  • Audiolibros
  • Evaluaciones
  • Formación
  • Audioguías
  • Cine y animación

Telefonía, IVR y agentes de voz

Dé voz natural a centralitas, centros de contacto y agentes de voz basados en LLM. Los formatos de salida A-law y μ-law son los códecs G.711 que se utilizan en los sistemas de telefonía. Use SSML para controlar el ritmo, cambiar de idioma sobre la marcha y pronunciar los nombres de marca mediante su diccionario personalizado. Los canales simultáneos en tiempo real crecen con su contrato.

  • IVR
  • G.711
  • Agentes de voz
  • SSML
  • A-law / μ-law

Funcionalidades

Síntesis de voz para producción, de principio a fin

Todo lo que su producto necesita para responder con voz.

90 idiomas, 300 voces

Elija dentro de un catálogo de voces profesional y amplio para cada idioma. Las voces se licencian de forma individual; puede añadir más en cualquier momento.

Entrada SSML

Use SSML para pausas, transcripciones fonéticas y cambios de voz o de idioma dentro de un mismo texto. Se admite el marcado SSML estándar.

Diccionarios de pronunciación personalizados

Cada cliente puede editar un diccionario específico de cada voz en el portal de clientes, para controlar cómo se pronuncian los nombres de marca, los términos técnicos y las palabras poco frecuentes. Los lingüistas de ReadSpeaker pueden corregir las pronunciaciones erróneas cuando se solicita.

Datos de sincronización (RSDS)

RSDS devuelve el audio y los marcadores de sincronización en una sola respuesta, lo que ahorra créditos frente a dos llamadas separadas. Resulta útil para resaltar palabras y frases en su interfaz. Disponible solo en MP3 a 48 kbps y no en todas las voces.

Seis formatos de salida de audio

MP3 (16, 24, 32, 48, 64, 128 kbit/s), Ogg VBR, μ-law, A-law, PCM sin procesar, WAV. PCM y WAV a 22050, 16000 u 8000 Hz, con profundidad de 16 bits. Se define en cada solicitud mediante parámetros de la API.

Transmisión o descarga

Ponga streaming=1 para que la reproducción empiece en cuanto el audio esté listo, ideal para uso en directo. O descargue el archivo terminado de una sola vez.

API REST sobre HTTPS

Clave de API incluida en cada llamada. Consulte los idiomas disponibles, las voces, el uso actual y los créditos restantes a través de la misma interfaz REST.

Portal de clientes SCAPI

Edite su diccionario de pronunciación, siga el consumo y los créditos restantes, y renueve la clave de API en cuanto sospeche un uso indebido, todo desde un único portal.

Infraestructura alojada y redundante

Alojado por ReadSpeaker en un entorno de alta seguridad con redundancia y conmutación por error. Nada que descargar ni instalar.

Pruébelo en su infraestructura

Del texto al audio en una sola solicitud

Un vistazo a cómo es una llamada en cuatro lenguajes. Autentíquese con su clave de API, enviada con cada solicitud.

# Synthesise a sentence to MP3 (48 kbps)
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "audioformat=mp3" \
  -d "audiobitrate=48" \
  -d "text=Welcome to ReadSpeaker." \
  --output speech.mp3

# With SSML, switching language inline
curl -X POST "https://tts.readspeaker.com/a/eg/v2.0" \
  -d "key=YOUR_API_KEY" \
  -d "voice=Adam" \
  -d "lang=en_uk" \
  -d "input=ssml" \
  --data-urlencode 'text=<speak>Hello, <voice name="Roxane" xml:lang="fr-FR">bonjour</voice>.</speak>' \
  --output greeting.mp3

La forma del endpoint es ilustrativa. Consulte la última Especificación de producto and the Customer Portal documentation for the current endpoint URL and parameter names.

Especificaciones técnicas

Todas las especificaciones que preguntará su revisión de seguridad

Autenticación, transporte, cobertura de idiomas, límites de rendimiento y formatos de audio. Las respuestas que sus equipos de seguridad y operaciones necesitan antes de integrar.

Especificaciones técnicas de speechCloud API
SpecificationValue
AutenticaciónClave de API, incluida en cada solicitud
TransporteREST sobre HTTPS
Idiomas admitidos90 idiomas
Voces disponibles300 voces
Texto máximo por solicitud5000 caracteres (sin contar los espacios en blanco), por defecto
Límite de uso previsto≤ 25 000 solicitudes/día · picos ≤ 2000 solicitudes en una misma hora
Formatos de salida de audioMP3 · Ogg VBR · μ-law · A-law · PCM · WAV
Tasas de bits MP316, 24, 32, 48, 64, 128 kbit/s
Frecuencias de muestreo PCM / WAV22050, 16000, 8000 Hz a 16 bits
Codificación de entradaSe recomienda UTF-8; se admiten las codificaciones más habituales
Compatibilidad con SSMLSí: pausas, transcripciones fonéticas y cambio de voz o idioma sobre la marcha
Datos de sincronización (RSDS)Audio y sincronización en una sola respuesta · actualmente solo MP3 a 48 kbit/s · no en todas las voces
Modo de transmisiónstreaming=1 (default) → redirect to streaming server; streaming=0 → file delivered after full generation
Reglas de almacenamiento del audioSin almacenamiento, reutilización ni redistribución salvo acuerdo explícito en la confirmación del pedido
Integración con telefoníaFormatos de salida A-law y μ-law (códecs G.711)
DocumentaciónEspecificación de producto (PDF)

Precios

Pague por lo que genera y crezca cuando lo necesite

speechCloud API utiliza un modelo de créditos. Los créditos de producción se piden a su gestor de cuenta de ReadSpeaker y el equipo de soporte de ReadSpeaker los añade a su cuenta. Las cuentas nuevas suelen recibir una cantidad limitada de créditos de prueba para las primeras pruebas.

Solicitar presupuesto

Empiece gratis: las cuentas nuevas suelen recibir créditos de prueba. Solicite acceso mediante el formulario de contacto.

Credits

speechCloud API

Modelo de créditos1 crédito = 1 carácter, sin contar los espacios en blanco

Cómo funcionan los créditos

  • 1 crédito = 1 carácter, sin contar los espacios en blanco, incluidos los cambios derivados de las entradas del diccionario de pronunciación
  • Variante por segundo de voz available via order confirmation for predictable cost on long audio
  • Créditos de prueba al abrir la cuenta so you can evaluate before committing

La capacidad con licencia se mide por

  • Número de caracteres over the contract period
  • Número de solicitudes and total speech time
  • Canales simultáneos en tiempo real for telephony and live use cases
  • Velocidad de generación when responsiveness is critical

Conformidad

Conformidad que puede entregar directamente a su auditor

ReadSpeaker es una organización certificada según ISO/IEC 27001:2022, conforme al RGPD y con Cláusulas Contractuales Tipo para las transferencias internacionales de datos.

  • ISO/IEC 27001:2022 (ISO/IEC 27001:2022: gestión de la seguridad de la información)

    Organización ReadSpeaker

  • RGPD (Reglamento General de Protección de Datos)

    Aviso de privacidad publicado

  • CCT de la UE (Cláusulas Contractuales Tipo de la UE)

    Para las transferencias internacionales

  • Con sede en la UE (Organización con sede en la Unión Europea)

    Con sede en Suecia (ReadSpeaker AB, Uppsala)

FAQ

Preguntas sobre speechCloud API

  • speechCloud API (SCAPI) es una API REST de síntesis de voz alojada en la nube de ReadSpeaker. Usted envía texto a los servidores de ReadSpeaker por HTTPS y recibe audio de alta calidad en el formato que elija (MP3, Ogg, PCM, WAV, A-law o μ-law). Admite 90 idiomas y 300 voces, marcado SSML, diccionarios de pronunciación personalizados y datos de sincronización para el resaltado sincronizado. Funciona en servidor, sin software que instalar; la integración se hace mediante una clave de API y solicitudes HTTP.

  • webReader y docReader son productos de usuario final con su propia interfaz. webReader puts a Listen button on the HTML pages of your website; docReader does the same for the documents you publish. speechCloud API has no user interface. You call it server-to-server from your application to generate audio. Use it for connected devices, telephony and IVR, mobile apps, e-learning platforms that produce audio, audiobooks, or any product where you need text-to-speech inside your own software.

  • speechCloud API devuelve el audio en seis formatos: MP3 (tasa de bits configurable de 16, 24, 32, 48, 64 o 128 kbit/s), Ogg VBR, μ-law, A-law, PCM sin procesar y WAV. PCM y WAV admiten frecuencias de muestreo de 22050, 16000 u 8000 Hz con profundidad de 16 bits. La elección del formato y de los parámetros de audio se define en cada solicitud mediante los parámetros de la API.

  • Cada solicitud admite hasta 5000 caracteres por defecto, contando todo salvo los espacios en blanco. El servicio estándar está dimensionado para un máximo de 25 000 solicitudes al día, con picos horarios de hasta 2000. ¿Necesita un tráfico mayor o sostenido? Hable con ReadSpeaker sobre una configuración dedicada a su volumen.

  • Sí. Se admite la entrada SSML, incluidas las pausas, las transcripciones fonéticas y el cambio de voz o de idioma dentro de un mismo texto. También hay diccionarios de pronunciación personalizados: cada cliente puede editar un diccionario específico de cada voz en el portal de clientes para controlar cómo se pronuncian los nombres de marca, los términos técnicos o las palabras poco frecuentes.

  • Sí. speechCloud API puede devolver RSDS, que combina el audio y la información de sincronización en una sola respuesta, con el consiguiente ahorro de créditos frente a dos solicitudes separadas. RSDS está disponible actualmente con MP3 a 48 kbit/s y no en todos los idiomas o voces; contacte con ReadSpeaker para conocer la lista actual.

  • speechCloud API funciona con créditos: un crédito cubre un carácter, contando todo salvo los espacios en blanco, más los caracteres que añada su diccionario de pronunciación. Los créditos de producción se piden a su gestor de cuenta de ReadSpeaker, y las cuentas nuevas suelen empezar con créditos de prueba. Hay disponible un modelo por segundo de voz a petición. La capacidad se puede licenciar por caracteres, por solicitudes, por tiempo de voz, por canales simultáneos o por velocidad de generación. Contacte con ReadSpeaker para recibir un presupuesto ajustado a su volumen.

  • ReadSpeaker, como organización, está certificada según ISO/IEC 27001:2022 y cumple el RGPD. Todo el tráfico de la API usa HTTPS. Para los clientes de la UE y las transferencias internacionales de datos, ReadSpeaker se apoya en las Cláusulas Contractuales Tipo (CCT). Según el aviso de privacidad de ReadSpeaker, las voces sintetizadas de ReadSpeaker son modelos de voz combinados que no constituyen información personal con arreglo al RGPD. Los datos de audio no se deben almacenar, reutilizar ni redistribuir salvo acuerdo explícito en la confirmación del pedido.

  • speechCloud API admite casos de uso en tiempo real. Por defecto, las solicitudes usan el modo de transmisión (streaming=1), en el que la respuesta redirige a un servidor de transmisión que empieza a entregar audio lo antes posible, para reducir al máximo el tiempo hasta el primer sonido. Para la entrega por lotes, ponga streaming=0 y el archivo se devuelve una vez generado por completo. El número de canales simultáneos en tiempo real forma parte de su capacidad con licencia y se puede ampliar en la confirmación del pedido.

  • Cree una cuenta en ReadSpeaker. Las cuentas nuevas suelen recibir una cantidad limitada de créditos de prueba para que pueda evaluar speechCloud API. Su clave de API está disponible en el portal de clientes SCAPI y debe incluirse en cada solicitud. Las instrucciones de implementación y de uso, el código de ejemplo en los lenguajes de programación más habituales y su diccionario de pronunciación editable también están accesibles desde el portal. Contacte con ReadSpeaker to start your account.

VoiceLab

¿Necesita una voz de marca propia?

speechCloud API se entrega con nuestro catálogo de voces profesionales.

Un locutor grabando frente a un micrófono de estudio

Una voz de marca creada con usted en estudio

Para una voz de marca totalmente personalizada, creada con usted en estudio, explore VoiceLab. Los lingüistas computacionales de ReadSpeaker crean voces de marca desde 1999.

¿Preparado para dar voz a su producto?

Normalmente se facilitan créditos de prueba al crear la cuenta para que pueda evaluar el servicio antes de comprometerse. Nuestro equipo le ayuda a dimensionar el volumen, los idiomas y los canales simultáneos en tiempo real para producción. Certificado ISO/IEC 27001:2022, alineado con el RGPD mediante las Cláusulas Contractuales Tipo de la UE.

Find your ReadSpeaker solution

Opening the conversation…

Search

    Searching…

    No results for

    Try another wording, or start from one of these.

    Search is not available right now.

    You can still reach the pages below.