Integradores y audiovisual

Manda audio, recibe voz traducida.

En tiempo real, y dentro del flujo que ya tienes. El mismo motor que mueve un congreso, alcanzable por los protocolos que tu instalación ya habla.

Una instalación de verdad

La Catedral de Santiago de Compostela: un equipo en la sala, el audio saliendo hacia el motor y la traducción llegando al teléfono de quien escucha. Más de cinco horas seguidas, en uno de los entornos acústicos más hostiles que existen.

Cómo encaja

Tres piezas, y de la del medio no te tienes que ocupar tú.

Entra

Tu audio

Un flujo continuo por SRT, o WebRTC cuando lo que habla es un teléfono que ya está identificado.

Motor

Una escucha, todos los idiomas

El audio se oye una vez y de esa escucha salen todos los idiomas de destino. Ninguno espera detrás de otro.

Sale

Voz y texto

La voz traducida hacia tu propio WebRTC por WHIP, y un POST de HTTP por cada frase traducida para el texto.

Catorce idiomas en paralelo sobre un solo nodo, y 812 ms de extremo a extremo.

Por dónde entra el audio.

Una sala en la que se está hablando no manda ficheros: manda un flujo continuo, y tiene que seguir mandándolo por una red que pierde paquetes. Para eso está SRT.

  • Tu equipo es el que llama. Al crear la sala se te devuelve la URL entera ya montada — servidor, puerto, identificador del equipo y contraseña.
  • Opus en un contenedor MPEG-TS, mono, 16 kHz y alrededor de 24 kbps. Esto es voz y no música, y el ancho de banda de más no compra nada que se vaya a oír.
  • La contraseña es por equipo y no es opcional: una conexión sin cifrar se rechaza por muy bien que haga todo lo demás. Diez caracteres es el mínimo del propio SRT, no nuestro.
  • Manda de forma continua, con la transmisión discontinua desactivada. Un flujo que se para en los silencios se come el principio de la frase que lo vuelve a arrancar.

La URL de conexión, tal como te la devuelve la sala

srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRET

La tubería que corre nuestro propio equipo

La forma más corta de probar el tuyo es correr exactamente esto. Una captura de línea suele llegar más floja que un micrófono: si la tuya se oye baja, añade una etapa de volumen en vez de apretar más el codificador.

gst-launch-1.0 -e \
  alsasrc device=plughw:CODEC,0 ! audioconvert ! audioresample ! \
  audio/x-raw,rate=16000,channels=1 ! \
  opusenc bitrate=24000 ! mpegtsmux ! \
  srtsink uri="srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRET"

La otra entrada es WebRTC. Es la que toca cuando lo que habla es un teléfono que ya está identificado: no hay nada que instalar ni nada con lo que autenticarse, así que la sala no devuelve credenciales.

Y por dónde sale.

Si ya tienes infraestructura de WebRTC —una plataforma de vídeo, una aplicación de eventos, una sala de control— no tienes que entrar en una sala nuestra para recoger la traducción. Dinos un extremo WHIP y publicamos ahí.

  • Cada idioma de destino es su propia sesión de WHIP. Un extremo WHIP puede aceptar una sola pista de audio y muchos lo hacen, así que cinco idiomas en una sesión llegarían como uno, con cuatro faltando sin avisar.
  • Pon el marcador de idioma en la URL y cada idioma tiene su propia ruta; déjalo fuera y el idioma viaja como parámetro de consulta. De las dos maneras tu lado los puede distinguir, que es algo que tiene que poder hacer.
  • Si pones una credencial se manda como cabecera Authorization Bearer, y al terminar una intervención borramos el recurso de la sesión, para no dejar nada sujetando una conexión.
  • Por defecto esto es además de la sala: tus oyentes siguen funcionando y tu instalación recibe el audio también. Si lo pones como único destino, la sala deja de usarse.

Las dos formas del extremo

delivery.whip.url = https://you.example.com/ingest/{lang}/whip   → …/ingest/en/whip
delivery.whip.url = https://you.example.com/whip                 → …/whip?lang=en

El texto viaja aparte, y eso no es un detalle

WHIP lleva medios y nada más — el protocolo no tiene canal de datos— así que los subtítulos no pueden venir dentro del audio. Danos una URL y hacemos un POST por cada frase traducida, con la sala, el segmento, el idioma del que venía y al que fue. Quien monte esto dando por hecho que el texto llega con el audio se entera el día del evento.

Con los que funciona tal cual

Éstos son los que nombra la especificación, no un muro de logotipos. Para algo que hable RTMP o SRT aguas abajo, MediaMTX por delante hace de puente desde WHIP sin que ninguno de los dos escriba código.

LiveKitJanusMediaMTXSRSAnt MediaCloudflare

Esto no es la referencia de la API, y la diferencia importa

Son dos puertas al mismo motor, y entrar por la equivocada cuesta un día. Ésta es para meter un flujo de medios por él. La otra es para programar contra él.

Esta página

Ya tienes audio moviéndose y quieres la traducción dentro de ese movimiento. Lo que necesitas es un puerto, un códec y un sitio donde publicar.

La referencia de la API

Estás escribiendo código: crear salas, subir una grabación, pedir el resultado en el formato que quieras, decidir quién puede tomar la palabra. Endpoint por endpoint, con ejemplos que funcionan al pegarlos.

Ir a la referencia
  • Las dos se juntan en un sitio: el extremo WHIP y la URL del texto son ajustes de una sala, y una sala se crea por la API.

  • La latencia de extremo a extremo son 812 ms — el recorrido completo, de que alguien habla a que se le oye traducido.

  • Los catorce idiomas salen de una sola escucha del audio, así que el decimocuarto cuesta lo que cuesta un decimocuarto y no catorce veces el primero.

Integraciones y trabajos: minutos sueltos

Para emitir una sala o procesar ficheros. Sin cuota: compras minutos y se gastan según traducen. Tienes doce meses para gastarlos, y el mismo motor y los mismos catorce idiomas en todos los paquetes.

7,0min contados
17/60
min de reunión

En acento, lo que se habla

silencio · el contador está parado

41escuchando

no suman al contador

Una hora de reunión, 20 minutos de habla: 20 minutos contados.

20 €+ IVA

Unos cuantos actos, o probarlo con algo de verdad.

Empezar
100 minutos
de voz traducida a un idioma
0,20 € el minuto
sin cuota mensual, y doce meses para gastarlo
el precio de referencia
≈ 1 celebración
de una hora, 40 minutos de habla, cuatro idiomas
Catorce idiomas
del mismo audio y a la vez

85 €+ IVA

Una celebración semanal, y toda su temporada.

Empezar
500 minutos
de voz traducida a un idioma
0,17 € el minuto
sin cuota mensual, y doce meses para gastarlo
−15 %
de descuento sobre el importe suelto
≈ 6 celebraciones
de una hora, 40 minutos de habla, cuatro idiomas
Catorce idiomas
del mismo audio y a la vez
El más elegido

300 €+ IVA

Varias salas funcionando cada semana.

Empezar
2000 minutos
de voz traducida a un idioma
0,15 € el minuto
sin cuota mensual, y doce meses para gastarlo
−25 %
de descuento sobre el importe suelto
≈ 24 celebraciones
de una hora, 40 minutos de habla, cuatro idiomas
Catorce idiomas
del mismo audio y a la vez

675 €+ IVA

Un sitio que emite casi todos los días.

Empezar
5000 minutos
de voz traducida a un idioma
0,135 € el minuto
sin cuota mensual, y doce meses para gastarlo
−32,5 %
de descuento sobre el importe suelto
≈ 60 celebraciones
de una hora, 40 minutos de habla, cuatro idiomas
Catorce idiomas
del mismo audio y a la vez

En todos los paquetes, sin excepción

  • Los catorce idiomas, del mismo audio
  • Todas las salas que quieras crear
  • Grabaciones, documentos y subtítulos
  • La API entera y tus propias claves
  • Una factura por compra, con tus datos fiscales
  • Nada grabado de una sala en directo

El acompañamiento va aparte

El minuto paga el motor, no horas de persona. Todo lo que lleve a alguien nuestro detrás se presupuesta:

  • Puesta en marcha: conectar tu SRT o tu WebRTC y revisar tu montaje
  • Estar al otro lado el día del evento
  • Desarrollo a medida de lo que tu flujo necesite
  • Instalarlo dentro de tu red
Pídenos presupuesto

O el importe que quieras

A 0,20 € el minuto, sin descuento por volumen: para eso están los paquetes. Entre 10 € y 5.000 €, y entra en la cuenta en cuanto el pago pasa.

Los primeros 30 minutos te los regalamos

Guarda una tarjeta y los tienes en tu cuenta. No se cobra nada y en la pantalla de la tarjeta también pone 0 € — la tarjeta queda ahí para el día que quieras recargar de un clic, no para cobrarte por lo bajo. Duran tres meses: son para probar, no para guardar.

Habla con ingeniería

Cuatro campos, y ninguna pregunta sobre volumen mensual — a estas alturas no lo sabe nadie. Cuéntanos qué tienes delante y contesta alguien que ya ha montado esto.

Las palabras que sólo se usan en tu casa

Los nombres propios de una organización —personas, calles, referencias, cargos— son justo lo que un modelo general no ha oído nunca, y donde falla: los cambia por una palabra corriente que suena parecido. Se escriben una vez y dejan de fallar. Se escriben en la sala y valen para todas sus reuniones.

  • Es una lista, no un entrenamiento: se escribe y funciona desde la primera frase.
  • No recoge nada. Ni tu audio, ni tu texto, ni un segundo de nada.
  • Y va incluido. No es un plan de más ni una línea de factura.