Envoyez de l'audio, recevez la voix traduite.
En temps réel, et dans le flux que vous avez déjà. Le même moteur qui fait tourner un congrès, joignable par les protocoles que votre installation parle déjà.
Une installation réelle
La cathédrale de Saint-Jacques-de-Compostelle : un équipement dans la salle, l'audio qui sort vers le moteur et la traduction qui arrive sur le téléphone de qui écoute. Plus de cinq heures d'affilée, dans l'une des acoustiques les plus hostiles qui soient.
Comment cela s'emboîte
Trois pièces, et celle du milieu n'est pas votre affaire.
Entre
Votre audio
Un flux continu par SRT, ou WebRTC quand ce qui parle est un téléphone déjà identifié.
Moteur
Une écoute, toutes les langues
L'audio est entendu une fois et de cette écoute sortent toutes les langues cibles. Aucune n'attend derrière une autre.
Sort
Voix et texte
La voix traduite vers votre propre WebRTC par WHIP, et un POST HTTP par phrase traduite pour le texte.
Quatorze langues en parallèle sur un seul nœud, et 812 ms de bout en bout.
Par où entre l'audio.
Une salle où l'on parle n'envoie pas de fichiers : elle envoie un flux continu, et elle doit continuer à l'envoyer à travers un réseau qui perd des paquets. C'est à cela que sert SRT.
- Votre équipement est l'appelant. La création de la salle vous rend l'URL entière déjà assemblée — serveur, port, identifiant de l'appareil et phrase secrète.
- De l'Opus dans un conteneur MPEG-TS, mono, 16 kHz, autour de 24 kbps. C'est de la parole et non de la musique, et la bande passante en plus n'achète rien qui s'entende.
- La phrase secrète est par appareil et n'est pas facultative : une connexion non chiffrée est refusée quoi qu'elle fasse de bien par ailleurs. Dix caractères, c'est le plancher de SRT lui-même, pas le nôtre.
- Envoyez en continu, avec la transmission discontinue désactivée. Un flux qui s'arrête dans les silences mange le début de la phrase qui le relance.
L'URL de connexion, telle que la salle vous la rend
srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRETLe pipeline que fait tourner notre propre appareil
Le plus court chemin pour tester le vôtre est de lancer exactement ceci. Une prise ligne arrive souvent plus faible qu'un micro : si la vôtre est basse, ajoutez un étage de volume plutôt que de pousser l'encodeur.
gst-launch-1.0 -e \
alsasrc device=plughw:CODEC,0 ! audioconvert ! audioresample ! \
audio/x-raw,rate=16000,channels=1 ! \
opusenc bitrate=24000 ! mpegtsmux ! \
srtsink uri="srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRET"L'autre entrée est WebRTC. C'est celle qui convient quand ce qui parle est un téléphone déjà identifié : il n'y a rien à installer ni rien avec quoi s'authentifier, donc la salle ne rend pas d'identifiants.
Et par où elle sort.
Si vous avez déjà une infrastructure WebRTC — une plateforme vidéo, une application d'événement, une régie — vous n'avez pas à entrer dans une salle à nous pour récupérer la traduction. Donnez-nous un point WHIP et nous y publions.
- Chaque langue cible est sa propre session WHIP. Un point WHIP a le droit d'accepter une seule piste audio et beaucoup le font, donc cinq langues dans une session arriveraient comme une, avec quatre manquantes en silence.
- Mettez le marqueur de langue dans l'URL et chaque langue a son propre chemin ; laissez-le de côté et la langue voyage en paramètre de requête. Dans les deux cas votre côté peut les distinguer, ce qu'il doit pouvoir faire.
- Si vous posez un jeton, il est envoyé en en-tête Authorization Bearer, et à la fin d'une intervention nous supprimons la ressource de session, pour ne rien laisser qui tienne une connexion.
- Par défaut cela s'ajoute à la salle : vos auditeurs continuent de fonctionner et votre installation reçoit l'audio aussi. Mettez-le comme seule destination et la salle cesse d'être utilisée.
Les deux formes du point de publication
delivery.whip.url = https://you.example.com/ingest/{lang}/whip → …/ingest/en/whip
delivery.whip.url = https://you.example.com/whip → …/whip?lang=enLe texte voyage à part, et ce n'est pas un détail
WHIP porte des médias et rien d'autre — le protocole n'a pas de canal de données — donc les sous-titres ne peuvent pas venir dans l'audio. Donnez-nous une URL et nous faisons un POST par phrase traduite, avec la salle, le segment, la langue d'où elle venait et celle où elle est allée. Qui construit cela en tenant pour acquis que le texte arrive avec l'audio l'apprend le jour de l'événement.
Avec quoi cela marche tel quel
Ce sont ceux que nomme la spécification, pas un mur de logos. Pour quelque chose qui parle RTMP ou SRT en aval, MediaMTX placé devant fait le pont depuis WHIP sans qu'aucun de nous deux écrive du code.
Ceci n'est pas la référence de l'API, et la différence compte
Ce sont deux portes vers le même moteur, et entrer par la mauvaise coûte une journée. Celle-ci sert à y faire passer un flux de médias. L'autre à programmer contre lui.
Cette page
Vous avez déjà de l'audio qui bouge et vous voulez la traduction dans ce mouvement. Ce qu'il vous faut, c'est un port, un codec et un endroit où publier.
La référence de l'API
Vous écrivez du code : créer des salles, déposer un enregistrement, demander le résultat au format voulu, décider qui peut prendre la parole. Point d'accès par point d'accès, avec des exemples qui fonctionnent tels quels.
Aller à la référenceLes deux se rejoignent à un endroit : le point WHIP et l'URL du texte sont des réglages d'une salle, et une salle se crée par l'API.
La latence de bout en bout est de 812 ms — le trajet complet, de quelqu'un qui parle à quelqu'un qui l'entend traduit.
Les quatorze langues sortent d'une seule écoute de l'audio, donc la quatorzième coûte ce que coûte une quatorzième et non quatorze fois la première.
Intégrations et traitements : minutes à l'unité
Pour diffuser une salle ou traiter des fichiers. Sans abonnement : vous achetez des minutes, elles se consomment au fil des traductions. Vous avez douze mois pour les consommer, et c'est le même moteur et les mêmes quatorze langues dans tous les packs.
En couleur, ce qui se dit
silence · le compteur est arrêté
ne comptent pas
Une heure de réunion, 20 minutes de parole : 20 minutes comptées.
20 €+ TVA
Quelques événements, ou un essai sur du vrai.
- 100 minutes
- de voix traduite vers une langue
- 0,20 € la minute
- sans abonnement, et douze mois pour l'utiliser
- —
- le prix de référence
- ≈ 1 célébration
- d'une heure, 40 minutes de parole, quatre langues
- Quatorze langues
- depuis le même audio, en même temps
85 €+ TVA
Une célébration hebdomadaire, et toute sa saison.
- 500 minutes
- de voix traduite vers une langue
- 0,17 € la minute
- sans abonnement, et douze mois pour l'utiliser
- −15 %
- de remise sur le tarif à l'unité
- ≈ 6 célébrations
- d'une heure, 40 minutes de parole, quatre langues
- Quatorze langues
- depuis le même audio, en même temps
300 €+ TVA
Plusieurs salles en service chaque semaine.
- 2 000 minutes
- de voix traduite vers une langue
- 0,15 € la minute
- sans abonnement, et douze mois pour l'utiliser
- −25 %
- de remise sur le tarif à l'unité
- ≈ 24 célébrations
- d'une heure, 40 minutes de parole, quatre langues
- Quatorze langues
- depuis le même audio, en même temps
675 €+ TVA
Un lieu qui diffuse presque tous les jours.
- 5 000 minutes
- de voix traduite vers une langue
- 0,135 € la minute
- sans abonnement, et douze mois pour l'utiliser
- −32,5 %
- de remise sur le tarif à l'unité
- ≈ 60 célébrations
- d'une heure, 40 minutes de parole, quatre langues
- Quatorze langues
- depuis le même audio, en même temps
Dans tous les forfaits, sans exception
- Les quatorze langues, depuis le même audio
- Autant de salles que vous voulez créer
- Enregistrements, documents et sous-titres
- L'API complète et vos propres clés
- Une facture par achat, avec vos données fiscales
- Rien n'est enregistré d'une salle en direct
L’accompagnement se devise à part
La minute paie le moteur, pas des heures de personne. Tout ce qui met quelqu’un de chez nous derrière se devise :
- Mise en route : brancher votre SRT ou votre WebRTC et revoir votre montage
- Être au bout du fil le jour de l’événement
- Développement sur mesure pour ce dont votre flux a besoin
- L’installer dans votre réseau
Ou le montant que vous voulez
À 0,20 € la minute, sans remise de volume — c'est à cela que servent les forfaits. Entre 10 € et 5 000 €, et c'est dans le compte dès que le paiement passe.
Les trente premières minutes sont pour nous
Enregistrez une carte et elles sont dans votre compte. Rien n'est débité, et la page de la carte affiche 0 € elle aussi — la carte est là pour le jour où vous voudrez recharger en un clic, pas pour vous facturer en silence. Ils durent trois mois : ils sont là pour essayer, pas pour garder.
Parler à l'ingénierie
Quatre champs, et aucune question sur le volume mensuel — à ce stade personne ne le sait. Dites-nous ce que vous avez devant vous et quelqu'un qui a déjà câblé cela répond.
Les mots qu'on n'emploie que chez vous
Les noms propres d'une organisation — personnes, rues, références, fonctions — sont exactement ce qu'un modèle général n'a jamais entendu, et là où il échoue : il les remplace par un mot courant qui sonne pareil. On les écrit une fois et ils cessent d'échouer. Ils s'écrivent dans la salle et valent pour toutes ses réunions.
- C'est une liste, pas un entraînement : on l'écrit et elle marche dès la première phrase.
- Elle ne collecte rien. Ni votre audio, ni votre texte, pas une seconde de quoi que ce soit.
- Et c'est inclus. Ni forfait supplémentaire, ni ligne de facture.