Audio senden, übersetzte Stimme empfangen.
In Echtzeit, und in dem Fluss, den Sie schon haben. Dieselbe Maschine, die einen Kongress trägt, erreichbar über die Protokolle, die Ihre Anlage ohnehin spricht.
Eine echte Installation
Die Kathedrale von Santiago de Compostela: ein Gerät im Raum, das Audio geht zur Maschine hinaus und die Übersetzung kommt auf dem Telefon des Zuhörers an. Über fünf Stunden am Stück, in einer der feindlichsten Akustiken überhaupt.
Wie es sich einfügt
Drei Stücke, und um das mittlere müssen Sie sich nicht kümmern.
Herein
Ihr Audio
Ein durchgehender Strom über SRT, oder WebRTC, wenn das Sprechende ein bereits angemeldetes Telefon ist.
Maschine
Einmal hören, alle Sprachen
Das Audio wird einmal gehört, und aus diesem einen Hören kommen alle Zielsprachen. Keine wartet hinter einer anderen.
Hinaus
Stimme und Text
Die übersetzte Stimme über WHIP in Ihr eigenes WebRTC, und für den Text ein HTTP-POST je übersetztem Satz.
Vierzehn Sprachen parallel auf einem einzigen Knoten, und 812 ms von Ende zu Ende.
Wo das Audio hineingeht.
Ein Saal, in dem gesprochen wird, schickt keine Dateien: er schickt einen durchgehenden Strom, und er muss weiterschicken durch ein Netz, das Pakete verliert. Dafür ist SRT da.
- Ihr Gerät ruft an. Beim Anlegen des Raums bekommen Sie die ganze URL schon zusammengesetzt — Server, Port, Gerätekennung und Passphrase.
- Opus in einem MPEG-TS-Container, mono, 16 kHz, ungefähr 24 kbps. Das ist Sprache und nicht Musik, und die zusätzliche Bandbreite kauft nichts, was man hören würde.
- Die Passphrase gilt je Gerät und ist nicht optional: eine unverschlüsselte Verbindung wird abgewiesen, so richtig sie sonst auch sein mag. Zehn Zeichen sind die Untergrenze von SRT selbst, nicht unsere.
- Senden Sie durchgehend, mit abgeschalteter diskontinuierlicher Übertragung. Ein Strom, der bei Stille aussetzt, frisst den Anfang des Satzes, der ihn wieder startet.
Die Verbindungs-URL, so wie der Raum sie zurückgibt
srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRETDie Pipeline, die unser eigenes Gerät fährt
Der kürzeste Weg, Ihre zu testen, ist genau dies laufen zu lassen. Eine Line-Aufnahme kommt oft leiser an als ein Mikrofon: klingt Ihre schwach, fügen Sie eine Lautstärkestufe ein, statt den Encoder härter zu treiben.
gst-launch-1.0 -e \
alsasrc device=plughw:CODEC,0 ! audioconvert ! audioresample ! \
audio/x-raw,rate=16000,channels=1 ! \
opusenc bitrate=24000 ! mpegtsmux ! \
srtsink uri="srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRET"Der andere Eingang ist WebRTC. Der passt, wenn das Sprechende ein bereits angemeldetes Telefon ist: es gibt nichts zu installieren und nichts, womit man sich anmelden müsste, deshalb gibt der Raum keine Zugangsdaten zurück.
Und wo sie herauskommt.
Wenn Sie schon WebRTC-Infrastruktur haben — eine Videoplattform, eine Veranstaltungs-App, einen Regieraum — müssen Sie keinen Raum von uns betreten, um die Übersetzung abzuholen. Nennen Sie uns einen WHIP-Endpunkt, und wir veröffentlichen dorthin.
- Jede Zielsprache ist ihre eigene WHIP-Sitzung. Ein WHIP-Endpunkt darf eine einzige Audiospur annehmen, und viele tun genau das, fünf Sprachen in einer Sitzung kämen also als eine an, vier fehlten stillschweigend.
- Setzen Sie den Sprachplatzhalter in die URL, und jede Sprache bekommt ihren eigenen Pfad; lassen Sie ihn weg, und die Sprache reist als Abfrageparameter. So oder so kann Ihre Seite sie auseinanderhalten, was sie können muss.
- Wenn Sie eine Berechtigung hinterlegen, wird sie als Authorization-Bearer-Kopfzeile geschickt, und am Ende eines Beitrags löschen wir die Sitzungsressource, damit nichts eine Verbindung offen hält.
- Standardmäßig ist das zusätzlich zum Raum: Ihre Zuhörer funktionieren weiter, und Ihre Anlage bekommt das Audio ebenfalls. Machen Sie es zum einzigen Ziel, wird der Raum nicht mehr benutzt.
Die beiden Formen des Endpunkts
delivery.whip.url = https://you.example.com/ingest/{lang}/whip → …/ingest/en/whip
delivery.whip.url = https://you.example.com/whip → …/whip?lang=enDer Text reist getrennt, und das ist keine Kleinigkeit
WHIP trägt Medien und sonst nichts — das Protokoll hat keinen Datenkanal — die Untertitel können also nicht im Audio mitkommen. Geben Sie uns eine URL, und wir schicken je übersetztem Satz ein POST, mit dem Raum, dem Segment, der Sprache, aus der er kam, und der, in die er ging. Wer das baut und annimmt, der Text käme mit dem Audio, merkt es am Tag der Veranstaltung.
Womit es unverändert läuft
Das sind die, die die Spezifikation nennt, keine Logowand. Für etwas, das stromabwärts RTMP oder SRT spricht, baut MediaMTX davor die Brücke von WHIP, ohne dass einer von uns beiden Code schreibt.
Das hier ist nicht die API-Referenz, und der Unterschied zählt
Es sind zwei Türen zu derselben Maschine, und durch die falsche zu gehen kostet einen Tag. Diese ist dafür da, einen Medienfluss hindurchzuschicken. Die andere, um dagegen zu programmieren.
Diese Seite
Sie haben schon Audio in Bewegung und wollen die Übersetzung in dieser Bewegung. Was Sie brauchen, ist ein Port, ein Codec und ein Ort zum Veröffentlichen.
Die API-Referenz
Sie schreiben Code: Räume anlegen, eine Aufnahme hochladen, das Ergebnis im gewünschten Format holen, entscheiden, wer das Wort ergreifen darf. Endpunkt für Endpunkt, mit Beispielen, die so laufen, wie man sie einfügt.
Zur ReferenzBeide treffen sich an einer Stelle: der WHIP-Endpunkt und die Text-URL sind Einstellungen eines Raums, und ein Raum wird über die API angelegt.
Die Latenz von Ende zu Ende sind 812 ms — der ganze Weg, davon, dass jemand spricht, bis er übersetzt gehört wird.
Die vierzehn Sprachen kommen aus einem einzigen Hören des Audios, die vierzehnte kostet also, was eine vierzehnte kostet, und nicht das Vierzehnfache der ersten.
Integrationen und Aufträge: einzelne Minuten
Zum Senden eines Raums oder zum Verarbeiten von Dateien. Ohne Grundgebühr: Sie kaufen Minuten, und sie werden beim Übersetzen verbraucht. Sie haben zwölf Monate Zeit, sie zu verbrauchen — und in jedem Paket dieselbe Engine und dieselben vierzehn Sprachen.
In Akzentfarbe: was gesprochen wird
Stille · der Zähler steht
zählen nicht mit
Eine Stunde Besprechung, 20 Minuten Sprache: 20 Minuten gezählt.
20 €+ MwSt.
Ein paar Veranstaltungen, oder ein echter Test.
- 100 Minuten
- Stimme, in eine Sprache übersetzt
- 0,20 € pro Minute
- keine monatliche Gebühr, und zwölf Monate Zeit
- —
- der Referenzpreis
- ≈ 1 Veranstaltung
- je eine Stunde, 40 Minuten Sprache, vier Sprachen
- Vierzehn Sprachen
- aus derselben Aufnahme, gleichzeitig
85 €+ MwSt.
Ein wöchentlicher Gottesdienst, und die ganze Saison.
- 500 Minuten
- Stimme, in eine Sprache übersetzt
- 0,17 € pro Minute
- keine monatliche Gebühr, und zwölf Monate Zeit
- −15 %
- Nachlass gegenüber dem Einzelpreis
- ≈ 6 Veranstaltungen
- je eine Stunde, 40 Minuten Sprache, vier Sprachen
- Vierzehn Sprachen
- aus derselben Aufnahme, gleichzeitig
300 €+ MwSt.
Mehrere Räume, jede Woche im Einsatz.
- 2.000 Minuten
- Stimme, in eine Sprache übersetzt
- 0,15 € pro Minute
- keine monatliche Gebühr, und zwölf Monate Zeit
- −25 %
- Nachlass gegenüber dem Einzelpreis
- ≈ 24 Veranstaltungen
- je eine Stunde, 40 Minuten Sprache, vier Sprachen
- Vierzehn Sprachen
- aus derselben Aufnahme, gleichzeitig
675 €+ MwSt.
Ein Ort, der fast täglich überträgt.
- 5.000 Minuten
- Stimme, in eine Sprache übersetzt
- 0,135 € pro Minute
- keine monatliche Gebühr, und zwölf Monate Zeit
- −32,5 %
- Nachlass gegenüber dem Einzelpreis
- ≈ 60 Veranstaltungen
- je eine Stunde, 40 Minuten Sprache, vier Sprachen
- Vierzehn Sprachen
- aus derselben Aufnahme, gleichzeitig
In jedem Paket, ohne Ausnahme
- Alle vierzehn Sprachen, aus derselben Aufnahme
- So viele Räume, wie Sie anlegen möchten
- Aufnahmen, Dokumente und Untertitel
- Die vollständige API und Ihre eigenen Schlüssel
- Eine Rechnung pro Kauf, mit Ihren Steuerdaten
- Nichts wird aus einem Live-Raum aufgezeichnet
Die Begleitung wird getrennt angeboten
Die Minute bezahlt die Maschine, keine Arbeitsstunden. Alles, wo jemand von uns dahintersteht, wird angeboten:
- Inbetriebnahme: dein SRT oder WebRTC anschließen und deinen Aufbau prüfen
- Am Veranstaltungstag am anderen Ende sein
- Maßgeschneiderte Entwicklung für deinen Ablauf
- Installation in deinem Netz
Oder ein beliebiger Betrag
Zu 0,20 € die Minute, ohne Mengenrabatt — dafür sind die Pakete da. Zwischen 10 € und 5.000 €, und es ist im Konto, sobald die Zahlung durch ist.
Die ersten 30 Minuten gehen auf uns
Karte hinterlegen und sie sind in Ihrem Konto. Es wird nichts abgebucht, und auch die Kartenseite zeigt 0 € — die Karte liegt da für den Tag, an dem Sie mit einem Klick aufladen wollen, nicht um Ihnen still etwas zu berechnen. Sie halten drei Monate: sie sind zum Ausprobieren, nicht zum Aufheben.
Mit der Technik sprechen
Vier Felder, und keine Frage nach dem Monatsvolumen — das weiß an dieser Stelle niemand. Erzählen Sie uns, was Sie vor sich haben, und es antwortet jemand, der das schon verkabelt hat.
Die Wörter, die es nur bei Ihnen gibt
Die eigenen Namen einer Organisation — Personen, Straßen, Referenzen, Funktionen — sind genau das, was ein allgemeines Modell nie gehört hat, und woran es scheitert: es ersetzt sie durch ein gewöhnliches Wort, das ähnlich klingt. Einmal aufschreiben, und sie scheitern nicht mehr. Sie werden im Raum eingetragen und gelten für alle seine Besprechungen.
- Es ist eine Liste, kein Training: aufgeschrieben, und ab dem ersten Satz wirkt sie.
- Sie sammelt nichts. Nicht Ihr Audio, nicht Ihren Text, keine Sekunde von irgendwas.
- Und sie ist inbegriffen. Kein Zusatztarif, keine Rechnungszeile.