Integratorzy i technika sceniczna

Wyślij dźwięk, odbierz przetłumaczony głos.

W czasie rzeczywistym i wewnątrz strumienia, który już masz. Ten sam silnik, który obsługuje kongres, osiągalny przez protokoły, którymi twoja instalacja już mówi.

Prawdziwa instalacja

Katedra w Santiago de Compostela: urządzenie na sali, dźwięk wychodzący do silnika i tłumaczenie docierające na telefon słuchacza. Ponad pięć godzin z rzędu, w jednej z najbardziej wrogich akustyk, jakie istnieją.

Jak to się wpina

Trzy kawałki, a tym środkowym nie musisz się zajmować ty.

Wchodzi

Twój dźwięk

Ciągły strumień po SRT, albo WebRTC, kiedy mówi telefon, który jest już zalogowany.

Silnik

Jedno słuchanie, wszystkie języki

Dźwięk słyszany jest raz i z tego jednego słuchania wychodzą wszystkie języki docelowe. Żaden nie czeka za innym.

Wychodzi

Głos i tekst

Przetłumaczony głos do twojego własnego WebRTC przez WHIP, a dla tekstu jedno żądanie POST na każde przetłumaczone zdanie.

Czternaście języków równolegle na jednym węźle i 812 ms od końca do końca.

Którędy wchodzi dźwięk.

Sala, w której ktoś mówi, nie wysyła plików: wysyła ciągły strumień i musi wysyłać dalej przez sieć, która gubi pakiety. Do tego służy SRT.

  • To twoje urządzenie dzwoni. Utworzenie sali zwraca ci cały adres już złożony — serwer, port, identyfikator urządzenia i hasło.
  • Opus w kontenerze MPEG-TS, mono, 16 kHz, około 24 kbps. To mowa, a nie muzyka, i dodatkowe pasmo nie kupuje niczego, co dałoby się usłyszeć.
  • Hasło jest na urządzenie i nie jest opcjonalne: połączenie bez szyfrowania zostaje odrzucone, choćby wszystko inne było zrobione dobrze. Dziesięć znaków to dolna granica samego SRT, nie nasza.
  • Wysyłaj w sposób ciągły, z wyłączoną transmisją nieciągłą. Strumień, który zatrzymuje się w ciszy, zjada początek zdania, które go znów uruchamia.

Adres połączenia, tak jak zwraca go sala

srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRET

Potok, który działa na naszym własnym urządzeniu

Najkrótszy sposób przetestowania twojego to uruchomić dokładnie to. Sygnał liniowy zwykle przychodzi ciszej niż mikrofon: jeśli twój jest słaby, dodaj stopień głośności zamiast mocniej dociskać koder.

gst-launch-1.0 -e \
  alsasrc device=plughw:CODEC,0 ! audioconvert ! audioresample ! \
  audio/x-raw,rate=16000,channels=1 ! \
  opusenc bitrate=24000 ! mpegtsmux ! \
  srtsink uri="srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRET"

Drugie wejście to WebRTC. Pasuje wtedy, kiedy mówi telefon, który jest już zalogowany: nie ma czego instalować ani czym się uwierzytelniać, więc sala nie zwraca żadnych poświadczeń.

I którędy wychodzi.

Jeśli masz już infrastrukturę WebRTC — platformę wideo, aplikację wydarzenia, reżyserkę — nie musisz wchodzić do naszej sali, żeby odebrać tłumaczenie. Podaj nam punkt WHIP, a będziemy publikować tam.

  • Każdy język docelowy to osobna sesja WHIP. Punkt WHIP może przyjąć jedną ścieżkę dźwiękową i wiele tak robi, więc pięć języków w jednej sesji dotarłoby jako jeden, a cztery zniknęłyby bez ostrzeżenia.
  • Wstaw znacznik języka w adresie, a każdy język dostanie własną ścieżkę; zostaw go, a język pojedzie jako parametr zapytania. Tak czy inaczej twoja strona umie je rozróżnić, co musi umieć.
  • Jeśli ustawisz token, wysyłamy go jako nagłówek Authorization Bearer, a po zakończeniu wystąpienia usuwamy zasób sesji, żeby nic nie trzymało otwartego połączenia.
  • Domyślnie to jest dodatek do sali: twoi słuchacze działają dalej, a twoja instalacja też dostaje dźwięk. Ustaw to jako jedyny cel, a sala przestaje być używana.

Dwie postacie punktu publikacji

delivery.whip.url = https://you.example.com/ingest/{lang}/whip   → …/ingest/en/whip
delivery.whip.url = https://you.example.com/whip                 → …/whip?lang=en

Tekst jedzie osobno, i to nie jest szczegół

WHIP niesie media i nic więcej — protokół nie ma kanału danych — więc napisy nie mogą przyjechać wewnątrz dźwięku. Podaj nam adres, a wyślemy jedno POST na każde przetłumaczone zdanie, z salą, segmentem, językiem, z którego przyszło, i tym, na który poszło. Kto zbuduje to zakładając, że tekst przyjedzie razem z dźwiękiem, dowie się w dniu wydarzenia.

Z czym działa bez zmian

To są te, które wymienia specyfikacja, a nie ściana logotypów. Dla czegoś, co dalej mówi RTMP albo SRT, MediaMTX postawiony z przodu robi most z WHIP i żadne z nas nie musi pisać kodu.

LiveKitJanusMediaMTXSRSAnt MediaCloudflare

To nie jest dokumentacja API, i ta różnica ma znaczenie

To dwoje drzwi do tego samego silnika, a wejście niewłaściwymi kosztuje dzień. Te są po to, żeby przepuścić przez niego strumień mediów. Tamte, żeby pod niego programować.

Ta strona

Masz już dźwięk w ruchu i chcesz tłumaczenie wewnątrz tego ruchu. Potrzebujesz portu, kodeka i miejsca, do którego publikować.

Dokumentacja API

Piszesz kod: tworzyć sale, wgrać nagranie, poprosić o wynik w wybranym formacie, decydować, kto może zabrać głos. Punkt po punkcie, z przykładami, które działają po wklejeniu.

Przejść do dokumentacji
  • Te dwie rzeczy spotykają się w jednym miejscu: punkt WHIP i adres tekstu to ustawienia sali, a salę tworzy się przez API.

  • Opóźnienie od końca do końca to 812 ms — cała droga, od tego, że ktoś mówi, do tego, że słychać go przetłumaczonego.

  • Czternaście języków wychodzi z jednego słuchania dźwięku, więc czternasty kosztuje tyle, ile kosztuje czternasty, a nie czternaście razy tyle co pierwszy.

Integracje i zlecenia: minuty na sztuki

Do nadawania z pokoju albo przetwarzania plików. Bez abonamentu: kupujesz minuty i zużywają się w miarę tłumaczenia. Masz dwanaście miesięcy, żeby je zużyć, a w każdym pakiecie ten sam silnik i te same czternaście języków.

7,0min naliczonych
17/60
min spotkania

Kolorem to, co się mówi

cisza · licznik stoi

41słucha

nie liczą się

Godzina spotkania, 20 minut mowy: 20 minut naliczonych.

20 €+ VAT

Kilka wydarzeń albo test na czymś prawdziwym.

Zacznij
100 minut
głosu przetłumaczonego na jeden język
0,20 € za minutę
bez abonamentu, i dwanaście miesięcy na wykorzystanie
cena odniesienia
≈ 1 celebracja
godzinnych, 40 minut mowy, cztery języki
Czternaście języków
z tego samego nagrania, naraz

85 €+ VAT

Cotygodniowa celebracja i cały jej sezon.

Zacznij
500 minut
głosu przetłumaczonego na jeden język
0,17 € za minutę
bez abonamentu, i dwanaście miesięcy na wykorzystanie
−15%
zniżki wobec ceny pojedynczej
≈ 6 celebracji
godzinnych, 40 minut mowy, cztery języki
Czternaście języków
z tego samego nagrania, naraz
Najczęściej wybierany

300 €+ VAT

Kilka sal działających co tydzień.

Zacznij
2000 minut
głosu przetłumaczonego na jeden język
0,15 € za minutę
bez abonamentu, i dwanaście miesięcy na wykorzystanie
−25%
zniżki wobec ceny pojedynczej
≈ 24 celebracje
godzinnych, 40 minut mowy, cztery języki
Czternaście języków
z tego samego nagrania, naraz

675 €+ VAT

Miejsce, które nadaje niemal codziennie.

Zacznij
5000 minut
głosu przetłumaczonego na jeden język
0,135 € za minutę
bez abonamentu, i dwanaście miesięcy na wykorzystanie
−32,5%
zniżki wobec ceny pojedynczej
≈ 60 celebracji
godzinnych, 40 minut mowy, cztery języki
Czternaście języków
z tego samego nagrania, naraz

W każdym pakiecie, bez wyjątku

  • Wszystkie czternaście języków, z tego samego nagrania
  • Tyle sal, ile zechcesz utworzyć
  • Nagrania, dokumenty i napisy
  • Całe API i własne klucze
  • Faktura za każdy zakup, z twoimi danymi
  • Nic nie jest nagrywane z sali na żywo

Wsparcie wdrożeniowe wyceniamy osobno

Minuta płaci za silnik, nie za godziny pracy człowieka. Wszystko, za czym stoi ktoś od nas, wyceniamy:

  • Uruchomienie: podłączenie twojego SRT albo WebRTC i przegląd konfiguracji
  • Obecność po drugiej stronie w dniu wydarzenia
  • Rozwój na miarę tego, czego potrzebuje twój przepływ
  • Instalacja wewnątrz twojej sieci
Poproś o wycenę

Albo dowolna kwota

Po 0,20 € za minutę, bez rabatu ilościowego — od tego są pakiety. Od 10 € do 5000 €, i trafia na konto, gdy tylko przejdzie płatność.

Pierwsze 30 minut jest od nas

Zapisz kartę, a znajdą się na twoim koncie. Nic nie jest pobierane, a strona karty też pokazuje 0 € — karta leży tam na dzień, w którym zechcesz doładować jednym kliknięciem, a nie po to, by cicho cię obciążać. Ważne są trzy miesiące: są do wypróbowania, nie do trzymania.

Porozmawiaj z inżynierią

Cztery pola i żadnego pytania o miesięczny wolumen — na tym etapie nikt go nie zna. Napisz, co masz przed sobą, a odpowie ktoś, kto już to spinał.

Słowa, których używa się tylko u was

Nazwy własne organizacji — ludzie, ulice, oznaczenia, stanowiska — to dokładnie to, czego model ogólny nigdy nie słyszał, i tam się myli: zamienia je na zwykłe słowo, które podobnie brzmi. Zapisuje się je raz i przestają się mylić. Zapisuje się je w sali i obowiązują na wszystkich jej spotkaniach.

  • To lista, nie trenowanie: zapisujesz i działa od pierwszego zdania.
  • Nic nie zbiera. Ani twojego dźwięku, ani tekstu, ani sekundy czegokolwiek.
  • I jest w cenie. To nie dodatkowy plan ani pozycja na rachunku.