Wyślij dźwięk, odbierz przetłumaczony głos.
W czasie rzeczywistym i wewnątrz strumienia, który już masz. Ten sam silnik, który obsługuje kongres, osiągalny przez protokoły, którymi twoja instalacja już mówi.
Prawdziwa instalacja
Katedra w Santiago de Compostela: urządzenie na sali, dźwięk wychodzący do silnika i tłumaczenie docierające na telefon słuchacza. Ponad pięć godzin z rzędu, w jednej z najbardziej wrogich akustyk, jakie istnieją.
Jak to się wpina
Trzy kawałki, a tym środkowym nie musisz się zajmować ty.
Wchodzi
Twój dźwięk
Ciągły strumień po SRT, albo WebRTC, kiedy mówi telefon, który jest już zalogowany.
Silnik
Jedno słuchanie, wszystkie języki
Dźwięk słyszany jest raz i z tego jednego słuchania wychodzą wszystkie języki docelowe. Żaden nie czeka za innym.
Wychodzi
Głos i tekst
Przetłumaczony głos do twojego własnego WebRTC przez WHIP, a dla tekstu jedno żądanie POST na każde przetłumaczone zdanie.
Czternaście języków równolegle na jednym węźle i 812 ms od końca do końca.
Którędy wchodzi dźwięk.
Sala, w której ktoś mówi, nie wysyła plików: wysyła ciągły strumień i musi wysyłać dalej przez sieć, która gubi pakiety. Do tego służy SRT.
- To twoje urządzenie dzwoni. Utworzenie sali zwraca ci cały adres już złożony — serwer, port, identyfikator urządzenia i hasło.
- Opus w kontenerze MPEG-TS, mono, 16 kHz, około 24 kbps. To mowa, a nie muzyka, i dodatkowe pasmo nie kupuje niczego, co dałoby się usłyszeć.
- Hasło jest na urządzenie i nie jest opcjonalne: połączenie bez szyfrowania zostaje odrzucone, choćby wszystko inne było zrobione dobrze. Dziesięć znaków to dolna granica samego SRT, nie nasza.
- Wysyłaj w sposób ciągły, z wyłączoną transmisją nieciągłą. Strumień, który zatrzymuje się w ciszy, zjada początek zdania, które go znów uruchamia.
Adres połączenia, tak jak zwraca go sala
srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRETPotok, który działa na naszym własnym urządzeniu
Najkrótszy sposób przetestowania twojego to uruchomić dokładnie to. Sygnał liniowy zwykle przychodzi ciszej niż mikrofon: jeśli twój jest słaby, dodaj stopień głośności zamiast mocniej dociskać koder.
gst-launch-1.0 -e \
alsasrc device=plughw:CODEC,0 ! audioconvert ! audioresample ! \
audio/x-raw,rate=16000,channels=1 ! \
opusenc bitrate=24000 ! mpegtsmux ! \
srtsink uri="srt://HOST:8890?streamid=DEVICE_ID&mode=caller&latency=120&passphrase=SECRET"Drugie wejście to WebRTC. Pasuje wtedy, kiedy mówi telefon, który jest już zalogowany: nie ma czego instalować ani czym się uwierzytelniać, więc sala nie zwraca żadnych poświadczeń.
I którędy wychodzi.
Jeśli masz już infrastrukturę WebRTC — platformę wideo, aplikację wydarzenia, reżyserkę — nie musisz wchodzić do naszej sali, żeby odebrać tłumaczenie. Podaj nam punkt WHIP, a będziemy publikować tam.
- Każdy język docelowy to osobna sesja WHIP. Punkt WHIP może przyjąć jedną ścieżkę dźwiękową i wiele tak robi, więc pięć języków w jednej sesji dotarłoby jako jeden, a cztery zniknęłyby bez ostrzeżenia.
- Wstaw znacznik języka w adresie, a każdy język dostanie własną ścieżkę; zostaw go, a język pojedzie jako parametr zapytania. Tak czy inaczej twoja strona umie je rozróżnić, co musi umieć.
- Jeśli ustawisz token, wysyłamy go jako nagłówek Authorization Bearer, a po zakończeniu wystąpienia usuwamy zasób sesji, żeby nic nie trzymało otwartego połączenia.
- Domyślnie to jest dodatek do sali: twoi słuchacze działają dalej, a twoja instalacja też dostaje dźwięk. Ustaw to jako jedyny cel, a sala przestaje być używana.
Dwie postacie punktu publikacji
delivery.whip.url = https://you.example.com/ingest/{lang}/whip → …/ingest/en/whip
delivery.whip.url = https://you.example.com/whip → …/whip?lang=enTekst jedzie osobno, i to nie jest szczegół
WHIP niesie media i nic więcej — protokół nie ma kanału danych — więc napisy nie mogą przyjechać wewnątrz dźwięku. Podaj nam adres, a wyślemy jedno POST na każde przetłumaczone zdanie, z salą, segmentem, językiem, z którego przyszło, i tym, na który poszło. Kto zbuduje to zakładając, że tekst przyjedzie razem z dźwiękiem, dowie się w dniu wydarzenia.
Z czym działa bez zmian
To są te, które wymienia specyfikacja, a nie ściana logotypów. Dla czegoś, co dalej mówi RTMP albo SRT, MediaMTX postawiony z przodu robi most z WHIP i żadne z nas nie musi pisać kodu.
To nie jest dokumentacja API, i ta różnica ma znaczenie
To dwoje drzwi do tego samego silnika, a wejście niewłaściwymi kosztuje dzień. Te są po to, żeby przepuścić przez niego strumień mediów. Tamte, żeby pod niego programować.
Ta strona
Masz już dźwięk w ruchu i chcesz tłumaczenie wewnątrz tego ruchu. Potrzebujesz portu, kodeka i miejsca, do którego publikować.
Dokumentacja API
Piszesz kod: tworzyć sale, wgrać nagranie, poprosić o wynik w wybranym formacie, decydować, kto może zabrać głos. Punkt po punkcie, z przykładami, które działają po wklejeniu.
Przejść do dokumentacjiTe dwie rzeczy spotykają się w jednym miejscu: punkt WHIP i adres tekstu to ustawienia sali, a salę tworzy się przez API.
Opóźnienie od końca do końca to 812 ms — cała droga, od tego, że ktoś mówi, do tego, że słychać go przetłumaczonego.
Czternaście języków wychodzi z jednego słuchania dźwięku, więc czternasty kosztuje tyle, ile kosztuje czternasty, a nie czternaście razy tyle co pierwszy.
Integracje i zlecenia: minuty na sztuki
Do nadawania z pokoju albo przetwarzania plików. Bez abonamentu: kupujesz minuty i zużywają się w miarę tłumaczenia. Masz dwanaście miesięcy, żeby je zużyć, a w każdym pakiecie ten sam silnik i te same czternaście języków.
Kolorem to, co się mówi
cisza · licznik stoi
nie liczą się
Godzina spotkania, 20 minut mowy: 20 minut naliczonych.
20 €+ VAT
Kilka wydarzeń albo test na czymś prawdziwym.
- 100 minut
- głosu przetłumaczonego na jeden język
- 0,20 € za minutę
- bez abonamentu, i dwanaście miesięcy na wykorzystanie
- —
- cena odniesienia
- ≈ 1 celebracja
- godzinnych, 40 minut mowy, cztery języki
- Czternaście języków
- z tego samego nagrania, naraz
85 €+ VAT
Cotygodniowa celebracja i cały jej sezon.
- 500 minut
- głosu przetłumaczonego na jeden język
- 0,17 € za minutę
- bez abonamentu, i dwanaście miesięcy na wykorzystanie
- −15%
- zniżki wobec ceny pojedynczej
- ≈ 6 celebracji
- godzinnych, 40 minut mowy, cztery języki
- Czternaście języków
- z tego samego nagrania, naraz
300 €+ VAT
Kilka sal działających co tydzień.
- 2000 minut
- głosu przetłumaczonego na jeden język
- 0,15 € za minutę
- bez abonamentu, i dwanaście miesięcy na wykorzystanie
- −25%
- zniżki wobec ceny pojedynczej
- ≈ 24 celebracje
- godzinnych, 40 minut mowy, cztery języki
- Czternaście języków
- z tego samego nagrania, naraz
675 €+ VAT
Miejsce, które nadaje niemal codziennie.
- 5000 minut
- głosu przetłumaczonego na jeden język
- 0,135 € za minutę
- bez abonamentu, i dwanaście miesięcy na wykorzystanie
- −32,5%
- zniżki wobec ceny pojedynczej
- ≈ 60 celebracji
- godzinnych, 40 minut mowy, cztery języki
- Czternaście języków
- z tego samego nagrania, naraz
W każdym pakiecie, bez wyjątku
- Wszystkie czternaście języków, z tego samego nagrania
- Tyle sal, ile zechcesz utworzyć
- Nagrania, dokumenty i napisy
- Całe API i własne klucze
- Faktura za każdy zakup, z twoimi danymi
- Nic nie jest nagrywane z sali na żywo
Wsparcie wdrożeniowe wyceniamy osobno
Minuta płaci za silnik, nie za godziny pracy człowieka. Wszystko, za czym stoi ktoś od nas, wyceniamy:
- Uruchomienie: podłączenie twojego SRT albo WebRTC i przegląd konfiguracji
- Obecność po drugiej stronie w dniu wydarzenia
- Rozwój na miarę tego, czego potrzebuje twój przepływ
- Instalacja wewnątrz twojej sieci
Albo dowolna kwota
Po 0,20 € za minutę, bez rabatu ilościowego — od tego są pakiety. Od 10 € do 5000 €, i trafia na konto, gdy tylko przejdzie płatność.
Pierwsze 30 minut jest od nas
Zapisz kartę, a znajdą się na twoim koncie. Nic nie jest pobierane, a strona karty też pokazuje 0 € — karta leży tam na dzień, w którym zechcesz doładować jednym kliknięciem, a nie po to, by cicho cię obciążać. Ważne są trzy miesiące: są do wypróbowania, nie do trzymania.
Porozmawiaj z inżynierią
Cztery pola i żadnego pytania o miesięczny wolumen — na tym etapie nikt go nie zna. Napisz, co masz przed sobą, a odpowie ktoś, kto już to spinał.
Słowa, których używa się tylko u was
Nazwy własne organizacji — ludzie, ulice, oznaczenia, stanowiska — to dokładnie to, czego model ogólny nigdy nie słyszał, i tam się myli: zamienia je na zwykłe słowo, które podobnie brzmi. Zapisuje się je raz i przestają się mylić. Zapisuje się je w sali i obowiązują na wszystkich jej spotkaniach.
- To lista, nie trenowanie: zapisujesz i działa od pierwszego zdania.
- Nic nie zbiera. Ani twojego dźwięku, ani tekstu, ani sekundy czegokolwiek.
- I jest w cenie. To nie dodatkowy plan ani pozycja na rachunku.