Задача
У организатора конференций прямые эфиры идут на международную аудиторию. Живой синхронист дорог, на десяток языков нужна бригада, к концу смены точность падает.
Заказчик хотел автоматическую цепочку: распознать речь спикера, перевести, озвучить голосом — почти без отставания от живого выступления.
Подход
Все три шага работают потоком: перевод и озвучка начинаются, пока спикер ещё договаривает фразу.
Сколько слов накопить перед переводом — настраиваемый порог: меньше слов — быстрее, больше — точнее. Баланс подбирается под формат мероприятия.
Очереди между шагами не дают отставанию расти на быстрой речи. Термины и имена подхватываются из глоссария доклада.
Стек
streaming ASR · incremental MT (wait-k) · streaming TTS · очереди + backpressure · GPU serving
Результат
На живом докладе перевод отставал от спикера на 1,9 секунды — на слух как работа синхрониста. Многоязычные эфиры больше не требуют штата переводчиков.