Два секундных долга
Задержка в синхронном переводе — не техническая характеристика, а содержательное решение. Переводить можно быстро и неточно или медленно и хорошо, и промежуточных вариантов бесконечно много.
Причина фундаментальная: в момент, когда прозвучало первое слово фразы, ее смысл еще не определен. Во многих языках ключевой глагол приходит в конце, отрицание может перевернуть все сказанное, а придаточное — уточнить до неузнаваемости. Переводчик, начавший говорить слишком рано, вынужден будет выкручиваться.
Мы согласовали с заказчиком целевую задержку около двух секунд от речи до речи и дальше проектировали под нее.
Политика ожидания
Система работает по правилу отложенного старта: перевод фрагмента начинается, когда накоплено достаточно контекста, чтобы структура фразы стала определенной. Размер этого запаса подобран по языковой паре — для языков с похожим порядком слов он меньше, для языков, где смысл договаривается в конце, больше.
Дополнительно система опирается на просодию: пауза, интонация завершения и синтаксическая граница — сигналы того, что фрагмент можно переводить целиком.
Сказанного не вернуть
Текстовый переводчик может переписать начало предложения, когда дочитал конец. В синхроне такой роскоши нет: слушатель уже услышал.
Отсюда правило: система строит перевод так, чтобы его можно было продолжить в любую сторону. Формулировки выбираются менее категоричные, порядок слов — допускающий уточнение, начало фразы — нейтральное. Живые синхронисты пользуются тем же приемом десятилетиями; мы просто перенесли его в постановку задачи.
Имена, термины и аббревиатуры
Главный источник позора в машинном синхроне — не грамматика. Это фамилия докладчика, превращенная в набор звуков, название продукта, переведенное дословно, и аббревиатура, распознанная как обычное слово.
Поэтому обязательная часть подготовки мероприятия — глоссарий: имена участников, названия компаний и продуктов, отраслевые термины с утвержденным переводом на каждый язык. Собирается заранее, за сутки до эфира, и подгружается в систему как жесткий словарь. Это самая скучная часть проекта и одна из самых заметных по эффекту.
Восемь языков из одного потока
Речь спикера распознается один раз, а дальше расходится по языкам параллельно. Это принципиально дешевле, чем восемь независимых цепочек, и обеспечивает согласованность: во всех языках переводится одна и та же расшифровка.
Обратная сторона — общая точка отказа: ошибка распознавания уезжает сразу во все языки. Поэтому контур распознавания дублирован, а качество расшифровки отслеживается отдельно от качества перевода.
Голос и субтитры — разные продукты
Перевод можно отдать зрителю двумя способами, и они предъявляют разные требования. Текстовые субтитры терпимы к задержке: зритель читает и досматривает. Синтезированная речь в наушнике требует ровного темпа — если она отстает от спикера сильнее, чем на пару секунд, слушатель теряет связь между речью и картинкой на экране.
Поэтому в речевом канале скорость синтеза подстраивается под темп говорящего: когда спикер ускоряется, перевод произносится компактнее. Это ровно то, что делает живой синхронист, и это же ограничивает точность — короче формулировка, больше потерь смысла. Мы вынесли этот размен в настройки мероприятия: организатор выбирает, что важнее для конкретного зала.
Где машинный синхрон не годится
- Юридически значимый перевод. Переговоры с подписанием, суд, нотариальные действия — только живой переводчик с ответственностью.
- Юмор, каламбуры, культурные отсылки. Тут машина проигрывает предсказуемо и обидно.
- Свободная дискуссия с перебиваниями. Синхрон рассчитан на одного говорящего; круглый стол на пять голосов разваливает и распознавание, и перевод.
- Плохой микрофон. Качество звука на входе определяет потолок для всей цепочки, и никакая модель его не поднимет.
Мы говорим это на первой встрече. Машинный синхрон закрывает доклады, презентации, обучение и трансляции — там, где сегодня перевода нет вовсе, потому что живые синхронисты на восемь языков стоят как половина мероприятия.
Как это оценивать
Метрика качества перевода сама по себе мало говорит зрителю. Мы предложили заказчику два практических измерения: доля фрагментов, где смысл передан без искажения по оценке носителя языка, и фактическая задержка на реальных докладах, а не на тестовой записи.
Второе особенно важно: задержка растет на быстрой речи и при плотном потоке без пауз, и знать этот потолок нужно до, а не во время мероприятия.
Направление целиком — речевые технологии; смежная задача расшифровки потока — в кейсе потокового распознавания для контакт-центра.