Задача
Клиент из финтеха разбирает поток длинных «грязных» B2B-документов. Узкое место — нейросеть-трансформер: документ вдвое длиннее, вычислений вчетверо больше. Ответ замедлялся, счета за видеокарты росли.
Подход
Перевели разбор на архитектуру State Space Models (Mamba): её аппетит растёт пропорционально длине текста. Остальное добрали оптимизацией под конкретное железо и запасом на пиковые нагрузки.
Стек
Mamba/SSM · PyTorch · Triton · CUDA · динамический батчинг
Результат
Те же видеокарты пропускают в семь раз больше документов, время ответа предсказуемо на любой длине. Продукт снова сходится по деньгам.