К содержимому
MoranaLabs.
FinTech / B2B — 27 янв. 2026 г.

SSM/Mamba-пайплайн для парсинга тяжелых B2B-данных 

Разбор B2B-документов дорожал с каждым лишним абзацем, экономика продукта трещала. Помогла смена архитектуры нейросети: тот же парк видеокарт теперь тянет весь поток, а обработка подешевела кратно.

×7
throughput
O(n)
сложность по контексту

Задача

Клиент из финтеха разбирает поток длинных «грязных» B2B-документов. Узкое место — нейросеть-трансформер: документ вдвое длиннее, вычислений вчетверо больше. Ответ замедлялся, счета за видеокарты росли.

Подход

Перевели разбор на архитектуру State Space Models (Mamba): ее аппетит растет пропорционально длине текста. Остальное добрали оптимизацией под конкретное железо и запасом на пиковые нагрузки.

Стек

Mamba/SSM · PyTorch · Triton · CUDA · динамический батчинг

Результат

Те же видеокарты пропускают в семь раз больше документов, время ответа предсказуемо на любой длине. Продукт снова сходится по деньгам.

×7
throughput
  • High-load
  • SSM/Mamba
  • inference opt
  • B2B data
заказчик

FinTech / B2B · детали под NDA

НаправлениеHigh-load и Foundation Models

Что мы делаем в этом направлении и сколько это стоит.

Комментарий инженера

Разделение труда тут показательное. Mamba сняла главную проблему — вычисления перестали разбухать на длинных документах, и это был быстрый старт. Дальше пошел цикл: профилировщик показывает участок, где видеокарта простаивает, переписываешь его, гоняешь замер, берешь следующий. Каждый круг добавлял к итоговой цифре понемногу — из таких кругов множитель и набрался.
инженер ML-инфраструктуры · MoranaLabs
Другие кейсы
— заявка

Опишите задачу  ответим как инженеры. 

Оставьте имя и Telegram — остальное обсудим. Без брифов на 40 слайдов и звонков по три раза.

Отвечаем за пару часовотвечает инженер, а не отдел продажNDA по запросу

Сюда напишем — это быстрее всего

Или сразу написать в Telegram

Без спама и звонков-роботов. Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и обработкой персональных данных.