Практические how-to для инженеров.
380 секунд. Таким был наш p99 latency, когда мы впервые попытались скормить LLM массивный юридический архив. История одного эпичного отказа инфраструктуры, стоимость железа и архитектура реальной работы с гигантскими текстами под нагрузкой.
Почему 80-гигабайтная A100 не тянет большие LLM, как деградация сети убивает утилизацию железа и зачем резать веса. Разбираем распределенное обучение на GPU-кластере на уровне железа и байтов.
Провал с «идеальным» графом, который запихнул фургон в арку без сквозного проезда, научил меня главному: логистическая математика мертва без физики. Срезаем косты последней мили.
Пакетная обработка данных для поиска инцидентов — это вскрытие трупа, а не диагностика. Разбираем, почему batch-мониторинг ведет к убыткам и как строить потоковую аналитику для детекции аномалий на лету.
Забыли обновить цены — потеряли маржу, завысили — убили конверсию. Разбираем, как построить потоковую систему, которая меняет ценники на лету, не уходит в демпинг и не бесит покупателей.
ИИ-протоколирование совещаний спасает от потери задач, но облачные SaaS сливают коммерческую тайну. Разбираем on-prem пайплайн: от микрофона в переговорке до готовой карточки в Jira без доступа в интернет.
Офлайн-метрики врут. Как только новая ML-модель сталкивается с реальным миром, ваши F1 и ROC-AUC рассыпаются. Разбираем жесткий пайплайн выкатки в продакшен: от теневого режима до автоотката.
Хаос в проде начинается с блокнотов и ручных запусков. Разбираем, как связать данные, код и веса в единый пайплайн, чтобы не гадать, откуда взялась упавшая в продакшене модель.
Как похоронить конверсию магазина с помощью нейросетей за пару недель. Разбираем инженерию конвейера, который заменяет фотостудию и реально генерирует ИИ-карточки товара для e-commerce без брака и галлюцинаций.
3 часа ночи, пульт охраны гудит от сотни алертов. Оператор привычно жмет «отмена» не глядя. Ложные срабатывания убивают саму суть контроля. Разбираем, почему вендорские коробки ломаются о реальный свет и как вытащить точность инференса под конкретный объект.
В 2019 году мы попытались прокинуть 60 видеопотоков с завода в облако и намертво положили местную сеть. Рассказываю, почему инференс на местах становится безальтернативным и как гибридная архитектура спасает от астрономических счетов за трафик.
Заливаете полмиллиарда документов в базу в надежде на семантику? При p99 latency в секунду хайп заканчивается. Как чинить деградацию релевантности, бороться с HNSW и внедрять гибридный поиск.
Страница 18 из 19 · 223 материалов
Оставьте имя и Telegram — остальное обсудим. Без брифов на 40 слайдов и звонков по три раза.
Отвечаем за пару часов·отвечает инженер, а не отдел продаж·NDA до передачи данных
Любой один канал — куда удобнее, туда и ответим
Без спама и звонков-роботов. Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и обработкой персональных данных.