R&D — что инженерия взяла у мозга и где сходство кончается
Нейросети и нейробиология
Фраза «нейросеть работает как мозг» стоит в презентациях подрядчиков ровно до того момента, когда надо назвать ватты и метрики. Направление разбирает, что из устройства нервной системы действительно перешло в инженерию, что совпало по форме и что дает выигрыш там, где работаем мы: на узле с бюджетом в единицы ватт.
Работа отвечает на один вопрос: что из устройства нервной системы имеет инженерную ценность в наших задачах — детекции малых целей на edge-узле, видеоаналитике реального времени и работе при бюджете в единицы ватт. Разобрана родословная метафоры от Маккаллока и Питтса до сверточных сетей, шесть мест, где сходство с биологией разваливается, энергетический разрыв в четыре порядка и его причина в физике счета. Отдельно — спайковые сети и способы их обучить, реально существующее нейроморфное железо с его цифрами и ограничениями, событийные камеры и обратное направление, где компьютерное зрение работает инструментом нейробиологии. Собственная часть — четыре гипотезы с заранее назначенными критериями закрытия и порядком проверки от дешевой к дорогой. Замеров по спайковым платформам у лаборатории нет, и в тексте они не выдуманы: все цифры по чужим системам идут со ссылкой на первоисточник.
ключевые слова
спайковые нейронные сети
нейроморфные вычисления
событийное зрение
предиктивное кодирование
STDP
суррогатный градиент
коннектомика
edge-инференс
паспорт работы
объем
5 частей, 14 глав
источников
70 первоисточников с DOI
формул
10 со сквозной нумерацией
рисунков
6 плюс интерактивная модель нейрона
собственных замеров
нет, и это сказано в каждой главе, где они были бы уместны
срез
13.08.2026
Ссылки вида [12] в тексте ведут в список литературы. Формулы пронумерованы сквозной нумерацией.
кратко
Если читать работу целиком некогда
01
Зачем лаборатории направление, которое не дает весов
Заказчик регулярно приходит с формулировкой из чужой презентации: нужна система, которая «работает как мозг» и потому обходится без разметки, учится на лету и потребляет ватт. Каждое из трех обещаний по отдельности имеет отношение к реальным исследованиям, вместе — не имеет. Направление существует, чтобы этот разговор заканчивался за одну ссылку, а не за два часа созвона, и чтобы отделять то, за что стоит платить сегодня, от того, что пока живет в статьях.
02
Единственная ставка, которая тут вообще имеет смысл
Это ватты. По точности спайковые сети обычным проигрывают, по инструментарию нейроморфные платформы проигрывают всухую, и притворяться иначе смысла нет. Выигрыш возможен ровно в одной конфигурации: событийный сенсор плюс железо, которое считает события, а не кадры. Половинчатые варианты — спайковая сеть на обычном GPU или событийная камера, из которой снова собирают кадры, — дают отрицательный результат, воспроизведенный в литературе много раз.
03
Что из разбора уже применимо на обычном железе
Два приема, не требующие ни нового сенсора, ни нового чипа. Первый — передавать ошибку предсказания вместо потока: событие и подтверждающий кадр вместо непрерывного видео, фоновая модель до вызова детектора, кроп по подсказке трекера. Второй — фовеальный разбор кадра под малые цели: обзорный проход в низком разрешении плюс нарезка на тайлы там, где что-то шевельнулось. Оба приема имеют прямые биологические прообразы и оба меряются на нашем текущем стенде.
факты
формат
длинная форма: 5 частей, 14 глав, глоссарий и библиография
источники
70 первоисточников с DOI, от Ходжкина и Хаксли 1952 до коннектома коры мыши 2025
энергетика
кора — порядка 4·10⁹ нейронов на ватт, нейроморфная система Hala Point — порядка 4·10⁵
прямых заимствований
одно за шестьдесят лет — свертка из работ Хьюбела и Визеля
своих замеров
нет: событийного сенсора и нейроморфного чипа на стенде лаборатории не стоит
проверяемых гипотез
4, с назначенным заранее порогом закрытия каждой
первая в очереди
H3 — предиктивная передача вместо потока, проверяется на текущем железе
Часть I
Метафора и ее цена
Инженерная нейросеть выросла из трех работ по нейрофизиологии, сделанных до 1965 года. Дальше пути разошлись, и почти все, что дало результат после 2012 года, к устройству мозга отношения не имеет. Разбираем, что именно было взято, что выброшено и почему выброшенное оказалось важным ровно там, где мы работаем: в единицах ватт на объекте.
глава 01
Родословная: откуда в инженерии взялся нейрон
Линия наследования короткая и обрывается в конце 1980-х
Первая формальная модель нейрона появилась в 1943 году у Маккаллока и Питтса [1] и была моделью логики, а не физиологии. Нейрон в ней — пороговый элемент: он суммирует входы с весами и выдает единицу, когда сумма перевалила порог. Авторы доказывали не то, что мозг устроен так, а то, что сеть подобных элементов вычисляет любую функцию исчисления высказываний. Инженерия унаследовала именно эту конструкцию и держит ее до сих пор.
y = θ( Σᵢ wᵢ·xᵢ − b ), θ(z) = 1 при z ≥ 0, иначе 0
где xᵢ — входы, wᵢ — веса, b — порог, θ — ступенька Хевисайда
(1)
Вся дальнейшая история — замена ступеньки на дифференцируемую функцию, чтобы заработал градиентный спуск. Биологического содержания в этой замене нет.
Через шесть лет Хебб сформулировал правило обучения, которое до сих пор цитируется чаще самой книги [2]: связь между двумя нейронами усиливается, когда один участвует в возбуждении другого. Правило локальное — ему нужны только активность пресинаптической и постсинаптической клетки, никакого глобального сигнала ошибки. Это принципиальная развилка, к которой мы вернемся в главе 10.
Δwᵢⱼ = η · xᵢ · yⱼ
где η — скорость обучения, xᵢ — активность источника, yⱼ — активность приемника
(2)
Правило Хебба в чистом виде расходится: веса растут неограниченно. Рабочие варианты добавляют нормировку или порог забывания — правило Ойи, BCM, позже STDP.
Параллельно шла работа, которая к нейросетям привела косвенно, а к пониманию нейрона — напрямую. Ходжкин и Хаксли в 1952 году [3] описали потенциал действия на гигантском аксоне кальмара системой из четырех дифференциальных уравнений с воротными переменными натриевого и калиевого каналов. Это первая количественная модель в нейробиологии, Нобелевская премия 1963 года и до сих пор эталон, относительно которого упрощают все остальные модели нейрона.
где m, h, n — воротные переменные со своей динамикой, E — равновесные потенциалы каналов
(3)
Четыре связанных уравнения на один нейрон. Для сети из миллионов клеток это неподъемно, поэтому инженерия работает с упрощением до одного уравнения — см. формулу (6).
Дальше — розенблаттовский перцептрон 1958 года [4] и главный источник современного компьютерного зрения: работы Хьюбела и Визеля [5, 6]. Вводя микроэлектрод в первичную зрительную кору кошки, они обнаружили клетки, которые отвечают на полоску определенной ориентации в определенном месте поля зрения (простые клетки), и клетки, которые отвечают на ту же полоску независимо от точного положения (сложные клетки). Нобелевская премия 1981 года. Из этой пары — простая клетка плюс сложная клетка — выросло все, что мы сегодня называем сверточной сетью.
Рис. 1. Что формальный нейрон взял у биологического и что оставил за бортом. Слева — клетка с дендритным деревом, аксонным холмиком и синапсами; справа — то, во что она превратилась в вычислительном графе. Выброшены: время, спайк, нелинейность дендритов, нейромодуляция.
Фукусима в 1980 году построил неокогнитрон [7] — буквальную реализацию иерархии простых и сложных клеток: S-слои ищут признак, C-слои дают устойчивость к сдвигу. Это сверточная сеть за девять лет до появления термина. Чего в ней не было — обучения по градиенту: backprop опубликован в 1986-м [8], а в 1989-м Лекун применил его к распознаванию почтовых индексов [9], и связка «иерархия рецептивных полей плюс обратное распространение ошибки» стала стандартом на следующие тридцать пять лет.
Отдельной веткой шла физика. Хопфилд в 1982 году [10] описал сеть с симметричными связями как систему со спиновой энергией, у которой воспоминания — это локальные минимумы. В 2024 году Нобелевскую премию по физике дали Хопфилду и Хинтону именно за этот пласт работ. А Маасс в 1997-м [11] предложил считать спайковые сети «третьим поколением» нейросетевых моделей и доказал, что по вычислительной мощности они не уступают аналоговым при меньшем числе элементов.
Что инженерия взяла из нейробиологии и в каком году. После 1989 года новых заимствований по существу почти нет: трансформер, батч-нормализация, residual-связи и диффузионные модели выросли из математики и практики обучения, а не из данных о коре.
глава 02
Шесть мест, где метафора ломается
Каждое расхождение — это либо упущенная возможность, либо честная граница
Фразу «нейросеть работает как мозг» произносят в презентациях, и она мешает работать. Ниже — шесть конкретных расхождений, каждое с источником. Три из них для нас означают упущенную инженерную возможность, три — границу, за которую заходить не стоит.
1. Нейрон не является сумматором
Дендритное дерево считает само. Пуарази, Бреннон и Мел в 2003 году [12] показали, что по вход-выходной функции пирамидный нейрон коры эквивалентен двухслойной сети: отдельные ветви дендрита суммируют входы нелинейно, а сома складывает уже результаты этих подсчетов. В 2020 году Гидон с соавторами [13] нашли в нейронах слоя 2/3 коры человека дендритные кальциевые потенциалы, отклик которых немонотонен по амплитуде входа: одиночная клетка решает задачу XOR. Формальный нейрон XOR не решает по построению — это классический результат Минского и Паперта, ради обхода которого и появились скрытые слои.
2. Информация идет спайками, а не числами
Нейрон передает разряды длительностью около миллисекунды, и вопрос, что именно кодируется, решается не в пользу простого среднего. Торп с соавторами в 1996 году [14] показали: человек категоризует новое изображение примерно за 150 миллисекунд, что подтверждается дифференциальной активностью на ЭЭГ. За это время сигнал успевает пройти около десяти синаптических уровней, то есть на слой приходится порядка 10 мс. Усреднять частоту разрядов на таком окне нечем: каждый нейрон успевает выдать один спайк, и информация сидит в том, какой из них пришел раньше.
3. Обучение локальное, обратного канала весов нет
Обратное распространение ошибки требует, чтобы при движении сигнала ошибки назад использовались те же самые веса, что и при прямом проходе. В коре для этого нужен физический канал, который сообщал бы каждому синапсу значения весов синапсов на следующем уровне. Такого канала нет — эта дыра известна как проблема транспорта весов, ее сформулировал Гроссберг [15], а Крик в 1989 году в Nature прямо назвал backprop биологически неправдоподобным [16].
4. Разделения на обучение и работу не существует
У модели есть фаза обучения и фаза инференса, и после заморозки весов она не меняется. Нервная система учится непрерывно и при этом не забывает старое. У сетей ровно противоположная беда: дообучение на новой задаче стирает предыдущую — катастрофическая интерференция, описанная еще в 1989 году [17]. Биологический ответ на это — консолидация: синапс имеет несколько состояний с разными скоростями изменения [18]. Именно из этой модели выросла инженерная регуляризация EWC [19], которая штрафует уход весов, важных для старой задачи.
5. Активность разрежена, и это следствие энергетики
Ленни в 2003 году [20] оценил, что энергетический бюджет коры позволяет держать одновременно активными порядка одного процента нейронов. Разреженность здесь — не красивое свойство, а условие выживания ткани. Ольсхаузен и Филд [21] показали обратное следствие: если потребовать от модели разреженного кода на естественных изображениях, рецептивные поля сами собой становятся ориентированными и локализованными — то есть такими, какими их видели Хьюбел и Визель, и такими, какие сверточная сеть выучивает в первом слое без всяких требований разреженности.
6. Есть химический контур, который меняет правила обучения
Шульц, Дайан и Монтегю в 1997 году [22] показали, что разряды дофаминовых нейронов среднего мозга кодируют не награду, а ошибку ее предсказания — величину, которая в обучении с подкреплением называется TD-ошибкой. Этот сигнал глобальный и химический: он умножает эффект локальных изменений синапса и решает задачу назначения заслуги во времени. В сети такого контура нет, ее эквивалент — функция потерь, которую задает инженер снаружи.
Свод расхождений. Колонка справа — то, ради чего эта глава написана: не всякое расхождение стоит устранять.
глава 03
Энергетика: единственный аргумент, ради которого стоит смотреть на биологию
Разрыв в четыре порядка по нейронам на ватт — и он не про алгоритм, а про физику счета
В мозге взрослого человека около 86 миллиардов нейронов, из них порядка 16 миллиардов в коре больших полушарий — это прямой подсчет методом изотропного фракционирования, а не старая оценка «сто миллиардов» [23]. Синапсов порядка 10¹⁴. Потребление — около 20 ватт, примерно пятая часть энергозатрат покоя всего организма при массе органа около двух процентов.
Эттвелл и Лафлин в 2001 году [24] разложили этот бюджет по статьям и показали, что основная его часть уходит на восстановление ионных градиентов после синаптической передачи и распространения потенциалов действия. Иначе говоря, платят за события, а не за существование связей. Синапс, через который сейчас ничего не идет, почти бесплатен. В плотном матричном умножении бесплатных весов нет: каждый вес читается из памяти и умножается на каждом кадре, даже когда на входе ноль.
Рис. 2. Нейронов на ватт по логарифмической шкале. Цифры платформ взяты из первичных публикаций и материалов производителей [26, 27, 28], биологические — из [23]. Метрика намеренно грубая: «нейрон» на нейроморфном чипе — это модель с одним уравнением, а кортикальный нейрон по вход-выходной функции ближе к двухслойной сети (глава 2). Сравнение показывает не отставание в 10⁴ раз, а то, что порядок разрыва вообще такой.
Второй урок того же порядка дает сетчатка. В ней порядка ста миллионов фоторецепторов и около миллиона ганглиозных клеток, аксоны которых образуют зрительный нерв. То есть сжатие примерно сто к одному происходит еще в сенсоре, до всякой обработки в коре. Оценка пропускной способности этого канала — порядка 10 мегабит в секунду [25], что смехотворно мало по меркам видеопотока и полностью объясняется тем, что сетчатка передает наверх изменения и контрасты, а не яркости пикселей.
Энергетика платформ. Столбец «класс» важнее цифр: плотный ускоритель платит за каждый вес на каждом кадре, событийный — только за события. Значения по чипам приведены по публикациям и паспортам производителей, замеров этих платформ у лаборатории нет.
Грубый пересчет по крайним строкам таблицы: у коры получается порядка 4·10⁹ нейронов на ватт, у Hala Point — порядка 4·10⁵. Четыре порядка разрыва при том, что нейроморфная система уже отказалась от плотного счета. Сравнение не в пользу кремния и по справедливости должно быть еще хуже, потому что нейроны считаются разной сложности. Полезно тут другое: разрыв возник не из-за плохих алгоритмов обучения, а из-за того, как устроен сам счет.
Часть II
Что уже перешло в инженерию
Из всего наследия зрительной коры в продакшене живет ровно одна конструкция — свертка. Нормализация перешла по существу, внимание совпало по форме без родства, разреженность заимствована на словах и на нашем железе экономии не дает. Разбираем каждое заимствование и заканчиваем принципом, который приносит деньги прямо сейчас: предсказанием.
глава 04
Свертка: единственный прямой перенос
И единственный случай, когда копирование коры оказалось дешевле выдумывания
Сверточный слой держится на трех свойствах, и все три списаны со зрительной системы. Локальность: нейрон V1 смотрит в маленький участок поля зрения, а не во все сразу. Ретинотопия: соседние участки сетчатки проецируются в соседние участки коры, поэтому у карты признаков есть геометрия. Иерархия: простая клетка отвечает на ориентированный край в конкретном месте, сложная — на тот же край в некотором диапазоне положений [5, 6], что в инженерии превратилось в пару «свертка плюс пулинг».
Рис. 3. Сопоставление зрительного тракта и сверточного стека. Соответствие настоящее только по направлению «снизу вверх». Обратных и латеральных связей в коре больше, чем прямых, и в сверточной сети им ничего не соответствует.
Насколько глубоко идет сходство, измерили Яминс и ДиКарло [29]. Они брали сверточные сети, обученные под распознавание объектов, и проверяли, насколько хорошо их внутренние признаки предсказывают отклики реальных нейронов в нижневисочной коре обезьяны. Оказалось, что чем лучше модель решает задачу распознавания, тем точнее она предсказывает нейронные ответы, причем модели, оптимизированные под задачу, обошли все специально построенные модели зрения. Никто не пытался копировать кору — сходство возникло как побочный эффект оптимизации под ту же задачу на тех же входах.
Где сходство разваливается
Первое: состязательные примеры [30]. Добавление шума, невидимого глазу, переводит уверенную классификацию в противоположную. У биологического зрения такого класса уязвимостей не описано. Второе: смещение к текстуре [31]. Сети, обученные на ImageNet, классифицируют преимущественно по текстуре, тогда как человек опирается на форму; картинка с силуэтом кошки и текстурой слона уходит в «слона». Третье: рекуррентность. В зрительной коре обратных проекций больше, чем прямых, и для трудных изображений решение вызревает во времени; в чистой сверточной сети обратных путей нет вовсе.
Для нашей задачи важнее четвертое расхождение, о котором говорят реже. Зрение работает неоднородно по полю: в центральной ямке плотность колбочек на порядки выше, чем на периферии, и высокое разрешение обеспечивается не большой матрицей, а перенацеливанием взгляда — саккадами по три-четыре раза в секунду. Сверточный детектор устроен противоположным образом: он обрабатывает весь кадр с одинаковым разрешением, и малая цель на дальнем плане теряется при первом же уменьшении входа до 640 пикселей.
Рис. 4. Инженерный эквивалент фовеации в детекции малых целей: обзорный проход по всему кадру в низком разрешении плюс нарезка на перекрывающиеся тайлы или кроп по подсказке трекера. Прием известен как нарезка при инференсе [32] и стоит дополнительных проходов сети — цену этого решения на edge-узле надо мерить, а не предполагать.глава 05
Нормализация, внимание и разреженность
Одно заимствование настоящее, одно совпало по форме, одно существует только в словах
Нормализация — заимствование по существу
Делительная нормализация описана как каноническое вычисление коры [33]: отклик нейрона делится на суммарную активность соседей по пулу. Так объясняются насыщение контрастной характеристики в V1, перекрестное подавление и адаптация к статистике входа. Ту же форму имеет добрая половина слоев современной сети — от локальной нормировки откликов до softmax, где экспонента логита делится на сумму по всем логитам.
Rᵢ = γ · xᵢⁿ / ( σⁿ + Σⱼ∈pool xⱼⁿ )
где xᵢ — возбуждение нейрона, pool — соседи по нормировочному пулу, σ — константа насыщения
(4)
Рейнольдс и Хигер [34] показали, что тем же уравнением описывается зрительное внимание: усиление входа в одной области поля зрения меняет отклик через знаменатель, а не через прямое умножение выхода.
Внимание — совпадение формы без родства
Механизм внимания в трансформере [35] выглядит как биологический аналог, и здесь надо быть аккуратным. Формально softmax по скалярным произведениям запроса и ключей — это та же делительная нормализация. Содержательно трансформер вырос из задач машинного перевода и из соображений параллелизации обучения, а не из данных о коре. Утверждать преемственность неверно.
При этом обратная связь между областями существует и она интереснее. Уиттингтон с соавторами [36] показали, что трансформер с подходящим позиционным кодированием воспроизводит представления гиппокампальной формации — клетки места и сетчатые клетки. Банино с соавторами [37] получили тот же результат раньше и другим путем: сетчатые представления возникли сами в рекуррентной сети, обученной навигационной задаче, и повысили эффективность поиска пути. Это второй случай того же паттерна, что и в главе 4: биология воспроизводится как решение оптимизационной задачи, а не как результат копирования.
Разреженность — заимствование на словах
Про разреженность в машинном обучении говорят постоянно, и почти всегда — впустую. ReLU обнуляет около половины активаций, но плотный матричный ускоритель все равно читает все веса и выполняет все умножения: ноль на входе экономит энергию только в железе, которое умеет пропускать нулевые операнды. Наш edge-таргет так не умеет — Hailo-8L это плотный INT8-ускоритель с фиксированным конвейером, и разреженность активаций там не превращается в ватты.
Три заимствования и их честный статус. Колонка «дает ли экономию на нашем железе» — единственная, которая имеет отношение к деньгам заказчика.
глава 06
Предсказание как принцип работы
Единственный биологический принцип, который уже приносит нам деньги на объекте
Рао и Баллард в 1999 году [38] предложили модель, в которой более высокий уровень коры постоянно предсказывает активность более низкого, вниз идет предсказание, а наверх — только ошибка. Модель объясняла эффекты, которые не выводились из классического рецептивного поля: например, почему отклик нейрона V1 на протяженную решетку падает по сравнению с откликом на ее фрагмент. Ответ прост: протяженная решетка предсказуема, а предсказанное наверх не передается.
e = x − f(W·r), r ← r + η·Wᵀ·e
где x — вход уровня, r — представление уровня выше, e — ошибка предсказания, f — нелинейность
(5)
Наверх уходит e, а не x. Когда сцена предсказуема, e близко к нулю и канал практически молчит. Обобщение этой идеи до принципа работы нервной системы известно как минимизация свободной энергии [39]; к нему есть обоснованная претензия в нефальсифицируемости, и в инженерной части мы опираемся на конкретную модель Рао и Балларда, а не на общую теорию.
Инженерия пришла к тому же независимо и раньше, чем нейробиология это описала. Межкадровое предсказание в видеокодеках устроено ровно так: опорный кадр плюс векторы движения и остаток, который передается по каналу. Именно поэтому видеонаблюдение за статичным двором стоит копейки по трафику, а тот же двор во время метели забивает канал. Совпадение с моделью Рао и Балларда полное, и оно снова объясняется общим ограничением: дорогой канал.
Этот четвертый шаг и есть событийная камера. Пиксель, который сам решает, что яркость изменилась достаточно, чтобы об этом сообщить, — аппаратная реализация передачи одной ошибки предсказания. Ему посвящена глава 9; сначала надо разобраться с моделью нейрона, который такой поток обрабатывает.
Часть III
Спайк как единица вычисления
Единственное место, где биология обещает инженерии выигрыш в ваттах, а не в точности. Разбираем модель спайкового нейрона и ее главную проблему — необучаемость градиентом, три обходных пути, реально существующие нейроморфные чипы с их цифрами и событийные камеры, которые меняют саму постановку задачи детекции.
глава 07
Спайковый нейрон и почему его нельзя обучить напрямую
Производная спайка — дельта-функция, и градиентный спуск об нее ломается
Четыре уравнения Ходжкина и Хаксли для сети из миллиона элементов неподъемны, поэтому инженерия работает с моделью «интегрируй и стреляй с утечкой» — LIF. Мембрана представляется конденсатором с утечкой, вход подкачивает потенциал, утечка тянет его к покою. Как только потенциал перевалил порог, нейрон выдает спайк и сбрасывается.
τₘ·dV/dt = −(V − V_rest) + R·I(t); если V ≥ V_th → спайк, V ← V_reset
где τₘ — постоянная времени мембраны, R·I — вклад входного тока, V_th — порог
(6)
Одно уравнение вместо четырех и одно состояние на нейрон. Именно эта модель стоит в кремнии на всех нейроморфных чипах из главы 8 — в разных вариантах с адаптацией порога и рефрактерным периодом.
интерактив · формула (6), шаг 1 мс, окно 400 мсрефрактерный период 3 мс
разрядов
14
частота
35,0 Гц
тактов с событием
3,5%
у плотного слоя
100%
Вся экономия спайковой сети сидит в третьей колонке. Нейрон отправляет что-то дальше на единицах процентов тактов, и на событийном железе платится именно за них. Плотный матричный ускоритель читает все веса на каждом такте независимо от того, что происходит во входе, — его колонка всегда равна ста процентам. Уменьшите ток или поднимите порог, и разряды исчезнут совсем: та же модель при том же железе перестанет потреблять.
Теперь про обучение. Выход такого нейрона — последовательность разрядов, то есть функция со значениями ноль и единица. Ее производная по мембранному потенциалу равна нулю везде, кроме точки порога, где она бесконечна. Обратное распространение ошибки по такой функции не идет: градиент либо нулевой, либо не определен. Это и есть центральная техническая проблема всей области, из-за которой спайковые сети тридцать лет оставались в лабораториях.
Три обходных пути
Первый — конвертация. Обычная сеть обучается как всегда, а затем ее активации переводятся в частоты разрядов: чем выше активация, тем чаще спайки [40, 41]. Способ рабочий и не требует переизобретать обучение, но платит задержкой: чтобы частота стала точной оценкой числа, нужно накопить достаточно тактов. Ранние работы требовали сотен тактов на кадр, что съедало весь энергетический выигрыш; последующие довели цифру до единиц и десятков за счет нормировки порогов и гибридных схем.
Второй — суррогатный градиент [42]. На прямом проходе нейрон остается пороговым и выдает честные ноль-единица, а на обратном производная ступеньки подменяется гладкой колоколообразной функцией. Прием формально некорректен и практически работает: он сделал возможным обучение глубоких спайковых сетей обычным автоградиентом. Разновидности отличаются формой суррогата и способом разворачивать время — SLAYER [43] распределяет заслугу по временному окну, SuperSpike [44] строит правило, локальное по синапсу.
∂S/∂V ≈ 1 / (1 + β·|V − V_th|)²
где S — бинарный выход нейрона, β — крутизна суррогата
(7)
На прямом проходе спайк остается бинарным. Подменяется только производная — и именно эта нечестность делает спайковые сети обучаемыми в существующих фреймворках.
Третий путь — временное кодирование, при котором информация лежит во времени прихода первого спайка. Это ближе всего к биологии, где на слой приходится порядка десяти миллисекунд и усреднять частоту попросту нечем [14]. Сеть в таком режиме дает ответ по первым спайкам и обрывает счет — это и есть теоретический максимум экономии. Цена: обучение сложнее, устойчивость к шуму ниже, зрелых промышленных реализаций нет.
Три способа получить работающую спайковую сеть. Правая колонка — то, что определяет выбор в проекте с реальными сроками.
глава 08
Нейроморфное железо: что существует и на каких цифрах
Чипы есть, цифры хорошие, инструментария нет — и это главный риск для подрядчика
Идея считать в кремнии так же, как считает нервная ткань, старше глубокого обучения: термин neuromorphic ввел Карвер Мид в конце 1980-х для аналоговых схем, воспроизводящих сетчатку и улитку. Промышленная фаза началась в 2014 году, и с тех пор в ней есть три школы.
Цифровая асинхронная — IBM TrueNorth [26]: 4096 нейросинаптических ядер, миллион нейронов и 256 миллионов синапсов на 5,4 миллиарда транзисторов, потребление в демонстрации порядка 70 милливатт. Никакого обучения на чипе: веса заливаются снаружи. Intel Loihi [27] пошел дальше и добавил программируемые правила пластичности прямо в ядро — 128 ядер, до 130 тысяч нейронов и 130 миллионов синапсов. Loihi 2 перевели на техпроцесс Intel 4 и подняли емкость до миллиона нейронов на чип, а в 2024 году из 1152 таких чипов собрали систему Hala Point: 1,15 миллиарда нейронов при потреблении порядка 2,6 киловатта [28].
Вторая школа — множество обычных процессорных ядер, имитирующих нейроны в реальном времени. Это манчестерский SpiNNaker [45], миллион ядер ARM, и его дрезденский наследник SpiNNaker2. Плюс подхода в гибкости: модель нейрона — это программа, а не схема. Минус там же: энергетика хуже, чем у специализированного кремния.
Третья школа — аналоговые вычисления в памяти на мемристивных кроссбарах [46]. Матрица весов физически хранится в проводимостях элементов, и умножение вектора на матрицу выполняется законами Ома и Кирхгофа за один такт, без переноса весов из памяти в АЛУ. Именно перенос весов, а не арифметика, съедает основную энергию в классической архитектуре, поэтому потенциальный выигрыш здесь наибольший. Открытые вопросы промышленные: выход годных, дрейф проводимости, ограниченная разрядность и отсутствие внятного маршрута проектирования.
Нейроморфные платформы по публикациям и материалам производителей. Ни одна из них в лаборатории не замерялась; таблица нужна, чтобы понимать, из чего вообще выбирать, если гипотеза H1 из главы 14 подтвердится.
глава 09
Событийные камеры: сенсор, который меняет постановку задачи
Самая близкая к нашим задачам часть всей работы — и единственная, куда мы реально целимся
Обычная матрица выдает кадры по таймеру: тридцать раз в секунду весь массив пикселей уезжает наверх независимо от того, изменилось в сцене хоть что-нибудь. Событийный сенсор устроен как сетчатка [47]: каждый пиксель независимо следит за логарифмом яркости и сообщает наверх, когда изменение перевалило порог. Выход — не кадр, а поток четверок «координата, координата, время с микросекундной точностью, знак изменения».
Рис. 5. Кадровая и событийная камера на одной временной оси. Кадровая тратит канал на неподвижный фон и размазывает быструю цель за время экспозиции. Событийная молчит на статике и отмечает движение с микросекундным разрешением, но не сообщает абсолютную яркость и не видит неподвижный объект вовсе.
свойство
кадровая камера
событийная камера
временное разрешение
миллисекунды, задано кадровой частотой
микросекунды, задано событием
динамический диапазон
порядка 60 дБ
свыше 120 дБ
смаз быстрой цели
есть, растет с экспозицией
отсутствует по построению
поток данных
постоянный, не зависит от сцены
пропорционален движению в кадре
статичный объект
виден
невидим, событий нет
цвет и текстура
есть
практически нет
зрелость датасетов и моделей
двадцать лет накоплений
единицы открытых наборов
Сравнение по свойствам, важным именно для детекции малой быстрой цели. Значения по событийным сенсорам приведены по обзору [48] и паспортам производителей.
Для детекции беспилотника это попадание почти по всем пунктам. Цель малая, быстрая и наблюдается против яркого неба или в контражуре — три ситуации, где кадровая матрица теряет объект в пересвете и смазе, а событийная работает штатно. Поток данных на пустом небе близок к нулю, что означает и экономию канала, и экономию вычислений на узле. Открытые наборы и модели детекции на событиях уже существуют: мегапиксельный набор для автомобильного сценария [49] и рекуррентные архитектуры уровня RVT [50], которые держат детекцию с задержкой в единицы миллисекунд.
Ограничения перечисляем до того, как кто-нибудь спросит. Событийная камера не видит неподвижное: висящий в воздухе дрон при неподвижной камере не порождает событий, и решение тут одно — движение самого сенсора либо гибрид с кадровым каналом. Цвета и текстуры нет, поэтому классификация типа объекта по событиям хуже, чем по картинке. В темноте и при мерцающем освещении растет поток паразитных событий, который нужно фильтровать. Разметка событийных данных дороже и требует своего инструментария. И, наконец, сенсор стоит заметно дороже обычной промышленной камеры, что для проекта с сотней точек решает все.
Часть IV
Обучение без backprop
Обратное распространение ошибки требует глобального сигнала и памяти под весь граф вычислений — на edge-узле нет ни того, ни другого. Нервная система обходится локальными правилами и продолжает учиться, не стирая старое. Разбираем механизмы, их инженерные реализации и то, что из этого применимо к дрейфу домена на реальном объекте.
глава 10
Локальные правила: STDP, выравнивание обратной связи, предиктивное кодирование
Четыре способа обучать сеть, не таща градиент через всю глубину
Правило Хебба из главы 1 говорит «связывается то, что срабатывает вместе», но не уточняет, что значит «вместе». Уточнение нашли в конце 1990-х: важен порядок во времени с точностью до миллисекунд. Маркрам с соавторами [51] и затем Би и По [52] показали, что если пресинаптический спайк приходит за несколько миллисекунд до постсинаптического, связь усиливается, а при обратном порядке — ослабевает. Ширина окна — порядка двадцати миллисекунд в обе стороны. Механизм получил имя STDP.
Δw = A₊·exp(−Δt/τ₊) при Δt > 0; Δw = −A₋·exp(Δt/τ₋) при Δt < 0
где Δt = t_post − t_pre, τ± порядка 20 мс
(8)
Правило причинности в чистом виде: усиливается то, что предсказывало разряд. Информации о цели обучения тут нет вообще, поэтому чистый STDP делает то же, что кластеризация, — находит частые совпадения во входе.
Чтобы локальное правило начало решать задачу, ему нужен третий множитель. Его роль и играет нейромодуляция из главы 2: синапс, у которого совпал порядок спайков, оставляет след готовности, а пришедший позже дофаминовый сигнал превращает след в реальное изменение веса. Такие схемы называют трехфакторными [53], и они напрямую связаны с обучением с подкреплением: величина, которую кодируют дофаминовые нейроны [22], в инженерии называется временной разностью.
δ = r + γ·V(s′) − V(s)
где r — награда, γ — дисконт, V — оценка состояния
(9)
Совпадение между разрядами дофаминовых нейронов и этой формулой [22] — самый сильный случай взаимного подтверждения нейробиологии и машинного обучения за всю их историю. Тут заимствование пошло в обратную сторону: инженерная модель объяснила биологические данные.
Три инженерных обхода транспорта весов
Рис. 6. Куда идет сигнал обучения. В обратном распространении назад передаются те же веса, что и вперед, — механизма для этого в коре не описано [15, 16]. Выравнивание обратной связи заменяет их фиксированной случайной матрицей и все равно обучает сеть [54]. Локальные правила обходятся без обратного пути вовсе: обновление считается по величинам, доступным синапсу, и графа вычислений хранить не нужно.
Первый — выравнивание обратной связи [54]. Оказалось, что для обучения не нужно передавать назад точные веса прямого прохода: достаточно фиксированной случайной матрицы. Прямые веса сами подстраиваются так, чтобы согласоваться со случайной обратной проекцией. Результат неожиданный и воспроизводимый, и он снимает главное биологическое возражение против backprop.
Второй — предиктивное кодирование как машина обучения. Уиттингтон и Богач [55] показали, что сеть, устроенная по схеме Рао и Балларда из главы 6, при сходимости внутренней динамики дает те же обновления весов, что и обратное распространение ошибки, при этом каждое обновление использует только локально доступные величины. То есть backprop получается как предельный случай локального процесса.
Третий — схемы с двумя проходами вместо прямого и обратного. Равновесное распространение [57] обучает энергетическую сеть по разнице двух равновесий, а алгоритм forward-forward [56] заменяет обратный проход вторым прямым на отрицательных примерах, что убирает необходимость хранить граф вычислений целиком.
глава 11
Забывание, консолидация и дрейф домена на объекте
Модель на объекте стареет — и биология подсказывает, как ее дообучать, не ломая
Дообучите готовую сеть на новой задаче — и она потеряет старую. Эффект описан в 1989 году [17] и остается фундаментальным свойством градиентного обучения: веса, важные для первой задачи, свободно уезжают под вторую. Нервная система с этим справляется, и известно, за счет чего.
Первый механизм — устройство самого синапса. Фузи, Дрю и Эбботт [18] показали, что синапс с каскадом внутренних состояний разной устойчивости примиряет быстрое обучение с долгой памятью: часто подтверждаемое изменение проваливается в более устойчивое состояние и перестает стираться случайными событиями. Прямая инженерная реализация этой идеи — регуляризация EWC [19], где для каждого веса оценивается его важность для прошлой задачи, и уход важных весов штрафуется.
L = L_new(θ) + Σᵢ (λ/2)·Fᵢ·(θᵢ − θ*ᵢ)²
где F — диагональ информационной матрицы Фишера, θ* — веса после прошлой задачи
(10)
Важность веса оценивается кривизной функции потерь: чем сильнее ошибка растет при его смещении, тем крепче он держится. Дешево по вычислениям и работает как страховка от деградации при дообучении на объекте.
Второй механизм — повторное проигрывание опыта. Уилсон и Макнотон в 1994 году [58] обнаружили, что во сне гиппокамп воспроизводит последовательности активности, записанные во время бодрствования, в ускоренном темпе. Отсюда идея системной консолидации: свежий опыт постепенно переписывается в кору за счет повторов. В машинном обучении тот же прием называется буфером воспроизведения и стоит в основе обучения с подкреплением на нейросетях [59] — авторы прямо ссылались на гиппокампальный реплей как на мотивацию.
Как это ложится на нашу боль
Модель детекции, поставленная на объект, стареет предсказуемо. Меняется сезон и фон, ставят новые прожекторы, появляется техника, которой не было в обучающем наборе, камеру подкручивают на пару градусов после обслуживания. Сегодня это лечится ручным циклом: собрать кадры с объекта, разметить, переобучить, перекомпилировать под ускоритель, выкатить. Цикл занимает недели и требует человека с GPU.
Отбор материала по удивлению: на дообучение идут кадры, где велика ошибка предсказания трекера или где детектор колеблется у порога. Это ровно тот сигнал, который в предиктивном кодировании уходит наверх (глава 6), и он не требует разметки для отбора.
Буфер воспроизведения: вместе со свежими кадрами прогоняется выборка старых, чтобы дообучение не переписало модель под текущую неделю [58, 59].
Штраф за уход важных весов по схеме EWC [19] — страховка от катастрофического забывания.
Якорный набор и автоматический откат: до и после дообучения метрики снимаются на неизменяемом отложенном наборе объекта, и при падении recall ниже порога версия откатывается сама.
Часть V
Обратное направление и наша программа
Сегодня нейробиология получает от компьютерного зрения больше, чем отдает: коннектомы собирают сегментацией электронной микроскопии, нейроинтерфейсы работают на рекуррентных декодерах, поведение животных размечают позными моделями. Разбираем это направление, затем — что из всего материала лаборатория умеет продать сегодня, и заканчиваем программой из четырех гипотез с критериями, по которым каждую можно закрыть.
глава 12
Сети как инструмент нейробиологии
Коннектомика, нейроинтерфейсы и поведение — это задачи компьютерного зрения промышленного масштаба
Прямое направление — взять принцип из мозга и применить в инженерии — дало за шестьдесят лет одну свертку. Обратное направление сегодня богаче: без машинного обучения современная нейробиология физически не может обработать то, что производят ее приборы.
Коннектомика
В 2024 году опубликован полный коннектом мозга взрослой дрозофилы — порядка 140 тысяч нейронов и около 50 миллионов синапсов, реконструированные по стопке электронно-микроскопических срезов [60]. В 2025 году вышел результат проекта MICrONS: кубический миллиметр зрительной коры мыши, порядка 200 тысяч клеток, около 523 миллионов синапсов и порядка четырех километров суммарной длины аксонов, причем для той же ткани есть функциональные записи активности [61].
С инженерной стороны это чистая задача сегментации в объеме: автоматически проследить каждый отросток через тысячи срезов, найти синаптические контакты и не склеить два разных нейрона в один. Ошибки слияния и разрыва — главная метрика качества, и именно вокруг них построен цикл с проверкой человеком. Масштаб данных петабайтный, ручная реконструкция невозможна арифметически.
Регистрация активности и нейроинтерфейсы
Зонды Neuropixels [62] пишут сотни каналов одновременно, и первая же задача после записи — разделить смесь разрядов на отдельные клетки, то есть решить задачу разделения источников на потоке [63]. Дальше начинается декодирование. Интерфейс, восстанавливающий рукописный ввод по активности моторной коры, показал порядка 90 знаков в минуту [64]; речевые интерфейсы 2023 года — от 62 до 78 слов в минуту [65, 66].
Поведение
Позные модели без маркеров [67, 68] превратили анализ поведения животных из ручной работы в конвейер: сеть находит ключевые точки тела на видео, дальше считаются траектории, позы и события. Это буквально наша область — трекинг, ключевые точки, разметка интервалов, — только предметная область другая. И те же грабли: разметка дорогая, домен узкий, перенос между установками требует дообучения.
Отдельный жанр — использование сетей как модели мозга, а не как инструмента. Именно об этом работы про предсказание откликов нижневисочной коры [29] и про появление сетчатых представлений у навигационного агента [37], и на этом стоит целая программа вычислительной нейробиологии [69]. Отдельно стоит держать в голове аргумент Задора [70]: большая часть поведения животного не выучена, а заложена структурой, которая проходит через геномное бутылочное горлышко, и именно эта врожденная структура делает обучение таким быстрым. В инженерных терминах — правильный индуктивный сдвиг важнее объема данных.
глава 13
Что из этого лаборатория умеет продать сегодня
Четыре рабочие ниши и один короткий список того, за что не беремся
Раздел нужен, чтобы отделить исследовательскую часть от коммерческой. Ниже — задачи из пересечения нейробиологии и компьютерного зрения, которые решаются нашим обычным стеком уже сегодня, без единого спайкового нейрона.
микроскопия и гистология
сегментация и подсчет объектов на снимках, срезах и стопках срезов; разметка в паре с оператором и контроль качества по ошибкам слияния и разрыва. Тот же инструментарий, что в промышленной дефектоскопии, другой домен.
поведенческий трекинг
позные модели без маркеров для установок вивария и поведенческих камер: ключевые точки, траектории, автоматическая разметка событий и интервалов. Смыкается с нашим направлением распознавания действий во времени.
биосигналы на edge
фильтрация и классификация ЭЭГ, ЭМГ и ЭКГ прямо на устройстве, без выгрузки сырого сигнала наружу. Ограничение по памяти и питанию тут жестче, чем в видеоаналитике, и работает та же дисциплина сжатия модели.
событийное зрение под быстрые процессы
то, ради чего затевалась глава 9, но не только про беспилотники: контроль вибрации, подсчет быстрых объектов на конвейере, искрение и электрическая дуга, любая сцена с высоким контрастом и коротким событием.
глава 14
Программа: четыре гипотезы и критерии, по которым их закрывают
Порог назначается до эксперимента, иначе результат всегда получается положительным
Все предыдущие тринадцать глав — разбор чужих результатов. Собственная часть направления начинается здесь и состоит из четырех гипотез. У каждой заранее назначен порог, ниже которого гипотеза считается закрытой, и определен минимальный эксперимент, который этот порог проверяет. Пороги назначены лабораторией и являются решением, а не измерением.
H1 · сенсор
Событийная камера с обычной сетью-детектором дает по малой быстрой цели в контражуре и на пересвеченном небе более высокий recall, чем кадровая камера при сопоставимом бюджете вычислений. Критерий закрытия: прирост recall на общей сцене меньше 5 процентных пунктов при равном числе ложных срабатываний. Что нужно: событийный сенсор и параллельная запись обеими камерами на одной сцене.
H2 · энергия
Спайковая сеть на нейроморфном ускорителе с событийным входом удерживает детекцию при мощности узла ниже одного ватта. Критерий закрытия: падение recall относительно нашего текущего контура на Hailo-8L больше чем на 10 процентных пунктов либо невозможность уложиться в один ватт по измеренной мощности. Что нужно: подтвержденная H1 и доступ к нейроморфному чипу с рабочим маршрутом сборки модели.
H3 · канал
Передача по схеме предиктивного кодирования — событие плюс подтверждающий кадр вместо потока — сокращает исходящий трафик узла не менее чем на порядок без потери полноты журнала событий. Критерий закрытия: сокращение меньше чем в 10 раз либо пропуск событий на контрольной записи. Что нужно: только то, что уже есть, — обычная камера и наш edge-узел.
H4 · дообучение на узле
Локальное дообучение головы детектора прямо на объекте по кадрам, отобранным по величине ошибки предсказания, поднимает recall на дрейфующем домене. Критерий закрытия: падение метрик на неизменяемом якорном наборе более чем на 1 процентный пункт либо отсутствие прироста на свежих данных объекта. Что нужно: объект под пилот и накопленный за сезон архив.
гипотеза
что нужно для проверки
стоимость входа
статус
H3 · канал
текущий стенд, без закупок
низкая
в очереди первой
H1 · сенсор
событийная камера, параллельная запись
средняя
нужна закупка
H4 · дообучение
объект под пилот и архив за сезон
средняя
нужен объект
H2 · энергия
нейроморфный чип и маршрут сборки
высокая
зависит от H1
Порядок работ построен от дешевого к дорогому: первая гипотеза не требует закупок вообще, последняя требует чипа и доступа к платформе. Статус на 13.08.2026 — ни один эксперимент не начат.
Что заказчик может забрать из этого направления прямо сейчас: понимание, за какие обещания в области нейроморфных вычислений не стоит платить, и разбор двух приемов, которые работают на обычном железе уже сегодня — предиктивная передача вместо потока и фовеальный кроп под малые цели. Готовые веса и метрики лежат в соседнем направлении, на странице детектора БПЛА, и они измерены.
Хорошая исследовательская программа отличается от плохой не тем, что чаще оказывается права, а тем, что заранее известно, каким результатом она будет опровергнута.
рабочее правило лаборатории, сформулировано при закрытии направления MoranaDocs
приложение А
Глоссарий
Термины, которые в тексте используются без расшифровки.
спайк
потенциал действия: короткий разряд нейрона длительностью около миллисекунды. Амплитуда постоянна, информацию несут момент и частота разрядов.
LIF
leaky integrate-and-fire, модель нейрона из одного дифференциального уравнения: вход накапливается, утечка тянет потенциал к покою, при достижении порога происходит разряд и сброс.
STDP
spike-timing-dependent plasticity: изменение силы синапса в зависимости от порядка и разницы во времени между разрядами двух нейронов.
суррогатный градиент
прием обучения спайковых сетей: на прямом проходе нейрон остается пороговым, на обратном производная ступеньки подменяется гладкой функцией.
транспорт весов
требование обратного распространения ошибки использовать при обратном проходе те же веса, что и при прямом. Биологического механизма для этого не описано.
событийная камера, DVS
матрица, где каждый пиксель независимо сообщает об изменении логарифма яркости. Выход — поток событий с микросекундными метками времени вместо кадров.
нейроморфный процессор
чип, реализующий сеть спайковых нейронов в кремнии: вычисление запускается приходом события, а не тактом кадра.
предиктивное кодирование
схема, в которой уровень выше предсказывает активность уровня ниже, а наверх передается только ошибка предсказания.
разреженный код
представление, в котором на любой вход отвечает малая доля элементов. В коре это следствие энергетического бюджета.
рецептивное поле
участок сенсорного пространства, изменение в котором меняет отклик нейрона. Прямой прообраз ядра свертки.
коннектом
полная схема связей нервной системы или ее участка, восстановленная по срезам электронной микроскопии.
дрейф домена
расхождение между данными, на которых модель обучалась, и данными объекта в эксплуатации: сезон, освещение, новая техника в кадре, сдвиг камеры.
катастрофическое забывание
потеря качества на старой задаче при дообучении на новой — базовое свойство градиентного обучения.
якорный набор
неизменяемая отложенная выборка объекта, на которой метрики снимаются до и после каждого дообучения. Страховка от тихой деградации модели.
приложение Б
Литература
Только первоисточники, каждый открывается по DOI или на arXiv. Единственное исключение — материалы производителей железа, они помечены прямо в позиции: независимых замеров по этим системам в открытом доступе нет.
[28]Intel. Hala Point: система из 1 152 процессоров Loihi 2, 1,15 млрд нейронов. Материалы производителя, 2024 — независимых замеров в открытом доступе нет.
Направление аналитическое. Собственных замеров по спайковым сетям, нейроморфным ускорителям и событийным камерам у лаборатории нет, потому что нет ни сенсора, ни чипа — парк железа перечислен на витрине R&D. Все цифры по этим платформам в тексте взяты из публикаций и паспортов производителей и помечены как чужие. Продать по этому направлению сегодня нечего, кроме экспертизы на созвоне: работающие веса и измеренные метрики лежат в направлении детекции БПЛА.
журнал
Что происходило по направлению
13.08.2026
Направление открыто. Собрана аналитическая часть: 14 глав, 70 первоисточников, сквозная нумерация формул, глоссарий. Сформулированы четыре гипотезы с назначенными заранее порогами закрытия и порядком проверки от дешевой к дорогой. Экспериментов не начато, закупок под H1 и H2 не сделано.