# Пилот Morana Labs: что именно мы теряем, когда «сжимаем мозг»

**Статус:** вычислительный эксперимент выполнен 16 сентября 2026 года. **Объект:** открытый структурный граф FlyWire FAFB v783, взрослый мозг самки Drosophila. **Уровень вывода:** свойства выбранной выгрузки и алгоритмов прореживания. Физиологическая передача, обучение и поведение здесь не моделировались.

## Исследовательский вопрос

Можно удалить большую часть связей и сохранить значительную часть общего числа синапсов. Но означает ли это, что сохранён полезный каркас мозга? Для R&D это не риторика: выбор критерия прореживания определяет, какие цепи останутся в будущей модели, какие входы исчезнут и какую ошибку затем будет невозможно исправить настройкой динамики.

Мы поставили компактный проверяемый вопрос: **при одинаковом числе оставленных направленных пар согласуются ли сохранность синаптического счёта, доступность нисходящих выходов для сенсорных источников и размер рекуррентной части графа?**

Ответ в этом пилоте — нет. На одном бюджете локальное нормирование почти полностью сохраняет число сенсорных нейронов с хотя бы одним путём до нисходящего нейрона, хотя удерживает меньше синаптического счёта. На более жёстком бюджете та же схема сохраняет высокую общую достижимость, одновременно разрушая большую сильную компоненту и ухудшая доступность отдельных модальностей. Одного процента «сохранённой сети» недостаточно.

## Данные: что именно было скачано

Работа использует официальные публичные статические объекты FlyWire/Codex, а не стороннюю перепаковку. Всего скачано **214 708 253 байта**. EM-изображения и объёмы сегментации не скачивались.

| Продукт | Назначение | Размер, байт | GCS generation | Last-Modified |
|---|---|---:|---|---|
| `connections_no_threshold.csv.gz` | Направленные связи без порога по числу синапсов на пару | 212 093 967 | 1733428417714928 | 05.12.2024 |
| `classification.csv.gz` | Классы и super_class нейронов | 934 402 | 1771945205700934 | 24.02.2026 |
| `neurons.csv.gz` | Полный список узлов | 1 679 884 | 1733428446832038 | 05.12.2024 |

Базовый URL: [официальное хранилище FlyWire FAFB v783](https://storage.googleapis.com/flywire-data/codex/data/fafb/783/connections_no_threshold.csv.gz). Полные URL, хеши SHA-256 и времена загрузки сохранены в [manifest](data/manifest.json).

**Версия сегментации не фиксирует версию всех производных файлов.** Взята materialization 783, но классификация в этой выгрузке обновлена в феврале 2026 года. Мы не называем её аннотациями публикационного среза 2024 года. Официальная документация отдельно предупреждает, что статические выгрузки синхронизируются с актуальным Codex и могут отличаться от архивов времени публикации. [Codex FAQ](https://codex.flywire.ai/faq)

Использован исходный продукт синапсов Buhmann/Heinrich, файл `connections_no_threshold`, а не новый продукт `connections_princeton`. Текущий Codex также использует более новые синаптические предсказания; эти версии нельзя объединять в одной таблице под общим словом «v783». [About FlyWire](https://codex.flywire.ai/about_flywire)

Условия FlyWire указывают CC BY-NC 4.0 для правок и аннотаций клеток. CSV не содержит отдельного встроенного лицензионного заголовка; manifest фиксирует документированный scope, а не вывод о правах на каждый составной продукт. В репозитории сохраняются код, метаданные и агрегированные результаты; сырые файлы исключены из Git. Для коммерческого использования конкретного производного продукта требуется отдельно установить применимые права. [FlyWire Terms of Service, пункт 1.2](https://flywire.ai/tos)

## Построение графа

Исходная таблица содержит **16 847 997 строк**. Несколько строк могут соответствовать одной паре нейронов, если её синапсы лежат в разных neuropil. Поэтому сначала суммируется `syn_count` по направленной паре `(pre_root_id, post_root_id)`, а порог применяется **после** агрегации. Порог по отдельной строке означал бы другой эксперимент.

Получено:

| Величина | Значение |
|---|---:|
| Узлов из полного списка neurons | 139 255 |
| Уникальных направленных пар | 15 091 983 |
| Суммарный синаптический счёт | 54 492 922 |
| Самосвязей в исходной выгрузке | 0 |
| Узлов хотя бы с одним инцидентным ребром | 138 639 |
| Полностью изолированных узлов | 616 |
| Размер крупнейшей сильной компоненты | 135 403 |
| Размер крупнейшей слабой компоненты | 138 113 |
| Узлов с `super_class=sensory` | 16 938 |
| Узлов с `super_class=descending` | 1 305 |
| Сенсорных узлов, достигающих хотя бы одного descending | 14 695 |

Корневые идентификаторы читаются как 64-битные целые, без преобразования в floating point. Верифицировано совпадение всех концов рёбер со списком узлов. Во всех вариантах сохраняется одна и та же вселенная из 139 255 узлов, в том числе изолированные; это защищает метрики от искусственного улучшения через удаление «неудобных» узлов.

Синаптический счёт здесь — сумма анатомически предсказанных контактов. Это не сумма токов, проводимостей или физиологических весов. «Без порога» означает отсутствие дополнительного порога по числу синапсов на пару в данном продукте, а не отсутствие предшествующих фильтров детекции или доказанную полноту всех синапсов.

Публикационная статистика и наши числа не обязаны совпадать до последней пары. Например, Lin et al. указывают для v783 2 701 601 связь при пороге 5, а зафиксированный здесь непороговый файл после агрегации даёт 2 700 513. Разница 1 088 пар отмечена; её причина отдельно не исследована. Пилот привязан к точным байтам manifest и не заявляется точной репликацией таблиц статьи. [Lin et al., 2024](https://www.nature.com/articles/s41586-024-07968-y)

## Три способа прореживания

Пусть `w_ij` — суммарное число синапсов от нейрона `i` к нейрону `j`.

1. **Абсолютный порог.** Оставить `w_ij ≥ τ`, где `τ ∈ {1, 2, 3, 5, 10, 20, 50, 100}`. Полученное число пар обозначим `M(τ)`.
2. **Доля выхода источника.** Для исходного графа вычислить `r_ij = w_ij / Σ_j w_ij`. Оставить глобально `M(τ)` пар с максимальным `r_ij`. При равенстве значений используется стабильный порядок source ID, затем target ID. Дополнительный абсолютный порог к этому графу не применяется.
3. **Случайный контроль.** Равномерно выбрать без возвращения ровно `M(τ)` исходных направленных пар. Провести пять запусков с seeds `78301–78305`.

Второй и третий методы запущены для бюджетов порогов 5, 10, 20, 50, 100. Всего получено **38 графов** и **266 записей по сенсорным классам**.

Случайный контроль выравнивает число пар, но не выравнивает суммарный синаптический счёт, степени узлов, модальности, типы передатчиков или расположение в neuropil. Он отвечает на ограниченный вопрос «что даёт правило выбора при таком же числе рёбер». Он не изолирует причинное значение слабых связей. Контроль с сохранением распределения степеней и веса пока не выполнен.

Нормирование по доле выхода — простой диагностический baseline. Оно не представляется новым алгоритмом Morana Labs: относительные веса, пороги и синаптические бюджеты уже обсуждаются в литературе. Собственный результат здесь — совместная измеренная картина компромиссов на зафиксированном графе. [Schlegel et al., 2024](https://www.nature.com/articles/s41586-024-07686-5)

## Метрики и их границы

**Масса:** доля оставшегося синаптического счёта и доля оставшихся пар.

**Структура:** число активных и изолированных узлов, количество сильных и слабых компонент и размер крупнейших компонент. В сильной компоненте каждый узел достижим из каждого по направленным путям. Её размер — структурная характеристика взаимной достижимости, а не прямое измерение памяти, рекуррентной вычислительной мощности или устойчивости динамики.

**Доступность источников:** для каждого sensory-нейрона проверяется существование хотя бы одного направленного пути к хотя бы одному из 1 305 descending-нейронов. Поиск выполняется от всех descending-узлов в обращённом графе. Показатель не требует сохранения конкретного выхода и может считать сохранённым источник, которому оставлен только один выходной маршрут.

**Покрытие выходов:** для каждого из семи сенсорных классов считается доля descending-узлов, достижимых хотя бы из одного источника этого класса. Это объединение маршрутов по источникам, не доля всех возможных пар source–target.

Оба вида достижимости рассчитаны без ограничения длины пути и отдельно для максимум 2, 3, 4, 5, 8 переходов. Пути допускают промежуточные узлы любых классов, включая другие sensory/descending-нейроны: это явно определённый графовый baseline, а не физиологическая модель сенсорного канала. Расчёт игнорирует знак передачи, задержки, рецепторы и текущий режим активности.

## Результат 1. Даже слабейшие пары заметны в структуре

Удаление всех пар с единственным синапсом сохраняет **50,33% пар** и **86,24% синаптического счёта**. Крупнейшая сильная компонента уменьшается с 135 403 до 130 487 узлов. Число sensory-нейронов с путём к любому descending уменьшается с 14 695 до 13 387: **потеря 1 308 источников, или 8,90% от исходно достижимых**.

Это не доказывает, что каждый удалённый односинаптический контакт функционален. Среди слабых рёбер могут быть ошибки детекции; именно поэтому исходную достижимость нельзя автоматически объявить биологической истиной. Измерен риск конкретной операции: даже после самого мягкого удаления по счёту из сохранённой массы нельзя определить, какие источники потеряли путь.

| Порог | Пар | Пар от исходного, % | Синаптический счёт, % | Sensory с путём до any DN | От исходно достижимых, % | Крупнейшая SCC |
|---:|---:|---:|---:|---:|---:|---:|
| 1 | 15 091 983 | 100,00 | 100,00 | 14 695 | 100,00 | 135 403 |
| 2 | 7 595 967 | 50,33 | 86,24 | 13 387 | 91,10 | 130 487 |
| 3 | 4 916 231 | 32,58 | 76,41 | 12 227 | 83,21 | 126 668 |
| 5 | 2 700 513 | 17,89 | 62,68 | 10 028 | 68,24 | 119 756 |
| 10 | 1 066 822 | 7,07 | 43,43 | 6 326 | 43,05 | 94 650 |
| 20 | 366 864 | 2,43 | 26,45 | 3 262 | 22,20 | 32 823 |
| 50 | 66 438 | 0,44 | 10,71 | 494 | 3,36 | 6 311 |
| 100 | 15 837 | 0,10 | 4,51 | 89 | 0,61 | 1 382 |

## Результат 2. При одинаковом бюджете меняется сам смысл «сохранить»

Рассмотрим **1 066 822 пары**, то есть 7,07% исходного графа.

| Метод | Синаптический счёт, % исходного | Достижимых sensory | Доля от 14 695 исходно достижимых | Крупнейшая SCC |
|---|---:|---:|---:|---:|
| Абсолютный порог ≥10 | 43,43% | 6 326 | 43,05% | 94 650 |
| Ранжирование по доле выхода | 28,58% | 14 570 | 99,15% | 95 501 |
| Случайно, среднее пяти запусков | 7,07% | 7 128,2 | 48,51% | 115 432,8 |
| Случайно, min–max пяти запусков | 7,05–7,08% | 7 073–7 185 | 48,13–48,89% | 115 345–115 551 |

Абсолютный порог ожидаемо максимизирует оставшийся синаптический счёт при данном бюджете: это следствие самого ранжирования, не научное открытие. Однако максимальная масса не обеспечивает максимальное число доступных источников.

Локальное нормирование даёт преимущество паре, занимающей большую долю выхода своего источника. Это позволяет сохранить маршруты от источников с небольшим общим счётом. На выбранном бюджете количество доступных источников почти сохраняется. **Из этого не следует сохранение 99,15% функции мозга:** число конкретных доступных выходов, длины путей и динамика могут сильно измениться.

Даже внутри нашего графового определения важна длина. При ограничении маршрута тремя переходами в исходном графе до any DN достигают **14 299 sensory-нейронов**, после абсолютного порога 10 — **3 106**, после локального ранжирования — **6 277**. Результат «99,15%» относится только к существованию пути неограниченной длины.

Случайный граф сохраняет более крупную SCC, чем оба детерминированных метода, несмотря на существенно меньший синаптический счёт. Это ещё один аргумент против выбора победителя по одному числу. Min–max пяти random-запусков — описательный диапазон выбранных реализаций, **не доверительный интервал и не оценка биологической вариабельности**.

![Компромиссы трёх критериев](figures/sparsification_tradeoffs.png)

## Результат 3. Высокая общая достижимость маскирует потерю отдельного канала

На бюджете **366 864 пар** локальное ранжирование сохраняет путь до any DN для **12 193 sensory-нейронов**, абсолютный порог 20 — для **3 262**. Если смотреть только на эту метрику, победитель выглядит очевидным.

Но крупнейшая SCC составляет **2 447 узлов** у локальной схемы против **32 823** у абсолютного порога. Сохранность от исходной крупнейшей SCC — 1,81% против 24,24%. Один путь на выход и сохранённая взаимная достижимость — разные требования.

Обонятельные источники показывают ещё один провал агрегирования. При локальном ранжировании путь до any DN остаётся у **17,89%** из 2 281 olfactory-нейронов; при абсолютном пороге — у **51,51%**. Между тем зрительных sensory-источников 11 426 из 16 938, и их вклад доминирует в общей сумме. Улучшение большой группы может скрыть деградацию меньшей.

| Класс sensory | Число источников | Исходный граф, % | Порог ≥20, % | Локальный ранг, % |
|---|---:|---:|---:|---:|
| gustatory | 334 | 100,00 | 55,09 | 89,22 |
| hygrosensory | 74 | 100,00 | 82,43 | 59,46 |
| mechanosensory | 2 674 | 96,19 | 14,73 | 92,00 |
| olfactory | 2 281 | 99,52 | 51,51 | 17,89 |
| thermosensory | 29 | 100,00 | 93,10 | 48,28 |
| unknown_sensory | 120 | 96,67 | 66,67 | 95,83 |
| visual | 11 426 | 81,39 | 11,74 | 77,49 |

В этой таблице знаменатель — **все аннотированные источники конкретного класса**, а не только исходно достижимые. `sensory_ascending`, `ascending` и `visual_projection` не включены в множество источников; они могут быть промежуточными узлами. Таким образом, оценка не охватывает все возможные афферентные пути нервной системы.

![Сохранность отдельных сенсорных классов](figures/modality_coverage.png)

## Что из этого следует для R&D

Пилот даёт конкретную постановку следующего эксперимента: **искать компактные подграфы на Pareto-фронте нескольких явно определённых структурных требований**. Минимальный вектор оценки должен включать сохранённую массу, доступность каждой модальности, достижимость конкретных source–target пар, распределение удлинения кратчайших путей и характеристику обратных контуров. Выбор весов или жёстких ограничений надо привязывать к задаче модели.

Например, будущий критерий можно сформулировать как «минимизировать число пар при сохранении не менее заданной доли исходно достижимых источников **в каждом** сенсорном классе и ограничении изменения длин маршрутов». Это предложенный критерий, а не уже достигнутый результат. Необходимо отдельно проверить, имеет ли такое сохранение смысл для конкретной динамической модели и наблюдаемого ответа на стимул.

Следующая очередь работ, **пока не выполненная**:

1. Повторить весь протокол на `connections_princeton_no_threshold` и сравнить устойчивость выводов к детектору синапсов. Один и тот же segmentation snapshot с разными детекторами не считать независимой биологической репликацией.
2. Добавить контроль с сохранением степеней, neuropil и распределения счёта; сравнить относительный входной бюджет, относительный выходной бюджет и их комбинацию.
3. Уточнить сенсорные источники и выходы по целевой экспериментальной задаче. Выделить фиксированные source–target наборы, запретить физиологически неуместные промежуточные классы там, где есть основания.
4. Провести анализ устойчивости к ошибкам рёбер и неполноте аннотаций; показать распределение результатов, а не только один номинальный граф.
5. Проверить перенос на независимый экземпляр/пол и согласованные клеточные типы. Материализации, пол и состав объёма хранить раздельно.
6. Лишь после структурного этапа оценивать динамическую модель на заранее выбранных наблюдаемых ответах, с независимыми контролями и абляциями.

Так появляется измеримый исследовательский проект: не «скопировать мозг в нейросеть», а установить, какие свойства коннектома необходимы для воспроизводимых вычислительных результатов при ограниченном бюджете модели.

## Проверки и ограничения

Расчёт выполнен одним прогоном за **30,76 секунды** без времени загрузки и установки зависимостей. Среда и версии зафиксированы в `run_summary.json`; это не benchmark производительности. Скрипт проверки прошёл: агрегация дубликатов до порога, корректность направления путей, исключение самосвязей, сохранение суммы счёта, одинаковые бюджеты пар, монотонность вложенных пороговых графов, хеши исходников/результатов и соответствие хеша анализа выполненному прогону. Рисунки визуально проверены.

Основные ограничения:

- Один экземпляр мозга, один выбранный синаптический продукт и обновлённые аннотации. Обобщение на вид или пол не установлено.
- Слабые рёбра могут быть истинными, случайными или ошибочными; здесь эти случаи не различаются. Высокая достижимость через слабые рёбра сама по себе не доказывает их физиологической необходимости.
- Рассчитывается бинарная связность. Нейромодуляция, знак, рецепторы, пластичность, геометрия, задержки и состояния мембраны отсутствуют.
- DN — выбранные нисходящие нейроны внутри доступного brain-графа; наличие пути до них не эквивалентно движению, управлению телом или связи с мышцей.
- Классы источников имеют резко неодинаковые размеры; общий процент необходимо читать вместе с таблицей по классам. Для 29 thermosensory-нейронов изменение одного узла уже составляет 3,45 процентного пункта.
- Пять random seed дают только ограниченное описание случайного baseline. Биологических повторностей и статистической проверки новых универсальных закономерностей нет.
- Порог 10 и бюджет 20 выделены в тексте после осмотра сетки результатов. Это **exploratory** анализ, не заранее зарегистрированная confirmatory гипотеза.
- Выгрузка не является точной копией опубликованной таблицы; происхождение небольшой разницы числа пороговых пар не установлено. Manifest делает эту границу проверяемой.

## Источники и атрибуция

Собственные числа таблиц и рисунков получены скриптами этого каталога. Исходная реконструкция и аннотации принадлежат создателям FlyWire и соответствующих научных продуктов, а не Morana Labs.

1. Dorkenwald S. et al. **Neuronal wiring diagram of an adult brain.** Nature 634, 124–138 (2024). [DOI](https://doi.org/10.1038/s41586-024-07558-y).
2. Schlegel P. et al. **Whole-brain annotation and multi-connectome cell typing of Drosophila.** Nature 634, 139–152 (2024). [DOI](https://doi.org/10.1038/s41586-024-07686-5).
3. Lin A. et al. **Network statistics of the whole-brain connectome of Drosophila.** Nature (2024). [Статья](https://www.nature.com/articles/s41586-024-07968-y).
4. Buhmann J. et al. **Automatic detection of synaptic partners in a whole-brain Drosophila electron microscopy data set.** Nature Methods (2021). [Библиографическая запись](https://pubmed.ncbi.nlm.nih.gov/34168373/).
5. [FlyWire/Codex: происхождение продуктов и attribution](https://codex.flywire.ai/about_flywire); [документация версий и выгрузок](https://codex.flywire.ai/faq); [условия использования](https://flywire.ai/tos). Проверены 16.09.2026.
