В множестве всех страниц длиной 3200 знаков лежит верный ответ на любой ваш вопрос — и рядом с ним 10 в степени 1825 страниц, отличающихся одной цифрой и выглядящих ровно так же убедительно. Найти страницу дешево, отличить ее от соседней — дорого, и разница между этими операциями измеряется в битах. Работа считает эту величину, меряет ее на собственном корпусе и показывает, почему механизм, который всегда стоит на какой-то полке, не имеет способа сообщить, что полка не та.
аппарат и собственный замер готовы, сравнение с нейросетевыми моделями на том же корпусе не проведено
программа открыта 23.08.2026
стек и предметная область
теория информации
кросс-энтропия и сжатие
символьные n-граммы
колмогоровская сложность
теория поиска
методология эксперимента
аннотация
Работа вводит единицу измерения знания — бит сокращения адреса — и меряет ее на собственном корпусе. Отправная точка: множество всех текстов заданной длины, где вопрос о существовании ответа лишен смысла, потому что ответ есть по построению. Показано, что перебор в таком множестве невозможен физически, а не дорог, и что адрес произвольной страницы весит ровно столько же, сколько сама страница. Перечислены семь механизмов сужения пространства с оценкой цены бита и гарантии для каждого; из разбора следует закон сохранения: биты соответствия реальности не возникают внутри пространства, они вносятся измерением и дальше только перераспределяются. Отсюда выводится, почему языковая модель не может отказаться отвечать и почему инструкции против выдумок не работают. Практическая часть — собственный замер на 782 380 знаках: знание языка и предметной области снимает 9 936 бит из 16 000, то есть 62 % адреса, сжимая пространство поиска в 10 в степени 2991 раз и оставляя 10 в степени 1825 кандидатов. Обнаружено, что кривая энтропии разворачивается вверх после пятого порядка, и проверено, что положение этого минимума задается объемом корпуса, а не свойствами языка: на корпусе в тридцать пять раз меньше оптимум уезжает с пятого порядка на третий. Завершается работа разбором входящей задачи по механизмам, формулировками для протокола приемки и перечнем восьми способов обмануть себя при таком счете.
16 позиций: от Борхеса 1941 и Шеннона 1948 до работ по сжатию
измерено нами
кросс-энтропия на корпусе 782 380 знаков и кривая обучения
срез
23.08.2026
стенд
рабочая библиотека на /babel, расчет идет в браузере читателя
Ссылки вида [12] в тексте ведут в список литературы. Формулы пронумерованы сквозной нумерацией.
кратко
Если читать работу целиком некогда
01
Адрес не бывает короче страницы
Адресация обязана быть взаимно однозначной, значит адресов нужно не меньше, чем страниц. Отсюда следует утверждение, которое выглядит парадоксом и является тавтологией: указать на произвольный ответ стоит ровно столько же, сколько сам ответ. Короткие ссылки, которыми мы пользуемся ежедневно, указывают не на произвольный элемент, а на элемент заранее суженного множества.
02
Пустых полок не бывает
Любой синтаксически корректный адрес указывает на заполненную страницу — понятия «здесь ничего нет» в пространстве не существует. Отсюда галлюцинация языковой модели выводится не как дефект обучения, а как свойство механизма: тот, кто всегда стоит на какой-то полке, не имеет средства сообщить, что полка не та.
03
Минимум кривой лежит там, где кончается корпус
Модель восьмого порядка формально включает в себя модель пятого и работает хуже: 2,188 бита против 1,895. Причина — разреженность: контекстов больше, чем наблюдений. Проверка прямая — на корпусе в тридцать пять раз меньше оптимум уезжает с пятого порядка на третий. Сложность, оправданная объемом данных, определяется замером, а не пожеланием заказчика.
факты
формат
длинная форма: 7 частей, 28 глав, глоссарий и библиография
главная величина
бит отсечения: I = log₂(N_до / N_после)
нижняя граница адреса
16 000 бит на страницу в 3200 знаков — столько же, сколько весит сама страница
перебор
невозможен физически: 10¹¹⁰ против 10⁴⁸¹⁶ при вычислителе размером со Вселенную
измерено нами: энтропия
1,895 бит на знак на корпусе 782 380 знаков, модель пятого порядка
что дает язык
9 936 бит из 16 000 — 62 % адреса, сжатие пространства в 10²⁹⁹¹ раз
что остается
6 064 бита, то есть 10¹⁸²⁵ страниц-кандидатов: язык до страницы не доводит
измерено нами: разворот кривой
после пятого порядка энтропия растет; переход к восьмому теряет 938 бит адреса
проверка находки
оптимальный порядок движется с объемом корпуса: 20 тыс. знаков → n=3, 704 тыс. → n=5
закон сохранения
биты соответствия реальности вносит только измерение; остальные шесть механизмов их перераспределяют
не измерено
сравнение с нейросетевыми моделями, оценка предельной сжимаемости русского языка, перенос на чужой корпус
Часть I
Пространство, в котором лежит все
Работа начинается с конструкции, которой сто лет: множество всех текстов заданной длины. Эта часть показывает, что в таком множестве вопрос о существовании ответа лишен смысла — ответ есть всегда, — и что вся сложность переезжает в адресацию. Здесь же выводится нижняя граница стоимости адреса и разбирается свойство, которое делает пространство опасным: в нем не бывает пустых мест.
глава 01
Множество всех страниц
Существование ответа перестает быть вопросом, как только пространство задано полностью
Возьмем алфавит из тридцати двух знаков и страницу фиксированной длины в 3200 знаков — сорок строк по восемьдесят. Множество всех таких страниц конечно и полностью определено: в нем 32 в степени 3200 элементов. Никакого отбора, никакой генерации, никакого авторства — множество задано самим фактом определения алфавита и длины.
N = A^L = 32^3200 ≈ 10^4816
где A — размер алфавита, L — длина страницы в знаках
(1)
Показатель считается как L·log₁₀A = 3200 · 1,50515 = 4816,5. Дальше по тексту используется округленное 10^4816.
В этом множестве лежит текст этой главы. Лежит протокол совещания, которое состоится через месяц, — во всех вариантах, включая верный. Лежит корректный отчет о выручке за любой будущий квартал и рядом с ним все неверные отчеты, отличающиеся одной цифрой. Ни одна из этих страниц не будет написана: они уже заданы, как задано число 4 в определении натурального ряда.
Конструкция принадлежит Борхесу [1], и в литературоведении она читается как притча о бессмысленности всеобщего знания. Для инженера в ней есть другое содержание. Как только пространство задано полностью, вопрос «существует ли ответ» теряет смысл: ответ существует по построению. Остается ровно один вопрос — как назвать его место.
глава 02
Перебор невозможен, и это не вопрос ресурсов
Между «очень долго» и «нельзя никогда» проходит граница, которую стоит увидеть в числах
Первое, что приходит в голову при виде конечного множества, — перебрать его. Оценим, чего это стоит, взяв заведомо избыточную вычислительную установку: превратим каждый атом наблюдаемой Вселенной в отдельный процессор, дадим каждому производительность в триллион страниц в секунду и запустим их всех в момент Большого взрыва.
величина
значение
источник
атомов в наблюдаемой Вселенной
≈ 10⁸⁰
общепринятая оценка
страниц в секунду на атом
10¹²
заведомо завышенное допущение
секунд с Большого взрыва
≈ 4,4 · 10¹⁷
13,8 млрд лет
перебрано страниц
≈ 10¹¹⁰
произведение трех строк выше
страниц в библиотеке
10⁴⁸¹⁶
формула (1)
доля перебранного
10⁻⁴⁷⁰⁶
отношение
Таблица 1. Перебор при физически невозможной установке. Доля просмотренного отличается от нуля на величину, для которой в физике нет применения.
Разница между 10¹¹⁰ и 10⁴⁸¹⁶ — это не разница в производительности, которую закроет следующее поколение железа. Между этими числами 4706 порядков. Удвоение производительности добавляет к показателю 0,3; чтобы закрыть разрыв, удвоений нужно около пятнадцати тысяч. Перебор здесь запрещен не бюджетом, а размерностью задачи [14].
глава 03
Адрес весит столько же, сколько страница
Нижняя граница стоимости адресации выводится из счета, а не из качества реализации
Раз перебор невозможен, к странице нужно приходить сразу — по адресу. Возникает естественное желание сделать адрес компактным: короткий номер полки, ключ из нескольких символов, идентификатор в базе. Это желание неисполнимо, и причина лежит в счете, а не в изобретательности.
Адресация обязана быть взаимно однозначной: разным страницам — разные адреса, иначе по адресу нельзя вернуться. Значит адресов нужно не меньше, чем страниц. Если адрес записывается в том же алфавите, его длина не может быть меньше длины страницы. В битах это выглядит так.
|Adr| ≥ log₂N = L·log₂A = 3200 · 5 = 16 000 бит
где |Adr| — длина адреса в битах, N — мощность множества страниц
(2)
Равенство достигается, когда адресация не тратит ни бита впустую. В нашей реализации оно достигнуто точно: 3194 знака имени шестигранника по 5 бит плюс 30 бит координат дают ровно 16 000.
Отсюда следует утверждение, которое стоит проговорить отдельно, потому что оно выглядит как парадокс, а является тавтологией: указать на страницу стоит ровно столько же, сколько стоит сама страница. Никакой «короткой ссылки» на произвольный элемент такого пространства не существует. Ссылки, которые мы используем ежедневно, коротки по другой причине — они указывают не на произвольный элемент, а на элемент заранее суженного множества.
Рис. 1. Рисунок 1. Слева — интуитивное представление об адресации: короткий ключ указывает на большой объект. Справа — фактическое положение дел для произвольного элемента полного пространства: адрес и объект равновелики.глава 04
Пустых полок не бывает
Свойство, из-за которого пространство отвечает всегда, — включая случаи, когда ответа нет
У полного пространства есть свойство, которое в притче Борхеса выглядит декоративным, а в инженерной практике оказывается источником самых дорогих ошибок. В нем нет пустых мест. Любой синтаксически корректный адрес указывает на заполненную страницу. Понятия «здесь ничего нет» в пространстве не существует.
Соседняя страница отличается от нужной на один знак и выглядит ровно так же убедительно: тот же алфавит, та же длина, та же структура. По внутренним признакам верная страница неотличима от соседней — различие целиком лежит снаружи, в соответствии реальности.
Борхес описывает это как каталог библиотеки и тысячи ложных каталогов, от него неотличимых [1]. В современной практике то же самое называется галлюцинацией языковой модели, и обсуждается обычно как дефект обучения. Из устройства пространства видно, что это не дефект: механизм, который всегда стоит на какой-то полке, не имеет способа сообщить, что полка не та.
Отказ «не знаю» требует отдельного механизма — само пространство его не подсказывает.
Уверенность ответа не связана с его верностью: она измеряется внутри, верность — снаружи.
Уговоры и инструкции не создают бит информации, а значит не сдвигают адрес.
Последний пункт стоит запомнить: к нему работа вернется в части IV, где будет показано, что информация внутри пространства не рождается вообще. Пока достаточно зафиксировать постановку: ответ есть всегда, отличить его от соседнего изнутри нельзя, и вся работа сводится к тому, чтобы понять, чем именно и по какой цене это различение покупается.
Часть II
Единица измерения
Чтобы сравнивать несравнимое — интуицию, эксперимент, справочник и запрос к модели, — нужна общая шкала. Эта часть вводит бит отсечения, показывает, что любое действие в пространстве поиска есть сужение и ничего кроме сужения, и связывает стоимость адреса с длиной кода. Здесь же выводится, почему хорошая модель и хороший архиватор — это одно и то же устройство, рассмотренное с двух сторон.
глава 05
Бит отсечения
Одно действие — одно сужение; ничего другого в пространстве поиска не происходит
Все, что можно сделать с пространством кандидатов, — это уменьшить его. Вспомнить, вывести, измерить, спросить, ограничить формат: каждое из этих действий вычеркивает часть вариантов и не делает ничего другого. Величина вычеркнутого измеряется в битах.
I = log₂(N_до / N_после)
где N_до и N_после — мощность множества кандидатов до и после действия
(3)
Один бит — сокращение множества вдвое. Десять бит — в тысячу двадцать четыре раза. Величина аддитивна: два независимых действия дают сумму бит.
Определение восходит к Шеннону [2] и в теории информации стандартно [9, 13]. Практическая его ценность в том, что оно уравнивает в правах вещи, которые обычно обсуждаются на разных языках. Справочник номенклатуры, регламент предприятия, ГОСТ, дообученная модель, удачно составленный промпт и полевой замер — все это поставщики бит, и различаются они только количеством и ценой.
действие
сужение
бит
выбрать одну позицию из справочника в 50 000 SKU
50 000 → 1
15,6
узнать первую букву слова (равновероятно, 32 знака)
32 → 1
5,0
ответ на корректно поставленный вопрос «да или нет»
2 → 1
1,0
задать формат из 12 знаков вместо 3200
10⁴⁸¹⁶ → 10¹⁸
≈ 15 940
указать страницу целиком
10⁴⁸¹⁶ → 1
16 000
Таблица 2. Разные по природе действия в одной шкале. Последняя строка — полная адресация, она же верхняя граница; все остальное занимает свою долю от нее.
глава 06
Знание — это сжатие адреса
Модель не хранит текстов; она хранит меру на пространстве, и мера сокращает запись
Библиотека Борхеса задает на множестве страниц равномерное распределение: все полки равноправны, никакая не предпочтительнее. Языковая модель задает на том же множестве неравномерное распределение. Множество одно, различие целиком в мере.
Из неравномерности сразу следует экономия записи. Если некоторые страницы вероятнее других, им можно назначить более короткие коды за счет удлинения кодов для маловероятных. Оптимальная длина кода задается логарифмом вероятности, а средняя длина — энтропией [2, 9].
|Adr_P| = −log₂P(s) и E[|Adr_P|] = H(P) · L
где P(s) — вероятность страницы s по модели, H(P) — энтропия модели в битах на знак
(4)
При равномерной модели H = log₂32 = 5 бит на знак, и формула вырождается в (2). Любое отклонение меры от равномерной уменьшает средний адрес.
Отсюда рабочее определение, которым работа пользуется дальше. Знание — это величина, на которую известное сокращает адрес относительно равномерного случая. Не метафора и не переформулировка: разность измеряется в битах и проверяется замером, который приведен в части V.
K = L·(log₂A − H) = 3200 · (5 − H)
где K — сэкономленные биты адреса, H — кросс-энтропия модели в битах на знак
(5)
Величина K — это и есть «сколько знания в модели», выраженное в единицах адресации. Все дальнейшие замеры считают именно ее.
Тот же вывод объясняет, почему задача сжатия и задача предсказания — одна задача. Архиватор, который сжимает текст лучше, по построению предсказывает его лучше: длина выхода равна минус логарифму вероятности, назначенной моделью. Это соображение лежит в основе конкурсов на сжатие текста как меры интеллекта [10] и в принципе минимальной длины описания [16].
глава 07
Нижняя граница и почему до нее не дойти
У каждой страницы есть свой минимальный адрес, но вычислить его в общем случае нельзя
Формула (2) дает границу для произвольной страницы. Но конкретные страницы бывают устроены просто: страница из 3200 пробелов описывается фразой «3200 пробелов», и адрес такой длины не нужен. Величина, отвечающая на вопрос «какова длина кратчайшего описания именно этого объекта», введена Колмогоровым и Соломоновым [6, 7].
K(s) = min{ |p| : U(p) = s }
где U — универсальная машина, p — программа, порождающая строку s
(6)
Величина зависит от выбора машины лишь на аддитивную константу, поэтому имеет смысл как характеристика объекта, а не реализации.
У этой величины два свойства, которые нужно держать в голове вместе. Первое: почти все страницы несжимаемы. Строк длины L ровно A^L, а описаний короче L−k существенно меньше, поэтому доля страниц, для которых адрес удается сократить хотя бы на десять бит, меньше одной тысячной. Второе: величина невычислима — не существует алгоритма, который по строке выдаст длину ее кратчайшего описания.
Из первого свойства следует и практическое ограничение на ожидания. Интуиция подсказывает, что осмысленный текст «должен» сжиматься сильно. Осмысленный — да, и часть V покажет, насколько. Но осмысленные страницы составляют исчезающую долю пространства, и утверждение «почти все несжимаемо» относится к пространству целиком, а не к тому его углу, в котором работают люди.
Часть III
Семь способов дойти
Известные способы сужения пространства перечислимы, и их немного. Эта часть разбирает каждый по одной схеме: что он делает с пространством, сколько стоит бит, какую гарантию дает и где перестает работать. Порядок не случаен — механизмы выстроены по возрастанию цены бита, и последние три оказываются единственными, которые дают что-то новое.
глава 08
Память: адрес уже записан
Самый дешевый бит — тот, за который заплатил кто-то другой
Кто-то уже прошел путь и оставил указатель: справочник, база, документация, запись в реестре. Стоимость чтения на порядки ниже стоимости первого прохода, и именно поэтому память — основной механизм в любой работающей системе.
Гарантия здесь ровно такая, каким был тот, кто ходил. Память не проверяет содержимое, она его переносит; ошибка, попавшая в справочник, воспроизводится бесконечно и с полной уверенностью. Это не недостаток механизма, а его определение: перенос бит без порождения новых.
глава 09
Навигация по похожести: рельеф вместо карты
Механизм языковых моделей: быстро, дешево и без гарантии попадания
Адреса нет, но есть распределение: одни продолжения вероятнее других. Движение идет по градиенту правдоподобия, шаг за шагом, и каждый шаг отсекает часть пространства. Именно это делает авторегрессионная модель, и часть V меряет, сколько бит такой механизм дает на нашем корпусе.
Свойство, из-за которого механизм ставится вторым, а не первым: он приводит туда, где похоже, и не имеет средства отличить это место от того, где верно. Оценка правдоподобия считается внутри пространства, а верность определяется снаружи — в главе 04 показано, что изнутри различие недоступно.
Скорость: наибольшая среди всех механизмов, цена бита близка к нулю.
Гарантия: отсутствует; уверенность модели не является оценкой верности.
Область: там, где нужная страница лежит в плотной области распределения, то есть похожа на виденное при обучении.
Отказ: невозможен без внешнего механизма — пустых полок в пространстве нет.
глава 10
Вывод: адрес строится, а не ищется
Полная гарантия ценой крошечной области применимости
Дедукция не ищет страницу в пространстве — она конструирует ее из аксиом по правилам вывода. Стоимость измеряется длиной доказательства, гарантия абсолютна в пределах принятой системы, а проверить результат дешевле, чем получить его: проверка доказательства линейна по его длине.
Ограничение механизма — не в мощности, а в охвате. Выводимо только то, что следует из принятых аксиом. Утверждение о выручке конкретного предприятия за конкретный квартал не выводится ни из какой системы аксиом: оно не следует, оно происходит. Область применимости вывода — формальные объекты, и она исчезающе мала относительно пространства.
глава 11
Перебор с проверкой: цена определяется проверяющим
Работает ровно там, где проверить дешевле, чем предложить
Механизм генерирует кандидатов и отбраковывает их проверкой. Полный перебор невозможен (глава 02), поэтому речь всегда о направленном поиске в суженной области. Стоимость складывается из числа проверенных кандидатов и цены одной проверки.
C = n · c_проверки, где n ≈ 2^(|Adr| − K)
где K — биты, уже отсеченные другими механизмами
(7)
Формула объясняет, почему перебор с проверкой всегда идет последним звеном: n падает экспоненциально по числу бит, купленных заранее. Один лишний бит сужения вдвое сокращает счет за проверку.
Ключевое условие — асимметрия. Механизм имеет смысл тогда и только тогда, когда проверка существенно дешевле генерации: маршрут проверяется быстрее, чем строится, раскрой считается быстрее, чем подбирается. Там, где проверка стоит столько же, сколько генерация, механизм вырождается в перебор и упирается в главу 02.
глава 12
Измерение: единственный источник новых бит
Все прочие механизмы перераспределяют то, что этот механизм внес
Адрес нельзя ни вспомнить, ни вывести, ни угадать — остается пойти и посмотреть. Механизм самый дорогой и самый медленный из семи, и он единственный, который добавляет в систему информацию, которой в ней не было.
Утверждение сформулировано в части IV как закон сохранения и там же разобрано подробно. Здесь достаточно указать на следствие для практики: если задача требует бит, которых нет ни в одном справочнике и ни в одном корпусе, ни одна модель их не создаст. Требуется замер, и стоимость проекта определяется стоимостью замера, а не выбором архитектуры.
глава 13
Отсечение: вычеркивать эффективнее, чем подтверждать
Наибольшая отдача на единицу усилия — у вопроса, который делит пространство пополам
Механизм работает не с искомой страницей, а с ее дополнением: каждое действие объявляет часть пространства несовместимой с наблюдениями. По формуле (3) максимум бит дает разбиение на равные половины — это верхняя граница информативности одного вопроса.
I = −p·log₂p − (1−p)·log₂(1−p), max при p = 1/2
где p — доля пространства, отсекаемая при одном исходе
(8)
Вопрос, ответ на который предсказуем, дает около нуля бит. Отсюда количественное содержание требования фальсифицируемости [12]: ценность проверки равна тому, сколько она способна отсечь при неудачном для гипотезы исходе.
исход подтверждает гипотезу с вероятностью
отсечено бит
0,99 — почти наверняка
0,08
0,90
0,47
0,75
0,81
0,50 — исход непредсказуем
1,00
Таблица 3. Информативность одной проверки. Опыт, исход которого известен заранее, приносит около нуля бит независимо от его стоимости.
глава 14
Сужение алфавита: уменьшить пространство до поиска
Единственный механизм, который меняет не положение в пространстве, а само пространство
Шесть предыдущих механизмов ищут внутри заданного пространства. Седьмой меняет его границы: запрет части символов, схема документа, тип данных, предметный язык. Пространство схлопывается до начала всякого поиска, причем экспоненциально по длине.
ΔI = L·log₂(A₁/A₂)
где A₁ и A₂ — размеры алфавита до и после ограничения
(9)
Сокращение алфавита с 32 знаков до 10 на странице в 3200 знаков дает 5375 бит сужения — треть полного адреса, полученная одним ограничением формата.
Механизм самый дешевый по цене бита и самый недооцененный на практике. Требование строгого формата ответа, конечный перечень допустимых значений и схема выходного документа отсекают больше, чем дообучение, и стоят при этом часы проектирования, а не недели вычислений.
Рис. 2. Рисунок 2. Семь механизмов на плоскости «цена бита — гарантия попадания». Дешевые механизмы гарантий не дают, гарантирующие дороги или узки. Пустой правый нижний угол — дешево и с гарантией — не занят ничем, и это не пробел в перечислении.глава 15
Сводная таблица механизмов
Семь строк, к которым сводится вся практическая часть работы
механизм
цена бита
гарантия
дает новое
память
минимальная
как у источника
нет
навигация по похожести
близка к нулю
отсутствует
нет
вывод
длина доказательства
полная
нет
перебор с проверкой
n · цена проверки
полная при полной проверке
нет
измерение
наибольшая
в пределах точности прибора
да
отсечение
цена опыта, до 1 бита за опыт
полная на отвергнутом
да
сужение алфавита
часы проектирования
полная в пределах схемы
нет
Таблица 4. Сводка части III. Столбец «дает новое» подготавливает часть IV: положительное значение стоит ровно у тех двух механизмов, которые обращаются к реальности, а не к содержимому пространства.
Часть IV
Закон сохранения
Разложив механизмы по одной шкале, обнаруживаем закономерность: пять из семи не добавляют в систему ни одного бита о том, какая страница соответствует реальности. Эта часть формулирует утверждение строго, разбирает, что из него следует для языковых моделей, и объясняет, почему борьба с галлюцинациями инструкциями не имеет шансов.
глава 16
Внутри пространства биты не рождаются
Перестановка карт не сообщает, где закопан клад
Пространство содержит все страницы и ни одного признака того, какая из них соответствует положению дел вне пространства. Признак соответствия не выводится из содержимого: соседние страницы синтаксически равноправны, и никакое преобразование внутри множества не делает одну из них верной.
I(S ; R) не возрастает при любом преобразовании S, не зависящем от R
где S — состояние системы, R — положение дел в реальности
(10)
Это применение неравенства обработки данных [9]: обработка не увеличивает взаимную информацию с источником. Величина I(S;R) растет только при взаимодействии с R — то есть при измерении.
Отсюда закон, к которому работа шла с части III. Механизмы памяти, навигации, вывода, перебора и сужения алфавита перераспределяют биты, уже находящиеся в системе. Взаимодействие с реальностью происходит в двух механизмах — измерение и отсечение, — и только они увеличивают взаимную информацию с положением дел.
глава 17
Что делает языковая модель
Перераспределение чужих измерений — большая работа, но не порождение новых бит
Корпус обучения состоит из текстов, написанных людьми, которые что-то измеряли, наблюдали или выводили. Модель извлекает из корпуса регулярности и переносит их на новые запросы. Работа полезная и огромная по объему, но по своей природе это перенос, а не порождение: все биты соответствия в модели импортированы вместе с корпусом.
Отсюда предсказуемая граница. О том, чего никто никогда не измерял и не записывал, модель не может сообщить ничего — и при этом ответит, потому что механизм навигации не имеет состояния «полка пуста». Ответ будет построен по рельефу правдоподобия и окажется настолько же уверенным, насколько и любой другой.
Справочник заказчика не был в корпусе — бит о нем в модели нет, сколько ни спрашивай.
События после среза обучения не измерялись моделью — сведений о них нет по построению.
Внутренние регламенты предприятия существуют в одном экземпляре — вероятность их попадания в корпус равна нулю.
Это же соображение объясняет, почему интеграция дает результат, а наращивание размера модели на таких задачах не дает. Размер увеличивает качество перераспределения уже импортированных бит; отсутствующих бит он не создает.
глава 18
Почему инструкции не уменьшают галлюцинации
Требование не ошибаться не является источником информации
Распространенная практика — добавлять в запрос требования отвечать точно, признаваться в незнании и не выдумывать. Из закона сохранения видно, что происходит на самом деле: инструкция смещает распределение в сторону осторожных формулировок, но не вносит ни одного бита о том, где лежит верная страница.
Наблюдаемый эффект от таких инструкций реален и объясняется без противоречия: меняется не адресация, а форма ответа. Модель чаще выбирает области пространства, где формулировки уклончивы. Доля неверных утверждений может снизиться просто потому, что снизилась доля утверждений вообще.
мера
вносит бит о реальности
что меняет
инструкция «не выдумывай»
нет
распределение по форме ответа
увеличение размера модели
нет
качество перераспределения
подстановка справочника в запрос
да, из памяти
положение в пространстве
вызов инструмента с обращением к системе учета
да, из памяти
положение в пространстве
полевой замер и разметка
да, из измерения
содержимое системы
внешняя проверка результата
да, из отсечения
отбраковку неверных страниц
Таблица 5. Меры против галлюцинаций по признаку внесения бит. Первые две строки меняют вид ответа, остальные — его адресацию.
Часть V
Замер: сколько бит дает знание языка
Все предыдущее сводилось к величине K из формулы (5) — насколько известное сокращает адрес. Эта часть ее измеряет. Корпус — 782 380 знаков собственных технических текстов лаборатории, модели — символьные n-граммы порядков от нуля до восьми, проверка — на отложенном хвосте. Главный результат оказался не в величине сжатия, а в том, где кривая разворачивается вверх.
глава 19
Постановка замера
Свой корпус, отложенная проверка, сглаживание без подгоняемых параметров
Мерим кросс-энтропию: сколько бит на знак тратит модель, предсказывая текст, которого не видела. Разность между пятью битами равномерного случая и измеренной величиной, умноженная на длину страницы, и есть K — биты адреса, которые дает знание языка.
параметр замера
значение
корпус
782 380 знаков
источник
тексты монографий, посадочных страниц и разборов лаборатории
файлов просмотрено
188
алфавит
32 знака: 31 буква и пробел
обучение
704 142 знака — первые 90 %
проверка
78 238 знаков — хвост, не участвовавший в обучении
Таблица 6. Условия замера. Дата среза — 23.08.2026.
Два решения в постановке требуют объяснения. Первое: корпус собран из собственных текстов, а не из общедоступного русского. Вопрос работы — сколько бит дает знание конкретной предметной области, и усреднение по всему языку на него не отвечает. Второе: отложенная часть отрезана хвостом, а не выбрана вперемешку. Перемешивание кусков одного документа оставляет модели контекст из соседних абзацев и занижает энтропию — величина получилась бы красивее и была бы неверна.
Сглаживание Виттена-Белла выбрано потому, что вес отката к модели меньшего порядка вычисляется из числа уникальных продолжений контекста и не настраивается вручную [8]. Настраиваемый параметр в такой работе означал бы подгонку под ответ.
javascript
/** Виттен-Белл: P = (c + T·P_backoff) / (N + T), рекурсивно до равномерного. */
function prob(ctx, ch, k) {
if (k < 0) return 1 / 32 // равномерное дно
const row = tables[k].get(ctx)
const backoff = prob(k === 0 ? '' : ctx.slice(1), ch, k - 1)
if (!row) return backoff
const t = row.counts.size // уникальных продолжений
return ((row.counts.get(ch) ?? 0) + t * backoff) / (row.total + t)
}
let bits = 0
for (let i = order; i < test.length; i++) {
const ctx = order === 0 ? '' : test.slice(i - order, i)
bits += -Math.log2(prob(ctx, test[i], order))
}
const bitsPerChar = bits / (test.length - order)
Листинг 1. Ядро замера. Полные скрипты сбора корпуса и расчета — в репозитории лаборатории, scripts/babel-entropy.глава 20
Результат
Знание языка снимает около двух третей адреса и останавливается
порядок
бит на знак
бит на страницу
снято бит
сжатие пространства
равномерно
5,000
16 000
0
1
0 — частоты знаков
4,375
13 999
2 001
10⁶⁰²
1 — биграммы
3,568
11 418
4 582
10¹³⁷⁹
2
2,843
9 096
6 904
10²⁰⁷⁸
3
2,198
7 032
8 968
10²⁷⁰⁰
4
1,915
6 127
9 873
10²⁹⁷²
5 — лучший
1,895
6 064
9 936
10²⁹⁹¹
6
1,974
6 316
9 684
10²⁹¹⁵
7
2,081
6 658
9 342
10²⁸¹²
8
2,188
7 003
8 997
10²⁷⁰⁸
Таблица 7. Замер лаборатории от 23.08.2026. Столбец «сжатие» — во сколько раз сокращается число кандидатов относительно равномерного случая.
Лучший результат — 1,895 бит на знак при порядке 5. В пересчете на страницу это 6 064 бита вместо 16 000: знание языка и предметной области снимает 9 936 бит, то есть 62 % адреса, и сокращает число кандидатов в 10²⁹⁹¹ раз.
Рис. 3. Рисунок 3. Кросс-энтропия по порядку модели. Спуск от равномерных пяти бит, минимум на пятом порядке и разворот вверх — форма кривой обсуждается в следующей главе.
Для сопоставления: классические оценки энтропии печатного английского дают от 0,6 до 1,3 бита на знак по методу угадывания [3, 4], около 1,75 бита у моделей PPM середины девяностых [11] и порядка 1,75 бита в оценке по большому корпусу [5]. Наш результат лежит в том же диапазоне, что ожидаемо: алфавит и метод различаются, порядок величины — нет.
глава 21
Кривая разворачивается вверх
После пятого порядка модель знает больше, а предсказывает хуже
Модель порядка 8 располагает более длинным контекстом, чем модель порядка 5, и формально включает ее в себя. Тем не менее на отложенной части она работает хуже: 2,188 бита против 1,895. Разница в 0,293 бита на знак — это 938 бит адреса, потерянных при переходе к более мощной модели.
Причина в разреженности. Контекстов длины 8 в алфавите из 32 знаков может быть до 32⁸ ≈ 1,1 · 10¹²; в корпусе из 704 тысяч знаков встречается не более 704 тысяч различных, и почти каждый — по одному разу. Счетчик, построенный на одном наблюдении, не является статистикой: он описывает конкретное место корпуса, а не закономерность языка.
n_контекстов ≤ min(A^k, N_корпуса), плотность = N / A^k
где k — порядок модели, N — размер корпуса в знаках
(11)
При k = 5 плотность равна 704 142 / 32⁵ ≈ 0,021 — в среднем один пример на полсотни возможных контекстов. При k = 8 плотность падает до 6 · 10⁻⁷.глава 22
Проверка: оптимум движется вместе с корпусом
Сколько бит можно взять, определяется тем, сколько измерено
Если объяснение из главы 21 верно, положение минимума должно зависеть от объема обучения: на маленьком корпусе оптимальный порядок ниже, на большом выше. Проверяем прямо: обучаем те же модели на урезанных корпусах и меряем на одной и той же отложенной части в 40 000 знаков.
корпус, знаков
n=3
n=4
n=5
n=6
n=7
оптимум
20 000
3,040
3,136
3,281
3,387
3,459
n=3
50 000
2,905
2,946
3,110
3,251
3,350
n=3
150 000
2,571
2,448
2,565
2,726
2,860
n=4
350 000
2,422
2,212
2,274
2,424
2,567
n=4
704 142
2,215
1,920
1,896
1,975
2,080
n=5
Таблица 8. Кривая обучения, замер лаборатории от 23.08.2026. Значения в битах на знак; жирным в исходных данных отмечен минимум строки. Расхождение с таблицей 7 в третьем знаке объясняется меньшей отложенной частью.
Гипотеза подтверждается: оптимальный порядок сдвигается с третьего на пятый по мере роста корпуса в тридцать пять раз. При этом на последней строке значения для четвертого и пятого порядков практически сравнялись — 1,920 против 1,896, — то есть корпус только-только дорос до того, чтобы пятый порядок стал оправданным.
Рис. 4. Рисунок 4. Положение оптимального порядка в зависимости от объема корпуса. Каждая кривая — свой размер обучения; минимум смещается вправо монотонно.
Полученная зависимость — количественная форма утверждения из части IV. Биты нельзя взять из воздуха: доступное количество ограничено объемом того, что измерено и записано. Наращивание сложности модели поверх недостаточного корпуса не добавляет бит, а убавляет их, и замер показывает, на сколько именно.
Часть VI
Чего достичь нельзя и что достижимо
Вопрос, с которого работа началась, звучал так: если ответ есть на все, как получить ответ на все. Эта часть отвечает на него отрицательно и обосновывает отказ счетом, а не осторожностью. Дальше разбирается то, что достижимо на самом деле: биты, купленные один раз, переиспользуются неограниченно, и вся история познания читается как история удешевления адресации.
глава 23
Ответа на все не будет
Канал импорта конечен, требуемое количество бит — нет
Соберем счет. Каждый бит соответствия реальности поступает через измерение (часть IV). Измерение стоит времени, денег и доступа к объекту, то есть пропускная способность канала конечна. Число вопросов, на которые можно захотеть ответа, не ограничено ничем. Конечный поток против неограниченного спроса — этого достаточно, чтобы закрыть вопрос.
К общему счету добавляются три отдельных ограничения, каждое из которых самостоятельно исключает всеведение.
Невычислимость минимума
Длина кратчайшего описания невычислима (глава 07), поэтому даже для одной задачи нельзя узнать, достаточно ли купленных бит.
Недоступность будущего
Адрес страницы о еще не наступившем событии существует, но отличить ее от соседних можно только после наступления. До этого момента цена адреса бесконечна, и никакая модель этого не меняет.
Вопросы без истинностного значения
Часть запросов не имеет верного ответа в принципе — они некорректно поставлены. Пространство ответит и на них, потому что пустых полок не бывает.
глава 24
Биты переиспользуются
Один раз оплаченное измерение работает неограниченно долго — в этом вся экономика знания
Отрицательный ответ предыдущей главы не делает картину безнадежной, и причина в свойстве, которое легко упустить. Импортированные биты не расходуются при использовании. Один замер, будучи записанным, отвечает на неограниченное число будущих запросов.
Наиболее выгодная форма записи — та, что покрывает наибольшую область пространства наименьшим числом бит. Закон механики занимает несколько строк и заменяет неограниченное число измерений падающих тел. В терминах работы это предельный случай сжатия адреса: короткий указатель на огромную область.
Э = I_покрытое / |T|
где I_покрытое — биты, которые заменяет теория, |T| — длина ее записи в битах
(12)
Величина не вычисляется точно по тем же причинам, что и (6), но задает направление отбора: из двух описаний одних и тех же наблюдений полезнее короткое. Это же соображение стоит за принципом минимальной длины описания [16].
Отсюда рабочее определение, которым удобно пользоваться при разборе задач. Теория — это переиспользуемый указатель. Ее ценность измеряется не убедительностью, а отношением покрытой области к длине записи, и по этому признаку теории сравнимы между собой количественно.
глава 25
Познание как удешевление адресации
Единая шкала позволяет уложить разнородные достижения в одну кривую
Если знание измеряется в битах сокращения адреса, разнородные исторические события выстраиваются в один ряд. Письменность сделала биты переносимыми во времени. Печать снизила цену копирования до величины, при которой переиспользование стало массовым. Научный метод ввел механизм отсечения (глава 13) как обязательный этап. Каждый шаг снижал цену бита, не меняя природы самой величины.
Языковые модели в этом ряду занимают определенное место, и оно скромнее распространенных ожиданий. Они резко удешевили доступ к уже импортированным битам: то, что раньше требовало часов поиска, занимает секунды. Новых бит они не вносят по построению (глава 17). Это существенное удешевление одного из семи механизмов, а не появление восьмого.
что изменилось
какой механизм удешевился
новые биты
письменность
память — перенос во времени
нет
печать
память — цена копирования
нет
научный метод
отсечение — сделано обязательным
да
приборы и инструментальный замер
измерение — точность и охват
да
базы данных и поиск
память — цена доступа
нет
языковые модели
навигация — цена доступа к импортированному
нет
Таблица 9. Крупные сдвиги в цене бита. Столбец «новые биты» положителен ровно у тех двух строк, где произошло обращение к реальности.
Часть VII
Рабочие процедуры
Аппарат имеет смысл ровно настолько, насколько он меняет решения. Эта часть содержит три вещи, которыми лаборатория пользуется в работе: порядок разбора входящей задачи по механизмам, формулировки для протокола приемки вместо процентов и перечень систематических ошибок, которые такой счет допускает.
глава 26
Разбор входящей задачи
Четыре вопроса, которые определяют, взлетит проект или нет
Порядок ниже применяется до оценки трудоемкости. Он не заменяет техническое задание, а отвечает на предшествующий вопрос: покупаются ли нужные биты вообще и по какой цене.
Сколько бит стоит задача. Выбор одной позиции из справочника в 50 000 SKU — 15,6 бита; классификация на два класса — 1 бит; свободный текст на страницу — до 16 000. Величина считается по формуле (3) и задает масштаб всего дальнейшего.
Где эти биты лежат. В обучении модели, в справочниках заказчика, в его регламентах, в еще не проведенном замере. Ответ «в модели» проверяется прямо: если данные не публиковались, их там нет.
Каким механизмом они берутся. Семь строк таблицы 4. Обычно рабочая цепочка состоит из трех-четырех, и порядок в ней важен: сужение алфавита ставится первым, потому что удешевляет все последующие.
Чем закрывается остаток. Если после всех доступных механизмов остаются неоплаченные биты, система будет отдавать соседнюю страницу с той же уверенностью. Это допустимо ровно тогда, когда цена такой ошибки посчитана и принята.
класс задачи
чем закрывается
прогноз
общеизвестное
навигация по похожести
работает, но и не стоит денег
данные заказчика
память: интеграция с учетной системой
работает, основной класс наших проектов
оптимизация и планирование
перебор с проверкой, солвер
языковой моделью не решается принципиально
прогноз события
измерение после наступления
до срока цена адреса бесконечна
некорректный вопрос
не закрывается ничем
ответ будет получен и будет бессмысленным
Таблица 10. Классы входящих задач по доступным механизмам. Третья и четвертая строки — самые частые источники неудачных внедрений: задача берется, а механизм подбирается не тот.
глава 27
Что писать в приемку
Проценты в протоколе не проверяются; проверяются процедуры и границы
Из закона сохранения следует, какие требования в протоколе имеют смысл, а какие нет. Требование «модель не должна выдумывать» не проверяемо и не исполнимо: механизм навигации не имеет состояния отказа. Проверяемы требования к источникам бит и к внешним проверкам.
Источник бит указан
Для каждого класса запросов названо, откуда берется ответ: справочник, регламент, замер. Ответы без указанного источника выделяются в отдельный класс и обрабатываются отдельно.
Отказ реализован явно
Отказ — не свойство модели, а внешний механизм. В протоколе фиксируется условие отказа и его наблюдаемая доля, иначе система будет отвечать всегда.
Проверка отделена от генерации
Проверяющее звено не должно опираться на ту же меру, что и генерирующее: иначе оно подтверждает правдоподобие, а не верность.
Сложность обоснована объемом
Порядок модели, глубина сети или размер контекста подтверждаются замером на отложенной части. Часть V показывает, что превышение оправданной сложности ухудшает результат, и не проявляется на обучающей выборке.
Класс задачи назван
В протоколе указано, к какой строке таблицы 10 относится задача. Смена класса в ходе проекта — основание пересмотреть смету, а не искать лучшую модель.
глава 28
Как обмануть себя при таком счете
Перечень собран по собственным ошибкам, включая допущенные в этой работе
Аппарат бит удобен и потому опасен: он создает ощущение точности там, где величины оценены грубо. Перечень ниже — систематические ошибки, к которым такой счет располагает.
Считать биты по равномерному распределению. Позиции справочника выбираются не равновероятно: на десяток ходовых SKU приходится большая часть обращений, и реальная величина ниже 15,6 бита.
Складывать биты зависимых источников. Формула (3) аддитивна для независимых действий. Справочник и регламент, описывающие одно и то же, дают сумму меньше арифметической.
Мерить энтропию на обучающей выборке. Величина получится сколь угодно малой и не будет означать ничего. Отложенная часть обязательна, и отрезать ее нужно хвостом.
Переносить наш результат в 1,895 бита на чужой корпус. Величина измерена на технических текстах одной лаборатории; на другом материале она будет другой.
Считать сжатие достижением само по себе. Оставшиеся 6 064 бита — это 10¹⁸²⁵ кандидатов. Сжатие в 10²⁹⁹¹ раз звучит внушительно и до страницы не доводит.
Путать уверенность модели с вероятностью верности. Первая измеряется внутри пространства, вторая — снаружи. Связь между ними не гарантирована ничем.
Считать невозможное дорогим. Перебор (глава 02) не станет доступен при росте бюджета; прогноз до наступления события не купить деньгами.
Наращивать сложность модели вместо корпуса. Глава 22 показывает цену этой ошибки количественно: 938 бит адреса, потерянных при переходе с пятого порядка на восьмой.
приложение А
Глоссарий
Термины, которые в тексте используются без расшифровки.
Адрес
Полное описание положения страницы в пространстве всех страниц. В нашей реализации — 16 000 бит: 3194 знака имени шестигранника и 30 бит координат.
Бит отсечения
Единица сужения пространства поиска. Один бит вдвое сокращает множество кандидатов. Вся работа меряет знание в этих единицах.
Биекция
Взаимно однозначное соответствие. В библиотеке — между адресами и страницами: каждому адресу отвечает ровно одна страница и наоборот.
Кросс-энтропия
Средняя длина кода в битах на знак, которую дает модель на тексте, не участвовавшем в обучении. Мера того, насколько хорошо модель предсказывает.
Ложный каталог
Описание, синтаксически неотличимое от верного, но указывающее в неверное место. В языковых моделях известно как галлюцинация.
Порядок модели
Длина контекста, по которому модель предсказывает следующий знак. Модель порядка 5 смотрит на пять предыдущих знаков.
Разреженность
Состояние, при котором контекстов в модели больше, чем наблюдений в корпусе. Счетчики перестают быть статистикой, и качество на новых данных падает.
Сглаживание Виттена-Белла
Способ оценить вероятность события, ни разу не встреченного в обучении: вес отката к модели меньшего порядка задается числом уникальных продолжений контекста.
Сложность описания
Длина кратчайшей программы, порождающей объект (Колмогоров). Невычислима в общем случае, но задает нижнюю границу стоимости адреса.
Шестигранник
Единица навигации в нашей реализации: 1 073 741 824 страницы. К размеру библиотеки отношения не имеет — это размер комнаты, а не хранилища.
приложение Б
Литература
Только первоисточники, каждый открывается по DOI или на arXiv. Единственное исключение — материалы производителей железа, они помечены прямо в позиции: независимых замеров по этим системам в открытом доступе нет.
[1]Borges J. L. La biblioteca de Babel // El jardin de senderos que se bifurcan. Buenos Aires: Sur, 1941.
[5]Brown P. F. et al. An Estimate of an Upper Bound for the Entropy of English // Computational Linguistics, 1992, vol. 18, no. 1, pp. 31–40.
[6]Kolmogorov A. N. Three Approaches to the Quantitative Definition of Information // Problems of Information Transmission, 1965, vol. 1, no. 1, pp. 1–7.
Измеренного в работе ровно две вещи, обе в части V и обе воспроизводимы скриптами из scripts/babel-entropy: кросс-энтропия символьных n-грамм на собственном корпусе в 782 380 знаков и зависимость оптимального порядка модели от объема обучения. Сравнения с нейросетевыми языковыми моделями на том же корпусе лаборатория не проводила, поэтому утверждать, что 1,895 бита на знак близки к пределу сжимаемости русского технического текста, нельзя: это предел для символьных n-грамм на нашем объеме данных, и не более. Величина измерена на текстах одной лаборатории по одной предметной области — переносить ее на художественную прозу, разговорную речь или чужой технический корпус нет оснований. Все оценки бит в главах 05 и 26 являются расчетами по формуле (3) при допущении равновероятности исходов; реальные распределения неравномерны, и фактические величины ниже расчетных. Классификация семи механизмов — наша систематизация: она полна в том смысле, что других механизмов лаборатория назвать не смогла, но это не доказательство полноты. Экономических выкладок работа не содержит вовсе: перевод бит в рубли — предмет смежной монографии о стоимости ошибки.
журнал
Что происходило по направлению
23.08.2026
Направление открыто. Собран корпус из 782 380 знаков собственных технических текстов, построены символьные n-граммы порядков 0–8 со сглаживанием Виттена-Белла, измерена кросс-энтропия на отложенном хвосте. Зафиксирован основной результат: знание языка и предметной области снимает 9 936 бит из 16 000, оставляя 10 в степени 1825 кандидатов.
23.08.2026
Обнаружен разворот кривой энтропии после пятого порядка: модель восьмого порядка формально мощнее и работает хуже на 0,293 бита на знак. Выдвинута гипотеза о разреженности и проверена прямым замером — оптимальный порядок монотонно движется с объемом корпуса, с третьего на пятый при росте обучения в тридцать пять раз. Гипотеза подтверждена, результат вошел в главу 22.
23.08.2026
Собран рабочий стенд /babel: адресация страницы в 3200 знаков с полной биекцией и расчетом в браузере читателя. Стенд подтверждает нижнюю границу из формулы (2) не рассуждением, а проверкой обратимости, которую читатель запускает у себя.