«Никаких облаков» произносится на первой встрече и закрывает половину архитектурных вариантов раньше, чем названа задача. Дальше выясняется одно из двух. Либо за фразой стоит пункт документа с номером, датой и подписью. Либо привычка, доставшаяся от прошлого ИТ-директора, — при том что корпоративная почта компании давно живет на чужих серверах, а отчетность уходит наружу через оператора.
Спорить на встрече тут бесполезно, проверяется это за один рабочий день. А разница между двумя случаями измеряется в стойках, картах и людях, которые все это обслуживают. Ниже — как провести проверку, какие задачи учетной системы реально уходят локальной модели, что она стоит в железе, где проигрывает облачной и где ломается обезличивание.
Три причины держать модель у себя
Причин, которые выдерживают проверку, ровно три. Все остальное сводится к ним или остается разговором. У каждой есть признак подлинности и признак ритуала.
| Причина | Настоящая, когда | Ритуал, когда | Чем проверяется за день |
|---|---|---|---|
| Персональные данные | В промпт попадают паспорта, кадровые сканы, ФИО с адресами и телефонами | В задаче нет ни одного ПД: номенклатура, артикулы, суммы, ИНН юрлиц | Выгрузить десять реальных промптов в файл и прочитать их глазами |
| Коммерческая тайна | Введен режим: перечень сведений, учет доступа, гриф на носителях, ознакомление работников | Режима нет, «у нас все секретно» звучит от человека без полномочий | Попросить перечень сведений, составляющих КТ, и найти в нем свои данные |
| Требование регулятора или головной компании | Есть документ: пункт, дата, кто утвердил, на кого распространяется | Есть устная ссылка на политику, которую никто не видел целиком | Запросить пункт и прочитать формулировку без пересказов |
Персональные данные: где запрет настоящий
152-ФЗ требует, чтобы запись, систематизация, накопление и хранение персональных данных граждан России шли в базах на территории страны. Требование говорит про территорию и про бумаги между оператором и обработчиком; класс технологии в нем не упоминается. Российское облако с центром обработки данных в России и подписанным поручением на обработку формально это требование закрывает.
Жестким запрет становится в двух ситуациях. Первая: сегмент с персональными данными аттестован, и любое новое ПО или новый канал наружу — это изменение состава, которое согласуется с тем, кто аттестовал. Провести модель внутрь периметра тут дешевле, чем обосновывать новый исходящий поток. Вторая: трансграничная передача, когда провайдер или его инфраструктура находятся за пределами России.
В 1С-контуре персональные данные концентрируются в предсказуемых местах: ЗУП целиком, сканы паспортов и СНИЛС для кадровых документов и авансовых отчетов, физлица-контрагенты в УНФ, зарплатные ведомости. Для задач вокруг этих данных вопрос закрыт архитектурно.
А теперь ритуальная часть. Типовая задача первички — это наименование позиции, артикул, количество, цена, ставка НДС и ИНН юридического лица. ИНН организации есть в открытых государственных реестрах. Персональных данных в таком промпте нет вообще, и запрет по 152-ФЗ к этой задаче отношения не имеет. Проверка из правой колонки таблицы занимает полчаса. Нет в промптах ФИО, адреса, телефона и документа, удостоверяющего личность, — переходите к следующей причине.
Коммерческая тайна: режим либо есть, либо его нет
Юридически коммерческая тайна существует, когда сделаны четыре вещи: утвержден перечень сведений, ограничен доступ с учетом того, кто его получил, нанесен гриф на материальные носители, работники ознакомлены под подпись. Без этого набора юридически защищать нечего.
Настоящий случай выглядит конкретно: договоры с особыми условиями и индивидуальными скидками, калькуляции себестоимости, конструкторская документация, база поставщиков с закупочными ценами. Структура закупочных цен, утекшая на рынок, считается деньгами напрямую.
Ритуальный случай выглядит так же конкретно: тот же самый договор за последний месяц прошел через мессенджер менеджера, полежал на публичном файловом диске и уехал контрагенту почтой без шифрования. Запрет на один канал при пяти открытых закрывает отчетность перед руководством, но риск оставляет на месте. Инженерный тест: возьмите три документа из перечня КТ и проследите их путь за прошлый месяц — через чьи серверы они прошли. Локальная модель имеет смысл, когда она закрывает последнюю дыру в списке, а не первую из шести.
Отдельная тема — фрагменты договоров, которые сотрудники сами вставляют в чужие чаты со своих рабочих машин. Модель в вашем контуре этот канал не закрывает: он идет мимо нее. Как ловить такое на периметре, разобрано в статье про DLP для LLM-трафика.
Требование сверху: читаем бумагу целиком
Требование существует, если у него есть номер, дата и автор. Реальные источники в порядке частоты: политика информационной безопасности группы компаний, статус объекта критической информационной инфраструктуры, отраслевые требования, замечания аудитора, договорные обязательства перед крупным заказчиком. Последнее встречается чаще, чем ожидают: формулировка «данные заказчика не покидают периметр исполнителя» живет в приложении к рамочному договору, и про нее вспоминают на третьей встрече.
Читать формулировку целиком важно: она почти никогда не звучит как «нельзя использовать языковые модели». Обычно это либо список конкретных запрещенных сервисов, либо требование хранения на территории России, либо запрет на передачу данных третьим лицам без согласования. Свой сервер закрывает такие требования с запасом. Российское облако с нужными бумагами закрывает часть из них — и это иногда быстрее и дешевле. Полная матрица критериев собрана в разборе облако или on-prem для корпоративного ИИ, здесь идем дальше по 1С-специфике.
Периметр проверяется целиком
Перед закупкой карты стоит выписать на одном листе, что у компании уже снаружи. Список среднего бизнеса собирается за полчаса и обычно удивляет самого автора запрета: почта на публичном сервисе, база 1С в аренде у хостера, ЭДО через оператора, отчетность через оператора, зарплатный проект в банке, рабочие чаты в мессенджере.
Вывод отсюда не «раз все течет, можно лить дальше». Требования формулируются по классам данных, а не по классам технологий. Кадровые сканы нельзя наружу нигде, включая мессенджер. Наименования номенклатуры можно почти везде. Как только запрет переписан в такой форме, решение становится инженерным и считается.
Техническое следствие: если сама база 1С работает в арендованном облаке, «локальная модель» означает виртуальную машину у того же хостера. Компромисс законный, но контуром компании это называть некорректно: данные лежат там же, где лежали.
Какие задачи 1С-контура отдают локальной модели
Локальная модель класса 7–8 миллиардов параметров закрывает больше задач учетной системы, чем принято думать: почти все они короткие — короткий вход, короткий выход, проверяемый результат.
| Задача | Что делает модель | Класс модели | Локально обязательно? |
|---|---|---|---|
| Классификация входящего документа в Документообороте: вид, маршрут, ответственный | Выбор из конечного списка по тексту | 7–8 млрд | Редко, данных категории ПД в тексте обычно нет |
| Статья затрат и статья ДДС по счету или акту | Классификация по справочнику | 7–8 млрд | Редко |
| Извлечение полей из скана паспорта, СНИЛС, кадрового приказа | Извлечение по схеме поверх OCR | 7–8 млрд плюс движок OCR | Всегда: это персональные данные |
| Ответ по учетной политике и внутреннему регламенту со ссылкой на пункт | Поиск фрагментов плюс ответ строго по ним | 7–8 млрд, на сложных регламентах 14 млрд | Часто: регламенты входят в перечень КТ |
| Сопоставление номенклатуры поставщика со своим справочником | Векторное представление и переранжирование | Модель эмбеддингов, LLM не обязательна | Редко |
| Пересказ истории переписки и документов по договору в карточку контрагента | Суммаризация длинного контекста | 14–32 млрд | Часто: условия договоров |
| Расшифровка звонка или приемки с привязкой к документу | Распознавание речи плюс извлечение полей | 1,5 млрд на речь плюс 7–8 млрд на разбор | Часто: запись голоса и содержание переговоров |
| Генерация запроса на встроенном языке под отчет | Кодогенерация | 32 млрд и выше | Редко, но малые модели тут слабы |
Подключается это во всех случаях одинаково: модель живет отдельным сервисом, конфигурация остается нетронутой, обмен идет через OData, HTTP-сервис в расширении или внешнюю обработку, документ создается черновиком. Сама схема обмена и нагрузка на учетную систему разобраны в материале про встраивание модели в 1С и ERP. Локальная специфика одна: карта общая на всех, поэтому синхронный вызов из регламентного задания заменяется очередью с таймаутом. Порядок работ и сроки — на странице ИИ в 1С: первый процесс от 250 000 ₽, три-пять недель до пилота.
Распознавание речи локально: где это уместно в 1С
Распознавание речи в 1С-контуре обычно нужно в трех местах: диктовка при приемке и инвентаризации в мобильном рабочем месте, расшифровка звонков менеджеров с привязкой к контрагенту, протокол планерки с превращением поручений в задачи Документооборота.
Считать здесь легче, чем с языковыми моделями. Открытая модель распознавания речи на 1,5 миллиарда параметров в половинной точности занимает около 3 ГБ весов: 1,5 млрд × 2 байта. Она помещается на ту же карту рядом с языковой моделью и в большинстве сценариев работает пакетно — звонки за день обрабатываются ночью, реальное время не требуется. Держат такое у себя охотно: технически дешево, а содержание переговоров наружу отдавать никто не хочет.
Грабли ровно там, где ждали. Русская номенклатура и артикулы на слух разваливаются: «Отвод 90-57х3,5 ст20» приезжает в текст как «отвод девяносто пятьдесят семь на три и пять эс тэ двадцать». Отраслевой жаргон, шум склада, два говорящих в одном канале, обрывы связи в мобильном приложении. Лечится это не сменой модели: словарь подсказок из вашего же справочника, постобработка через сопоставление с номенклатурой, порог уверенности и очередь спорных фрагментов человеку.
Метрику берите прикладную: доля правильно распознанных артикулов, количеств и сумм на двадцати ваших записях. Общая точность по словам тут мало о чем говорит — служебные слова распознаются прекрасно, а ломается ровно то, ради чего затевалось. И замерьте отношение времени обработки к длительности записи на своем железе: если оно больше единицы, интерактивная диктовка отпадает, и остается фоновый режим.
Что это стоит в железе
Разговор про железо обычно уходит в спор о конкретных картах, хотя считается он на салфетке: параметры умножаем на число байт на параметр. В четырехбитной квантизации это 0,5 байта, значит модель на 8 миллиардов параметров — примерно 4 ГБ весов, 14 миллиардов — 7 ГБ, 32 миллиарда — 16 ГБ, 70 миллиардов — 35 ГБ. Сверх весов карта держит KV-кэш, который растет с длиной контекста и числом одновременных сессий, плюс резерв на активации и фрагментацию памяти.
| Класс модели | Веса в 4 битах | Порядок по видеопамяти | Что закрывает |
|---|---|---|---|
| 7–8 млрд | около 4 ГБ | 8–12 ГБ | Классификация, извлечение полей, короткие ответы по регламенту, одна-три параллельные сессии |
| 14–32 млрд | 7–16 ГБ | 24–48 ГБ | Суммаризация, ответы с рассуждением, более длинный контекст |
| 70 млрд и выше | от 35 ГБ | Две карты и больше | Сложные задачи близко к облачному качеству, ценой шардирования и обслуживания |
Это ориентиры порядка; точная конфигурация считается под длину контекста, число одновременных пользователей и допустимую задержку. Полный расчет с KV-кэшем и неочевидным выводом о том, почему более дорогая карта не всегда дает больше шагов диалога, разобран в материале про потолки локального агента.
Три вещи, которые ломают расчет чаще остальных.
- Параллельные сессии. Демо на одном пользователе ничего не говорит о профиле нагрузки, когда двадцать бухгалтеров закрывают день одновременно. Память считается по пиковому часу, а раздает ее инференс-сервер с непрерывным батчингом и вытеснением — это отдельный выбор, который делают до закупки карты.
- Соседство с 1С. Инференс на той же машине, где живет сервер 1С или СУБД, дает взаимную деградацию: закрытие месяца и очередь документов в модель сходятся в один вечер. Отдельный узел дешевле разбирательств.
- Русский текст в контексте. На кириллице токенов на тот же объем выходит больше, чем на английском. Прогоните свой типовой промпт через токенизатор выбранной модели до планирования памяти.
На процессоре все это тоже работает. Веса те же, оперативная память дешевле видеопамяти, узкое место — пропускная способность памяти, поэтому генерация идет медленно. Профили, где такая задержка приемлема: ночная пакетная обработка очереди документов, разбор звонков за сутки, классификация накопившихся обращений. Интерактивный помощник в форме документа на процессоре ощущается плохо, и лучше это выяснить до обещаний пользователям. Если модель нужна прямо на объекте — на складе, в цеху, на посту — это отдельная дисциплина со своими ограничениями по питанию, температуре и обслуживанию: edge-AI.
Что теряем в качестве
Разница между локальной моделью среднего класса и большой облачной есть всегда. Вопрос в том, попадает ли она в вашу задачу.
Разницы почти не видно там, где вход короткий, выход короткий и правильность проверяется программно: классификация по конечному списку, извлечение полей из документа известного типа, короткий ответ по поданному фрагменту регламента, нормализация формулировок, черновик комментария к документу. Это как раз основная масса задач учетного контура.
Разница видна сразу на многошаговых рассуждениях с ветвлением, на длинном контексте в сотни страниц или в переписке за год, на редких языках и смешанном тексте (китайские наименования в спецификациях, латиница вперемешку с кириллицей и артикулами), на генерации кода и на задачах, где нужна эрудиция за пределами поданных документов.
Спор тут решается выборкой. Соберите 100–200 реальных примеров своей задачи с эталонными ответами, прогоните оба варианта, посчитайте долю совпадений по своей метрике. Дальше это разговор про число. Если разрыв терпимый по смыслу, но обидный по величине, дообучение под свой домен часто выходит дешевле перехода на модель на порядок крупнее — арифметика в разборе когда LoRA дешевле гигантской модели.
Поправка из практики: на извлечении и классификации качество чаще упирается в подготовку контекста и формат ответа, чем в размер модели. Модель, которой подали нужный кусок регламента и жесткую схему полей, работает предсказуемо. Ей же, отправленной искать ответ в трехстах страницах без поиска, не поможет никакой размер.
Гибрид и граница обезличивания
Рабочая гибридная схема выглядит как маршрутизатор по классу данных. Запросы, где присутствуют персональные данные или сведения из перечня КТ, идут на локальную модель. Остальное может уходить наружу, если задача действительно выигрывает от большой модели. Технически перед отправкой сущности заменяются плейсхолдерами вида [КОНТРАГЕНТ_1], [ФИО_2], [СЧЕТ_3], карта соответствия остается на вашей стороне, ответ подставляется обратно.
Граница проходит не по наличию ФИО в тексте. Вот где обезличивание ломается.
- Уникальность важнее имени. Строка «поставка турбины мощностью такой-то для агрегата такой-то серии, декабрь» опознает и поставщика, и проект без единого имени в тексте.
- Совокупность полей. Сумма, дата и отрасль на узком рынке однозначно указывают на конкретную сделку.
- Числа маскировать обычно нельзя. Задача чаще всего именно про них: сверить, посчитать, сравнить.
- Текст договора не обезличивается. Особые условия сами по себе и есть предмет тайны, ФИО там вторичны.
- Свободный комментарий пользователя обходит любую маскировку. Человек напишет фамилию и телефон в поле «примечание», и никакая схема этого не предугадает.
Отсюда практическое правило: обезличивание работает на задачах, где смысл сохраняется после удаления идентификаторов, и не работает там, где ценность именно в идентификаторах. И маскирование само по себе — еще один компонент, который ошибается и требует отдельных тестов. Гибрид оправдан, когда доля чувствительных запросов невелика, а на остальных задачах большая модель дает измеримый выигрыш. Если чувствительных запросов большинство, гибрид добавляет сложность и почти ничего не экономит.
Когда локальная модель не нужна
Пять ситуаций, в которых честный ответ — «не надо».
- Запрет держится на словах. Пункта нет, перечня КТ нет, персональных данных в задаче нет. Сначала бумага, потом закупка.
- Некому дежурить. Локальная модель — это круглосуточный сервис: мониторинг, обновления, дежурство при отказе карты. Если админ один и он же чинит принтеры, сервис ляжет в первый же отпуск.
- Задача требует качества топовой модели. Сложные рассуждения, длинный контекст, кодогенерация. Малая локальная модель выдаст правдоподобный мусор, а виноват окажется «ИИ» в целом.
- Задача решается без модели. Если классификация закрывается справочником и десятком правил, языковая модель добавит стоимость и точку отказа без выигрыша.
- Через квартал переезд в облачный сервис 1С. Контур все равно станет чужим, и локальный узел придется переносить или списывать.
Чек-лист выбора
Восемь пунктов, которые занимают один-два дня и снимают месяц споров.
- Выпишите конкретную задачу и выгрузите десять реальных промптов. Прочитайте их глазами: какие классы данных там на самом деле есть.
- Найдите бумагу: пункт, дату, автора, область применения. Прочитайте формулировку целиком.
- Составьте карту периметра: где сейчас почта, база, ЭДО, чаты, отчетность. Отметьте, какие из этих каналов уже несут те же данные.
- Соберите 100–200 примеров задачи с эталонными ответами. Без этого сравнивать нечего.
- Прогоните локальную модель класса 7–8 миллиардов и облачную на одной и той же выборке. Сравните долю совпадений и решите, терпим ли разрыв.
- Посчитайте память: веса плюс KV-кэш, умноженный на число одновременных сессий в пиковый час, плюс резерв.
- Замерьте задержку на своем железе отдельно для интерактивных сценариев и для фоновых. Решите, что из этого вообще нужно в реальном времени.
- Назначьте ответственного за сервис и заложите обновление модели с фиксацией версии: без версионирования ответы «поплывут» после первого же апдейта.
Что дальше
Если по итогам чек-листа локальный контур подтвердился, порядок работ, сроки и состав поставки — на странице локальные LLM и RAG в контуре компании: пилот от 700 000 ₽, четыре-шесть недель. Разумный первый шаг — одна задача из таблицы выше на своем железе с замером по своей выборке. Он же дает честный ответ на вопрос, нужна ли вам вообще большая модель, или все закрывается восемью миллиардами параметров на одной карте.