Половина enterprise RAG-систем в стране прямо сейчас галлюцинирует исключительно потому, что вы кормите LLM мусором, который притащил древний sbert_large_nlu_ru. Если генеративная сеть выдумывает факты, проблема не в температуре и не в промпте. Проблема в том, что правильного ответа физически нет в топ-5 поисковой выдачи. Дырявый поиск ломает пайплайн еще до того, как в дело вступает генерация. И здесь начинается гонка за качеством: лучшая эмбеддинг-модель для русского в 2026 году обязана тянуть доменную специфику on-prem, так как облачные API типа OpenAI недоступны или лежат вне контура 152-ФЗ.
Де-факто стандартом корпоративного поиска долгое время оставался sbert. Его главная и фатальная беда — архитектура, заточенная на симметричные задачи STS (Semantic Textual Similarity). Он отлично ищет перефразированные предложения. Но retrieval — это жесткая асимметрия: пользователь пишет кривой вопрос из трех слов, а правильный ответ — тяжелый регламент на пять страниц. Симметричная сеть пытается найти кусок текста, структурно похожий на вопрос, игнорируя фактологию. В итоге база отдает FAQ-пустышки. Эту структурную слабость невозможно закрыть реранкером. Модель пора списывать.
Ищем замену: ruMTEB, боевые тесты и VRAM
Лидерборд ruMTEB прекрасен как витрина, но абсолютно бесполезен, если вы смотрите на агрегированный балл. Инженера интересует строго изолированная вкладка Retrieval. На арене сейчас бьются несколько классов моделей.
| Модель | Профиль задачи | Качество (Retrieval) | Оценка железа / RAM |
|---|---|---|---|
| sbert_large_nlu_ru | Симметричные парафразы | Провал на асимметрии | Дешевый инференс, вектор 1024 |
| multilingual-e5-base | Короткие чанки | Стабильный baseline | Копейки по VRAM, вектор 768 |
| multilingual-e5-large | Универсальный поиск | Выше среднего | Легкий деплой, вектор 1024 |
| BGE-M3 | Длинные документы | Топ на мультилингве | Тяжелая база, вектор 1024 |
| GigaEmbeddings-3B | Глубокая семантика РФ | Отличный скор | Высокие требования к GPU |
| Qwen3-Embedding | Мультиязычный RAG | SOTA метрики | Сложная оптимизация памяти |
| E5-Mistral-7B | Тяжелая аналитика | Идеальный матчинг | От 24GB VRAM, долгий ответ |
| text-embedding-3-large | Эталон вне 152-ФЗ | Референс | Только облако, бан on-prem |
Когда мы в Morana Labs переводили поиск технической документации металлургического холдинга с устаревшего sbert на пайплайн с e5-large, боевая метрика Recall@5 взлетела с 61% до 89% на сложных индустриальных терминах без единого файнтюна. Это разница между мертвым алгоритмом и правильным инструментом. Но корреляция абстрактного бенчмарка с вашей локальной метрикой nDCG редко превышает 0.6. Пока вы не прогоните замер на своих данных, вы тычете пальцем в небо. Сбор собственного golden set занимает сутки, если не заниматься ручной разметкой:
- Выгружаете тысячу сырых фрагментов из рабочей базы логов.
- Отдаете массив тяжелой on-prem LLM с промптом сгенерировать 3-5 сложных пользовательских вопросов к каждому чанку.
- Отсеиваете галлюцинации и оставляете только те пары, где ответ однозначно лежит в тексте.
Гибридная архитектура и миграция индексов
Переход на плотные векторы (dense) — лишь половина работы. Любая нейросеть начинает впадать в кому, когда пользователь ищет точный артикул детали вида АВ-773/12-бис. Векторные эмбеддеры сжимают символы в семантическое облако, теряя жесткую буквенную привязку. Здесь выдачу спасает только лексический алгоритм BM25. Гибрид лексического и векторного поиска, сшитый через алгоритм ранжирования RRF (Reciprocal Rank Fusion), закрывает 99% проблем: нейросеть понимает смысл, а BM25 цепляется за ГОСТы и специфичные аббревиатуры.
Размер нового вектора напрямую бьет по RAM. Переход с 768 на 4096 размерность сожрет в пять раз больше оперативной памяти под графовые индексы HNSW. Индексация 10 миллионов документов новой 3-миллиардной моделью на одной видеокарте займет несколько суток. Проводить такую замену на живом RAG без даунтайма можно исключительно через паттерн Shadow-индекса. В векторной СУБД поднимается параллельная коллекция. Настраивается двойная запись для входящих документов. Старая база фоном прогоняется через новую модель. При этом весь клиентский трафик обрабатывает старый роутер со sbert. Как только новая коллекция догоняет оригинал по числу записей — роутинг переключается. Старый кластер удаляется, а пользователи получают двукратный прирост релевантности мгновенно и без 503 ошибок.