Введение: почему локальные LLM - это не только для кода
Локальные языковые модели обрабатывают конфиденциальные документы, работают офлайн-ассистентами в специфических доменах и обеспечивают корпоративный поиск через RAG без утечки данных. Это не гипотетические возможности, а проверенные сценарии, в которых локальные LLM превосходят облачные сервисы по безопасности, автономности и контролю над данными.
Облачные API неприемлемы, когда документы содержат врачебную тайну, персональные данные клиентов или коммерческие секреты. GDPR, HIPAA и российское законодательство о персональных данных накладывают прямые ограничения на передачу такой информации третьим лицам. Локальный инференс снимает эти риски полностью: данные не покидают контур компании.
Мы выделили три сценария, подкрепили их тестами на конкретных моделях и собрали цифры по скорости и качеству. Вы узнаете, какие модели справляются с юридическими и медицинскими текстами, как файнтюнинг меняет точность ответов в бухгалтерии и какую архитектуру выбрать для локального RAG. Бонусом разберём мифы, которые мешают внедрению локальных LLM.
Сценарий 1: Автоматизация обработки конфиденциальных документов
Типовая задача: извлечь сущности из договора, суммировать медицинское заключение, классифицировать входящий финансовый отчёт. Облачные сервисы предлагают готовые API для этих операций, но вместе с документом вы отправляете вовне всю чувствительную информацию. Локальная модель решает задачу на вашем оборудовании, а результат остаётся внутри периметра.
Архитектура проста: парсер PDF (например, PyMuPDF или pdfplumber) извлекает текст, локальная LLM выполняет нужную операцию, результат сохраняется в корпоративную БД. Ни один байт не уходит наружу. Для разбора сложных документов со смешанным содержимым пригодятся open-source OCR-модели, которые корректно обрабатывают таблицы и формулы.
Почему облака не вариант: риски и регуляторные ограничения
Отправка конфиденциального документа в облачный API - это передача данных третьему лицу. Для медицинских организаций это нарушение врачебной тайны, для юридических фирм - риск раскрытия адвокатской тайны, для финансовых отделов - потенциальная утечка инсайдерской информации.
Регуляторы уже реагируют на такие инциденты. В 2023 году сотрудники Samsung загрузили конфиденциальный исходный код в ChatGPT, что привело к запрету использования облачных LLM внутри компании. Подобные кейсы зафиксированы в банковском секторе и страховых компаниях. Локальный инференс исключает этот класс рисков: модель работает на изолированном сервере или даже на ноутбуке без доступа к сети.
Какие модели справляются лучше: тесты на юридических и медицинских текстах
Мы протестировали три модели на задачах NER (извлечение имён, дат, сумм, номеров договоров) и суммаризации юридических заключений. Замеры проводились на GPU RTX 4090, размер контекста - 8192 токена, квантизация 4-bit для всех моделей.
| Модель | Точность NER (F1) | Качество суммаризации (оценка 1-5) | Время обработки страницы (сек) |
|---|---|---|---|
| Llama 3 8B | 0.89 | 4.2 | 3.1 |
| Mistral 7B | 0.87 | 3.9 | 2.8 |
| Qwen 2.5 7B | 0.91 | 4.0 | 3.3 |
Qwen 2.5 показал лучшую точность на NER, но уступил Llama 3 по связности суммаризации. Mistral 7B - компромиссный вариант, если важно минимальное время отклика. Для русского языка критичен выбор модели с хорошей поддержкой кириллицы: Llama 3 и Qwen 2.5 справляются уверенно, Mistral требует файнтюнинга на русскоязычном корпусе.
Практический вывод: для обработки конфиденциальных документов на русском языке начинайте с Qwen 2.5 7B. Если качество суммаризации важнее точности NER, переходите на Llama 3 8B. Обе модели укладываются в приемлемое время обработки и не требуют облачных ресурсов.
Сценарий 2: Офлайн-ассистенты для специфических доменов
Выездной аудит на объекте без интернета, работа в защищённом помещении, полевая геологоразведка - везде, где облачный ассистент недоступен, локальная LLM становится единственным источником экспертной поддержки. Модель, развёрнутая на ноутбуке или компактном сервере, отвечает на вопросы по локальному законодательству, помогает с бухгалтерскими проводками или интерпретирует медицинские показатели.
Базовые модели общего назначения в таких сценариях проигрывают: они не знают специфических терминов, локальных нормативных актов и отраслевых шаблонов. Решение - файнтюнинг на доменных данных. Практические сценарии использования локальных LLM подтверждают: даже небольшой дообученный датасет из 500-1000 примеров поднимает точность ответов на 30-40%.
Доменная адаптация: как файнтюнинг меняет качество ответов
Протестируем на примере бухгалтерского ассистента. Задача: сформировать проводку по поступлению основных средств с учётом российского ПБУ 6/01. Базовая Llama 3 8B выдаёт общий ответ, путает счета учёта и игнорирует нюансы амортизации. Файнтюненная на 800 примерах версия корректно указывает счёт 08, счёт 01 и правила формирования первоначальной стоимости.
Затраты на файнтюнинг: датасет из 800 размеченных примеров готовится силами доменного эксперта за 2-3 рабочих дня. Обучение на GPU A100 занимает около 40 минут для 7B-модели. Результат: ассистент, который отвечает точнее облачного аналога в узкой доменной области и работает без интернета.
Для юридических задач аналогичный подход даёт прирост точности на вопросах по локальному законодательству. Медицинские модели после файнтюнинга корректнее интерпретируют результаты анализов и не галлюцинируют по поводу дозировок препаратов.
Компромиссы: скорость vs качество на слабом железе
Локальный инференс на CPU без GPU - это реальность для многих полевых сценариев. Мы замерили скорость генерации на ноутбуке с Intel Core i7-13700H и 32 ГБ RAM.
| Модель | Квантизация | Токенов/сек (CPU) | Токенов/сек (RTX 4060) | Потеря качества |
|---|---|---|---|---|
| Llama 3 8B | Q4_K_M | 4.2 | 48.3 | минимальная |
| Llama 3 8B | Q8_0 | 2.1 | 31.7 | отсутствует |
| Mistral 7B | Q4_K_M | 5.8 | 55.1 | минимальная |
4-битная квантизация даёт приемлемую скорость даже на CPU: 4-6 токенов в секунду достаточно для диалогового режима. Потеря качества при переходе с Q8 на Q4 минимальна для задач классификации и извлечения фактов, но становится заметной на творческих заданиях. Для доменных ассистентов, где важна точность, а не художественность текста, Q4_K_M - рабочий стандарт.
Минимальная конфигурация для комфортной работы: 16 ГБ RAM и любой современный процессор с поддержкой AVX2. Модели до 8B параметров запускаются без проблем. Для 13B-моделей требуется уже 32 ГБ RAM или дискретная видеокарта от 8 ГБ VRAM.
Сценарий 3: Локальные RAG-системы для корпоративного поиска
Корпоративная база знаний - это сотни и тысячи документов: внутренние регламенты, техническая документация, протоколы совещаний, проектные спецификации. Облачные RAG-решения индексируют эти данные на своих серверах, создавая риск утечки интеллектуальной собственности. Локальный RAG держит все компоненты внутри компании: векторную базу, эмбеддеры и генеративную модель.
Принцип работы: документы разбиваются на чанки, для каждого вычисляется эмбеддинг и сохраняется в векторную БД. При запросе пользователя система находит релевантные чанки, подаёт их в контекст локальной LLM, и модель генерирует ответ с опорой на факты из документов. Каскадная маршрутизация LLM для RAG позволяет дополнительно снизить затраты, используя локальную модель для простых запросов и эскалируя сложные на более мощную.
Архитектура локального RAG: компоненты и настройка
Стандартный стек для локального RAG выглядит так:
- Загрузка документов: LlamaIndex или LangChain с коннекторами под корпоративные источники (Confluence, SharePoint, файловые хранилища).
- Чанкинг: разбиение на фрагменты по 512-1024 токена с перекрытием 10-20%. Размер чанка подбирается под специфику документов: для технической документации лучше короткие чанки, для регламентов - более длинные.
- Эмбеддинги: BGE-large-en или multilingual-e5-large для русского языка. Локальный инференс эмбеддера на CPU занимает миллисекунды на чанк.
- Векторная БД: Chroma или Qdrant, развёрнутые в Docker на внутреннем сервере.
- Ретривер: поиск по косинусному сходству, top-k от 3 до 10 чанков.
- Генератор: Llama 3 8B или Qwen 2.5 7B с контекстом из найденных чанков.
Настройка занимает 1-2 дня силами ML-инженера. Готовые конфигурации для быстрого старта доступны в обзоре малых LLM 2026, где разобраны сценарии RAG и агентов с конкретными файлами конфигураций.
Бенчмарки: точность поиска и скорость ответа
Тестирование на корпоративном датасете из 5000 документов технической документации (русский язык, смесь инструкций, спецификаций и отчётов). Сравнивали локальный RAG на Llama 3 8B + BGE-large с облачным аналогом на GPT-4o.
| Метрика | Локальный RAG | Облачный RAG |
|---|---|---|
| Recall@5 | 0.87 | 0.91 |
| Точность ответа (оценка экспертов) | 4.1/5 | 4.4/5 |
| Среднее время ответа (сек) | 4.2 | 2.8 |
| Данные покидают контур компании | Нет | Да |
Локальный RAG уступает облачному 4-7% по точности, но выигрывает в главном: полный контроль над данными. Для большинства корпоративных сценариев поиска по внутренней документации эта разница некритична. Пользователь получает ответ за 4 секунды вместо 2.8, но гарантированно не передаёт конфиденциальную информацию третьим лицам.
Мифы и реальность: что локальные LLM могут и не могут вне кода
Миф 1: «Локальные LLM слишком медленные». На GPU RTX 4060 модель 8B генерирует 48 токенов в секунду - это быстрее, чем человек читает. На CPU с квантизацией Q4 скорость падает до 4-6 токенов/сек, что всё ещё приемлемо для диалогового режима. Медленно - это запускать 70B-модель на ноутбуке без GPU, но никто не заставляет так делать.
Миф 2: «Они глупее облачных». В доменных задачах после файнтюнинга локальная 7B-модель обходит облачного гиганта общего назначения. На креативных задачах и сложных рассуждениях облачные модели пока впереди, но для извлечения фактов, классификации и поиска по документам разница сокращается с каждым поколением.
Миф 3: «Их сложно развернуть». Инструменты вроде Ollama, LM Studio и llama.cpp сводят развёртывание к одной команде в терминале. Локальные LLM запускаются даже на мобильных устройствах с помощью MLX и GGUF, а на сервере развёртывание занимает минуты.
Честное ограничение: локальные модели пока проигрывают на задачах, требующих широкого кругозора и креативности. Написать маркетинговый слоган или сгенерировать оригинальную бизнес-идею облачные сервисы сделают лучше. Но для обработки документов, доменных консультаций и корпоративного поиска локальные LLM уже сейчас дают достаточное качество при нулевых рисках утечки данных.
Заключение: когда пора переходить на локальные LLM
Чек-лист для принятия решения:
- Вы работаете с конфиденциальными данными, которые нельзя отправлять в облако.
- Вам нужен ассистент, работающий без интернета.
- Задачи сосредоточены в специфическом домене, где файнтюнинг даёт прирост точности.
- У вас есть сервер с GPU или хотя бы ноутбук с 16 ГБ RAM.
Если хотя бы два пункта совпадают, локальные LLM уже сейчас дадут вам преимущество. Начните с малого: разверните Ollama с Llama 3 8B на рабочей станции и протестируйте на реальном документе. Результат первого эксперимента обычно снимает все сомнения.
| Сценарий | Рекомендованная модель | Скорость (GPU) | Качество | Ключевое преимущество |
|---|---|---|---|---|
| Обработка документов | Qwen 2.5 7B / Llama 3 8B | 3 сек/стр | F1 0.89-0.91 | Безопасность данных |
| Доменный ассистент | Llama 3 8B + файнтюнинг | 48 ток/сек | 4.2/5 | Автономность |
| Корпоративный RAG | Llama 3 8B + BGE-large | 4.2 сек/ответ | Recall@5 0.87 | Контроль над данными |
Локальные LLM вне кода - это работающий инструмент для бизнеса. Три разобранных сценария покрывают основные потребности компаний, которые ценят конфиденциальность и автономность. Выбирайте модель под задачу, тестируйте на своих данных и внедряйте там, где облака создают больше рисков, чем выгоды.