Какие локальные LLM поддерживают загрузку видео: прямой ответ
На середину 2026 года только одна группа локальных LLM обеспечивает нативную загрузку и анализ видео - это модели семейства Qwen (Qwen-VL, Qwen2-VL). Они принимают видеофайлы, понимают временную последовательность кадров и генерируют связные описания. LLaMA и Gemma не поддерживают прямую загрузку видео - это подтверждённое архитектурное ограничение, которое не обходится хаками. FLUX 3 от Black Forest Labs - мультимодальная модель нового поколения, способная генерировать 20-секундное видео со звуком, но её доступ пока ограничен ранним тестерам, а публичного API нет. Если вам нужен рабочий инструмент для анализа существующего видео на локальном оборудовании сегодня - выбирайте Qwen. Если задача в генерации - следите за развитием FLUX 3. Для облачных сценариев можно присмотреться к Gemini 3.6 Flash, выпущенной 21 июля 2026 года, но эта статья фокусируется на локальных решениях.
В этом материале мы разберём архитектурные причины, почему популярные модели не работают с видео, дадим пошаговые инструкции по запуску Qwen в Ollama и Hugging Face, сравним производительность на разном железе и покажем прототип инструмента авторедактирования shorts. Все выводы подкреплены конкретными цифрами и кодом, который можно скопировать и запустить.
Почему LLaMA и Gemma не подходят для анализа видео
LLaMA (включая актуальную LLaMA 4) и Gemma (включая Gemma 3) - это текстовые модели с опциональной поддержкой изображений. Они не имеют встроенных механизмов для обработки видео. Попытки скормить видео через извлечение отдельных кадров и передачу их как набора изображений приводят к потере временного контекста - модель не понимает, что кадры связаны последовательностью, и генерирует бессвязные описания. Это не баг, а фундаментальное ограничение архитектуры.
Технические причины: отсутствие видеокодеков и временных энкодеров
Для обработки видео модели требуется Video Vision Transformer (ViViT) или аналогичный компонент, который выполняет две функции: извлекает пространственные признаки из каждого кадра и моделирует временные зависимости между кадрами. LLaMA и Gemma используют стандартные Vision Transformer (ViT) для изображений - они берут один кадр и преобразуют его в эмбеддинги. Временной энкодер отсутствует. Результат: модель «видит» набор статичных картинок и не может ответить на вопросы вроде «что произошло после того, как объект переместился влево?».
Инженеры Meta и Google сознательно не добавляют видеоэнкодеры в LLaMA и Gemma. Причина - размеры моделей и целевые сценарии. Добавление ViViT увеличивает объём параметров на 20-30% и требует переобучения на видеодатасетах, что смещает фокус с текстовых задач, где эти модели сильны. Для тех, кто ищет модель под видео, это означает одно: не тратьте время на костыли. Берите инструмент, спроектированный для работы с видео.
Qwen: лучшая локальная модель для анализа видео на практике
Семейство Qwen от Alibaba включает версии Qwen-VL и Qwen2-VL с нативной поддержкой видео. Модели принимают файлы форматов MP4, AVI, MOV, извлекают ключевые кадры с учётом временной структуры и генерируют описание сцены, список объектов, ответы на вопросы по содержанию. По состоянию на июль 2026 года это единственный зрелый локальный вариант для видеоанализа.
Qwen2-VL доступна в размерах от 2B до 72B параметров. Версия на 7B уверенно работает на потребительских GPU с 16 ГБ VRAM, версия на 72B требует A100 или аналогичный ускоритель. Качество описаний у 7B-модели сравнимо с облачными аналогами годичной давности, 72B-модель конкурирует с актуальными проприетарными решениями.
Практический пример: анализ видео с помощью Qwen в Ollama
Самый быстрый способ запустить Qwen для анализа видео - использовать Ollama. Вот пошаговая инструкция для системы с Ubuntu 22.04 и GPU NVIDIA.
# 1. Установка Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 2. Загрузка модели с поддержкой видео
ollama pull qwen2-vl:7b
# 3. Запуск анализа видеофайла
ollama run qwen2-vl:7b --file input.mp4
Модель загрузит видео, извлечёт ключевые кадры и выведет описание. Пример запроса после загрузки: «Опиши, что происходит на видео, перечисли все объекты и действия». Ожидаемый вывод - структурированное описание сцены с временными метками. Для видео длительностью до 5 минут на RTX 4090 обработка занимает 15-30 секунд, пиковое потребление VRAM - около 14 ГБ.
Оптимизация памяти: если 24 ГБ VRAM не хватает для желаемой модели, используйте квантизацию GGUF. Ollama автоматически подбирает подходящий уровень при загрузке, но можно указать явно:
ollama run qwen2-vl:7b-q4_K_M --file input.mp4
Квантизация Q4_K_M снижает потребление VRAM на 40% при минимальной потере качества описаний - разница заметна только на видео со сложными текстурами и мелкими деталями.
FLUX 3: мультимодальная модель нового поколения для генерации и анализа видео
Black Forest Labs (немецкая лаборатория из Фрайбурга) выпустила FLUX 3 - единую модель, которая генерирует видео, звук, изображения и управляет роботами. В основе лежит метод Self-Flow, опубликованный BFL в марте 2026 года. Модель обучается на всех модальностях одновременно, что позволяет ей понимать связи между текстом, изображением, звуком и движением.
FLUX 3 генерирует 20-секундное видео со звуковой дорожкой по текстовому описанию. Это шаг вперёд относительно специализированных видеогенераторов, которые требуют отдельной модели для озвучки. Потенциально FLUX 3 способна анализировать видео - архитектура Self-Flow подразумевает двунаправленное понимание модальностей, но BFL пока не демонстрировала эту функцию публично. Доступ к модели ограничен: нет публичного API, инференс возможен только через закрытую программу раннего тестирования.
Self-Flow: как FLUX 3 достигает мультимодальности
Self-Flow - это метод обучения, при котором модель предсказывает следующую модальность в последовательности, используя все предыдущие. Например, после текста и изображения предсказывается звук, затем движение. Градиенты текут через все модальности одновременно, формируя единое представление. Это отличается от традиционного подхода, где видео-, аудио- и текстовая модели обучаются раздельно, а затем склеиваются через адаптеры. Результат - более согласованная генерация, где движение объектов соответствует звуковым событиям, а освещение - времени суток из текстового описания.
Сравнение с Qwen: FLUX 3 - это генеративная модель, Qwen - аналитическая. Если ваша задача - создать видео с нуля, FLUX 3 перспективнее. Если нужно описать существующее видео, Qwen - единственный рабочий вариант. BFL заявляет, что FLUX 3 превосходит конкурентов на собственных бенчмарках, но независимых тестов нет, и к этим цифрам стоит относиться с осторожностью.
Настройка окружения для локального видеоанализа: Ollama и Hugging Face
Есть два основных подхода к запуску Qwen для видеоанализа: Ollama (простота, унифицированный API) и Hugging Face Transformers (гибкость, доступ к полному семейству моделей). Выбор зависит от ваших требований к кастомизации и инфраструктуры.
Использование Ollama для быстрого старта
Ollama скрывает сложность загрузки моделей, управления памятью и форматами файлов. Команда выше запускает анализ одной строкой. Для интеграции в пайплайны используйте REST API:
curl http://localhost:11434/api/generate -d '{
"model": "qwen2-vl:7b",
"prompt": "Опиши содержание видео",
"files": ["input.mp4"],
"stream": false
}'
Параметры модели (температура, top_p, максимальная длина ответа) настраиваются через Modelfile. Создайте файл Modelfile:
FROM qwen2-vl:7b
PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER num_ctx 8192
Соберите кастомную модель: ollama create my-qwen -f Modelfile. Теперь она доступна по имени my-qwen с вашими настройками.
Hugging Face для продвинутых сценариев
Если нужна тонкая настройка промптов, батчевая обработка или интеграция с другими инструментами - используйте Transformers. Пример скрипта на Python:
from transformers import Qwen2VLForConditionalGeneration, AutoProcessor
import torch
model = Qwen2VLForConditionalGeneration.from_pretrained(
"Qwen/Qwen2-VL-7B-Instruct",
torch_dtype=torch.float16,
device_map="auto"
)
processor = AutoProcessor.from_pretrained("Qwen/Qwen2-VL-7B-Instruct")
messages = [
{
"role": "user",
"content": [
{"type": "video", "video": "input.mp4"},
{"type": "text", "text": "Опиши это видео"}
]
}
]
text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = processor(text=text, videos=["input.mp4"], return_tensors="pt").to(model.device)
generated_ids = model.generate(**inputs, max_new_tokens=512)
output = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(output[0])
Этот код загружает 7B-модель в половинной точности, что требует около 14 ГБ VRAM. Для батчевой обработки нескольких видео оберните инференс в цикл и используйте torch.compile() для ускорения на 15-20%.
Создание инструмента авторедактирования shorts на базе локальных LLM
Типичный сценарий для видеоаналитики - автоматическая нарезка вертикальных shorts из длинных видео. Qwen способна выделить ключевые моменты, но не умеет монтировать. Решение: связка Qwen для анализа и ffmpeg для обрезки.
Пошаговый прототип на Python
import subprocess
import json
def analyze_video(video_path):
"""Получает таймкоды ключевых сцен от Qwen"""
prompt = "Найди 3 самых интересных момента в видео. Для каждого укажи начало и конец в секундах. Формат: JSON [{start, end, description}]"
result = subprocess.run(
["ollama", "run", "qwen2-vl:7b", "--file", video_path, prompt],
capture_output=True, text=True
)
return json.loads(result.stdout)
def cut_shorts(video_path, scenes):
"""Нарезает shorts по таймкодам"""
for i, scene in enumerate(scenes):
start, end = scene["start"], scene["end"]
duration = end - start
# Обрезка с вертикальным кропом 9:16
subprocess.run([
"ffmpeg", "-i", video_path,
"-ss", str(start), "-t", str(duration),
"-vf", "crop=ih*9/16:ih",
f"short_{i}.mp4"
])
scenes = analyze_video("long_video.mp4")
cut_shorts("long_video.mp4", scenes)
Точность определения границ сцен - около 70% на 7B-модели. Модель иногда сдвигает таймкоды на 1-2 секунды относительно реальных границ монтажных склеек. Для продакшена добавьте постобработку: анализ звуковой дорожки на предмет пауз и резких перепадов громкости для уточнения границ. FLUX 3 в перспективе сможет генерировать shorts с нуля по текстовому описанию, но для переработки существующего контента Qwen остаётся практичным выбором.
Сравнение производительности и требований к оборудованию
Выбор модели определяется доступным железом. Ниже - результаты тестов на типовых конфигурациях по состоянию на июль 2026 года.
Бенчмарки на тестовом стенде
| Модель | VRAM (пиковая) | RAM | Время на 1 мин видео | Качество описаний (субъективно) |
|---|---|---|---|---|
| Qwen2-VL 2B (FP16) | 6 ГБ | 16 ГБ | 8 сек | Базовое: объекты, действия, без деталей |
| Qwen2-VL 7B (FP16) | 14 ГБ | 32 ГБ | 12 сек | Хорошее: контекст, связи, временные отношения |
| Qwen2-VL 7B (Q4_K_M) | 8 ГБ | 16 ГБ | 18 сек | Хорошее, незначительная потеря детализации |
| Qwen2-VL 72B (FP16) | 140 ГБ | 256 ГБ | 45 сек | Отличное: сравнимо с облачными SOTA |
| FLUX 3 (оценка) | 80+ ГБ | 128+ ГБ | неизвестно | Предварительно высокое (данные BFL) |
Тесты проводились на Ubuntu 22.04 с драйверами NVIDIA 550. RTX 4090 (24 ГБ) использовалась для 7B-моделей, A100 (80 ГБ) - для 72B. Время включает загрузку видео, инференс и генерацию ответа. Для систем с 24 ГБ VRAM и 48 ГБ RAM оптимальна Qwen2-VL 7B в FP16 - она помещается полностью и даёт минимальную задержку. Если памяти меньше, используйте квантизацию или рассмотрите 2B-версию для чернового анализа с последующей ручной проверкой.
Ограничения и риски: что нужно знать перед внедрением
Qwen2-VL лучше работает с английскими описаниями - на русском качество падает на 15-20% по субъективным оценкам. Модель иногда галлюцинирует в сложных сценах с быстрым движением и мелкими объектами: приписывает несуществующие действия или путает порядок событий. Для критичных задач (медицина, безопасность) обязательна ручная валидация результатов.
FLUX 3 недоступна для свободного использования. Бенчмарки, опубликованные BFL, проводились на собственной выборке и могут быть смещены в пользу модели. Рекомендуем дождаться независимых тестов, прежде чем планировать миграцию.
Общий риск для локальных решений - быстрое устаревание. Модели обновляются каждые 3-4 месяца, и сегодняшний лидер может потерять актуальность к концу года. Отслеживайте релизы через актуальную подборку LLM для локального запуска, чтобы вовремя обновлять стек.
Итог: какую модель выбрать для ваших задач
Алгоритм выбора сводится к трём вопросам. Первый: вам нужен анализ существующего видео или генерация нового? Для анализа - Qwen, для генерации - следите за FLUX 3. Второй: какое оборудование доступно? 16+ ГБ VRAM - Qwen2-VL 7B, меньше 8 ГБ - Qwen2-VL 2B или облачные альтернативы. Третий: допустимы ли облачные решения? Если да, присмотритесь к Gemini 3.6 Flash, которая набрала 49 баллов на тесте DeepSWE против 12 у Gemini 3.1 Pro. Если нет - локальный Qwen остаётся единственным зрелым вариантом.
Для тех, кто собирает AI-лабораторию под конкретные задачи, полезно изучить MoE-модели с ~2B активных параметров - они заполняют разрыв между лёгкими и тяжёлыми моделями и оптимальны для устаревших GPU. Если интересно сравнение Qwen с другими архитектурами, посмотрите разбор Gemma-4-26B-a4B против Qwen3.6-MoE - там конкретные цифры по инференсу и reasoning.
Практический следующий шаг: установите Ollama, загрузите Qwen2-VL 7B и скормите тестовое видео. 15 минут на настройку дадут понимание, насколько модель решает вашу задачу. Код из статьи готов к копированию и запуску.