Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
LLaVA-OV-2: мультимодальная модель, которая смотрит видео через кодек вместо кадров — открытая реализация и датасеты
Разбираем LLaVA-OV-2 - модель, анализирующую видео через H.264 вместо кадров. Открытые веса, датасеты, код. Сравнение с NVILA, Video-LLaVA. Кому подойдет и как
02
Nvidia LocateAnything: ускорение vision-language grounding в 10 раз — обзор модели и как запустить локально
Разбор Nvidia LocateAnything — открытой модели для vision-language grounding с 10-кратным ускорением. Сравнение с Qwen3-VL и Youtu-VL, архитектура Eagle, гайд п
03
Склейка монстра: как я упаковал 1000 файлов Java в один, чтобы DeepSeek понял проект целиком
Java-скрипт, который собирает весь проект в один файл для DeepSeek, Claude и GPT. Ускорьте код-ревью и рефакторинг — примеры и сравнение с альтернативами.
04
Корпус Usenet 1980–2013: 103B токенов без AI-загрязнения для точной настройки моделей
Обзор датасета Usenet 1980-2013: 103B токенов без следов LLM. Идеален для чистого fine-tuning малых моделей. Сравнение с альтернативами и примеры использования.
05
Delta Weight Sync в TRL: как сократить передачу данных при async RL обучении с 1 ТБ до 35 МБ
Как новая техника в TRL от Hugging Face позволяет синхронизировать веса в распределенном RL с минимальными затратами трафика. Детальный разбор и пример настройк
06
RAG-Anything: мультимодальный RAG фреймворк для обработки PDF, изображений и таблиц без лишних парсеров
Обзор RAG-Anything – нового мультимодального RAG-фреймворка, который сам обрабатывает PDF, таблицы и изображения, избавляя от геморроя с парсерами. Примеры, сра
07
vtcode: Rust TUI coding agent с AST-разбиением контекста — как сэкономить кучу токенов на DeepSeek V4 Flash
Разбираем vtcode — open-source терминальный агент для кода на Rust. AST-level chunking, ripgrep, ast-grep и экономия токенов. Сравнение с альтернативами.
08
Cactus Hybrid Router: как заставить Gemma4-2B работать как Gemini-3.1-Flash-Lite, не разорившись на API
Гибридный роутер Cactus: Gemma4-2B локально + Gemini для сложных задач. Экономия API, производительность уровня Gemini-3.1-Flash-Lite. Примеры кода и настройка.
09
Quale — инструмент для предотвращения глупых ошибок LLM: обзор и установка
Quale — opensource-библиотека для валидации вывода LLM. Установка, примеры, сравнение с Guardrails и NeMo. Избавьтесь от фактологических ошибок.
10
Bonsai Image 4B: первый 1-битный diffusion transformer, который запускает генерацию картинок прямо в браузере (и это работает)
Обзор Bonsai Image 4B — первого ternary-квантованного diffusion transformer (0VQ-VAE + 1-bit DiT), который генерирует 512×512 фото в браузере через WebGPU. Срав
11
dlmserve: Первый открытый движок для инференса диффузионных языковых моделей – установка и тест на RTX 5070
Установка и тест dlmserve — первого открытого сервинг-движка для диффузионных языковых моделей (LLaDA) на RTX 5070. Результаты, сравнение с PyTorch, инструкция
12
OSCAR KV Quant: как Together AI ужал KV-кэш до 2 бит без потери качества
Разбор OSCAR KV Quant — новой open-source техники квантования KV-кэша. Сравнение с TurboQuant, Attn-rot, Subquadratic Attention. Бенчмарки и примеры.