Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 LLaVA-OV-2: мультимодальная модель, которая смотрит видео через кодек вместо кадров — открытая реализация и датасеты Разбираем LLaVA-OV-2 - модель, анализирующую видео через H.264 вместо кадров. Открытые веса, датасеты, код. Сравнение с NVILA, Video-LLaVA. Кому подойдет и как 6 мин чтения 02 Nvidia LocateAnything: ускорение vision-language grounding в 10 раз — обзор модели и как запустить локально Разбор Nvidia LocateAnything — открытой модели для vision-language grounding с 10-кратным ускорением. Сравнение с Qwen3-VL и Youtu-VL, архитектура Eagle, гайд п 6 мин чтения 03 Склейка монстра: как я упаковал 1000 файлов Java в один, чтобы DeepSeek понял проект целиком Java-скрипт, который собирает весь проект в один файл для DeepSeek, Claude и GPT. Ускорьте код-ревью и рефакторинг — примеры и сравнение с альтернативами. 5 мин чтения 04 Корпус Usenet 1980–2013: 103B токенов без AI-загрязнения для точной настройки моделей Обзор датасета Usenet 1980-2013: 103B токенов без следов LLM. Идеален для чистого fine-tuning малых моделей. Сравнение с альтернативами и примеры использования. 6 мин чтения 05 Delta Weight Sync в TRL: как сократить передачу данных при async RL обучении с 1 ТБ до 35 МБ Как новая техника в TRL от Hugging Face позволяет синхронизировать веса в распределенном RL с минимальными затратами трафика. Детальный разбор и пример настройк 6 мин чтения 06 RAG-Anything: мультимодальный RAG фреймворк для обработки PDF, изображений и таблиц без лишних парсеров Обзор RAG-Anything – нового мультимодального RAG-фреймворка, который сам обрабатывает PDF, таблицы и изображения, избавляя от геморроя с парсерами. Примеры, сра 4 мин чтения 07 vtcode: Rust TUI coding agent с AST-разбиением контекста — как сэкономить кучу токенов на DeepSeek V4 Flash Разбираем vtcode — open-source терминальный агент для кода на Rust. AST-level chunking, ripgrep, ast-grep и экономия токенов. Сравнение с альтернативами. 4 мин чтения 08 Cactus Hybrid Router: как заставить Gemma4-2B работать как Gemini-3.1-Flash-Lite, не разорившись на API Гибридный роутер Cactus: Gemma4-2B локально + Gemini для сложных задач. Экономия API, производительность уровня Gemini-3.1-Flash-Lite. Примеры кода и настройка. 1 мин чтения 09 Quale — инструмент для предотвращения глупых ошибок LLM: обзор и установка Quale — opensource-библиотека для валидации вывода LLM. Установка, примеры, сравнение с Guardrails и NeMo. Избавьтесь от фактологических ошибок. 4 мин чтения 10 Bonsai Image 4B: первый 1-битный diffusion transformer, который запускает генерацию картинок прямо в браузере (и это работает) Обзор Bonsai Image 4B — первого ternary-квантованного diffusion transformer (0VQ-VAE + 1-bit DiT), который генерирует 512×512 фото в браузере через WebGPU. Срав 6 мин чтения 11 dlmserve: Первый открытый движок для инференса диффузионных языковых моделей – установка и тест на RTX 5070 Установка и тест dlmserve — первого открытого сервинг-движка для диффузионных языковых моделей (LLaDA) на RTX 5070. Результаты, сравнение с PyTorch, инструкция 4 мин чтения 12 OSCAR KV Quant: как Together AI ужал KV-кэш до 2 бит без потери качества Разбор OSCAR KV Quant — новой open-source техники квантования KV-кэша. Сравнение с TurboQuant, Attn-rot, Subquadratic Attention. Бенчмарки и примеры. 4 мин чтения