Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 PFlash: ускорение prefill в 10 раз на RTX 3090 при длине контекста 128K — разбор технологии и бенчмарков Разбор PFlash — новой техники, ускоряющей prefill в 10 раз на RTX 3090 с контекстом 128K. Сравнение с llama.cpp, бенчмарки, примеры использования и подводные ка 4 мин чтения 02 Intel AutoRound: Intel внезапно выстрелила. Почему SOTA-квантование теперь не про GPU? Разбор Intel AutoRound — нового алгоритма квантования LLM, который бьёт GPTQ и AWQ. Поддержка CPU/XPU/CUDA, интеграция с vLLM, SGLang и Transformers. Реальные т 8 мин чтения 03 8.7k диалогов Claude Opus 4.7: датасет для fine-tuning, от которого у вас потекут слюнки Новый синтетический датасет на HuggingFace: 8700 диалогов Claude Opus 4.6/4.7 с цепочками рассуждений. Очистка от отказов, сравнение с аналогами, примеры примен 4 мин чтения 04 Обзор лучших открытых LLM апреля 2026: что запустить локально? Актуальный обзор открытых LLM: Qwen3, Llama 4, Gemma 4 и другие. Сравнение по качеству и требованиям к железу. Тесты, советы, квантование. 7 мин чтения 05 DeepSeek Thinking-with-Visual-Primitives: фреймворк, который заставит ИИ думать картинками Разбираем новый фреймворк DeepSeek для визуального мышления: что такое Visual Primitives, как это работает и кому пригодится. Сравнение с аналогами, примеры код 6 мин чтения 06 Agent-browser от Vercel: бунт AI-агентов против Playwright? Обзор нового инструмента Разбираем agent-browser от Vercel: зачем AI-агентам отдельный браузер, чем он лучше Playwright и Puppeteer, и как его использовать с MCP. Актуально на апрель 20 4 мин чтения 07 Запуск llama.cpp с поддержкой NVFP4 на Blackwell: что это даёт и как настроить Полный гайд по сборке llama.cpp с NVFP4 для GPU Blackwell. Как ускорить LLM в 2 раза, сохранив качество. Тесты, бенчмарки и примеры настройки. 4 мин чтения 08 Xiaomi MiMo-V2.5: Sparse MoE 310B модель — запуск, квантование и производительность на обычном железе Обзор Xiaomi MiMo-V2.5: разреженная MoE 310B с 15B активных параметров. Как запустить на RTX 4090, квантование, сравнение с DeepSeek и Qwen. Тесты производитель 5 мин чтения 09 Nemotron Nano 3 Omni в llama.cpp: конвертируем мультимодальную модель NVIDIA своими руками Полный гайд по конвертации Nemotron Nano 3 Omni (NVIDIA) в GGUF для llama.cpp. Поддержка текста, изображений, аудио. Инструкция, примеры, сравнение с альтернати 6 мин чтения 10 KV cache бенчмарк Qwen 3.6-35B-A3B на M5 Max: f16, q8_0, turbo3 и turbo4 до 1M контекста Тестируем KV cache квантование для Qwen 3.6-35B-A3B на Mac M5 Max. Сравнение f16, q8_0, TurboQuant 3/4bit. Замеры до 1M токенов. Рекомендации по выбору. 7 мин чтения 11 Lemonade OmniRouter: Как объединить локальные AI-модели для работы с текстом, изображениями и аудио Lemonade OmniRouter — инструмент для создания единого API из локальных LLM, генераторов изображений и распознавания речи. Как настроить и кому это нужно. 5 мин чтения 12 Poolside Laguna XS.2: возможности 33B MoE модели с открытой лицензией Обзор Poolside Laguna XS.2 — открытой 33B MoE модели, сравнимой с Qwen 3.5. Агентские бенчмарки, примеры использования, сравнение с аналогами. 4 мин чтения