Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Как превратить Gemma 4 31B Dense в MoE: дообучение роутера и экспертов на Hugging Face Научитесь мутировать плотную Gemma 4 31B в Mixture of Experts с включением enable_moe_block. Дообучение роутера и экспертов на Hugging Face без обучения с нуля. 7 мин чтения 02 Unified llama binary: новый стандарт запуска LLM на любом устройстве Unified binary от llama.cpp — один файл для запуска LLM на любом железе. Сравнение с Ollama и LM Studio, примеры использования на Raspberry Pi и ПК. 4 мин чтения 03 AMD наконец-то получила свой W4A16: vLLM запускает нативный HIP kernel vLLM добавил поддержку нативного W4A16 квантования для AMD GPU через HIP. Ускорение до 2-3x по сравнению с fallback. Бенчмарки, примеры, сравнение с llama.cpp. 5 мин чтения 04 Obsidian Hybrid Search: когда ваша база знаний говорит на одном языке с AI-агентами Обзор Obsidian Hybrid Search — MCP-сервера и CLI, объединяющего лексический и семантический поиск по заметкам. Примеры, сравнение с аналогами, настройка для Cla 8 мин чтения 05 Step 3.7 Flash: подробный бенчмарк на M5 Max и RTX 6000 с конфигами и скоростью Сравнение Step 3.7 Flash на Mac M5 Max (llama.cpp) и RTX 6000 (NVFP4). Реальные цифры токен/с, настройки, GitHub. Кому подойдет и как запустить. 5 мин чтения 06 llama.cpp B9387: AMD ROCm получает долгожданное ускорение prefill — бенчмарки и сравнение Свежий релиз llama.cpp B9387 приносит до 2.5x ускорение обработки промптов на AMD GPU под ROCm. Бенчмарки, сравнение с vLLM, советы по настройке. 5 мин чтения 07 Патч для Claude CLI 2.1.154+: чиним совместимость с vLLM новыми ролями сообщений Решение проблемы совместимости Claude CLI 2.1.154+ с vLLM из-за новых ролей сообщений. Подробный гайд с кодом патча для локальных LLM. 6 мин чтения 08 Запуск Mimo 2.5 Pro на 8x Nvidia GB10: производительность и параллельные запросы Тесты Mimo 2.5 Pro на кластере из 8 Nvidia GB10: токены в секунду при разных контекстах, параллельные запросы, сравнение с H20 и RTX 4090. Данные для энтузиасто 5 мин чтения 09 Enforcement layer для AI-кодинг-агентов: когда модель говорит 'я не знаю', а код молчит Как построить enforcement layer для AI-кодинг-агента с Neo4j, ONNX и BM25. Полный гайд с примерами кода. Всё локально — без API. 8 мин чтения 10 How to Add a Custom Model to llama.cpp: Implementing Laguna XS.2 with GitHub Code Полное руководство по портированию нестандартной модели в llama.cpp на примере Laguna XS.2. Исходный код на GitHub, конвертация в GGUF, инференс и грабли. 5 мин чтения 11 Q4_K_M опережает Q8_0 на 230ms TTFT на Qwen2.5-7B: как config sweep CLI для llama.cpp и vLLM переворачивает бенчмарки Почему Q4_K_M оказался быстрее Q8_0 на 230ms TTFT в Qwen2.5-7B? Обзор нового CLI для перебора конфигураций llama.cpp и vLLM, находки и практические рекомендации 1 мин чтения 12 Zvec: почему Alibaba построила самую быструю open-source векторную БД и кто уже использует её в проде Zvec обгоняет Qdrant, LanceDB и Zilliz Cloud в 2-10 раз. Бенчмарки, архитектура, примеры индексации 10M векторов за 0.8 мс. Кому реально нужна эта БД. 5 мин чтения