Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
Как превратить Gemma 4 31B Dense в MoE: дообучение роутера и экспертов на Hugging Face
Научитесь мутировать плотную Gemma 4 31B в Mixture of Experts с включением enable_moe_block. Дообучение роутера и экспертов на Hugging Face без обучения с нуля.
02
Unified llama binary: новый стандарт запуска LLM на любом устройстве
Unified binary от llama.cpp — один файл для запуска LLM на любом железе. Сравнение с Ollama и LM Studio, примеры использования на Raspberry Pi и ПК.
03
AMD наконец-то получила свой W4A16: vLLM запускает нативный HIP kernel
vLLM добавил поддержку нативного W4A16 квантования для AMD GPU через HIP. Ускорение до 2-3x по сравнению с fallback. Бенчмарки, примеры, сравнение с llama.cpp.
04
Obsidian Hybrid Search: когда ваша база знаний говорит на одном языке с AI-агентами
Обзор Obsidian Hybrid Search — MCP-сервера и CLI, объединяющего лексический и семантический поиск по заметкам. Примеры, сравнение с аналогами, настройка для Cla
05
Step 3.7 Flash: подробный бенчмарк на M5 Max и RTX 6000 с конфигами и скоростью
Сравнение Step 3.7 Flash на Mac M5 Max (llama.cpp) и RTX 6000 (NVFP4). Реальные цифры токен/с, настройки, GitHub. Кому подойдет и как запустить.
06
llama.cpp B9387: AMD ROCm получает долгожданное ускорение prefill — бенчмарки и сравнение
Свежий релиз llama.cpp B9387 приносит до 2.5x ускорение обработки промптов на AMD GPU под ROCm. Бенчмарки, сравнение с vLLM, советы по настройке.
07
Патч для Claude CLI 2.1.154+: чиним совместимость с vLLM новыми ролями сообщений
Решение проблемы совместимости Claude CLI 2.1.154+ с vLLM из-за новых ролей сообщений. Подробный гайд с кодом патча для локальных LLM.
08
Запуск Mimo 2.5 Pro на 8x Nvidia GB10: производительность и параллельные запросы
Тесты Mimo 2.5 Pro на кластере из 8 Nvidia GB10: токены в секунду при разных контекстах, параллельные запросы, сравнение с H20 и RTX 4090. Данные для энтузиасто
09
Enforcement layer для AI-кодинг-агентов: когда модель говорит 'я не знаю', а код молчит
Как построить enforcement layer для AI-кодинг-агента с Neo4j, ONNX и BM25. Полный гайд с примерами кода. Всё локально — без API.
10
How to Add a Custom Model to llama.cpp: Implementing Laguna XS.2 with GitHub Code
Полное руководство по портированию нестандартной модели в llama.cpp на примере Laguna XS.2. Исходный код на GitHub, конвертация в GGUF, инференс и грабли.
11
Q4_K_M опережает Q8_0 на 230ms TTFT на Qwen2.5-7B: как config sweep CLI для llama.cpp и vLLM переворачивает бенчмарки
Почему Q4_K_M оказался быстрее Q8_0 на 230ms TTFT в Qwen2.5-7B? Обзор нового CLI для перебора конфигураций llama.cpp и vLLM, находки и практические рекомендации
12
Zvec: почему Alibaba построила самую быструю open-source векторную БД и кто уже использует её в проде
Zvec обгоняет Qdrant, LanceDB и Zilliz Cloud в 2-10 раз. Бенчмарки, архитектура, примеры индексации 10M векторов за 0.8 мс. Кому реально нужна эта БД.