Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
Cohere North Mini Code 1.0: 30B MoE-модель для кодинга с A3B архитектурой — обзор и ссылки
Обзор Cohere North Mini Code 1.0: новая кодинг-модель 30B MoE с архитектурой A3B. Веса на HuggingFace, возможности локального запуска, сравнение с альтернативам
02
KV Cache Sharing for Multi-Agent LLM Pipelines: как ускорить инференс в 2 раза на старых GPU
Техника KV Cache Sharing для мультиагентных пайплайнов: как получить 1.95x ускорение на RTX 3090 без покупки новых карт. Реализация в llama.cpp, бенчмарки, copy
03
Spring Explore Skill: настройка AI-агента для работы с Spring Boot и генерации кода
Как настроить AI-агента с помощью Spring Explore Skill. Установка через npx skills, примеры генерации Spring-кода, сравнение с альтернативами в 2026 году.
04
Локальная память для Codex на SQLite: как создать плагин Hermes для постоянных правил проекта
Создайте плагин Hermes для Codex, который хранит правила проекта в SQLite и не даёт агенту забыть ваши требования. Примеры кода, архитектура, сравнение с MCP.
05
Медицинская ASR модель Parakeet 0.6B: fine-tuning и локальный запуск на Mac и CUDA
Полный обзор медицинской ASR модели Parakeet 0.6B: возможности, дообучение под терминологию, запуск на Mac (MLX) и Linux (CUDA). Сравнение с Whisper, примеры ко
06
Визуальный конструктор команд llama.cpp: как перестать гадать на флагах и начать запускать LLM
Готовый бесплатный инструмент для построения CLI команд llama.cpp с полным списком флагов и сохранением конфигурации. Забудь про копипаст из Readme.
07
ByteShape против Unsloth: выбор квантизации для Qwen3.6-35B-A3B в задачах tool calling и long context
Сравниваем квантизации ByteShape и Unsloth для Qwen3.6-35B-A3B: точность tool calling, поведение на длинном контексте, скорость и KV cache. Бенчмарки и рекоменд
08
NanoQuant: экстремальное квантование LLM до 0.5 бит — обзор реализации и первые тесты
Обзор NanoQuant — открытого инструмента для суб-1-битного квантования LLM до 0.5 бита на вес. Установка, сравнение с GPTQ/TurboQuant, первые тесты на Llama 3.1
09
Luce Spark: 35B MoE модель для 16GB GPU без offload – обзор и установка
Luce Spark 35B MoE — модель, которая умещается в 16GB VRAM без offload. Сравнение с аналогами, бенчмарки, инструкция по установке для локального запуска.
10
Видео в llama.cpp: как включить поддержку видео через mtmd (PR #24269)
Разбираем PR #24269 от ngxson: как добавить поддержку видео в llama.cpp через mtmd. Примеры сборки, сравнение с альтернативами, практические советы.
11
Локальная суммаризация arXiv с Ollama и Gemma 4: полный пайплайн от установки до Cloudflare DB
Пошаговый гайд: как собрать пайплайн для суммаризации arXiv статей на локальной LLM (Ollama + Gemma 4) и сохранить результаты в Cloudflare D1. Примеры кода, про
12
Meddies PII: снимаем маску с пациентов, не нарушая закон
Обзор Meddies PII — открытой мультиязычной модели для удаления PII из медицинских записей. Возможности, сравнение с альтернативами, примеры использования и реко