Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Cohere North Mini Code 1.0: 30B MoE-модель для кодинга с A3B архитектурой — обзор и ссылки Обзор Cohere North Mini Code 1.0: новая кодинг-модель 30B MoE с архитектурой A3B. Веса на HuggingFace, возможности локального запуска, сравнение с альтернативам 4 мин чтения 02 KV Cache Sharing for Multi-Agent LLM Pipelines: как ускорить инференс в 2 раза на старых GPU Техника KV Cache Sharing для мультиагентных пайплайнов: как получить 1.95x ускорение на RTX 3090 без покупки новых карт. Реализация в llama.cpp, бенчмарки, copy 7 мин чтения 03 Spring Explore Skill: настройка AI-агента для работы с Spring Boot и генерации кода Как настроить AI-агента с помощью Spring Explore Skill. Установка через npx skills, примеры генерации Spring-кода, сравнение с альтернативами в 2026 году. 5 мин чтения 04 Локальная память для Codex на SQLite: как создать плагин Hermes для постоянных правил проекта Создайте плагин Hermes для Codex, который хранит правила проекта в SQLite и не даёт агенту забыть ваши требования. Примеры кода, архитектура, сравнение с MCP. 6 мин чтения 05 Медицинская ASR модель Parakeet 0.6B: fine-tuning и локальный запуск на Mac и CUDA Полный обзор медицинской ASR модели Parakeet 0.6B: возможности, дообучение под терминологию, запуск на Mac (MLX) и Linux (CUDA). Сравнение с Whisper, примеры ко 6 мин чтения 06 Визуальный конструктор команд llama.cpp: как перестать гадать на флагах и начать запускать LLM Готовый бесплатный инструмент для построения CLI команд llama.cpp с полным списком флагов и сохранением конфигурации. Забудь про копипаст из Readme. 4 мин чтения 07 ByteShape против Unsloth: выбор квантизации для Qwen3.6-35B-A3B в задачах tool calling и long context Сравниваем квантизации ByteShape и Unsloth для Qwen3.6-35B-A3B: точность tool calling, поведение на длинном контексте, скорость и KV cache. Бенчмарки и рекоменд 7 мин чтения 08 NanoQuant: экстремальное квантование LLM до 0.5 бит — обзор реализации и первые тесты Обзор NanoQuant — открытого инструмента для суб-1-битного квантования LLM до 0.5 бита на вес. Установка, сравнение с GPTQ/TurboQuant, первые тесты на Llama 3.1 5 мин чтения 09 Luce Spark: 35B MoE модель для 16GB GPU без offload – обзор и установка Luce Spark 35B MoE — модель, которая умещается в 16GB VRAM без offload. Сравнение с аналогами, бенчмарки, инструкция по установке для локального запуска. 4 мин чтения 10 Видео в llama.cpp: как включить поддержку видео через mtmd (PR #24269) Разбираем PR #24269 от ngxson: как добавить поддержку видео в llama.cpp через mtmd. Примеры сборки, сравнение с альтернативами, практические советы. 6 мин чтения 11 Локальная суммаризация arXiv с Ollama и Gemma 4: полный пайплайн от установки до Cloudflare DB Пошаговый гайд: как собрать пайплайн для суммаризации arXiv статей на локальной LLM (Ollama + Gemma 4) и сохранить результаты в Cloudflare D1. Примеры кода, про 8 мин чтения 12 Meddies PII: снимаем маску с пациентов, не нарушая закон Обзор Meddies PII — открытой мультиязычной модели для удаления PII из медицинских записей. Возможности, сравнение с альтернативами, примеры использования и реко 7 мин чтения