Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
Бенчмаркинг GGUF моделей на iPhone: вышло приложение, которое покажет реальную скорость
Новое iOS-приложение для тестирования GGUF моделей на iPhone. Измеряет токены/с, задержку и память. Сравнение с альтернативами, примеры использования на iPhone
02
Lightweight Terminal Agent: когда ИИ переезжает в консоль и не просит видеокарту
Разбираем легковесный open-source проект для запуска AI-агентов прямо в консоли. Возможности, сравнение с аналогами, примеры использования и кому это реально ну
03
Wiki-MCP-Server: распределённый граф знаний с авторизацией и MCP-протоколом — доработка идеи Карпати
Разбираем Wiki-MCP-Server — эволюцию идеи Карпати: распределённый граф знаний на AlloyDB, pgvector, типизированные рёбра и MCP-протокол. Примеры использования,
04
Unsloth выпустил MTP GGUF веса для Gemma 4: инструкция по использованию и сравнение квантований
Unsloth выпустил MTP GGUF веса для Gemma 4. Как загрузить, запустить и выбрать квантование (Q8, F16, BF16). Подробное сравнение и гайд.
05
Разбор исходного кода Claude Code v2.1.88: что правда, а что мифы об архитектуре агента
Детальный разбор исходного кода Claude Code v2.1.88. Опровергаем популярные мифы об архитектуре агента: монолитность, безопасность, queryLoop, стейт-менеджмент
06
proveKV: 36x lossless сжатие KV-кеша — когда VRAM кончается, а контекст растёт
Разбор proveKV: Rust-инструмент для сжатия KV-кеша в 36 раз без потерь точности. Полный пример кода, сравнение с Delta-KV, KVarN, nano-KvLLM. Экономия VRAM для
07
KVarN от Huawei: KV-кэш сжимается в 3-5 раз, а reasoning не тормозит
Новый метод квантования KV-кэша KVarN от Huawei сжимает данные в 3-5 раз для reasoning-задач, не замедляя инференс. Интеграция с vLLM одной строкой. Apache 2.0.
08
ESM Cambrian: открытая модель для дизайна белков, превзошедшая AlphaFold3 — обзор архитектуры и применение
Обзор ESM Cambrian — новой открытой модели Meta для дизайна белков. Сравнение с AlphaFold3, бенчмарк FoldBench, примеры использования в биоинформатике и разрабо
09
Headroom: бесплатный инструмент для сжатия промптов и RAG-данных с сокращением токенов до 95%
Обзор Headroom — open-source библиотеки, прокси и MCP-сервера для сжатия промптов и RAG-данных. Экономия токенов до 95% без потери качества. Примеры, сравнение
10
llama.cpp учится рисовать: Mermaid-диаграммы прямо в чате с интерактивным превью
Обзор новой фичи llama.cpp: теперь можно генерировать и редактировать Mermaid-диаграммы прямо в чате с локальной LLM. Сравнение с альтернативами, примеры, реком
11
Как ускорить инференс LLM в 2-6 раз: C++ бэкенд WarpGroup против паддинга
Разбор проблемы паддинга в батчинге LLM и готовое решение — C++ бэкенд WarpGroup. Бенчмарки показывают ускорение до 5.89x на GTX 1080 и 2x на H100. Код, примеры
12
DPO для OCR: как снизить дегенерацию текста на 87% с помощью Direct Preference Optimization
Как с помощью Direct Preference Optimization уменьшить повторения и галлюцинации в OCR. Пошаговый гайд с кодом на Python.