Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Бенчмаркинг GGUF моделей на iPhone: вышло приложение, которое покажет реальную скорость Новое iOS-приложение для тестирования GGUF моделей на iPhone. Измеряет токены/с, задержку и память. Сравнение с альтернативами, примеры использования на iPhone 6 мин чтения 02 Lightweight Terminal Agent: когда ИИ переезжает в консоль и не просит видеокарту Разбираем легковесный open-source проект для запуска AI-агентов прямо в консоли. Возможности, сравнение с аналогами, примеры использования и кому это реально ну 5 мин чтения 03 Wiki-MCP-Server: распределённый граф знаний с авторизацией и MCP-протоколом — доработка идеи Карпати Разбираем Wiki-MCP-Server — эволюцию идеи Карпати: распределённый граф знаний на AlloyDB, pgvector, типизированные рёбра и MCP-протокол. Примеры использования, 5 мин чтения 04 Unsloth выпустил MTP GGUF веса для Gemma 4: инструкция по использованию и сравнение квантований Unsloth выпустил MTP GGUF веса для Gemma 4. Как загрузить, запустить и выбрать квантование (Q8, F16, BF16). Подробное сравнение и гайд. 5 мин чтения 05 Разбор исходного кода Claude Code v2.1.88: что правда, а что мифы об архитектуре агента Детальный разбор исходного кода Claude Code v2.1.88. Опровергаем популярные мифы об архитектуре агента: монолитность, безопасность, queryLoop, стейт-менеджмент 6 мин чтения 06 proveKV: 36x lossless сжатие KV-кеша — когда VRAM кончается, а контекст растёт Разбор proveKV: Rust-инструмент для сжатия KV-кеша в 36 раз без потерь точности. Полный пример кода, сравнение с Delta-KV, KVarN, nano-KvLLM. Экономия VRAM для 7 мин чтения 07 KVarN от Huawei: KV-кэш сжимается в 3-5 раз, а reasoning не тормозит Новый метод квантования KV-кэша KVarN от Huawei сжимает данные в 3-5 раз для reasoning-задач, не замедляя инференс. Интеграция с vLLM одной строкой. Apache 2.0. 1 мин чтения 08 ESM Cambrian: открытая модель для дизайна белков, превзошедшая AlphaFold3 — обзор архитектуры и применение Обзор ESM Cambrian — новой открытой модели Meta для дизайна белков. Сравнение с AlphaFold3, бенчмарк FoldBench, примеры использования в биоинформатике и разрабо 4 мин чтения 09 Headroom: бесплатный инструмент для сжатия промптов и RAG-данных с сокращением токенов до 95% Обзор Headroom — open-source библиотеки, прокси и MCP-сервера для сжатия промптов и RAG-данных. Экономия токенов до 95% без потери качества. Примеры, сравнение 6 мин чтения 10 llama.cpp учится рисовать: Mermaid-диаграммы прямо в чате с интерактивным превью Обзор новой фичи llama.cpp: теперь можно генерировать и редактировать Mermaid-диаграммы прямо в чате с локальной LLM. Сравнение с альтернативами, примеры, реком 4 мин чтения 11 Как ускорить инференс LLM в 2-6 раз: C++ бэкенд WarpGroup против паддинга Разбор проблемы паддинга в батчинге LLM и готовое решение — C++ бэкенд WarpGroup. Бенчмарки показывают ускорение до 5.89x на GTX 1080 и 2x на H100. Код, примеры 7 мин чтения 12 DPO для OCR: как снизить дегенерацию текста на 87% с помощью Direct Preference Optimization Как с помощью Direct Preference Optimization уменьшить повторения и галлюцинации в OCR. Пошаговый гайд с кодом на Python. 5 мин чтения