Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

5677 Когда сжатие памяти в macOS убивает LLM: полный гайд по отключению MacBook тормозит с локальными LLM? Виртуальная память съедает производительность. Пошаговое руководство по отключению сжатия памяти в macOS для стабильной работ 7 мин чтения 5678 GLM-OCR: почему эта мультимодалка читает документы лучше, чем вы Технический разбор GLM-OCR — мультимодальной модели для понимания сложных документов. Multi-Token Prediction loss, CogViT энкодер, двухэтапный пайплайн. 8 мин чтения 5679 Step-3.5-Flash-Int4 в llama.cpp: как заставить модель думать, а не повторять одно и то же Пошаговая инструкция по настройке llama.cpp для Step-3.5-Flash-Int4: оптимальные параметры температуры, penalty и контекста против зацикливания в reasoning. 8 мин чтения 5680 NTTuner + GUI: Финтюн моделей на Windows без боли, с Unsloth под капотом Пошаговое руководство по использованию NTTuner с графическим интерфейсом для тонкой настройки языковых моделей на Windows. Интеграция с Unsloth для ускорения в 7 мин чтения 5681 Дистилляция Kimi K2: Сообщество пытается упаковать гиганта в 1 миллиард параметров Обзор первых попыток open-source сообщества сжать модель Kimi K2.5 методом дистилляции в меньшую модель Granite 1B. Технические детали и перспективы на 2026 год 5 мин чтения 5682 Kimi K2.5 Thinking обгоняет всех в Extended NYT Connections. Теперь это главный тест на сообразительность Китайская модель с открытыми весами возглавила новый бенчмарк на рассуждения. Разбираем, что такое Extended NYT Connections и почему он важен для оценки AI в 20 5 мин чтения 5683 Step-3.5-Flash-int4: новый король для Mac с 128 ГБ памяти Тестируем Step-3.5-Flash-int4 на M1 Ultra с 128 ГБ RAM. Реальные бенчмарки llama-bench, сравнение с альтернативами и полный контекст 256k. 5 мин чтения 5684 Запойные чтения 2025: 6 статей по локальным LLM, от которых вы не оторветесь Обзор самых важных научных работ 2025 года, которые меняют подход к локальному запуску LLM. Архитектуры, inference, квантование - только практика. 5 мин чтения 5685 PromptProxy: как собирать датасеты для дистилляции, не сжигая API-ключи Обзор PromptProxy: инструмент для безопасного сбора промптов и ответов от GPT-4o, Claude 3.7 и других LLM. Экономия токенов, защита API-ключей, создание датасет 6 мин чтения 5686 Когда Flash-Attention приходит на CPU: как ggml заставляет работать длинные контексты без GPU Как использовать оптимизацию FA split across kv в ggml для ускорения декодирования длинных контекстов на CPU. Сравнение с альтернативами и практические примеры. 4 мин чтения 5687 Devstral Small против GLM 4.7 Flash: какую модель загрузить в ваш coding agent сегодня? Прямое сравнение эффективности токенов Devstral Small и GLM 4.7 Flash для автономных coding agents. Какая модель экономит время и ресурсы в 2026. 8 мин чтения 5688 Transformer Lab for Teams: когда один GPU — это смешно, а кластер — головная боль Как Transformer Lab for Teams решает проблему фрагментации workflow в распределённом обучении моделей. Поддержка Slurm, SkyPilot, приватность. 6 мин чтения