Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
5677
Когда сжатие памяти в macOS убивает LLM: полный гайд по отключению
MacBook тормозит с локальными LLM? Виртуальная память съедает производительность. Пошаговое руководство по отключению сжатия памяти в macOS для стабильной работ
5678
GLM-OCR: почему эта мультимодалка читает документы лучше, чем вы
Технический разбор GLM-OCR — мультимодальной модели для понимания сложных документов. Multi-Token Prediction loss, CogViT энкодер, двухэтапный пайплайн.
5679
Step-3.5-Flash-Int4 в llama.cpp: как заставить модель думать, а не повторять одно и то же
Пошаговая инструкция по настройке llama.cpp для Step-3.5-Flash-Int4: оптимальные параметры температуры, penalty и контекста против зацикливания в reasoning.
5680
NTTuner + GUI: Финтюн моделей на Windows без боли, с Unsloth под капотом
Пошаговое руководство по использованию NTTuner с графическим интерфейсом для тонкой настройки языковых моделей на Windows. Интеграция с Unsloth для ускорения в
5681
Дистилляция Kimi K2: Сообщество пытается упаковать гиганта в 1 миллиард параметров
Обзор первых попыток open-source сообщества сжать модель Kimi K2.5 методом дистилляции в меньшую модель Granite 1B. Технические детали и перспективы на 2026 год
5682
Kimi K2.5 Thinking обгоняет всех в Extended NYT Connections. Теперь это главный тест на сообразительность
Китайская модель с открытыми весами возглавила новый бенчмарк на рассуждения. Разбираем, что такое Extended NYT Connections и почему он важен для оценки AI в 20
5683
Step-3.5-Flash-int4: новый король для Mac с 128 ГБ памяти
Тестируем Step-3.5-Flash-int4 на M1 Ultra с 128 ГБ RAM. Реальные бенчмарки llama-bench, сравнение с альтернативами и полный контекст 256k.
5684
Запойные чтения 2025: 6 статей по локальным LLM, от которых вы не оторветесь
Обзор самых важных научных работ 2025 года, которые меняют подход к локальному запуску LLM. Архитектуры, inference, квантование - только практика.
5685
PromptProxy: как собирать датасеты для дистилляции, не сжигая API-ключи
Обзор PromptProxy: инструмент для безопасного сбора промптов и ответов от GPT-4o, Claude 3.7 и других LLM. Экономия токенов, защита API-ключей, создание датасет
5686
Когда Flash-Attention приходит на CPU: как ggml заставляет работать длинные контексты без GPU
Как использовать оптимизацию FA split across kv в ggml для ускорения декодирования длинных контекстов на CPU. Сравнение с альтернативами и практические примеры.
5687
Devstral Small против GLM 4.7 Flash: какую модель загрузить в ваш coding agent сегодня?
Прямое сравнение эффективности токенов Devstral Small и GLM 4.7 Flash для автономных coding agents. Какая модель экономит время и ресурсы в 2026.
5688
Transformer Lab for Teams: когда один GPU — это смешно, а кластер — головная боль
Как Transformer Lab for Teams решает проблему фрагментации workflow в распределённом обучении моделей. Поддержка Slurm, SkyPilot, приватность.