Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
8005
DPO за 5 минут: как заменить сложный PPO одной формулой для выравнивания LLM
Объясняем Direct Preference Optimization (DPO) простым языком: как заменить сложный PPO одной формулой для выравнивания больших языковых моделей с примерами код
8006
Local LLM vs API: когда окупается покупка железа за $$$$$?
Полный финансовый анализ: когда выгоднее купить GPU для локальных LLM, а когда использовать API. Расчет ROI, сравнение затрат и практические кейсы.
8007
Diffusion vs Autoregressive LLM: какая архитектура быстрее и дешевле в 2025 году?
Полное сравнение архитектур Diffusion и Autoregressive LLM: какая быстрее, дешевле в эксплуатации и лучше для production в 2025 году.
8008
Gemini 2.5 Flash vs Gemini 3 Flash: кто победил в битве поколений?
Полное сравнение Gemini 2.5 Flash и Gemini 3 Flash от Google: тесты производительности, качество кода, математика, reasoning и практические рекомендации.
8009
Как создать Embodied AI на Jetson AGX Thor: 94K строк кода и сознание для робота
Полное пошаговое руководство по созданию Embodied AI с 94K строк кода на Jetson AGX Thor. Архитектура, интеграция LLM, сенсоры, актуаторы и создание сознания дл
8010
Как внутренний ИИ-инструмент для разработчиков вырос до 1,5 млн пользователей: история GPTunneL
История российского стартапа GPTunneL: от внутреннего инструмента для разработчиков до платформы с 1,5 млн пользователей. Ключевые факторы успеха и планы на экс
8011
Как локальная LLM может стать вашим личным патинг-инженером: опыт модификации open-source
Практическое руководство по использованию локальной LLM как патинг-инженера. Узнайте, как безопасно модифицировать open-source код с полной приватностью и контр
8012
Почему Post-Training Quantization ломается на длинных chain-of-thought рассуждениях
Глубокий разбор почему Post-Training Quantization разрушает качество длинных chain-of-thought рассуждений в LLM и как с этим бороться
8013
Как собрать RAG-агента для объяснения настолок без тяжёлых библиотек
Практический гайд по созданию лёгкого RAG-агента для объяснения правил настольных игр без сложных фреймворков. Работающий pet-проект на Python.
8014
Int4 QAT против PTQ: почему Kimi выбрала квантование для K2 и как это повлияло на latency
Глубокий технический разбор: почему Kimi выбрала квантование для модели K2, как QAT влияет на latency MoE-архитектур и что это значит для инференса.
8015
Как запустить 355-миллиардную модель на железе 2015 года: полное руководство по оптимизации
Подробный гайд по запуску огромных LLM (GLM-4, MoE) на CPU через llama.cpp. Квантование, оптимизация памяти, настройка для старых систем.
8016
Как настроить Reko для автоматической обработки YouTube-плейлистов
Полное руководство по настройке Reko для автоматической обработки YouTube-плейлистов. Скачивание, транскрибация, локальные модели и скриптинг.