Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

8005 DPO за 5 минут: как заменить сложный PPO одной формулой для выравнивания LLM Объясняем Direct Preference Optimization (DPO) простым языком: как заменить сложный PPO одной формулой для выравнивания больших языковых моделей с примерами код 8 мин чтения 8006 Local LLM vs API: когда окупается покупка железа за $$$$$? Полный финансовый анализ: когда выгоднее купить GPU для локальных LLM, а когда использовать API. Расчет ROI, сравнение затрат и практические кейсы. 8 мин чтения 8007 Diffusion vs Autoregressive LLM: какая архитектура быстрее и дешевле в 2025 году? Полное сравнение архитектур Diffusion и Autoregressive LLM: какая быстрее, дешевле в эксплуатации и лучше для production в 2025 году. 9 мин чтения 8008 Gemini 2.5 Flash vs Gemini 3 Flash: кто победил в битве поколений? Полное сравнение Gemini 2.5 Flash и Gemini 3 Flash от Google: тесты производительности, качество кода, математика, reasoning и практические рекомендации. 8 мин чтения 8009 Как создать Embodied AI на Jetson AGX Thor: 94K строк кода и сознание для робота Полное пошаговое руководство по созданию Embodied AI с 94K строк кода на Jetson AGX Thor. Архитектура, интеграция LLM, сенсоры, актуаторы и создание сознания дл 8 мин чтения 8010 Как внутренний ИИ-инструмент для разработчиков вырос до 1,5 млн пользователей: история GPTunneL История российского стартапа GPTunneL: от внутреннего инструмента для разработчиков до платформы с 1,5 млн пользователей. Ключевые факторы успеха и планы на экс 5 мин чтения 8011 Как локальная LLM может стать вашим личным патинг-инженером: опыт модификации open-source Практическое руководство по использованию локальной LLM как патинг-инженера. Узнайте, как безопасно модифицировать open-source код с полной приватностью и контр 7 мин чтения 8012 Почему Post-Training Quantization ломается на длинных chain-of-thought рассуждениях Глубокий разбор почему Post-Training Quantization разрушает качество длинных chain-of-thought рассуждений в LLM и как с этим бороться 8 мин чтения 8013 Как собрать RAG-агента для объяснения настолок без тяжёлых библиотек Практический гайд по созданию лёгкого RAG-агента для объяснения правил настольных игр без сложных фреймворков. Работающий pet-проект на Python. 7 мин чтения 8014 Int4 QAT против PTQ: почему Kimi выбрала квантование для K2 и как это повлияло на latency Глубокий технический разбор: почему Kimi выбрала квантование для модели K2, как QAT влияет на latency MoE-архитектур и что это значит для инференса. 7 мин чтения 8015 Как запустить 355-миллиардную модель на железе 2015 года: полное руководство по оптимизации Подробный гайд по запуску огромных LLM (GLM-4, MoE) на CPU через llama.cpp. Квантование, оптимизация памяти, настройка для старых систем. 8 мин чтения 8016 Как настроить Reko для автоматической обработки YouTube-плейлистов Полное руководство по настройке Reko для автоматической обработки YouTube-плейлистов. Скачивание, транскрибация, локальные модели и скриптинг. 8 мин чтения