Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3121
Лучшие GGUF модели для Mac M4 16 ГБ: итоги тестирования 331 модели и почему MoE побеждают
Полное тестирование 331 GGUF модели на Mac M4 16 ГБ. Обнаружили, почему Mixture of Experts (MoE) модели доминируют при ограниченной памяти. Список Pareto-оптима
3122
Modly: как запустить локальную генерацию 3D-моделей с TripoSG и TRELLIS
Полный гайд по установке Modly для генерации 3D-моделей на своём ПК. Используйте TripoSG и TRELLIS для игровых ассетов и 3D-печати без интернета.
3123
Анонс Unsloth для MLX: как готовиться к локальному fine-tuning на Mac (M1/M2/M3) и что это изменит
Анонс Unsloth для MLX в 2026 году обещает локальный fine-tuning на Mac без облака. Как подготовить железо и данные для революции в разработке AI.
3124
Voxtral Codec: как ужать речь до 2.14 кбит/с и не заметить разницы
Обзор Voxtral Codec. Как работает новый кодек для TTS со сжатием речи до 2.14 кбит/с. Архитектура VQ+FSQ, сравнение с альтернативами, примеры использования.
3125
Qwen3.5-122b в AWQ 4bit разгромил всех в стратегической игре: тест на саморефлексию, который испугал разработчиков
Пользовательский бенчмарк-стратегия показал, что квантованная Qwen3.5-122b превосходит другие LLM в адаптации и самоанализе. Итоги на 26.03.2026.
3126
Prompt-инжиниринг для геймдева: как точные фразы и обход base64 генерируют 400 игровых спрайтов
Практический гайд по prompt-инжинирингу для геймдева. Как конкретные фразы и обход бага с base64 в Gemini 3 Flash экономят часы на создании ассетов.
3127
Конфигурация vLLM для Qwen 3.5 27B: как добиться 1.1M токен/с на кластере с B200
Рекордная скорость инференса 1.1M токен/с на Qwen 3.5 27B с vLLM, NVIDIA B200, FP8 KV cache и MTP-1. Настройки и конфиги.
3128
Кастомный бэкенд llama.cpp для AMD XDNA2 NPU: полное руководство по установке и настройке
Эксклюзивный гайд по сборке кастомного бэкенда llama.cpp для AMD XDNA2 NPU. Настройка XRT, offload GEMM операций, тесты на Ryzen AI MAX 385.
3129
Дата-центры под давлением: как новые законы об энергопотреблении изменят локальный AI
Сенат США готовит жесткие законы для дата-центров. Как новые нормы энергопотребления заставят индустрию перейти на локальные модели и что это значит для разрабо
3130
Обзор OpenRoom от MiniMax: как запустить нишевую модель на Qwen 27B через llama.cpp
Обзор нишевой модели OpenRoom для генерации контента. Инструкция по локальному запуску Qwen 27B через llama.cpp, сравнение с аналогами и примеры использования.
3131
Amazon Polly Bidirectional Streaming: как API для потокового синтеза речи ускорит голосовых ассистентов
Новый API Amazon Polly с двунаправленным потоковым синтезом речи на HTTP/2 снижает задержку голосовых ассистентов до 200 мс. Технический разбор для разработчико
3132
Разработка ИИ-агента с нуля: архитектура MicroClaw, защита от утечек данных и оптимизация токенов
Практический гайд по разработке ИИ-агента с архитектурой MicroClaw. Защита от утечек данных, оптимизация токенов, пошаговый план на 2026 год.