Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

3121 Лучшие GGUF модели для Mac M4 16 ГБ: итоги тестирования 331 модели и почему MoE побеждают Полное тестирование 331 GGUF модели на Mac M4 16 ГБ. Обнаружили, почему Mixture of Experts (MoE) модели доминируют при ограниченной памяти. Список Pareto-оптима 7 мин чтения 3122 Modly: как запустить локальную генерацию 3D-моделей с TripoSG и TRELLIS Полный гайд по установке Modly для генерации 3D-моделей на своём ПК. Используйте TripoSG и TRELLIS для игровых ассетов и 3D-печати без интернета. 5 мин чтения 3123 Анонс Unsloth для MLX: как готовиться к локальному fine-tuning на Mac (M1/M2/M3) и что это изменит Анонс Unsloth для MLX в 2026 году обещает локальный fine-tuning на Mac без облака. Как подготовить железо и данные для революции в разработке AI. 5 мин чтения 3124 Voxtral Codec: как ужать речь до 2.14 кбит/с и не заметить разницы Обзор Voxtral Codec. Как работает новый кодек для TTS со сжатием речи до 2.14 кбит/с. Архитектура VQ+FSQ, сравнение с альтернативами, примеры использования. 5 мин чтения 3125 Qwen3.5-122b в AWQ 4bit разгромил всех в стратегической игре: тест на саморефлексию, который испугал разработчиков Пользовательский бенчмарк-стратегия показал, что квантованная Qwen3.5-122b превосходит другие LLM в адаптации и самоанализе. Итоги на 26.03.2026. 4 мин чтения 3126 Prompt-инжиниринг для геймдева: как точные фразы и обход base64 генерируют 400 игровых спрайтов Практический гайд по prompt-инжинирингу для геймдева. Как конкретные фразы и обход бага с base64 в Gemini 3 Flash экономят часы на создании ассетов. 8 мин чтения 3127 Конфигурация vLLM для Qwen 3.5 27B: как добиться 1.1M токен/с на кластере с B200 Рекордная скорость инференса 1.1M токен/с на Qwen 3.5 27B с vLLM, NVIDIA B200, FP8 KV cache и MTP-1. Настройки и конфиги. 4 мин чтения 3128 Кастомный бэкенд llama.cpp для AMD XDNA2 NPU: полное руководство по установке и настройке Эксклюзивный гайд по сборке кастомного бэкенда llama.cpp для AMD XDNA2 NPU. Настройка XRT, offload GEMM операций, тесты на Ryzen AI MAX 385. 6 мин чтения 3129 Дата-центры под давлением: как новые законы об энергопотреблении изменят локальный AI Сенат США готовит жесткие законы для дата-центров. Как новые нормы энергопотребления заставят индустрию перейти на локальные модели и что это значит для разрабо 5 мин чтения 3130 Обзор OpenRoom от MiniMax: как запустить нишевую модель на Qwen 27B через llama.cpp Обзор нишевой модели OpenRoom для генерации контента. Инструкция по локальному запуску Qwen 27B через llama.cpp, сравнение с аналогами и примеры использования. 5 мин чтения 3131 Amazon Polly Bidirectional Streaming: как API для потокового синтеза речи ускорит голосовых ассистентов Новый API Amazon Polly с двунаправленным потоковым синтезом речи на HTTP/2 снижает задержку голосовых ассистентов до 200 мс. Технический разбор для разработчико 5 мин чтения 3132 Разработка ИИ-агента с нуля: архитектура MicroClaw, защита от утечек данных и оптимизация токенов Практический гайд по разработке ИИ-агента с архитектурой MicroClaw. Защита от утечек данных, оптимизация токенов, пошаговый план на 2026 год. 10 мин чтения