Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

3997 Исправление ошибки: Qwen 3.5 выводит бессмыслицу после 2-3 ответов в Llama.cpp (глубокий разбор и решения) Глубокий разбор ошибки Qwen 3.5 в Llama.cpp, когда модель выводит бессмыслицу после 2-3 ответов. Пошаговые решения, настройки квантования и параметров на 05.03. 7 мин чтения 3998 Тестирование Qwen3.5 на NVIDIA V100 с NVLink: скорость inference, настройка и оптимизация Полный гайд по запуску Qwen3.5 на NVIDIA V100 с NVLink. Актуальные цифры скорости (до 80 t/s), пошаговая настройка multi-GPU, квантование и тонкая оптимизация i 9 мин чтения 3999 Как добиться 85% на SimpleQA с Llama-3.2 3B и Keiro API: локальный запуск за $0.005 за запрос Практический гайд по достижению 85% точности на SimpleQA с локальной Llama-3.2 3B и Keiro API. Стоимость запроса всего $0.005. Пошаговая инструкция. 6 мин чтения 4000 Google Workspace CLI: Как убить веб-интерфейс и подружить терминал с ИИ Обзор Google Workspace CLI на 2026: автоматизация управления пользователями, интеграция с Gemini 3 через командную строку. Примеры команд и сравнение с альтерна 5 мин чтения 4001 KernelEvo: как фреймворк от AIRI автоматически генерирует и оптимизирует CUDA/Triton ядра Фреймворк KernelEvo автоматически создает и оптимизирует CUDA/Triton ядра, экономя недели работы. Сравнение, примеры, для кого подходит. Актуально на март 2026 5 мин чтения 4002 Orion: как запустить и обучать LLM на Apple Neural Engine в обход CoreML (до 170 токенов/с) Обзор Orion - инструмента для запуска и обучения LLM на Apple Neural Engine в обход CoreML. Скорость до 170 токен/с, сравнение с альтернативами и примеры исполь 5 мин чтения 4003 Математическая революция: почему механизм внимания — это проблема d², а не n² Разбор анонимного доказательства, показывающего, что истинная сложность механизма внимания — O(d²), а не O(n²). Как это изменит архитектуру трансформеров и эффе 8 мин чтения 4004 zembed-1: мультиязычные эмбеддинги, которые обошли OpenAI. Как использовать в RAG Обзор zembed-1 - новой SOTA модели для мультиязычных эмбеддингов. Сравнение с OpenAI, инструкция по интеграции в RAG пайплайн. 4 мин чтения 4005 Сравнительный тест Qwen3.5: 4B, 9B и 27B модели в Ollama на Radeon 7900XTX Практический бенчмарк Qwen3.5 моделей на Radeon 7900XTX. Сравнение скорости и качества ответов. Код для повторения тестов. 9 мин чтения 4006 Почему LM Studio медленнее llama.cpp для MoE-моделей: разбор и настройка для максимальной скорости Разбираем, почему LM Studio в 2.5 раза медленнее llama.cpp для MoE-моделей и даем пошаговую настройку для максимальной скорости. 7 мин чтения 4007 Как создать саморазвивающегося ИИ-агента на Rust: эксперимент Truman Show Пошаговый гайд по созданию автономного ИИ-агента на Rust, который пишет код, ведет журнал и саморазвивается. Практический эксперимент Truman Show 2026. 10 мин чтения 4008 Yuan3.0-Ultra: обзор триллионной MoE-модели с открытыми весами и LAEP-алгоритмом Обзор Yuan3.0-Ultra - открытой триллионной MoE-модели с LAEP-алгоритмом. Возможности, сравнение с Mixtral и Qwen, примеры использования для RAG и мультимодальны 5 мин чтения