Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3997
Исправление ошибки: Qwen 3.5 выводит бессмыслицу после 2-3 ответов в Llama.cpp (глубокий разбор и решения)
Глубокий разбор ошибки Qwen 3.5 в Llama.cpp, когда модель выводит бессмыслицу после 2-3 ответов. Пошаговые решения, настройки квантования и параметров на 05.03.
3998
Тестирование Qwen3.5 на NVIDIA V100 с NVLink: скорость inference, настройка и оптимизация
Полный гайд по запуску Qwen3.5 на NVIDIA V100 с NVLink. Актуальные цифры скорости (до 80 t/s), пошаговая настройка multi-GPU, квантование и тонкая оптимизация i
3999
Как добиться 85% на SimpleQA с Llama-3.2 3B и Keiro API: локальный запуск за $0.005 за запрос
Практический гайд по достижению 85% точности на SimpleQA с локальной Llama-3.2 3B и Keiro API. Стоимость запроса всего $0.005. Пошаговая инструкция.
4000
Google Workspace CLI: Как убить веб-интерфейс и подружить терминал с ИИ
Обзор Google Workspace CLI на 2026: автоматизация управления пользователями, интеграция с Gemini 3 через командную строку. Примеры команд и сравнение с альтерна
4001
KernelEvo: как фреймворк от AIRI автоматически генерирует и оптимизирует CUDA/Triton ядра
Фреймворк KernelEvo автоматически создает и оптимизирует CUDA/Triton ядра, экономя недели работы. Сравнение, примеры, для кого подходит. Актуально на март 2026
4002
Orion: как запустить и обучать LLM на Apple Neural Engine в обход CoreML (до 170 токенов/с)
Обзор Orion - инструмента для запуска и обучения LLM на Apple Neural Engine в обход CoreML. Скорость до 170 токен/с, сравнение с альтернативами и примеры исполь
4003
Математическая революция: почему механизм внимания — это проблема d², а не n²
Разбор анонимного доказательства, показывающего, что истинная сложность механизма внимания — O(d²), а не O(n²). Как это изменит архитектуру трансформеров и эффе
4004
zembed-1: мультиязычные эмбеддинги, которые обошли OpenAI. Как использовать в RAG
Обзор zembed-1 - новой SOTA модели для мультиязычных эмбеддингов. Сравнение с OpenAI, инструкция по интеграции в RAG пайплайн.
4005
Сравнительный тест Qwen3.5: 4B, 9B и 27B модели в Ollama на Radeon 7900XTX
Практический бенчмарк Qwen3.5 моделей на Radeon 7900XTX. Сравнение скорости и качества ответов. Код для повторения тестов.
4006
Почему LM Studio медленнее llama.cpp для MoE-моделей: разбор и настройка для максимальной скорости
Разбираем, почему LM Studio в 2.5 раза медленнее llama.cpp для MoE-моделей и даем пошаговую настройку для максимальной скорости.
4007
Как создать саморазвивающегося ИИ-агента на Rust: эксперимент Truman Show
Пошаговый гайд по созданию автономного ИИ-агента на Rust, который пишет код, ведет журнал и саморазвивается. Практический эксперимент Truman Show 2026.
4008
Yuan3.0-Ultra: обзор триллионной MoE-модели с открытыми весами и LAEP-алгоритмом
Обзор Yuan3.0-Ultra - открытой триллионной MoE-модели с LAEP-алгоритмом. Возможности, сравнение с Mixtral и Qwen, примеры использования для RAG и мультимодальны