Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3325
Как заставить 8B модель работать как 70B: структурированный Chain-of-Thought и сжатие контекста для Graph RAG
Структурированный Chain-of-Thought и сжатие контекста графами позволяют малым LLM выполнять complex reasoning. Практический гайд для multi-hop QA с Llama 3.1 и
3326
LiteSearch: ваш 8-гигабайтный пропуск в мир авто-исследований ИИ
Пошаговый гайд по запуску авто-исследований ИИ на слабой видеокарте. Настройка GUI, адаптация моделей под 4-8 ГБ VRAM, сравнение с аналогами.
3327
Безвекторный RAG: 2 мс поиска, 87% точности и полная приватность для локальных LLM
Новый подход к RAG без эмбеддингов: поиск за 2 мс, hit rate 87%. Архитектура, преимущества для приватных локальных LLM и сферы применения.
3328
vLLM Studio: как тестировать OCR модели локально без Python и Docker (21.03.2026)
Обзор vLLM Studio 2.4 для Windows, Mac, Linux. Тестируйте Chandra, GLM OCR, PaddleOCR-VL локально на PDF и изображениях без программирования.
3329
Скандал с Delve: как AI-стартап обвиняют в «фейковом комплаенсе» и рисках для бизнеса
Разоблачение AI-стартапа Delve: как фейковый комплаенс подвергает данные компаний риску. Анализ скандала, штрафы GDPR и уроки для бизнеса в 2026 году.
3330
Зачем платят $100 в час за хамские диалоги с ИИ: разбор уникальной вакансии по стресс-тестированию
Уникальная вакансия 2026: платят $100 в час, чтобы оскорблять и ломать ИИ. Как стресс-тестирование стало ключевой индустрией и какие этические вопросы поднимает
3331
Конец эпохи TGI: на что перейти — vLLM или llama.cpp? Сравнение и гайд по миграции
TGI от Hugging Face перешел в режим поддержки. Разбираем, что лучше в 2026: vLLM или llama.cpp? Подробное сравнение и пошаговая миграция для DevOps-инженеров.
3332
Как бенчмаркать локальные LLM: сравнение моделей в кодинге, знаниях и рассуждениях
Полное руководство по объективному сравнению локальных языковых моделей. Узнай, как использовать OpenCompass, LM Evaluation Harness и другие инструменты для оце
3333
Как обучить свой GPT-трансформер с нуля на бюджетном CPU за 39 минут: полный гайд
Пошаговое руководство по обучению GPT-трансформера с нуля на обычном процессоре без GPU. Код, данные, оптимизации для PyTorch 2.4.
3334
Multi-Token Prediction в mlx-lm: как ускорить инференс Qwen 3.5 на Apple Silicon в 1.5 раза
Обзор Multi-Token Prediction в mlx-lm: как технология ускоряет генерацию Qwen 3.5 в 1.5 раза на Apple Silicon. Сравнение, примеры использования.
3335
TaskShield CLI: как ИИ-агенты ломают ваши задачи и что с этим делать
ИИ-агенты путают ваши проекты? Обзор TaskShield CLI 2.0 — open-source утилиты, которая защищает декомпозицию задач. Установка, примеры и сравнение.
3336
Nemotron 3 Super Uncensored для Mac: рекордные 96% на MMLU и установка с Hugging Face
Аблированная модель Nemotron 3 Super показывает рекордные 96% на MMLU. Как установить и использовать на Mac через Hugging Face. Сравнение с аналогами.