Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
2197
Написание компилятора LLM с нуля: как PyTorch преобразуется в CUDA на 5000 строк Python
Глубокий разбор создания компилятора для LLM: захват графа torch.fx, генерация CUDA ядер, fusion и оптимизация. Практический код и подводные камни. Апрель 2026.
2198
Локальный пайплайн PDF в аудиокнигу: Kokoro 82M, Qwen и llama.cpp
Полный гайд по созданию полностью офлайн-конвейера PDF→аудиокнига: извлечение текста через Qwen, очистка llama.cpp и синтез Kokoro 82M. Без облаков, без затрат,
2199
Аудит безопасности LLM-платформы: как один curl раскрыл все API-ключи
Реальный кейс: как через SSRF и открытые API утекли ключи AI-платформы. Пошаговый гайд по аудиту и защите инфраструктуры LLM.
2200
RAG-системы под ударом: как пять документов ломают ваш AI-помощник и что делать
Исследование USENIX Security показало: всего 5 вредоносных документов берут под контроль RAG-систему. Разбираем механизм атаки, уязвимости эмбеддингов и способы
2201
InclusionAI выкатила Ling-2.6-1T: очередной триллион для гигантов или надежда для локальных?
InclusionAI выпускает Ling-2.6-1T —новую модель с триллионом параметров. Разбираемся, что изменилось по сравнению с предшественником и как такие монстры могут б
2202
Как изменение тона Claude Opus 4.7 вызвало холивар в сообществе: разбор реакции и технических деталей
Разбираем, почему новый тон Claude Opus 4.7 взорвал сообщество: обвинения в сикофантии, технические детали изменений и реакция Anthropic.
2203
Как заменить PySpark на YAML: создание пайплайнов данных без разработчиков
Пошаговый гайд: как перевести ETL на декларативные YAML-пайплайны, избавиться от зависимости от разработчиков и ускорить релизы. Актуально на 2026 год.
2204
Взлом PS5 для локального инференса LLM: дешёвый GPU или пустая затея?
Разбираем, стоит ли взламывать PS5 для запуска нейросетей. Технические ограничения, сравнение с RTX 3090 и альтернативы на 2026 год.
2205
Как дать кодинг-агенту зрение: MCP-сервер с локальной vision-моделью GLM-5.1
Пошаговый гайд по созданию MCP-сервера с локальной моделью GLM-5.1 Vision 8B для анализа скриншотов и UI. Как дать агенту глаза без облака.
2206
Как сэкономить токены в агентных системах: 6 методов с интерактивными графиками
Инженерный гайд по снижению расхода токенов в агентных системах: prompt caching, semantic caching, lazy-loading инструментов, маршрутизация, субагенты и очистка
2207
llama.cpp NVFP4 Benchmark: Native vs Non-Native Performance on RTX 5090 (Blackwell)
Сравнение производительности NVFP4-квантования в llama.cpp на RTX 5090 (Blackwell). Реальные бенчмарки, сборка native vs non-native, прирост скорости до 50%.
2208
Silicon Lottery: Why GPU Cloud Performance Varies Dramatically – and How to Choose Wisely
Why does the same GPU model give 30% different performance in the cloud? Silicon lottery meets multi-tenancy. Learn how to benchmark and pick the right provider