Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

2197 Написание компилятора LLM с нуля: как PyTorch преобразуется в CUDA на 5000 строк Python Глубокий разбор создания компилятора для LLM: захват графа torch.fx, генерация CUDA ядер, fusion и оптимизация. Практический код и подводные камни. Апрель 2026. 7 мин чтения 2198 Локальный пайплайн PDF в аудиокнигу: Kokoro 82M, Qwen и llama.cpp Полный гайд по созданию полностью офлайн-конвейера PDF→аудиокнига: извлечение текста через Qwen, очистка llama.cpp и синтез Kokoro 82M. Без облаков, без затрат, 8 мин чтения 2199 Аудит безопасности LLM-платформы: как один curl раскрыл все API-ключи Реальный кейс: как через SSRF и открытые API утекли ключи AI-платформы. Пошаговый гайд по аудиту и защите инфраструктуры LLM. 6 мин чтения 2200 RAG-системы под ударом: как пять документов ломают ваш AI-помощник и что делать Исследование USENIX Security показало: всего 5 вредоносных документов берут под контроль RAG-систему. Разбираем механизм атаки, уязвимости эмбеддингов и способы 3 мин чтения 2201 InclusionAI выкатила Ling-2.6-1T: очередной триллион для гигантов или надежда для локальных? InclusionAI выпускает Ling-2.6-1T —новую модель с триллионом параметров. Разбираемся, что изменилось по сравнению с предшественником и как такие монстры могут б 4 мин чтения 2202 Как изменение тона Claude Opus 4.7 вызвало холивар в сообществе: разбор реакции и технических деталей Разбираем, почему новый тон Claude Opus 4.7 взорвал сообщество: обвинения в сикофантии, технические детали изменений и реакция Anthropic. 3 мин чтения 2203 Как заменить PySpark на YAML: создание пайплайнов данных без разработчиков Пошаговый гайд: как перевести ETL на декларативные YAML-пайплайны, избавиться от зависимости от разработчиков и ускорить релизы. Актуально на 2026 год. 1 мин чтения 2204 Взлом PS5 для локального инференса LLM: дешёвый GPU или пустая затея? Разбираем, стоит ли взламывать PS5 для запуска нейросетей. Технические ограничения, сравнение с RTX 3090 и альтернативы на 2026 год. 3 мин чтения 2205 Как дать кодинг-агенту зрение: MCP-сервер с локальной vision-моделью GLM-5.1 Пошаговый гайд по созданию MCP-сервера с локальной моделью GLM-5.1 Vision 8B для анализа скриншотов и UI. Как дать агенту глаза без облака. 9 мин чтения 2206 Как сэкономить токены в агентных системах: 6 методов с интерактивными графиками Инженерный гайд по снижению расхода токенов в агентных системах: prompt caching, semantic caching, lazy-loading инструментов, маршрутизация, субагенты и очистка 10 мин чтения 2207 llama.cpp NVFP4 Benchmark: Native vs Non-Native Performance on RTX 5090 (Blackwell) Сравнение производительности NVFP4-квантования в llama.cpp на RTX 5090 (Blackwell). Реальные бенчмарки, сборка native vs non-native, прирост скорости до 50%. 7 мин чтения 2208 Silicon Lottery: Why GPU Cloud Performance Varies Dramatically – and How to Choose Wisely Why does the same GPU model give 30% different performance in the cloud? Silicon lottery meets multi-tenancy. Learn how to benchmark and pick the right provider 4 мин чтения