Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

61 Как собрать EdTech-сервис для изучения английского без лишнего LLM Практический разбор архитектуры тренажёра английского на YouTube-субтитрах: очистка, лемматизация, частотные списки, IndexedDB, PWA и интервальные повторения. У 11 мин чтения 62 Что можно сделать с 500 ГБ Optane-памяти и есть ли ей применение в 2026 году 500 ГБ Optane звучат как редкий способ резко расширить память для AI, но в реальности все решают тип устройства и совместимость платформы. Разбираем отличия Opt 13 мин чтения 63 Qwen3.8-27B на RTX PRO 4000 Blackwell 24GB: 128K контекст и ускорение MTP3 Разбираем запуск Qwen3.8-27B на RTX PRO 4000 Blackwell 24GB: выбор CUDA 13.3 и nvcc, поддержку sm_120a, пересборку NInfer, MTP3 и сравнение BF16 с INT8 KV cache 17 мин чтения 64 Почему имя GGUF-кванта может не совпадать с тем, что реально лежит в файле Разбираем, почему маркировка GGUF может скрывать fallback в llama-quantize, из-за которого IQ1 или IQ2 оказываются ближе к 4.5 bpw. Узнайте, как проверить типы 10 мин чтения 65 Как neocloud-компании финансируют закупки GPU в 2026 году и почему AI-инфраструктура уходит в долг Почему AI-облака берут private debt и secured credit facility под Nvidia-GPU, как клиентские контракты превращают аренду мощностей в денежный поток и где скрыты 12 мин чтения 66 OpenAI проверяет постоянно работающий режим Codex: возможности и риски автономного ИИ-агента OpenAI проверяет превращение Codex в постоянно работающего ИИ-агента, который сохраняет контекст, продолжает задачи между сессиями и использует инструменты. Раз 12 мин чтения 67 ROCm 10.0: что меняется для локальных LLM и агентного AI на AMD Разбираем, что ROCm 10.0 меняет для локальных LLM на AMD: как связаны ROCm, llama.cpp и ONNX Runtime, зачем OpenAI-совместимый API агентам и RAG, сколько VRAM н 12 мин чтения 68 Как собрать локальный стек для Qwen3.8 27B на двух RTX 3090 с DFlash2 и LMCache Разбираем практическую схему запуска Qwen3.8 27B на двух RTX 3090 с DFlash2, speculative decoding, fp8 KV-cache и LMCache. Показываем, как связаны VRAM, RAM, NV 12 мин чтения 69 Как Salesforce добилась Multi-AZ отказоустойчивости для SageMaker Inference Components без потери экономии на GPU Разбираем, почему многозонный SageMaker endpoint не гарантирует отказоустойчивость конкретной модели и как SchedulingConfig с PlacementStrategy SPREAD помогает 10 мин чтения 70 Как Decathlon использует Chronos-2 для прогнозирования спроса на десятки тысяч SKU Разбираем заявленный кейс Decathlon с Chronos-2: как time series foundation model может упростить недельный прогноз спроса по десяткам тысяч SKU и регионов. В с 9 мин чтения 71 Amazon SageMaker Feature Store получил BatchWriteRecord и ListRecords: что меняется для ingestion и управления записями Разбираем, как BatchWriteRecord и ListRecords меняют работу с Amazon SageMaker Feature Store: пакетная запись до 25 признаковых записей, partial success, retry 10 мин чтения 72 Как построить human-in-the-loop для AI-агента без потери пропускной способности Как спроектировать систему подтверждений для AI-агента: риск-ориентированная маршрутизация, blast radius, чувствительность данных, UX ревью и калибровка порогов 8 мин чтения