Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

397 Дайджест и сравнительный анализ новых моделей для локального инференса: DeepSeek V4, Laguna 2.1 и Inkling-Small на фоне Qwen 3.5 122B Сравнили DeepSeek V4 (Q2), Laguna 2.1 (NVFP4) и Inkling-Small (IQ3) с Qwen 3.5 122B на DGX Spark. Замеры скорости, памяти и качества на реальных задачах. Готовы 7 мин чтения 398 Harness Design: как обвязка двигает точность модели на 22 пункта — разбор на 4B и Kubernetes SIG triage Одна замороженная 4B-модель, один корпус из 250 задач Kubernetes SIG triage, разная обвязка — и разброс точности от 60% до 82%. Разбираем, какие решения в дизай 9 мин чтения 399 Оптимальный размер модели для локального инференса в 2026: почему 70-80B MoE — золотая середина Почему 70-80B MoE — оптимальный размер модели для локального инференса в 2026 году. Практические тесты на AMD V620 с ROCm и llama.cpp: 16-22 ток/с на 120B проти 7 мин чтения 400 DeepSeek Q1, Q2 и Q3: что известно о новой линейке и как она изменит рынок AI Три новые модели DeepSeek за один день: Q1, Q2 и Q3. Разбираем предполагаемые характеристики, сравниваем с V4 Flash и GPT-5.6 Luna, анализируем влияние на цены 8 мин чтения 401 Автоматизация семантического слоя в Amazon Quick: Agentic Catalog Experience и конец ручного переноса метаданных Amazon Quick представил Agentic Catalog Experience — AI-рабочий процесс, который наследует семантику из AWS Glue и Databricks Unity Catalog, устраняя ручное пер 7 мин чтения 402 Deepseek V4 Flash: вторая среди open weight моделей и в 50 раз дешевле конкурентов — детальный разбор Deepseek V4 Flash: вторая среди open weight моделей при цене $0.09 за миллион токенов. Тесты кодинга, логических рассуждений и чат-сценариев, сравнение с Kimi K 9 мин чтения 403 Локальные LLM вне кода: 3 реальных сценария для бизнеса и повседневных задач Локальные LLM обрабатывают конфиденциальные документы, работают офлайн-ассистентами и обеспечивают корпоративный поиск без утечки данных. Тесты Llama 3, Mistral 7 мин чтения 404 Как запустить GLM-5.2 на tinybox: практическое руководство Пошаговое руководство по запуску 436B-модели GLM-5.2 на компактном tinybox: квантизация Q4_K_M, установка llama.cpp на ARM, реальные тесты скорости 2-4 токен/с 8 мин чтения 405 Inkling-Small-276B-12B против Qwen3.6-27B: битва архитектур в генерации кода Практический тест: Inkling-Small-276B-12B (MoE, 12B активных) против Qwen3.6-27B (плотная) на сложной задаче генерации кода. 6 минут размышлений и халтурный код 9 мин чтения 406 Structured Risk: Как пари на инфраструктуру ИИ привело к раскрытию хедж-фонда Situational Awareness и что осталось у Ашенбреннера Хедж-фонд Situational Awareness с доходностью 439% потерял половину активов из-за падения акций SK Hynix, Sandisk, Nebius и Bloom Energy. Разбираем, как плечо п 10 мин чтения 407 Судебная тяжба Anthropic с Пентагоном: прецедент для AI-контрактов Федеральный судья США признал незаконной попытку наказать Anthropic за отказ от военного контракта. Разбираем суть конфликта, аргументы сторон и значение прецед 6 мин чтения 408 Рекурсивный движок llama.cpp: прирост качества x3 ценой 13% скорости. Тесты на RTX 3050 с Qwen 32B, 7B Coder и Mistral Практический разбор рекурсивного движка llama.cpp (D=12) на RTX 3050. Тесты Qwen 32B-A3B, Qwen 2.5 Coder 7B и Mistral 7B: прирост точности до 3.1x, падение скор 9 мин чтения