Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
2253
материалов
01
Разоблачение бенчмарков для ИИ-кода: что скрывают графики Cursor и почему токены важнее процента решений
Критика CursorBench и SWE-bench: почему стоимость токенов и задержка генерации решают всё при выборе модели для продакшена. Актуально на март 2026.
02
Асимметричный скептицизм: как LLM стали цензорами по умолчанию
Новое исследование от 23.03.2026 показывает, как Claude 3.5, Gemini Ultra 2.0 и GPT-4o защищают официальные нарративы. Модели сами признают свою системную предв
03
Gimlet Labs: как multi-silicon inference cloud решает проблему bottlenecks в AI-инференсе
Стартап Gimlet Labs привлек $80M для multi-silicon inference cloud, который распределяет AI-нагрузку по разному железу, решая проблему bottlenecks. Подробности
04
Китайские LLM в тисках цензуры: как Qwen, DeepSeek, GLM и Yi фильтруют каждое слово
Свежее исследование 2026 года показывает, как Qwen 4, DeepSeek V3, GLM-4 и Yi-Large цензурируют ответы. Разбор абляции внимания и способов обхода.
05
LoCoMo врет: как сломанный бенчмарк памяти искажает все рейтинги LLM
Разбор скандала с LoCoMo. 6.4% неверных ответов и принятие 63% лжи искажают результаты тестов GPT-4o, Claude 3.5 и других моделей на 2026 год.
06
Открытый NPU: как самодельный чип обгоняет гигантов в локальном AI
Полный разбор открытой архитектуры NPU для ускорения 70B+ моделей на устройстве. Дизайн, энергоэффективность и перспективы против коммерческих решений.
07
SWE-bench февраль 2026: Claude Opus вырывается вперёд, но платить придётся
Анализ лидерборда SWE-bench за февраль 2026: кто лучше всего решает реальные PR на GitHub и сколько это стоит в 2026 году.
08
LILA Leech и геометрическое сжатие: революция в мобильном ИИ или громкий хайп?
Анализ технологии LILA Leech: обещает запускать GPT-3-уровневые модели на смартфонах с помощью геометрического сжатия E8. Реальность или хайп?
09
MiniMax M2.7: модель, которая учит сама себя, и почему это уже не фантастика
Разбор архитектуры MiniMax M2.7. Как модель улучшает себя через петли reinforcement learning и команды агентов. Актуальные метрики SWE-Pro и GDPval-AA на 2026 г
10
OpenClaw как стратегия Nvidia: почему робот-снеговик Олаф провалил демо на GTC 2026
На GTC 2026 робот-снеговик Олаф провалил демо из-за проблем с микрофоном. Как это связано со стратегией Nvidia OpenClaw и социальными рисками ИИ.
11
Terafab Илона Маска: амбициозные планы по производству чипов для SpaceX и Tesla — анализ реалистичности
Илон Маск объявил о строительстве фабрики Terafab для производства AI-чипов. Разбираем, насколько это реально в 2026 году.
12
Alibaba удваивает ставку на open-source: что ждать от новых моделей Qwen и Wan?
Разбор стратегии Alibaba по удвоению open-source инвестиций в AI. Что известно о новых моделях Qwen и Wan на март 2026 года? Анализ рисков и возможностей.