Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
2253
материалов
01
Claude Opus 4.8 на AWS: что нового в самой мощной модели Anthropic для агентных задач
Anthropic запустила Claude Opus 4.8 на AWS — флагманскую модель с Dynamic Workflows, улучшенной обработкой неопределённости и поддержкой длительных production-в
02
Granite 4.1: почему IBM разорвала с MoE и вернулась к pure transformer
Разбираем, почему IBM в Granite 4.1 заменила архитектуру Mixture of Experts на классический transformer. Причины: сложность дообучения, проблемы с памятью и пра
03
Anthropic Opus 4.8: Dynamic Workflows и улучшенная обработка неопределённости — обзор новых возможностей
Разбор релиза Claude Opus 4.8: Dynamic Workflows — как модель сама строит цепочки действий, перестаёт врать и честно говорит «я не знаю». Кейс Bridgewater.
04
Gemini 3.5 Flash против DeepSeek V4 и Tencent Hy3: кто реально дешевле и качественнее в production
Сравнение Gemini-3.5-flash, DeepSeek V4 и Tencent Hy3: стоимость API, latency, бенчмарки, stability. Кто лидирует в production? Результаты на май 2026.
05
SaaS в эпоху AI-агентов: как меняется модель монетизации и почему рано хоронить интерфейсы
Разбираем, как AI-агенты перекраивают SaaS-рынок: per-action биллинг, посреднические платежи и неожиданная роль UI. Инсайты из Kaiten и a16z.
06
Как привлечь $10M без продукта: разбор платежной инфраструктуры для AI-агентов от стартапа Natural
Как стартап Natural собрал $10 миллионов на платежную инфраструктуру для AI-агентов, не написав ни строчки кода. Разбор их рыночного документа и стратегии.
07
1C Code Bench: первый бенчмарк для кодогенерации на 1С — кто из LLM сдал экзамен?
Новый бенчмарк 1C Code Bench оценивает способности LLM генерировать код на встроенном языке 1С:Предприятие. Результаты тестов GPT-5, Claude 4, DeepSeek-R1 и рос
08
Единый AI API в России: как бизнесу платить рублями и получить 300+ моделей
Как российским компаниям использовать AI API без зарубежных карт. Обзор шлюза с 300+ моделями, оплата рублями, примеры интеграции.
09
Как Remote увеличил выручку на 50% на сотрудника с помощью AI: кейс внедрения Claude и Slack-агентов
Remote Build внедрила Claude и Slack-агентов, автоматизировав рутину. Результат – рост revenue per employee на 50%. Детали кейса и разбор ошибок.
10
SWE-rebench март–май 2026: GPT-5.5, Opus 4.7, Cursor 2.5 и Kimi K2.6 — кто реально пишет код без багов?
Свежий лидерборд SWE-rebench за март–май 2026: реальные проценты решённых задач, неожиданные лидеры и кто провалился. Читайте разбор четырёх топ-моделей.
11
ITBench-AA: новый бенчмарк для агентных IT-задач — все ведущие модели провалились (ниже 50%)
Новый бенчмарк ITBench-AA от IBM и Artificial Analysis показал: Claude Opus 4.7, GPT-5.5 и другие не справляются с реальными задачами SRE. Результаты ниже 50%.
12
Cognition привлек $1 млрд при оценке $25 млрд: что означает рост Devin для рынка AI-кодинга
Cognition привлёк $1 млрд при оценке $25 млрд. Разбираемся, почему Devin стал главным конкурентом Claude Code и Codex, и что это значит для разработчиков.