Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

2253 материалов
01 Claude Opus 4.8 на AWS: что нового в самой мощной модели Anthropic для агентных задач Anthropic запустила Claude Opus 4.8 на AWS — флагманскую модель с Dynamic Workflows, улучшенной обработкой неопределённости и поддержкой длительных production-в 6 мин чтения 02 Granite 4.1: почему IBM разорвала с MoE и вернулась к pure transformer Разбираем, почему IBM в Granite 4.1 заменила архитектуру Mixture of Experts на классический transformer. Причины: сложность дообучения, проблемы с памятью и пра 4 мин чтения 03 Anthropic Opus 4.8: Dynamic Workflows и улучшенная обработка неопределённости — обзор новых возможностей Разбор релиза Claude Opus 4.8: Dynamic Workflows — как модель сама строит цепочки действий, перестаёт врать и честно говорит «я не знаю». Кейс Bridgewater. 6 мин чтения 04 Gemini 3.5 Flash против DeepSeek V4 и Tencent Hy3: кто реально дешевле и качественнее в production Сравнение Gemini-3.5-flash, DeepSeek V4 и Tencent Hy3: стоимость API, latency, бенчмарки, stability. Кто лидирует в production? Результаты на май 2026. 5 мин чтения 05 SaaS в эпоху AI-агентов: как меняется модель монетизации и почему рано хоронить интерфейсы Разбираем, как AI-агенты перекраивают SaaS-рынок: per-action биллинг, посреднические платежи и неожиданная роль UI. Инсайты из Kaiten и a16z. 7 мин чтения 06 Как привлечь $10M без продукта: разбор платежной инфраструктуры для AI-агентов от стартапа Natural Как стартап Natural собрал $10 миллионов на платежную инфраструктуру для AI-агентов, не написав ни строчки кода. Разбор их рыночного документа и стратегии. 4 мин чтения 07 1C Code Bench: первый бенчмарк для кодогенерации на 1С — кто из LLM сдал экзамен? Новый бенчмарк 1C Code Bench оценивает способности LLM генерировать код на встроенном языке 1С:Предприятие. Результаты тестов GPT-5, Claude 4, DeepSeek-R1 и рос 4 мин чтения 08 Единый AI API в России: как бизнесу платить рублями и получить 300+ моделей Как российским компаниям использовать AI API без зарубежных карт. Обзор шлюза с 300+ моделями, оплата рублями, примеры интеграции. 3 мин чтения 09 Как Remote увеличил выручку на 50% на сотрудника с помощью AI: кейс внедрения Claude и Slack-агентов Remote Build внедрила Claude и Slack-агентов, автоматизировав рутину. Результат – рост revenue per employee на 50%. Детали кейса и разбор ошибок. 4 мин чтения 10 SWE-rebench март–май 2026: GPT-5.5, Opus 4.7, Cursor 2.5 и Kimi K2.6 — кто реально пишет код без багов? Свежий лидерборд SWE-rebench за март–май 2026: реальные проценты решённых задач, неожиданные лидеры и кто провалился. Читайте разбор четырёх топ-моделей. 7 мин чтения 11 ITBench-AA: новый бенчмарк для агентных IT-задач — все ведущие модели провалились (ниже 50%) Новый бенчмарк ITBench-AA от IBM и Artificial Analysis показал: Claude Opus 4.7, GPT-5.5 и другие не справляются с реальными задачами SRE. Результаты ниже 50%. 4 мин чтения 12 Cognition привлек $1 млрд при оценке $25 млрд: что означает рост Devin для рынка AI-кодинга Cognition привлёк $1 млрд при оценке $25 млрд. Разбираемся, почему Devin стал главным конкурентом Claude Code и Codex, и что это значит для разработчиков. 4 мин чтения