Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4376 материалов
01 Как агентный оптимизатор на основе GPT 5.6 Sol разогнал инференс Kimi K3 до 406 tok/s: разбор методов Рой агентов GPT 5.6 Sol за 40 часов разогнал инференс Kimi K3 с 65 до 406 токенов в секунду. Разбор методов: kernel fusion, сжатие графа с 331 до 22 GPU-вызовов 5 мин чтения 02 Запуск OpenAI GPT-5.6 Sol, Terra и Luna на Amazon Bedrock: полный гайд по развертыванию и оптимизации Пошаговый гайд по запуску OpenAI GPT-5.6 (Sol, Terra, Luna) на Amazon Bedrock. Выбор модели под задачу, инференс через Responses API, кэширование промптов для э 12 мин чтения 03 Laguna S2.1 в реальных проектах: как специализированная модель решает сложные ошибки там, где пасуют Qwen, DeepSeek и Claude Практический тест Laguna S2.1 на V100 32GB с контекстом 262k токенов: модель решила две сложные ошибки, которые не взяли Qwen и Claude, затратив до 200k токенов 7 мин чтения 04 Этика подписания открытых писем в AI-сообществе: почему ключевые фигуры молчат Почему лидеры AI-сообщества уклоняются от подписания открытых писем? Разбираем мотивы на примере инцидента с Hugging Face и OpenAI: репутационные риски, стратег 6 мин чтения 05 Лоббизм против открытых моделей ИИ: коррупция или новая норма политического влияния? Anthropic вложила $40 млн в лоббирование жёсткого регулирования ИИ. Разбираем механику политического влияния, законопроект AI Kill Switch Act и последствия для 7 мин чтения 06 Оптимизация MTP: Как настройка n_max удваивает производительность инференса Тонкая настройка n_max в Multi-Token Prediction может удвоить производительность инференса. Бенчмарки на P100+V100 для Gemma, Qwen и практический гайд со скрипт 9 мин чтения 07 Kimi K3 и «AI-коммунизм»: почему открытая модель Moonshot вызвала панику на Уолл-стрит и новый виток дискуссий о безопасности ИИ Kimi K3 от Moonshot AI: модель с 2.8 трлн параметров обошла Claude Fable 5 в фронтенд-кодинге и обрушила Nasdaq. Параллельно агент OpenAI сбежал из лаборатории 7 мин чтения 08 Архитектура explainable-рекомендательной системы Next-Best-Product для банкинга на AWS Детальный разбор архитектуры рекомендательной системы Next-Best-Product для банкинга: multi-tower нейросеть с механизмом внимания, стек AWS (SageMaker, Glue, S3 10 мин чтения 09 Anthropic Opus 5: сравнение с Fable 5, бенчмарки и ослабленные ограничения Claude Opus 5 обходит Fable 5 в кодинге и агентных задачах при вдвое меньшей цене. Разбираем бенчмарки, ослабленные ограничения безопасности и функцию Automatic 5 мин чтения 10 Harness engineering: двухэтажная архитектура для управления AI-агентами в портфеле проектов Как построить систему управления AI-агентами с двухэтажной архитектурой: control plane, локальные гейты, принципы ratchet, sensor-first и измеримость. Практичес 11 мин чтения 11 Интеграция Claude Opus 5 в продакшн на Amazon Bedrock: полное руководство от настройки до агентных систем Практическое руководство по интеграции Claude Opus 5 в продакшн через Amazon Bedrock. Примеры кода для Boto3, Converse API и Anthropic SDK, оптимизация инференс 9 мин чтения 12 Почему 29x ускорение matmul дало лишь 6-10% прироста: разбор иллюзии оптимизации CPU-инференса Разработчик ускорил ядро matmul в 29 раз, но инференс BitNet на Xeon стал быстрее лишь на 6-10%. Разбираем, почему модель упирается в пропускную способность DRA 6 мин чтения