LangChain выпустил Deep Agents v0.7 - обновление, которое сокращает количество входных токенов с ~6k до ~2k, то есть на 65%. Разработчики получают сопоставимую производительность при заметно меньших затратах на инференс. В основе - три архитектурных решения: удаление стандартного системного промпта, сжатие описаний инструментов на 43% и перевод TodoListMiddleware в опциональный режим.
Релиз прошел валидацию на новом наборе тестов - автономные задачи, диалоговые сценарии и задания с длинным контекстом. Модели для проверки: GPT-5.6 Luna, Gemini 3.6 Flash, Claude Sonnet 4-6 и Claude Opus 4-8. Результаты подтвердили: значимой деградации нет. Параллельно v0.7 открывает полный доступ к промптам и стеку middleware - встроенные компоненты можно заменить кастомными настройками без ограничений.
Что изменилось в Deep Agents v0.7: три ключевых нововведения
Версия 0.7 - это не косметический патч, а переосмысление базовой обвязки агента. Разработчики LangChain убрали всё, что не влияло на качество решений, но увеличивало контекст. Три главных изменения:
- Удаление стандартного системного промпта. Встроенные инструкции, которые раньше добавлялись к каждому вызову, исключены. Агент больше не получает предустановленных директив - разработчик сам определяет, что модель должна знать о своей роли.
- Сокращение описаний инструментов на 43%. Формулировки очищены от избыточных деталей. Ключевая информация для выбора инструмента сохранена, а токены, которые не помогали модели принимать решения, убраны.
- TodoListMiddleware переведен в опциональный режим. Компонент, отвечавший за ведение агентом списка задач, теперь подключается только когда нужен. Для коротких взаимодействий его отключение экономит токены без последствий.
Итог - входной контекст сократился с ~6k до ~2k токенов. При этом агент сохраняет способность работать с инструментами, вести диалог и обрабатывать длинные документы.
Почему это важно: экономия токенов без потери качества
Каждый входной токен - это деньги и время. При использовании моделей уровня Claude Opus или GPT-5.6 Luna сокращение контекста на 65% напрямую снижает стоимость одного вызова. Для агентов с высокой частотой запросов - чат-ботов, ассистентов в поддержке, систем автоматизации - накопленная экономия становится существенной.
Снижение объема контекста уменьшает latency. Модель обрабатывает меньше данных, ответ приходит быстрее. В диалоговых интерфейсах это критично: пользователь не ждет. В асинхронных сценариях - меньше нагрузка на API, выше пропускная способность.
Главный вопрос - не пострадало ли качество. LangChain проверил это на практике. Методология бенчмаркинга Deep Agents была полностью переработана: команда перешла от unit-тестов к сквозным оценкам через open-source фреймворк Harbor. Три набора задач покрывают разные режимы работы агента.
Детали тестирования: на каких задачах и моделях проверяли
Тестовый набор состоит из трех категорий:
- Автономные задачи - кодинг, поиск информации, анализ данных. Агент работает без участия человека, оценивается точность финального результата.
- Диалоговые сценарии - симулированный пользователь взаимодействует с агентом, уточняет запросы, меняет требования. Проверяется способность удерживать нить разговора и корректно реагировать на изменения.
- Длинноконтекстные задачи - поиск ответа в переданном корпусе данных. Агент должен извлечь релевантную информацию из объемного документа, не потеряв важные детали.
Модели для валидации подобраны так, чтобы охватить разные архитектуры и ценовые категории: GPT-5.6 Luna, Gemini 3.6 Flash, Claude Sonnet 4-6 и Claude Opus 4-8. На всех конфигурациях v0.7 показала результаты, сопоставимые с предыдущей версией. Деградации по точности, полноте или связности ответов не зафиксировано.
Для быстрых итераций команда использует облегченный бенчмарк - он работает в 8 раз быстрее и обходится в 6 раз дешевле полного прогона. Это позволило оперативно проверять гипотезы при оптимизации релиза. Параллельно поддерживается набор unit-тестов для проверки конкретных поведений агента.
Как устроена оптимизация: разбор архитектурных изменений
Экономия в 65% не взялась из воздуха. Каждое изменение в v0.7 адресует конкретный источник раздувания контекста. Разберем по порядку.
Удаление системного промпта: меньше токенов, больше гибкости
Стандартный системный промпт в предыдущих версиях Deep Agents содержал развернутые инструкции: как агенту думать, как выбирать инструменты, как форматировать ответ. Это добавляло сотни токенов к каждому запросу, независимо от задачи. Для простого вызова «найди документ за прошлый квартал» модель получала тот же объем системных указаний, что и для сложного многошагового сценария.
В v0.7 системный промпт удален полностью. Разработчик теперь сам определяет инструкции - ровно те, которые нужны для конкретного агента. Хотите, чтобы агент отвечал коротко и только по делу? Пропишите это в кастомном промпте. Нужна развернутая аргументация с цитатами? Добавьте соответствующие директивы. Никаких скрытых токенов, которые вы не контролируете.
Это решение также устраняет конфликты инструкций. В старой схеме системный промпт мог противоречить пользовательским указаниям, и модель выбирала не то, что вы ожидали. Теперь всё явно.
Оптимизация описаний инструментов: 43% экономии без потери функциональности
Описания инструментов - второй крупный потребитель токенов. Каждый инструмент, доступный агенту, требует текстового описания, чтобы модель понимала, когда и как его вызывать. В старых версиях эти описания были избыточны: примеры использования, детали реализации, пояснения, которые не помогали модели принять решение.
Пример сокращения. Описание инструмента поиска до:
Поиск по базе знаний компании. Принимает поисковый запрос в виде строки. Возвращает список релевантных документов с заголовками, сниппетами и ссылками. Используйте этот инструмент, когда пользователь спрашивает о внутренних политиках, процедурах или любой информации, которая может храниться в корпоративной базе знаний. Не используйте для поиска в интернете - для этого есть отдельный инструмент web_search.После оптимизации:
Поиск по внутренней базе знаний. Принимает строку запроса. Возвращает документы с заголовками и сниппетами. Для интернет-поиска используйте web_search.Ключевая информация сохранена: что делает инструмент, что принимает, что возвращает, когда не применять. Убраны очевидные пояснения и дублирование. Модели уровня GPT-5.6 Luna или Claude Sonnet 4-6 не нуждаются в развернутых инструкциях - им достаточно точных формулировок. Сокращение на 43% достигнуто именно за счет удаления «воды», а не функциональных деталей.
TodoListMiddleware: теперь опционально
TodoListMiddleware - это компонент, который заставлял агента вести список задач: «1. Найти документ. 2. Проверить даты. 3. Сформировать ответ». Для сложных многошаговых сценариев это полезно - модель не теряет нить, отслеживает прогресс. Но для коротких запросов вроде «переведи текст» или «какая погода в Лондоне» этот список - лишние токены.
В v0.7 TodoListMiddleware отключен по умолчанию. Разработчик подключает его явно, когда агент работает с задачами, требующими планирования: исследовательские цепочки, многоэтапная обработка данных, сценарии с ветвлением. Для простых диалоговых агентов и чат-ботов отключение дает дополнительную экономию без влияния на результат.
Практическое правило: если агент выполняет больше трех последовательных действий для ответа - включайте TodoListMiddleware. Если ответ формируется за один-два вызова инструментов - оставляйте отключенным.
Полный контроль над промптами и middleware: что это значит для разработчика
v0.7 снимает все ограничения на кастомизацию. Разработчик может заменить любой встроенный компонент - системный промпт, описания инструментов, middleware - своей реализацией. Это не «песочница» с предопределенными точками расширения, а открытая архитектура.
Раньше приходилось обходить ограничения: переопределять переменные окружения, патчить внутренние методы, мириться с неиспользуемыми токенами. Теперь конфигурация агента - это чистый код, который вы полностью контролируете. Хотите добавить кастомный middleware для логирования вызовов инструментов? Подключайте. Нужна нестандартная логика выбора инструментов? Реализуйте свою.
Этот подход стыкуется с трендом на агентные системы, где разработчик сам определяет поведение модели. При самостоятельной разработке AI-агента вы и так контролируете каждый компонент - Deep Agents v0.7 дает тот же уровень свободы, но с готовой инфраструктурой.
Пример конфигурации: заменяем системный промпт и добавляем свой middleware
Минимальный пример настройки агента в Deep Agents v0.7:
from deep_agents import Agent, Middleware
# Кастомный системный промпт
system_prompt = """Ты - ассистент технической поддержки.
Отвечай коротко, по делу. Если не знаешь ответ - скажи об этом прямо.
Не придумывай информацию."""
# Кастомный middleware для логирования
class LoggingMiddleware(Middleware):
def on_tool_call(self, tool_name, args):
print(f"[LOG] Вызов инструмента: {tool_name} с аргументами {args}")
return super().on_tool_call(tool_name, args)
# Создание агента
agent = Agent(
model="claude-sonnet-4-6",
system_prompt=system_prompt,
middleware=[LoggingMiddleware()],
tools=[...] # ваши инструменты
)
# Запуск
response = agent.run("Пользователь не может войти в систему")
print(response)Ключевые моменты: системный промпт задается явно, middleware наследуется от базового класса и переопределяет нужные методы, инструменты передаются списком. Никаких скрытых настроек, всё прозрачно.
Когда стоит обновляться: сценарии использования и потенциальные ограничения
v0.7 дает максимальный эффект в сценариях, где важен каждый токен:
- Чат-боты с высоким трафиком. Тысячи запросов в день - сокращение контекста на 65% напрямую конвертируется в снижение счетов за API. При использовании дорогих моделей вроде Claude Opus 4-8 экономия особенно заметна. Метрика «токенов на задачу» становится ключевым показателем эффективности.
- Агенты с большим количеством инструментов. Чем больше инструментов, тем больше токенов уходит на их описания. Сокращение на 43% умножается на количество инструментов - для агента с 20+ инструментами экономия измеряется тысячами токенов на каждый вызов.
- Задачи с жесткими бюджетными ограничениями. Стартапы, исследовательские проекты, образовательные платформы - везде, где бюджет на API ограничен, v0.7 позволяет делать больше за те же деньги.
Ограничения, которые нужно учитывать:
- Кастомные промпты требуют тестирования. Удаление системного промпта означает, что вы сами отвечаете за инструкции. Неудачная формулировка может ухудшить качество. Планируйте время на итерации и валидацию.
- Возможна несовместимость со старыми конфигурациями. Если ваш проект завязан на внутренние особенности предыдущих версий, обновление потребует адаптации кода. Проверьте документацию по миграции перед обновлением.
- Для простых задач выигрыш менее заметен. Агент с одним инструментом и короткими запросами не почувствует разницы так остро, как сложная система. Оцените свой профиль использования перед переходом.
Сравнение с альтернативами подтверждает тренд на оптимизацию контекста. ChatGPT 5.6 и Claude Sonnet 5 также движутся в сторону снижения стоимости инференса - Deep Agents v0.7 решает эту задачу на уровне фреймворка, а не модели.
Выводы: Deep Agents v0.7 как шаг к эффективным AI-агентам
Deep Agents v0.7 - это релиз, который решает конкретную проблему: затраты на инференс. Сокращение входных токенов на 65% (с ~6k до ~2k) и сжатие описаний инструментов на 43% дают прямую экономию бюджета без ущерба качеству. Валидация на четырех моделях и трех категориях задач это подтверждает.
Передача полного контроля над промптами и middleware разработчикам - логичное продолжение тренда на открытость агентных фреймворков. LangChain убирает «магию» и дает инструмент, который можно настроить точно под задачу.
Если вы используете Deep Agents в продакшене - обновляйтесь. Если только присматриваетесь к фреймворку - v0.7 хорошая точка входа: низкие накладные расходы, прозрачная архитектура, готовые тесты для валидации. Протестируйте на своих сценариях и сравните метрики до и после.