Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Deep Agents v0.7: как LangChain сократил входные токены на 65% и отдал контроль разработчикам

Deep Agents v0.7 сокращает входные токены на 65% — с ~6k до ~2k. Разбор архитектурных изменений, тесты на GPT-5.6 Luna и Claude Opus, примеры кастомных промптов

Коротко

Что будет в материале

  1. 01

    Что изменилось в Deep Agents v0.7: три ключевых нововведения

  2. 02

    Почему это важно: экономия токенов без потери качества

  3. 03

    Как устроена оптимизация: разбор архитектурных изменений

  4. 04

    Полный контроль над промптами и middleware: что это значит для разработчика

LangChain выпустил Deep Agents v0.7 - обновление, которое сокращает количество входных токенов с ~6k до ~2k, то есть на 65%. Разработчики получают сопоставимую производительность при заметно меньших затратах на инференс. В основе - три архитектурных решения: удаление стандартного системного промпта, сжатие описаний инструментов на 43% и перевод TodoListMiddleware в опциональный режим.

Релиз прошел валидацию на новом наборе тестов - автономные задачи, диалоговые сценарии и задания с длинным контекстом. Модели для проверки: GPT-5.6 Luna, Gemini 3.6 Flash, Claude Sonnet 4-6 и Claude Opus 4-8. Результаты подтвердили: значимой деградации нет. Параллельно v0.7 открывает полный доступ к промптам и стеку middleware - встроенные компоненты можно заменить кастомными настройками без ограничений.

Что изменилось в Deep Agents v0.7: три ключевых нововведения

Версия 0.7 - это не косметический патч, а переосмысление базовой обвязки агента. Разработчики LangChain убрали всё, что не влияло на качество решений, но увеличивало контекст. Три главных изменения:

  • Удаление стандартного системного промпта. Встроенные инструкции, которые раньше добавлялись к каждому вызову, исключены. Агент больше не получает предустановленных директив - разработчик сам определяет, что модель должна знать о своей роли.
  • Сокращение описаний инструментов на 43%. Формулировки очищены от избыточных деталей. Ключевая информация для выбора инструмента сохранена, а токены, которые не помогали модели принимать решения, убраны.
  • TodoListMiddleware переведен в опциональный режим. Компонент, отвечавший за ведение агентом списка задач, теперь подключается только когда нужен. Для коротких взаимодействий его отключение экономит токены без последствий.

Итог - входной контекст сократился с ~6k до ~2k токенов. При этом агент сохраняет способность работать с инструментами, вести диалог и обрабатывать длинные документы.

Почему это важно: экономия токенов без потери качества

Каждый входной токен - это деньги и время. При использовании моделей уровня Claude Opus или GPT-5.6 Luna сокращение контекста на 65% напрямую снижает стоимость одного вызова. Для агентов с высокой частотой запросов - чат-ботов, ассистентов в поддержке, систем автоматизации - накопленная экономия становится существенной.

Снижение объема контекста уменьшает latency. Модель обрабатывает меньше данных, ответ приходит быстрее. В диалоговых интерфейсах это критично: пользователь не ждет. В асинхронных сценариях - меньше нагрузка на API, выше пропускная способность.

Главный вопрос - не пострадало ли качество. LangChain проверил это на практике. Методология бенчмаркинга Deep Agents была полностью переработана: команда перешла от unit-тестов к сквозным оценкам через open-source фреймворк Harbor. Три набора задач покрывают разные режимы работы агента.

Детали тестирования: на каких задачах и моделях проверяли

Тестовый набор состоит из трех категорий:

  • Автономные задачи - кодинг, поиск информации, анализ данных. Агент работает без участия человека, оценивается точность финального результата.
  • Диалоговые сценарии - симулированный пользователь взаимодействует с агентом, уточняет запросы, меняет требования. Проверяется способность удерживать нить разговора и корректно реагировать на изменения.
  • Длинноконтекстные задачи - поиск ответа в переданном корпусе данных. Агент должен извлечь релевантную информацию из объемного документа, не потеряв важные детали.

Модели для валидации подобраны так, чтобы охватить разные архитектуры и ценовые категории: GPT-5.6 Luna, Gemini 3.6 Flash, Claude Sonnet 4-6 и Claude Opus 4-8. На всех конфигурациях v0.7 показала результаты, сопоставимые с предыдущей версией. Деградации по точности, полноте или связности ответов не зафиксировано.

Для быстрых итераций команда использует облегченный бенчмарк - он работает в 8 раз быстрее и обходится в 6 раз дешевле полного прогона. Это позволило оперативно проверять гипотезы при оптимизации релиза. Параллельно поддерживается набор unit-тестов для проверки конкретных поведений агента.

Как устроена оптимизация: разбор архитектурных изменений

Экономия в 65% не взялась из воздуха. Каждое изменение в v0.7 адресует конкретный источник раздувания контекста. Разберем по порядку.

Удаление системного промпта: меньше токенов, больше гибкости

Стандартный системный промпт в предыдущих версиях Deep Agents содержал развернутые инструкции: как агенту думать, как выбирать инструменты, как форматировать ответ. Это добавляло сотни токенов к каждому запросу, независимо от задачи. Для простого вызова «найди документ за прошлый квартал» модель получала тот же объем системных указаний, что и для сложного многошагового сценария.

В v0.7 системный промпт удален полностью. Разработчик теперь сам определяет инструкции - ровно те, которые нужны для конкретного агента. Хотите, чтобы агент отвечал коротко и только по делу? Пропишите это в кастомном промпте. Нужна развернутая аргументация с цитатами? Добавьте соответствующие директивы. Никаких скрытых токенов, которые вы не контролируете.

Это решение также устраняет конфликты инструкций. В старой схеме системный промпт мог противоречить пользовательским указаниям, и модель выбирала не то, что вы ожидали. Теперь всё явно.

Оптимизация описаний инструментов: 43% экономии без потери функциональности

Описания инструментов - второй крупный потребитель токенов. Каждый инструмент, доступный агенту, требует текстового описания, чтобы модель понимала, когда и как его вызывать. В старых версиях эти описания были избыточны: примеры использования, детали реализации, пояснения, которые не помогали модели принять решение.

Пример сокращения. Описание инструмента поиска до:

Поиск по базе знаний компании. Принимает поисковый запрос в виде строки. Возвращает список релевантных документов с заголовками, сниппетами и ссылками. Используйте этот инструмент, когда пользователь спрашивает о внутренних политиках, процедурах или любой информации, которая может храниться в корпоративной базе знаний. Не используйте для поиска в интернете - для этого есть отдельный инструмент web_search.

После оптимизации:

Поиск по внутренней базе знаний. Принимает строку запроса. Возвращает документы с заголовками и сниппетами. Для интернет-поиска используйте web_search.

Ключевая информация сохранена: что делает инструмент, что принимает, что возвращает, когда не применять. Убраны очевидные пояснения и дублирование. Модели уровня GPT-5.6 Luna или Claude Sonnet 4-6 не нуждаются в развернутых инструкциях - им достаточно точных формулировок. Сокращение на 43% достигнуто именно за счет удаления «воды», а не функциональных деталей.

TodoListMiddleware: теперь опционально

TodoListMiddleware - это компонент, который заставлял агента вести список задач: «1. Найти документ. 2. Проверить даты. 3. Сформировать ответ». Для сложных многошаговых сценариев это полезно - модель не теряет нить, отслеживает прогресс. Но для коротких запросов вроде «переведи текст» или «какая погода в Лондоне» этот список - лишние токены.

В v0.7 TodoListMiddleware отключен по умолчанию. Разработчик подключает его явно, когда агент работает с задачами, требующими планирования: исследовательские цепочки, многоэтапная обработка данных, сценарии с ветвлением. Для простых диалоговых агентов и чат-ботов отключение дает дополнительную экономию без влияния на результат.

Практическое правило: если агент выполняет больше трех последовательных действий для ответа - включайте TodoListMiddleware. Если ответ формируется за один-два вызова инструментов - оставляйте отключенным.

Полный контроль над промптами и middleware: что это значит для разработчика

v0.7 снимает все ограничения на кастомизацию. Разработчик может заменить любой встроенный компонент - системный промпт, описания инструментов, middleware - своей реализацией. Это не «песочница» с предопределенными точками расширения, а открытая архитектура.

Раньше приходилось обходить ограничения: переопределять переменные окружения, патчить внутренние методы, мириться с неиспользуемыми токенами. Теперь конфигурация агента - это чистый код, который вы полностью контролируете. Хотите добавить кастомный middleware для логирования вызовов инструментов? Подключайте. Нужна нестандартная логика выбора инструментов? Реализуйте свою.

Этот подход стыкуется с трендом на агентные системы, где разработчик сам определяет поведение модели. При самостоятельной разработке AI-агента вы и так контролируете каждый компонент - Deep Agents v0.7 дает тот же уровень свободы, но с готовой инфраструктурой.

Пример конфигурации: заменяем системный промпт и добавляем свой middleware

Минимальный пример настройки агента в Deep Agents v0.7:

from deep_agents import Agent, Middleware

# Кастомный системный промпт
system_prompt = """Ты - ассистент технической поддержки.
Отвечай коротко, по делу. Если не знаешь ответ - скажи об этом прямо.
Не придумывай информацию."""

# Кастомный middleware для логирования
class LoggingMiddleware(Middleware):
    def on_tool_call(self, tool_name, args):
        print(f"[LOG] Вызов инструмента: {tool_name} с аргументами {args}")
        return super().on_tool_call(tool_name, args)

# Создание агента
agent = Agent(
    model="claude-sonnet-4-6",
    system_prompt=system_prompt,
    middleware=[LoggingMiddleware()],
    tools=[...]  # ваши инструменты
)

# Запуск
response = agent.run("Пользователь не может войти в систему")
print(response)

Ключевые моменты: системный промпт задается явно, middleware наследуется от базового класса и переопределяет нужные методы, инструменты передаются списком. Никаких скрытых настроек, всё прозрачно.

Когда стоит обновляться: сценарии использования и потенциальные ограничения

v0.7 дает максимальный эффект в сценариях, где важен каждый токен:

  • Чат-боты с высоким трафиком. Тысячи запросов в день - сокращение контекста на 65% напрямую конвертируется в снижение счетов за API. При использовании дорогих моделей вроде Claude Opus 4-8 экономия особенно заметна. Метрика «токенов на задачу» становится ключевым показателем эффективности.
  • Агенты с большим количеством инструментов. Чем больше инструментов, тем больше токенов уходит на их описания. Сокращение на 43% умножается на количество инструментов - для агента с 20+ инструментами экономия измеряется тысячами токенов на каждый вызов.
  • Задачи с жесткими бюджетными ограничениями. Стартапы, исследовательские проекты, образовательные платформы - везде, где бюджет на API ограничен, v0.7 позволяет делать больше за те же деньги.

Ограничения, которые нужно учитывать:

  • Кастомные промпты требуют тестирования. Удаление системного промпта означает, что вы сами отвечаете за инструкции. Неудачная формулировка может ухудшить качество. Планируйте время на итерации и валидацию.
  • Возможна несовместимость со старыми конфигурациями. Если ваш проект завязан на внутренние особенности предыдущих версий, обновление потребует адаптации кода. Проверьте документацию по миграции перед обновлением.
  • Для простых задач выигрыш менее заметен. Агент с одним инструментом и короткими запросами не почувствует разницы так остро, как сложная система. Оцените свой профиль использования перед переходом.

Сравнение с альтернативами подтверждает тренд на оптимизацию контекста. ChatGPT 5.6 и Claude Sonnet 5 также движутся в сторону снижения стоимости инференса - Deep Agents v0.7 решает эту задачу на уровне фреймворка, а не модели.

Выводы: Deep Agents v0.7 как шаг к эффективным AI-агентам

Deep Agents v0.7 - это релиз, который решает конкретную проблему: затраты на инференс. Сокращение входных токенов на 65% (с ~6k до ~2k) и сжатие описаний инструментов на 43% дают прямую экономию бюджета без ущерба качеству. Валидация на четырех моделях и трех категориях задач это подтверждает.

Передача полного контроля над промптами и middleware разработчикам - логичное продолжение тренда на открытость агентных фреймворков. LangChain убирает «магию» и дает инструмент, который можно настроить точно под задачу.

Если вы используете Deep Agents в продакшене - обновляйтесь. Если только присматриваетесь к фреймворку - v0.7 хорошая точка входа: низкие накладные расходы, прозрачная архитектура, готовые тесты для валидации. Протестируйте на своих сценариях и сравните метрики до и после.

Подписаться на канал