LangChain выпустила LangSmith Engine v2, обновление платформы для разработки и отладки AI-агентов. Главное нововведение - Red Teaming: инструмент сам разбирает производственные трейсы и репозитории агента, а затем ищет галлюцинации и нарушения системных промптов до того, как они доберутся до пользователей. Второй значимый блок - автоматическое тестирование исправлений: Engine воспроизводит сбой, прогоняет предложенный фикс на тех же входных данных и только потом отдаёт результат на ревью.
Обе новые функции доступны в закрытой бете (Private Beta) для существующих пользователей LangSmith Deployment. Остальные улучшения версии касаются поиска трудноуловимых проблем в трейсах: неэффективных траекторий агента и трендов по error rate, latency и стоимости.
Что такое LangSmith Engine v2 и зачем он нужен
Engine - это агент внутри платформы LangSmith, который автоматизирует работу на каждом этапе жизненного цикла разработки агента (agent development lifecycle, ADLC). Он сканирует производственные трейсы, ищет области для улучшения, классифицирует найденные проблемы и группирует связанные трейсы в одну запись. К каждой записи прилагается root cause, предложенный фикс, ground truth примеры для датасетов оценки и дальнейший мониторинг. Полное описание релиза в блоге LangChain
Масштаб накопленной статистики показывает, насколько инструмент обкатан на реальных данных: с момента запуска в мае Engine проанализировал более 70 млн трейсов и диагностировал десятки тысяч проблем. Как LangChain измеряет качество такого агента-диагноста, разбираем в отдельном материале про IssueBench.
В v2 добавились три блока. Red Teaming ищет проблемы, которых в трейсах пока нет. Расширенная диагностика ловит неэффективные траектории и тренды по error rate, latency и стоимости. Автоматическая валидация фиксов проверяет предлагаемые правки до их показа человеку.
Red Teaming: как Engine v2 находит проблемы до продакшена
Red Teaming работает проактивно. Engine анализирует производственные трейсы и репозитории агента, чтобы понять его назначение и поведение, а затем использует этот контекст для проверки слабых мест и поиска проблем, которые ещё не проявились в продакшене.
Какие данные анализирует Red Teaming
На вход идут две группы данных. Первая - производственные трейсы, то есть логи реальных запусков агента со всеми вызовами инструментов и ответами модели. Вторая - репозитории, где лежат код, системные промпты и конфигурация. Из них Engine собирает картину того, зачем агент существует и как он ведёт себя на практике. Проверки строятся под конкретного агента, а не по абстрактному чек-листу из документации.
Примеры проблем: галлюцинации и нарушения системных промптов
LangChain называет два типа сбоев, которые ловит Red Teaming. Галлюцинация - агент выдаёт недостоверную информацию, опираясь на выдуманные факты или несуществующие детали. Нарушение системного промпта - агент игнорирует заданные инструкции: выходит за рамки роли, делает то, что ему запрещено, или пропускает обязательные шаги. В продакшене оба случая всплывают не сразу. Источник
Red Teaming решает задачу диагностики. Абсолютной защиты он не даёт: выявляет и подсвечивает проблемные места, но не гарантирует, что после прогона агент станет неуязвимым. Метрик полноты обнаружения LangChain не приводит, поэтому результат стоит трактовать как дополнительный слой проверки. Доступ к функции открыт в Private Beta существующим пользователям LangSmith Deployment.
Автоматическое тестирование исправлений: от воспроизведения сбоя до PR
Engine v2 тестирует и валидирует предложенные исправления промптов и кода автоматически, до того как показать их человеку. Полный цикл выглядит так: Engine сканирует производственные трейсы, находит проблему, классифицирует её и группирует связанные трейсы в одну запись. В записи уже лежат root cause, предлагаемый фикс, ground truth примеры для датасетов оценки и дальнейший мониторинг.
Как Engine воспроизводит сбой и тестирует фикс
Ключевой шаг - воспроизведение. Engine берёт производственные трейсы, восстанавливает условия, при которых проявился сбой, применяет предложенный фикс (изменение системного промпта или кода) и проверяет, решает ли правка проблему на тех же входных данных. По сути это автоматизированный регрессионный тест: одна и та же входная ситуация, две конфигурации агента, сравнение результата. Такой прогон отсекает фиксы, которые выглядят разумно, но не устраняют причину или ломают соседние сценарии.
Смежная задача - генерация самих тестов. LangChain ведёт её отдельно: Eval Engineering Skill сканирует репозиторий, анализирует трейсы и через интервью с разработчиком собирает контейнеризированные тесты для агента.
Ревью и создание PR в один клик
После успешной валидации фикс уходит на ревью человеку, где его можно превратить в pull request в один клик. Автоматика снимает рутину: не нужно вручную воспроизводить сбой и собирать контекст, достаточно проверить предложенную правку. Ревью при этом остаётся обязательным шагом. Автоматический тест подтверждает, что фикс закрывает конкретную проблему на конкретных данных, но не оценивает побочные эффекты на всей логике агента целиком.
Функция автотестирования фиксов доступна в закрытой бете для пользователей LangSmith Deployment.
Неэффективные траектории и тренды: что ещё находит Engine v2
Расширенная диагностика нацелена на проблемы, которые легко пропустить при разборе отдельных запросов. Engine v2 подсвечивает два класса.
Неэффективные траектории агента: лишние или повторяющиеся вызовы инструментов, которые тратят токены, но не приближают к результату. Агент может несколько раз дёрнуть один и тот же инструмент с теми же аргументами или пойти обходным путём там, где хватало одного шага. На масштабе такие петли превращаются в заметный расход токенов.
Второй класс - тренды по error rate, latency и стоимости. Незаметная деградация latency раздражает пользователей задолго до того, как превратится в явный сбой, а медленный рост error rate легко не заметить, если смотреть только на отдельные запросы. Engine отслеживает динамику этих метрик и флагует отклонения, чтобы команда успела среагировать до того, как деградация станет критичной. Источник
Конкретных числовых порогов и примеров трендов LangChain в публикации не приводит.
Кому и как доступен LangSmith Engine v2
Ключевое ограничение простое: Red Teaming и автоматическое тестирование фиксов доступны в закрытой бете (Private Beta) для существующих пользователей LangSmith Deployment. Остальные улучшения v2 (поиск неэффективных траекторий и трендов) в источнике отдельно не оговорены.
Закрытая бета: что это значит на практике
Private Beta означает ограниченный доступ. Новый пользователь не сможет включить Red Teaming сразу после регистрации: функция привязана к существующим аккаунтам LangSmith Deployment. Если вы закладываете эти возможности в свой процесс отладки, учитывайте, что они появятся не в тот же день, когда вы поднимете платформу. Даты открытия общего доступа LangChain не называет.
BYOK для self-hosted: что известно и чего ждать
В описании темы упоминается поддержка BYOK (bring your own key) для Engine в self-hosted LangSmith в следующих релизах. В публикации LangChain эта информация не подтверждается, поэтому считать её фактом нельзя. Планы по self-hosted стоит сверять по официальным каналам компании, а не по пересказам.
Практическая ценность: стоит ли внедрять Engine v2
Отладка перестаёт быть ручным поиском иголки в трейсах: Engine классифицирует проблемы, группирует связанные трейсы и сразу прикладывает root cause с примерами для датасета оценки. Токены перестают утекать в повторяющиеся вызовы инструментов, потому что неэффективные траектории подсвечиваются отдельно. Инциденты в продакшене удаётся предотвращать раньше: Red Teaming ищет галлюцинации и нарушения системных промптов, которых в текущих трейсах ещё нет. Цикл исправлений ускоряется за счёт автотестирования фиксов и PR в один клик.
Аргумент в пользу зрелости подхода - цифры: более 70 млн проанализированных трейсов и десятки тысяч диагностированных проблем с мая. Как выстроить релизные гейты на оценках, показывает опыт других команд: в медицинском AI LangSmith превращают клиническую экспертизу в переиспользуемые оценки и релизные гейты. Похожий вызов - оценка длинных ответов агента, где одного правильного ответа не существует; этот сценарий разобран на кейсе Similarweb.
Ограничения тоже стоит держать в голове. Red Teaming и автотестирование фиксов пока в закрытой бете, для них нужен LangSmith Deployment. Автоматическая валидация не заменяет ручное ревью и не проверяет побочные эффекты фикса за пределами воспроизведённого сбоя. Метрик полноты обнаружения LangChain не публикует. Если ваш агент работает с чувствительными данными или в регулируемой среде, эти оговорки весят больше, чем список новых функций.