Итог 11 недель: 77 багов у агента против 16 у человека
Агент отработал 277 активных часов, человек набрал 213 часов присутствия. Счёт подтверждённых дефектов: 77 у агента, 16 у человека, один совместный. Всего 94 подтверждённые находки за 11 недель. Цифры взяты из дневника, который автор вёл по каждой рабочей сессии и опубликовал на Habr (дневник замеров AI-тестировщика за 11 недель).
Соотношение 77 к 16 не означает, что человек в QA обесценился. Характер находок разный: агент методично перебирал состояния и читал код, человек работал с живым продуктом. Все шесть дефектов, которые агент пропустил, закрыл человек.
| Метрика | Агент | Человек |
|---|---|---|
| Активные часы | 277 | 213 |
| Подтверждённые находки | 77 | 16 (плюс 1 совместная) |
| Кандидаты сняты | около 130 | - |
| Передано вопросами | около 45 | - |
| Пропуски | 6 | 0 |
Дальше по тексту: около 80 рублей за агентский час, 0,77 часа человека на каждый час агента, примерно 16% итоговой экономии вместо обещанного «в десять раз быстрее», три зоны, где агент не окупился, и ограничения самого метода.
Как считали: методика замеров часов и вердиктов
Claude Code - кодинг-агент Anthropic, который живёт в терминале и IDE разработчика: читает проект, сам редактирует файлы, запускает тесты, работает с git и доводит задачу до результата (Claude Code: что это и чем отличается от чата). В эксперименте его поведение ограничивал опенсорсный пак скиллов paranoid-qa: набор правил, который заставляет агента тестировать с доказательной дисциплиной и прикладывать к каждой гипотезе воспроизведение.
Часы агента считались не по календарю, а по транскриптам сессий: суммировались интервалы между событиями, паузы длиннее 30 минут отбрасывались. Часы человека измерялись той же математикой, но по сообщениям автора, с порогом 20 минут. Подход отсекает простои, зато порождает вопрос: считать ли работой то время, пока агент молотит задачу, а человек занят другим. Об этом ниже, в разделе про ограничения метода.
Если вы повторяете такой замер у себя, заранее продумайте, как будете оценивать трудозатраты: у Claude Code есть отдельная проблема с оценкой сроков, когда в одном ответе смешиваются скорость агента, ручное ревью и неизвестные зависимости. Разбор с готовым промптом для калибровки по фактическому времени есть в материале почему Claude Code плохо оценивает сроки задач.
Из чего состояли 277 агентских часов
Разбивка показывает две разные работы внутри одного счёта. Около 190 часов ушло на ручное тестирование и тест-дизайн, 85 часов - на работу с автотестами, ещё пара часов - на обвязку самого агента. Большая часть времени легла туда, где в обычной команде сидят ручной QA и автоматизатор.
Четыре исхода кандидата в дефекты
Каждый кандидат, которого выдвинул агент, получал один из четырёх вердиктов:
- подтверждён - дефект воспроизведён и принят;
- передан вопросом - нужен ответ команды, чтобы понять, баг это или ожидаемое поведение;
- снят - гипотеза не подтвердилась при проверке;
- пропущен - дефект найден, но не агентом.
В счёт «найдено» попадают только подтверждённые, и только по финальному вердикту сессии. Это ключевое отличие от сырых кандидатов. Первая версия подсчёта находок оказалась завышенной почти вдвое как раз потому, что в неё попали промежуточные гипотезы, снятые позже.
Экономика: 80 ₽ за агентский час и 16% экономии вместо «в десять раз быстрее»
Агентский час обошёлся примерно в 80 рублей. На каждый час агента ушло 0,77 часа человека, что даёт около 16% экономии. Обещанного «в десять раз быстрее» в цифрах не нашлось (разбор экономики в дневнике замеров).
Причина в том, что человеческие часы не исчезают, а переезжают. Их забирают постановка задач агенту, разбор ложных срабатываний, передача спорных случаев команде и финальные вердикты. 277 агентских часов куплены ценой 213 человеческих, и эта цена почти не сжимается от того, что генерация гипотез стала быстрой.
Стоимость владения включает доступ. Агент требует активную подписку Claude Pro, Max, Team или Enterprise, либо аккаунт Claude Console, либо доступ через поддерживаемого облачного провайдера (требования к доступу и тарифы Claude Code). Это фиксированная часть бюджета, которая не зависит от того, сколько багов агент найдёт за месяц.
Похожая картина в разработке: агенты уверенно ускоряют типовые операции и почти не дают выигрыша на новой логике. Сравнение по типам задач с цифрами - планирование сокращается с двух вечеров до 30-60 минут, типовые задачи ускоряются в 2,5-4 раза, новая логика - только в 1,3-1,8 раза - разобрано в статье где AI-агенты реально ускоряют работу.
Почему 0.77 часа человека на час агента - это не провал, но и не победа
Человеческие часы в этих замерах уходили на четыре вещи: формулировку задач агенту, разбор около 130 снятых кандидатов, проработку около 45 переданных вопросами случаев и вынесение финальных вердиктов. Плюс ручная проверка там, где нужен физический контакт с продуктом, и её агентом не заменить.
Важная оговорка: при параллельной работе двух сессий присутствие человека удваивается в счёте. Человек один, а сессий две, и обе требуют внимания в overlapping-интервалах. Это ограничение метода измерения, а не свойство реального процесса, и оно занижает итоговую экономию.
Где агент не окупился
Три зоны, где агентские часы потрачены без отдачи. Короткие задачи: накладные расходы на постановку и последующее ревью съедают всю выгоду. Релизные отчёты: шаблонная работа, которую человек пишет быстрее, чем агент её согласовывает с контекстом. Обвязка MCP-сервера: инфраструктурная задача, где агент тратит время на самонастройку вместо результата.
Общий принцип шире QA: чем больше в задаче ревью и отладки относительно объёма генерации, тем хуже окупаемость. Механику этого эффекта - когда скорость набора строк превращается в фиктивный KPI, а лавина сгенерированного кода разрушает понимание кодовой базы - разбирает материал про coding-агентов и когнитивную ловушку.
Где агент сильнее человека, а где человек незаменим
Граница проходит по типу работы, а не по сложности продукта. Агент выигрывает там, где нужно систематически перебирать состояния или читать код. Человек - там, где нужно физическое присутствие в живом продукте.
Сверка с эталоном: почему агент здесь эффективен
Механика простая: агент читает код и сравнивает поведение с эталонной спецификацией или эталонной реализацией, последовательно проходя по состояниям. Задача хорошо формализуется, поэтому агент не теряет контекст на длинной дистанции и не устаёт к сотому кейсу. Человек на такой сверке сбивается примерно там, где заканчивается список из двух десятков пунктов, которые нужно удержать в голове одновременно.
Разбор падений автотестов и кодовые срезы прод/тест
85 агентских часов ушло на работу с автотестами: разбор падений, поиск причины, сопоставление с недавними изменениями в коде. Рядом стоит сравнение кодовых срезов прод и теста - агент систематически проходит по различиям двух окружений и вытаскивает расхождения, которые в ручном режиме остались бы за пределами внимания просто из-за объёма. Такие находки редко выглядят эффектно, зато именно они всплывают в продакшене.
Где человек незаменим: физическое присутствие в живом продукте
Проверка на реальном устройстве, работа в живой среде, воспроизведение багов, для которых нужно физическое взаимодействие с интерфейсом или железом. Здесь агент не работает в принципе: он видит код и тесты, но не видит, как ведёт себя продукт в руках пользователя. Все шесть пропусков агента нашёл человек, и это следствие ограничения, а не случайность.
Ложные срабатывания и пропуски: насколько агенту можно доверять
Агент снял около 130 своих кандидатов, передал вопросами около 45 и допустил 6 пропусков. Все шесть пропусков нашёл человек. Разброс между числом гипотез и числом подтверждённых дефектов - главный практический вывод замеров.
Почему ~130 снятых кандидатов - это нормально
Природа ложных срабатываний предсказуема: агент выдвигает гипотезы на основе чтения кода и перебора состояний, часть из них не подтверждается при проверке. Соотношение подтверждённых к снятым - метрика качества приёмки, а не качества агента. Если вы принимаете кандидатов пачкой, без проверки, счёт находок раздувается: первая версия подсчёта в этих замерах оказалась завышенной почти вдвое.
Пак скиллов paranoid-qa как раз для того и нужен, чтобы агент сам отсеивал часть гипотез до передачи человеку и приносил не «нашёл 40 багов», а обоснованные находки с воспроизведением.
6 пропусков: почему все нашёл человек
Пропущенные дефекты касались поведения, которое не видно из кода и автотестов: они требовали физического присутствия в живом продукте. Это системное ограничение, а не недоработка конкретной сессии. Если в процессе есть задачи, где нужен живой продукт, полностью убирать человека из QA нельзя, иначе именно на этих участках дырки в покрытии станут постоянными.
Ограничения метода: что искажает цифры
Четыре искажения, о которых автор говорит прямо (оговорки по методике в дневнике замеров).
- Параллельные сессии. При работе двух сессий присутствие человека удваивается в счёте, поэтому итоговая экономия выглядит меньше реальной.
- Баги вне сессий. Дефекты, найденные вне замеряемых сессий, в датасет не попадают вообще, поэтому общий счёт находок занижен.
- Вердикты одного человека. Решения по кандидатам выносит сам автор, второй пары глаз нет, значит остаётся риск субъективности в том, что считать подтверждённым дефектом.
- Ротация транскриптов. Файлы сессий ротируются раз в 30 дней, так что сырьё нужно архивировать сразу, иначе восстановить таймлайн будет нечем.
Если повторяете замер, архивируйте транскрипты в тот же день и отдельным счётчиком фиксируйте баги, найденные вне сессий. Иначе сравнение агента с человеком поедет на ровном месте.
Что это значит на практике: как внедрять агента в QA
Агент работает как усилитель на задачах систематического перебора состояний и чтения кода, а не как замена тестировщика. Критериев выбора задачи три: формализуемость проверки, объём перебора состояний и стоимость ревью результата. Чем дороже обходится разбор находок, тем меньше смысла запускать агента.
Начинайте с участков, где ответ легко проверить формально: сверка с эталоном, разбор падений автотестов, сравнение кодовых срезов окружений. Держите человека на задачах с физическим контактом с продуктом: там агент не просто слабее, он не работает совсем.
Считайте не только агентские часы, но и человеческие. Ориентир из этих замеров - 0,77 часа человека на каждый час агента, и это при том, что метод завышает человеческое присутствие. Закладывайте по меньшей мере подписку Claude Pro, Max, Team или Enterprise либо аккаунт Claude Console как постоянную часть стоимости, и не ждите десятикратного ускорения.
16% экономии - скромно на фоне рекламных обещаний, зато эта цифра получена на живом проекте с дневником по каждой сессии. При правильном распределении задач агент даёт ощутимый вклад в покрытие там, где человек физически не успевает перебрать все состояния, а мелкие задачи и шаблонные отчёты оставляйте людям.