Claude Code обрабатывает не промпт, а среду выполнения. Состояние кодовой базы, история правок, результаты тестов и системные инструкции - всё это формирует контекст, в котором агент принимает решения. Статичный промпт, написанный один раз и отправленный без оглядки на окружение, игнорирует 90% факторов, влияющих на результат. Поэтому классический prompt engineering утратил эффективность: он проектировался для одноразовых запросов к текстовой модели, а не для итеративного взаимодействия с агентом, который видит файлы, запускает команды и получает обратную связь.
Три техники, которые работают в этой парадигме: голосовая транскрипция для быстрой передачи контекста, обязательное описание способов тестирования в промпте и предварительное обсуждение архитектуры до написания кода. Четвёртый инструмент - генерация HTML-отчётов - превращает результаты работы агента в наглядную документацию, которую удобно ревьюить и передавать команде. Все четыре метода проверены на реальных проектах, включая сервер World of Warcraft с 1800 ботами на связке AzerothCore и DeepSeek API.
Почему классический prompt engineering устарел для AI-кодинг-агентов
Кодинг-агент - это цикл: модель получает наблюдение, выбирает инструмент, выполняет действие, снова наблюдает результат. Claude Code, Codex, OpenCode и Pi построены по этому принципу. Промпт здесь - лишь стартовое сообщение, которое быстро уходит в историю. Дальше агент опирается на результаты тестов, выводы линтера, содержимое файлов и сообщения об ошибках. Если промпт не учитывает этот цикл, он бесполезен.
Показательный сдвиг произошёл с появлением моделей уровня GPT-5.6 Sol Ultra. 23 июля 2026 года два исследователя из калифорнийских университетов опубликовали на arXiv доказательство для проблемы нескопируемого шифрования - задачи, над которой квантовые криптографы бились шесть лет. Авторы открыто указали: конструкцию и ключевые идеи доказательства целиком сгенерировал ИИ-агент. Модель предложила новый метод анализа, основанный на центрировании оператора и фильтре собственных чисел - подход, который не приходил в голову людям. Это не результат одного гениального промпта. Это результат итеративного взаимодействия, где агент исследовал пространство решений, проверял гипотезы и получал обратную связь.
Для разработчика практический вывод такой: перестаньте думать о промпте как о «заклинании». Думайте о нём как о спецификации процесса - что делать, как проверять результат, в каком формате отдавать. Агент сам выстроит цепочку действий. Контролируемый эксперимент с пятью обвязками кодинг-агентов показал: смена harness влияет на результат в 7.8 раза сильнее, чем смена модели на той же задаче. Промпт - лишь один элемент этой обвязки.
Голосовая транскрипция как способ быстрой передачи контекста
Описание архитектуры текстом занимает 15-30 минут. Диктовка - 3-5 минут. Разница критична, когда вы работаете с агентом в потоке и переключаетесь между задачами. Голосовая транскрипция решает проблему «холодного старта»: вы проговариваете контекст, агент получает его структурированным текстом и сразу начинает работать.
Инструмент - Whisper Web. Он запускает модель Whisper локально в браузере, без отправки аудио на сервер. Это принципиально: вы можете диктовать детали коммерческого проекта, архитектурные решения и фрагменты кода, не беспокоясь о конфиденциальности. Whisper meeting transcription via Whisper Web eliminates this risk entirely by processing everything locally inside your browser.
Настройка и интеграция Whisper Web в процесс работы с Claude Code
Workflow состоит из трёх шагов:
- Откройте Whisper Web в браузере. Выберите модель - для английского языка достаточно tiny или base, для русского рекомендована medium. Модель загружается один раз и кешируется браузером.
- Надиктуйте задачу. Говорите структурированно: начните с общей цели, затем перечислите ограничения, затем опишите ожидаемый результат. Паузы между смысловыми блоками улучшают качество транскрипции.
- Скопируйте текст и вставьте в Claude Code как стартовый промпт. При необходимости поправьте термины, которые модель могла неправильно распознать.
Для продвинутых пользователей доступна CLI-интеграция через whisper-cpp. Она позволяет транскрибировать аудио прямо в терминале и передавать текст в Claude Code одной командой. Настройка занимает 10 минут и описана в документации whisper-cpp.
Ограничения метода: транскрипция длинных записей (более 10 минут) нагружает браузер, на слабых машинах возможны задержки. Решение - разбивать диктовку на сегменты по 3-5 минут. Качество транскрипции русского языка ниже, чем английского: модель medium даёт около 85-90% точности на чистой речи, падая до 70% при фоновом шуме. Термины и названия функций лучше поправлять вручную после вставки в Claude Code.
Автор использует голосовую транскрипцию для описания архитектуры перед генерацией кода: диктует структуру модулей, связи между ними и контракты интерфейсов. Агент получает плотный контекст на 500-1000 слов и генерирует код, соответствующий спецификации, с первой-второй итерации.
Обязательное описание тестов: как гарантировать рабочий код
Код от агента без тестов - кот в мешке. Он может проходить линтер и выглядеть правильно, но падать на граничных случаях или не соответствовать ожидаемому поведению. Решение - встроить критерии тестирования прямо в промпт. Агент видит, что от него ждут не просто «напиши функцию», а «напиши функцию, которая проходит эти пять тестов», и генерирует код, удовлетворяющий спецификации.
Механизм работает через эффект «спецификации как ограничения». Когда агент знает, что результат будет проверен конкретными тест-кейсами, он тратит больше вычислительных ресурсов на верификацию логики и меньше - на генерацию непроверенных решений. Это подтверждается практикой: автоматическая верификация работы агента через прогон тестов - один из четырёх ключевых подходов к продлению продуктивных сессий кодинг-агентов до 24+ часов.
Пример промпта с встроенными критериями тестирования
Шаблон, который можно копировать и адаптировать под задачу:
Задача: реализовать функцию calculate_discount(order_amount, customer_tier).
Ожидаемое поведение:
- Принимает сумму заказа (float) и уровень клиента (str: 'bronze', 'silver', 'gold').
- Возвращает итоговую сумму после скидки (float).
Тест-кейсы:
1. calculate_discount(1000, 'bronze') → 1000 (нет скидки)
2. calculate_discount(1000, 'silver') → 950 (скидка 5%)
3. calculate_discount(1000, 'gold') → 900 (скидка 10%)
4. calculate_discount(0, 'gold') → 0 (нулевая сумма)
5. calculate_discount(-100, 'silver') → ValueError (отрицательная сумма)
Перед реализацией напиши юнит-тесты на pytest, которые проверят эти кейсы.
Затем реализуй функцию так, чтобы тесты проходили.
Формат работает по трём причинам. Во-первых, тест-кейсы задают однозначный контракт - агент не гадает, что вы имели в виду под «скидкой для премиум-клиентов». Во-вторых, требование написать тесты до кода включает режим test-driven development, который снижает вероятность багов. В-третьих, вы получаете готовый тестовый файл, который можно сразу запустить и убедиться в корректности.
Кейс с ботами WoW наглядно демонстрирует, что бывает без тестов. В первой версии диалогов ботов на DeepSeek API реплики выглядели неестественно: боты повторялись, не помнили контекст разговора и выдавали неуместные ответы. Проблема решилась, когда в промпт добавили конкретные критерии: «после трёх реплик бот должен запомнить имя собеседника», «бот не должен повторять последнюю фразу игрока», «на приветствие бот отвечает в стиле своего класса (воин - грубо, маг - высокомерно)». Эти критерии превратились в тесты для диалоговой системы, и качество реплик выросло радикально.
Предварительное обсуждение архитектуры с агентом
Самая дорогая ошибка в работе с кодинг-агентом - сразу просить код. Агент генерирует решение, вы видите, что структура не соответствует задаче, и начинаете итерации переписывания. Три-четыре таких цикла съедают больше времени, чем написание кода вручную.
Метод, который исключает эту проблему: сначала попросите Claude Code предложить архитектурное решение, обсудите его и только потом давайте команду на реализацию. Промпт выглядит так: «Опиши архитектуру для задачи X. Какие модули потребуются? Как они будут взаимодействовать? Какие интерфейсы нужны? Покажи структуру директорий. Код пока не пиши». Агент выдаёт текстовое описание архитектуры, вы указываете на слабые места, агент корректирует - и только после согласования начинается генерация кода.
Пример из практики: при разработке модуля интеграции для игрового сервера на AzerothCore агент предложил три варианта структуры - монолитную, микросервисную и гибридную с общей шиной событий. Обсуждение заняло 10 минут и выявило, что монолит не масштабируется на 1800 одновременных ботов, а микросервисы избыточны для прототипа. Гибридный вариант с event bus оказался оптимальным. Без этого обсуждения агент пошёл бы по первому пришедшему в голову пути, и переписывание заняло бы часы.
Техника особенно полезна в связке с голосовой транскрипцией: вы диктуете требования к архитектуре, агент их анализирует и предлагает решение. Диалог получается быстрым и предметным.
Генерация HTML-отчётов для визуализации и ревью
Код - не единственный результат работы агента. Claude Code генерирует HTML-отчёты с диаграммами, описаниями компонентов и схемами связей. Это решает три задачи: визуализирует сложные системы, ускоряет code review и создаёт документацию, которую можно передать команде.
Промпт для генерации отчёта: «Сгенерируй HTML-файл с описанием архитектуры проекта. Включи диаграмму компонентов (можно использовать Mermaid.js), список модулей с их ответственностью, схему взаимодействия и основные интерфейсы. Файл должен открываться в браузере без сервера». Агент создаёт самодостаточный HTML со встроенным JavaScript, который рендерит диаграммы на стороне клиента.
Интерактивные отчёты: добавляем JavaScript для наглядности
Статичный HTML полезен. Интерактивный - незаменим. Claude Code умеет включать в отчёт фильтры, сортировку и визуализацию данных через Plotly.js или Chart.js. Промпт: «Сгенерируй HTML-дашборд для анализа поведения ботов. Включи график распределения ботов по зонам (Plotly bar chart), таблицу с фильтрацией по классам и уровням, временную шкалу активности. Все библиотеки подключи через CDN».
Результат - файл, который открывается в браузере и показывает полную картину системы. Для проекта с 1800 ботами в WoW такой дашборд позволил за 15 минут найти аномалию: боты-маги собирались в одной зоне и не расходились, потому что в промпте была ошибка в описании поведения класса. Без визуализации этот баг мог оставаться незамеченным неделями.
HTML-отчёты работают как артефакт code review. Вместо того чтобы читать сотни строк кода, ревьюер открывает отчёт, видит архитектуру, проверяет соответствие требованиям и только потом идёт в код за деталями. Это сокращает время ревью в 2-3 раза на сложных модулях.
Практический кейс: 1800 ботов в World of Warcraft на связке AzerothCore и DeepSeek
Проект демонстрирует все четыре техники в действии. Открытый сервер WoW на движке AzerothCore с модулем playerbots, который управляет передвижением, квестами и базовым поведением 1800 ботов. Реплики ботов генерирует DeepSeek API через модель deepseek-v4-flash по цене $0.14 за миллион входных токенов (cache miss) и $0.28 за миллион выходных.
Голосовая транскрипция использовалась для описания сценариев поведения: автор диктовал, как боты разных классов должны общаться в таверне, реагировать на PvP-действия и отвечать на вопросы игроков. Транскрибированный текст становился частью системного промпта для DeepSeek.
Тестирование диалогов построили на конкретных критериях: бот должен поддерживать контекст в течение 10 реплик, не повторяться, использовать лексику своего класса и расы. Каждый критерий проверялся автоматически - скрипт прогонял диалоги и сравнивал с эталонными паттернами. Без настройки промптов и памяти диалоги выглядели неестественно, но после трёх итераций с уточнением критериев качество достигло приемлемого уровня.
HTML-отчёты визуализировали распределение ботов по зонам, активность по времени суток и паттерны диалогов. Интерактивный дашборд на Plotly.js позволил отфильтровать ботов по классу и увидеть, что маги требуют отдельной настройки промптов из-за специфики поведения.
Стоимость API оказалась управляемой: при 1800 ботах, каждый из которых генерирует в среднем 50 реплик в час, месячный бюджет на DeepSeek API составил около $400. Это сопоставимо с затратами на хостинг сервера.
Ограничения и подводные камни новых методов
Голосовая транскрипция через Whisper Web требовательна к ресурсам: модель medium загружает 1.5 ГБ в оперативную память браузера, на машинах с 8 ГБ ОЗУ возможны задержки при транскрипции длинных записей. Решение - использовать модель tiny для английского языка (200 МБ) или разбивать диктовку на сегменты.
Сгенерированный код и доказательства требуют ручной проверки. Модель может предложить синтаксически корректное, но логически ошибочное решение - особенно в задачах, где нет однозначного критерия правильности. Ответственность за результат всегда лежит на разработчике. Это относится и к научным результатам: авторы криптографического доказательства, сгенерированного GPT-5.6 Sol Ultra, явно проверили и верифицировали каждое утверждение перед публикацией.
HTML-отчёты избыточны для малых задач. Генерация дашборда для функции из 50 строк - неоправданная трата токенов. Порог рентабельности - модули от 500 строк или системы с тремя и более компонентами.
Зависимость от доступности API - фактор риска для проектов, завязанных на конкретного провайдера. DeepSeek API может быть недоступен из некоторых регионов, требуется проверка условий доступа перед включением в продуктовый пайплайн. Рекомендация - проектировать систему с возможностью замены LLM-провайдера через абстрактный слой.
Проблема памяти ботов в кейсе WoW не решена полностью: при длинных диалогах контекст вымывается, и боты теряют нить разговора. Это фундаментальное ограничение архитектуры transformer, а не конкретной модели. Частичное решение - суммаризация диалога после каждых 10 реплик и передача саммари вместо полной истории.