Проблема: почему пересказ источников не работает
206 длинных видео, 160 с лишним часов записи, 2,15 млн слов транскриптов. Такой корпус невозможно удержать в голове, а последовательный пересказ каждого ролика не даёт целостной картины. Вы получаете 206 отдельных конспектов, между которыми нет связей. Повторы множатся, противоречия остаются незамеченными, ключевые идеи тонут в потоке примеров.
Проблема в единице работы. Традиционный подход опирается на источник: берём видео, обрабатываем, пересказываем. Но читателю нужен ответ на конкретный вопрос, а не сумма пересказов. Когда единицей становится вопрос, а не ролик, конвейер начинает строить структурированную модель знаний: выделяет принципы, правила и приёмы, дедуплицирует смысловые повторы, отслеживает происхождение каждого вывода и проверяет числовые утверждения.
Результат - персональная «книга под вопрос», собранная из 160 часов видео. Это не конспект и не дайджест. Это модель предметной области, в которой каждая единица знания связана с источником и проверена на дубли.
Конвейер: от видео к структурированной модели знаний
Обработка идёт по этапам. Сначала транскрибация: 206 видео превращаются в 2,15 млн слов текста. Затем агенты разбирают этот массив на атомарные единицы знания, находят смысловые дубли, связывают утверждения с источниками и проверяют ключевые числа. На выходе - не сумма пересказов, а структурированная модель, готовая к ответам на новые вопросы.
Выделение сущностей: принципы, правила, приёмы
Сущности в этом конвейере - атомарные единицы знания. Принцип объясняет, почему что-то работает. Правило задаёт границы применимости. Приём описывает конкретное действие. Агенты идентифицируют такие единицы в неструктурированном тексте транскриптов, отделяя их от примеров, историй и отступлений.
Пример: в видео о переговорах принципом будет «цена определяется до обсуждения условий», правилом - «не называйте первое число, если не знаете рыночный диапазон», приёмом - «держите паузу после предложения контрагента». Каждая сущность получает идентификатор и сохраняется отдельно от исходного текста. Это позволяет комбинировать единицы из разных источников, а не тащить за собой весь контекст ролика.
Дедупликация смысловых повторов: ограничения векторной кластеризации
В 206 видео один и тот же принцип может повторяться десятки раз в разных формулировках. Векторная кластеризация - очевидный инструмент для поиска дублей, но у неё есть ограничения. Два высказывания с близкими векторами могут иметь разный смысл: «модель показала высокую точность» и «модель показала низкую точность» находятся рядом в векторном пространстве, хотя утверждают противоположное. Одинаковые по смыслу фразы могут оказаться далеко друг от друга из-за разного словаря: «снижайте температуру модели» и «уменьшайте параметр sampling temperature» описывают одно действие, но векторы различаются.
Решение - комбинировать векторный поиск с дополнительными проверками. Агенты сравнивают кандидатов на дубли по смыслу, а не только по косинусной близости. Для спорных случаев привлекается вторая итерация: LLM получает пару утверждений и решает, эквивалентны ли они. Это дороже, но точность выше. Дедупликация критична: без неё книга превращается в раздутый набор повторов, где один принцип занимает 40 страниц в 40 формулировках.
Provenance: отслеживание происхождения каждого вывода
Каждое утверждение в итоговой книге связывается с конкретным видео и моментом времени. Механизм provenance фиксирует: эта единица знания извлечена из ролика №47, таймкод 12:34–14:02. Если в книге появляется спорное утверждение, читатель может открыть исходный фрагмент и проверить контекст.
Для проверки и цитирования это принципиально. Модель знаний без provenance - чёрный ящик: вы не знаете, откуда взялся вывод и насколько он надёжен. С provenance каждое утверждение проверяемо. Агенты сохраняют связи между сущностями и источниками на всех этапах конвейера, от транскрибации до финальной сборки. Потеря связи на любом этапе помечает утверждение как непроверенное.
Проверка числовых утверждений
Числа искажаются чаще всего. В устной речи «рост на 30%» может прозвучать как «рост примерно на треть», а при транскрибации превратиться в «рост на 13%». Агенты сверяют ключевые числовые утверждения с исходным текстом транскрипта и между собой. Если одно видео говорит о 40% точности, а другое о 60% для той же метрики, система помечает расхождение и не включает оба числа без уточнения контекста.
Проверка работает по простому правилу: каждое число в книге должно иметь единственный источник в транскрипте. Если источников несколько и они расходятся, в книгу попадает диапазон с указанием обоих видео. Это исключает ситуацию, когда читатель цитирует неверную цифру, уверенный в её точности.
Отличие от RAG: почему это не просто retrieval
RAG извлекает релевантные фрагменты по запросу и передаёт их модели для генерации ответа. Это работает для точечных вопросов: «что сказано о температуре модели в видео №12?». Но RAG не строит целостную модель. Каждый запрос обрабатывается заново, связи между фрагментами не сохраняются, дубли не устраняются, provenance не ведётся.
Описанный конвейер создаёт структурированное знание, которое можно использовать для ответа на новые вопросы без обращения к исходникам каждый раз. Модель знаний хранит сущности, связи и provenance. Вопрос «какие принципы управления контекстом повторяются в разных видео?» получает ответ из собранной модели, а не из повторного поиска по 2,15 млн слов. Единица работы - вопрос, а не документ. RAG отвечает на вопрос, обращаясь к документам. Этот подход отвечает на вопрос, обращаясь к уже собранной модели знаний.
Для команд, которые проектируют собственных агентов, разница принципиальна. RAG дёшев на старте, но не накапливает знание. Конвейер сборки модели дороже, но создаёт актив, который со временем отвечает быстрее и точнее. Подробнее об архитектуре агентов с памятью и инструментами - в разборе самописного AI-агента на Python.
Проблемы длительной агентной работы
Обработка 160 часов видео - это не один прогон. Это сотни итераций агентов, и на длинной дистанции появляются специфические проблемы. Две из них проявляются чаще всего: потеря требований и регрессии в тексте.
Потеря требований
Агент получает инструкцию в начале работы. К середине конвейера часть требований игнорируется. Формат вывода упрощается, обязательные поля пропадают, проверки пропускаются. Причина - длинный контекст: ранние инструкции вытесняются из окна внимания, и агент начинает следовать только последним сообщениям.
Обнаружить это можно контрольными точками. После каждого этапа агент-проверщик сверяет выход с исходным техническим заданием. Если формат нарушен, этап перезапускается. Исправление - не в увеличении контекста, а в разбиении задания на короткие этапы с повторной передачей ключевых требований. Опыт команд, внедряющих автономных агентов, показывает: политики и рабочие процессы важнее размера контекстного окна. Практическое руководство по управлению агентной разработкой - в статье о Governance-стеке для агентной разработки.
Регрессии в тексте
Качество генерации падает со временем. Появляются повторы, теряется связность, возникают фактические ошибки. Агент, который в начале работы выдавал структурированные блоки, к концу скатывается в поток сознания. Это проявляется особенно заметно при обработке однотипных фрагментов: после 50-го видео агент начинает копировать шаблон, не наполняя его содержанием.
Методы контроля - повторная проверка каждого блока и разбиение на этапы с паузами. Агент-скептик, который проверяет выводы основного агента, ловит большинство регрессий до того, как они попадут в книгу. Паттерн верификации в LLM-агентах разобран на примерах биомедицинских проектов в статье об архитектуре агентов с самопроверкой.
Экономика персональных исследований: вопрос как единица работы
Смена единицы работы с источника на вопрос меняет экономику исследований. Раньше обработка 206 видео означала 206 задач: посмотреть, законспектировать, сохранить. Теперь это одна задача: собрать модель знаний под конкретный вопрос. Стоимость не растёт линейно с числом источников, потому что дубли устраняются, а связи выявляются автоматически.
Для специалиста это означает: персональная система знаний собирается за дни, а не месяцы. Вопрос «как устроена обработка ошибок в агентных системах» получает ответ из модели, собранной из десятков источников, с проверенными числами и provenance. Время на поиск релевантной информации сокращается, потому что поиск идёт по структурированной модели, а не по сырым транскриптам.
Организации получают похожий эффект при построении систем управления знаниями. Рост производительности на 50% и ROI 48% в первый год - цифры из практического руководства по системам управления знаниями в AI-эру. Конвейер сборки модели знаний - один из компонентов такой системы.
Заключение: персональная книга как новый формат знаний
Персональная книга, собранная из 160 часов видео, - это структурированная модель знаний, а не пересказ источников. Сущности выделены, дубли устранены, происхождение каждого вывода отслеживается, числа проверены. Ограничения известны: векторная кластеризация не всегда ловит смысловые дубли, длительная агентная работа требует контрольных точек и повторных проверок.
Главный вывод практический: единицей работы с информацией становится вопрос, а не источник. Это открывает путь к собственным системам производства знаний - от персональных книг под конкретный вопрос до корпоративных моделей предметной области. Конвейер воспроизводим: транскрибация, выделение сущностей, дедупликация, provenance, проверка чисел. Начните с одного вопроса и десяти источников. Дальше масштабируйте.