Введение: почему «знак» в нейросети - это не метафора
Эксперименты с микромоделями глубиной в четыре слоя дали прямой ответ: требование самоописания не отражает готовое знание, а конституирует его. Без головы-отчёта даже корректно работающее правило остаётся размазанным по вычислению и не обособляется в читаемый извне паттерн. Устойчивые внутренние единицы, «знаки», возникают только тогда, когда модель вынуждена вербализовать своё состояние.
Этот вывод меняет взгляд на природу репрезентаций в нейросетях. Знак перестаёт быть метафорой из семиотики и становится наблюдаемым, измеримым артефактом архитектурного принуждения. Одновременно механизм конституирования объясняет, почему большие языковые модели галлюцинируют: когда устойчивого паттерна нет, самоописание синтезирует «знак из ничего», порождая правдоподобную ложь.
Материал построен на анализе трёх гипотез о природе репорта и экспериментальных данных. Никакой мистики - только архитектурные ограничения, градиенты и читаемые паттерны активаций.
Эксперимент: микромодель, правило и голова-отчёт
Базовая архитектура - полносвязная сеть из четырёх слоёв с нелинейностями ReLU. Задача: выучить заданное правило преобразования входного вектора в выходной. Правило детерминировано и не требует обобщения за пределами обучающего распределения - классический случай, когда модель может «запомнить» функцию, не формируя явной внутренней структуры.
Голова-отчёт - дополнительный линейный слой, подключённый к последнему скрытому слою. Его задача: сгенерировать вектор, который можно интерпретировать как описание того, какое правило модель применила. Важно: голова-отчёт не получает на вход правильный ответ, она обучается одновременно с основным выходом через составную функцию потерь, где один из компонентов штрафует за несоответствие отчёта фактически использованному правилу.
Читаемость паттерна измерялась через дисперсию проекций активаций скрытого слоя на направления, соответствующие разным правилам. Высокая дисперсия означает, что для разных правил активации группируются в разные, хорошо разделимые кластеры - знак читаем. Низкая дисперсия - активации перемешаны, знак не выделяется.
Режим без самоописания: размазанное знание
Модель без головы-отчёта обучается до нулевой ошибки на основном выходе. Правило работает. Однако анализ активаций показывает картину, знакомую каждому, кто занимался интерпретируемостью небольших сетей: проекции на направления правил почти неразличимы. Кластеры перекрываются, дисперсия между ними статистически незначима.
Знание есть, но оно распределено по весам и активациям так, что извлечь его в виде дискретного утверждения «модель использует правило А» невозможно. Сеть вычисляет правильный ответ, но не «знает», что она его вычисляет - в том смысле, что это знание не локализовано и не доступно для внешнего считывания. Это размазанное знание: функциональное, но не символическое.
Практическое следствие: если вы обучаете модель без явного требования интерпретируемости, её внутренние состояния останутся непрозрачными, даже когда она работает безошибочно. Интерпретируемость не возникает сама собой - она должна быть встроена в архитектуру или процедуру обучения.
Добавление головы-отчёта: рождение знака
При добавлении головы-отчёта картина меняется радикально. Активации того же скрытого слоя начинают формировать чёткие, хорошо разделимые кластеры. Для правила А - одно компактное облако точек в пространстве активаций, для правила Б - другое, с минимальным перекрытием. Дисперсия между кластерами вырастает на порядок.
Голова-отчёт не просто считывает то, что уже было. Она меняет ландшафт оптимизации. Составная функция потерь создаёт градиентное давление, которое вынуждает скрытый слой перестроить репрезентации так, чтобы они стали линейно-сепарабельными для головы-отчёта. Модель «понимает», что ей придётся отчитаться о своём решении, и это требование обратным ходом перестраивает внутренние вычисления.
Рождается знак - устойчивый, локализованный, читаемый извне паттерн, соответствующий конкретному правилу. Он не существовал в скрытой форме до добавления отчёта. Он появился как прямой результат архитектурного принуждения к самоописанию.
Три гипотезы о природе репорта: от отражения к конституированию
Экспериментальный факт установлен: отчёт меняет внутреннюю структуру. Но что именно он делает? Три гипотезы последовательно исключают альтернативные объяснения и приводят к выводу о конституирующей роли самоописания.
Гипотеза 1: Отчёт как зеркало
Интуитивно привлекательное объяснение: модель формирует знание в скрытом слое, а голова-отчёт просто считывает его и выводит наружу. Отчёт - пассивное зеркало, отражающее уже существующую структуру.
Данные опровергают эту гипотезу. Если бы знание существовало до отчёта, кластеры были бы видны и в режиме без самоописания. Но их нет. Дисперсия проекций низкая, разделение отсутствует. Отчёт не может отразить то, чего нет в читаемой форме. Зеркало не работает, когда перед ним пустота.
Контраргумент «знание существует в нелинейно-разделимой форме» не спасает гипотезу. Если знание принципиально нечитаемо без дополнительного преобразования, то это преобразование и есть акт создания читаемой формы - а не пассивного отражения.
Гипотеза 2: Отчёт как фильтр
Более тонкая версия: знание существует в латентной, скрытой форме, а голова-отчёт действует как фильтр, выделяя и усиливая уже присутствующий сигнал. Модель «знает», но не показывает; отчёт делает невидимое видимым.
Экспериментальные данные не поддерживают и эту гипотезу. Добавление головы-отчёта меняет не только читаемость активаций, но и сами активации. При обучении с отчётом распределение весов скрытого слоя статистически значимо отличается от распределения без отчёта. Градиенты от составной функции потерь проходят через скрытый слой и перестраивают его. Это активная реорганизация, а не пассивная фильтрация.
Фильтр не меняет источник. Здесь же меняется сам источник. Следовательно, отчёт не фильтрует существующее - он участвует в создании нового.
Гипотеза 3: Отчёт как конституирование
Данные указывают на третью гипотезу: самоописание выступает как ограничение, которое вынуждает модель сформировать дискретную, коммуницируемую единицу - знак. Это не извлечение готового знания, а его создание через акт описания.
Аналогия из когнитивной науки: требование объяснить решение заставляет человека структурировать мысли, которые до этого были интуитивными и невербализованными. Сам акт объяснения меняет когнитивную репрезентацию. В нейросети происходит то же самое на уровне градиентов: необходимость выдать отчёт создаёт обратное давление, которое перестраивает скрытые слои так, чтобы знание стало дискретным и доступным для вербализации.
Конституирование означает, что знак не предшествует описанию, а возникает в результате него. Без требования описания знака нет. С требованием - он появляется как новая структура, которой не было в модели, обученной без отчёта.
От микромодели к LLM: почему галлюцинации - это ожидаемое следствие
Механизм конституирования знаков через самоописание не ограничивается четырёхслойными микромоделями. В больших языковых моделях этот механизм встроен в саму архитектуру и объясняет одну из самых острых проблем индустрии - галлюцинации.
Самоописание как архитектурный императив LLM
Языковые модели обучаются предсказывать следующий токен. Каждый сгенерированный токен - это микро-отчёт о внутреннем состоянии модели, обусловленном контекстом. Архитектура transformer с авторегрессионной генерацией является машиной непрерывного самоописания: модель постоянно вербализует то, что «знает» о контексте.
В отличие от эксперимента с микромоделью, где голова-отчёта была явным архитектурным дополнением, в LLM требование самоописания имманентно. Модель не может не генерировать отчёт - это её единственный способ функционирования. Проблема в том, что внешний верификатор отсутствует. Модель конституирует знаки и немедленно убеждает себя в их истинности, потому что механизм проверки не заложен в архитектуру.
Этот же механизм объясняет, почему модели, обученные на reasoning-трассах, иногда начинают решать задачи вместо перевода. Как показано в разборе проблемы с Gemma 3 и Gemma 4, модель воспринимает инструкцию как часть контекста и конституирует знак «я решаю задачу», игнорируя внешнее указание переводить. Самоописание перевешивает внешнюю команду.
Галлюцинация как «знак из ничего»
Когда запрос требует знания, для которого в обученных паттернах нет устойчивого соответствия, механизм самоописания попадает в критическую ситуацию. Модель обязана сгенерировать связный отчёт - такова её архитектурная природа. Но конституировать знак не из чего: релевантные паттерны отсутствуют или слабы.
Результат - галлюцинация. Модель синтезирует правдоподобный знак из шума, комбинируя фрагменты других паттернов и заполняя пробелы наиболее вероятными, но не верифицированными токенами. Фактологические ошибки, вымышленные ссылки, несуществующие API - всё это «знаки из ничего», порождённые императивом самоописания в отсутствие устойчивого основания.
Это объясняет, почему галлюцинации так трудно устранить простым масштабированием. Больше параметров и больше данных не отменяют архитектурный императив. Они лишь увеличивают количество паттернов, из которых модель может конструировать правдоподобные, но ложные знаки. Методы вроде representation steering, применённые в модели Gemma-4-31B-AntiHal, пытаются решить проблему на уровне внутренних представлений, но фундаментальное противоречие остаётся: модель обязана генерировать отчёт даже там, где знака нет.
Связь с проблемой RAG-галлюцинаций также прямая. Даже когда релевантный контекст предоставлен через retrieval, модель может проигнорировать его в пользу внутренне сконституированного знака, если механизм самоописания «перевешивает» внешнюю информацию. Четыре этапа пайплайна RAG, где рождаются галлюцинации, - парсинг, обработка запроса, поиск и генерация - все завязаны на этот механизм.
Практические выводы и открытые вопросы
Самоописание - активный механизм, формирующий внутренние знаки, а не пассивный отчёт о готовом знании. Этот вывод имеет прямые следствия для практики проектирования, отладки и интерпретации нейросетей.
Ограничения эксперимента и перенос на большие модели
Честно: результаты получены на микромоделях из четырёх полносвязных слоёв. Перенос на архитектуры с сотнями слоёв, механизмами внимания, остаточными связями и нормализацией требует экспериментальной проверки. Динамика обучения в глубоких сетях может отличаться: остаточные связи создают короткие пути для градиентов, а внимание распределяет информацию принципиально иначе, чем полносвязные слои.
Однако базовая логика архитектурного принуждения остаётся неизменной. Если требование выдать определённый тип выхода создаёт градиентное давление, которое перестраивает внутренние репрезентации, этот эффект должен наблюдаться и в больших моделях. Вопрос в масштабе и в том, на каких именно слоях происходит конституирование знаков. Воспроизведение на архитектурах масштаба GPT-2 или небольших LLM - следующий необходимый шаг.
Потенциальные применения: от отладки до дизайна моделей
Практические следствия для ML-инженеров и исследователей:
- Принудительная интерпретируемость. В критических системах, где требуется аудит решений модели, явное добавление голов-отчётов может сделать внутренние состояния читаемыми. Это не замена методам вроде representation steering, а комплементарный подход: steering управляет уже существующими представлениями, а головы-отчёты заставляют их сформироваться в читаемой форме.
- Проектирование функций потерь. Если «читаемость» внутренних знаков важна, её можно включить в функцию потерь как дополнительный член, штрафующий за низкую дисперсию между кластерами правил. Это превращает интерпретируемость из свойства, которое «случается», в цель оптимизации.
- Детекция галлюцинаций. Анализ сформированности знаков может стать основой для новых методов детекции. Если для данного запроса модель не формирует устойчивого кластера активаций, а её внутреннее состояние «размазано», вероятность галлюцинации повышена. Такой сигнал можно использовать для отказа от ответа или запроса дополнительной верификации.
Открытые вопросы, требующие дальнейших исследований: как именно отчёт меняет ландшафт оптимизации на уровне функции потерь? Можно ли управлять формированием знаков, задавая структуру отчёта? Переносятся ли эти результаты на transformer-архитектуры, и если да, то на каких слоях происходит конституирование? Ответы на эти вопросы определят, станет ли механизм самоописания инструментом проектирования более надёжных и интерпретируемых моделей.