Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Среднее арифметическое: от закона больших чисел до квадратичных потерь — история, наука и подводные камни

Глубокий разбор среднего арифметического: от Бернулли до Гаусса, почему вес p единственно верен, связь с квадратичными потерями и опасности «среднего человека».

Коротко

Что будет в материале

  1. 01

    Введение: почему среднее - больше, чем просто сумма, делённая на n

  2. 02

    Исторический экскурс: от «Викинга-1» до Бернулли и спора титанов

  3. 03

    Математическое обоснование: почему вес должен быть p, а не p² или eᵖ

  4. 04

    Среднее и квадратичная функция потерь: неразрывная связь

Введение: почему среднее - больше, чем просто сумма, делённая на n

Среднее арифметическое - фундаментальная статистическая метрика, обоснованная слабым законом больших чисел и методом наименьших квадратов. Это результат многовековой эволюции мысли: от космических миссий до современных ML-моделей. В этой статье разобраны исторические корни, математические доказательства и опасные заблуждения, связанные с этой метрикой.

Среднее минимизирует сумму квадратичных невязок и ожидаемые квадратичные потери. Вероятность p - единственно верный вес для его вычисления. Использование p² или eᵖ приводит к сходимости к «вымышленному» параметру, а не к истинному среднему. При этом среднее не отражает форму распределения, катастрофически чувствительно к выбросам и является синтетической величиной, в отличие от моды или медианы. Эти свойства делают его одновременно мощным инструментом и источником критических ошибок при бездумном применении.

Понимание этих ограничений напрямую влияет на качество ML-моделей. Когда вы выбираете функцию потерь или интерпретируете метрики, вы опираетесь на свойства среднего. Ошибка в этом фундаменте каскадом расходится по всей системе. Терпение и дисциплина в ML начинаются с корректного обращения с базовыми статистическими концепциями.

Исторический экскурс: от «Викинга-1» до Бернулли и спора титанов

Среднее - не абстракция, а инструмент, проверенный веками и критическими задачами. Его история - это цепочка практических побед и теоретических прорывов.

«Викинг-1»: как среднее посадило аппарат на Марс

В 1976 году спускаемый аппарат «Викинг-1» заходил на посадку в условиях высокого уровня шума в показаниях радарного высотомера. Датчики выдавали разрозненные, зашумлённые значения высоты. Одиночное измерение могло привести к фатальной ошибке: преждевременному отключению двигателей или удару о поверхность.

Решение: усреднение последовательных показаний радара. Инженеры NASA применили скользящее среднее для фильтрации случайных ошибок измерений. Усреднённый сигнал дал стабильную оценку высоты, позволившую аппарату включить посадочные двигатели точно в расчётный момент. «Викинг-1» успешно сел на Равнину Хриса, проработав на поверхности более шести лет.

Этот случай - практическая демонстрация ключевого свойства среднего: оно «схлопывает» случайные ошибки, оставляя систематическую составляющую сигнала.

Якоб Бернулли и рождение закона больших чисел

За два с половиной века до марсианской посадки Якоб Бернулли заложил теоретический фундамент этого свойства. В труде «Искусство предположений», опубликованном посмертно в 1713 году, он сформулировал и доказал слабый закон больших чисел.

Суть закона: при неограниченном увеличении числа независимых испытаний выборочное среднее сходится по вероятности к истинному математическому ожиданию. Иными словами, чем больше данных вы собираете, тем ближе ваша оценка к реальности. Для своего времени это было революционным утверждением. Бернулли показал, что неопределённость можно измерить и контролировать через объём выборки.

Формально: для любого ε > 0 вероятность того, что выборочное среднее отклонится от истинного более чем на ε, стремится к нулю с ростом n. Именно этот закон - причина, по которой мы доверяем среднему в A/B-тестах, клинических испытаниях и оценке метрик моделей.

Лежандр vs Гаусс: битва за метод наименьших квадратов

В 1805 году Адриен Мари Лежандр опубликовал «Новые методы определения орбит комет», где впервые явно описал метод наименьших квадратов. Идея: найти такие параметры модели, которые минимизируют сумму квадратов отклонений предсказанных значений от наблюдаемых.

Карл Фридрих Гаусс немедленно заявил, что использовал этот метод с 1795 года, задолго до публикации Лежандра. Спор о приоритете растянулся на десятилетия. Гаусс в 1809 году опубликовал формальное обоснование метода через нормальное распределение ошибок, связав его с максимизацией правдоподобия.

Независимо от того, кто был первым, метод наименьших квадратов дал математическое обоснование среднему: среднее арифметическое - это точка, минимизирующая сумму квадратов отклонений от всех наблюдений. Эта связь оказалась фундаментальной для всей последующей статистики.

Математическое обоснование: почему вес должен быть p, а не p² или eᵖ

Выборочное среднее - это взвешенная сумма наблюдений, где каждый вес равен оценке вероятности p = 1/n. Этот выбор не произволен. Он продиктован требованием несмещённости оценки.

Несмещённость и сходимость: что такое «вымышленный» параметр

Оценка параметра называется несмещённой, если её математическое ожидание равно истинному значению параметра. Для среднего с весами 1/n это выполняется: E[(1/n) Σ X_i] = μ. Математическое ожидание выборочного среднего равно математическому ожиданию генеральной совокупности.

Что произойдёт, если заменить вес p на p²? Для выборки размера n вес каждого наблюдения станет 1/n². Математическое ожидание такой оценки: E[(1/n²) Σ X_i] = (1/n) μ. С ростом n эта оценка сходится не к μ, а к нулю - к «вымышленному» параметру, не имеющему отношения к реальности.

Ещё хуже ситуация с экспоненциальными весами eᵖ. При большом n вес каждого наблюдения стремится к e⁰ = 1, и оценка превращается в сумму наблюдений, делённую на константу, расходящуюся с ростом выборки. Такая статистика вообще ни к чему не сходится.

Простой числовой пример: выборка [2, 4, 6], истинное среднее = 4. С весами 1/3 получаем 4 - верно. С весами 1/9 получаем 12/9 ≈ 1.33 - абсурд. С весами e^(1/3) ≈ 1.395 оценка равна (2+4+6)*1.395/3 ≈ 5.58 - смещение на 40%. Только линейные веса, пропорциональные вероятностям, гарантируют сходимость к истинному параметру.

Среднее и квадратичная функция потерь: неразрывная связь

Задача: найти константу c, минимизирующую сумму квадратов отклонений Σ(x_i - c)². Дифференцируем по c, приравниваем к нулю: -2 Σ(x_i - c) = 0, откуда c = (1/n) Σ x_i. Среднее арифметическое - единственная точка, минимизирующая квадратичные потери на выборке.

Обобщение на случайные величины: среднее минимизирует ожидаемые квадратичные потери E[(X - c)²]. Для любой случайной величины X с конечным вторым моментом минимум достигается при c = E[X].

От минимизации невязок к MSE в машинном обучении

MSE (Mean Squared Error) - прямой наследник этой идеи. Когда модель обучается минимизировать MSE, она учится предсказывать условное среднее целевой переменной. Линейная регрессия, нейронные сети с MSE-лоссом - все они аппроксимируют E[Y|X].

Это объясняет, почему MSE чувствительна к выбросам: квадратичная функция штрафует большие отклонения непропорционально сильно. Ошибка в 10 единиц даёт штраф 100, а ошибка в 1 единицу - штраф 1. Модель «старается» учесть выбросы, смещая предсказания. Для сравнения, MAE (среднее абсолютное отклонение) минимизируется медианой и устойчивее к выбросам. Выбор функции потерь - это выбор между средним и медианой в качестве целевой статистики.

В production-среде выбор метрики напрямую влияет на бизнес-результат. MLflow позволяет отслеживать разные функции потерь и сравнивать их влияние на поведение модели в эксперименте.

Тёмная сторона среднего: когда оно лжёт

Три фундаментальных ограничения делают среднее опасным при бездумном использовании.

Первое: среднее не отражает форму распределения. Два распределения - бимодальное с пиками на 0 и 100 и унимодальное с пиком на 50 - имеют одинаковое среднее 50. Но описывают принципиально разные явления. Среднее скрывает эту информацию.

Второе: неограниченная чувствительность к выбросам. Одно экстремальное наблюдение способно сместить среднее сколь угодно далеко. Выборка зарплат [50k, 52k, 48k, 51k, 5000k] имеет среднее около 1040k, что не описывает типичную зарплату в группе. Медиана остаётся на уровне 51k.

Третье: синтетическая природа. Среднее количество детей в семье 1.7 - этому значению не соответствует ни одна реальная семья. Среднее может указывать на значение, которого не существует в природе.

Опасность «среднего человека»: уроки Кетле и ВВС США

Адольф Кетле в 1830-х годах ввёл концепцию «среднего человека» - l'homme moyen. Он вычислял средние антропометрические показатели и объявлял их «идеальными» пропорциями, к которым должно стремиться общество. Среднее стало нормативом.

В 1950 году ВВС США провели масштабное антропометрическое исследование. Измерили 140 размеров тела у более чем 4000 пилотов. По каждому параметру вычислили среднее. Спроектировали кабину под «среднего пилота» - сиденье, штурвал, педали, остекление.

Затем проверили, сколько реальных пилотов соответствуют средним значениям хотя бы по 10 из 140 параметров. Ответ: ноль. Ни один пилот не был «средним» даже по небольшому подмножеству измерений. Кабина, спроектированная под среднее, не подходила никому. Результатом стала концепция регулируемых интерфейсов - сидений, педалей, штурвалов, настраиваемых под конкретного человека.

Этот кейс - жёсткое предупреждение: среднее описывает популяцию, но не индивида. Проектирование под среднее создаёт системы, не подходящие никому. В ML это проявляется, когда модель, оптимизированная под среднюю точность на валидации, проваливается на важных подгруппах пользователей. Расхождение safety-метрик между бенчмарком и продом часто имеет ту же природу: агрегированное среднее скрывает критическую вариативность.

Почему среднее всё ещё правит миром статистики и ML

Несмотря на перечисленные ограничения, среднее остаётся центральной метрикой в подавляющем большинстве статистических методов. Причина - математическое удобство и оптимальность для нормально распределённых данных.

От z-оценок до линейной регрессии: вездесущее среднее

Стандартизация: z-оценка = (x - μ) / σ. Среднее - точка отсчёта, относительно которой измеряется отклонение. Без среднего невозможно нормирование признаков, критически важное для градиентных методов оптимизации.

Линейная регрессия: оценки коэффициентов по методу наименьших квадратов выражаются через выборочные средние и ковариации. β̂ = Cov(X,Y) / Var(X) = Σ((x_i - x̄)(y_i - ȳ)) / Σ(x_i - x̄)². Средние x̄ и ȳ - обязательные компоненты формулы.

ANOVA: дисперсионный анализ сравнивает межгрупповую и внутригрупповую дисперсии, вычисляемые как суммы квадратов отклонений от групповых средних и от общего среднего. F-статистика полностью построена на средних.

Ковариация и корреляция: Cov(X,Y) = E[(X - E[X])(Y - E[Y])]. Средние - точки центрирования, без которых невозможно измерить совместную вариативность.

Центральная предельная теорема: распределение выборочного среднего стремится к нормальному независимо от распределения исходных данных. Это свойство делает среднее универсальным инструментом для построения доверительных интервалов и проверки гипотез.

Даже в робастных методах среднее часто используется как начальная оценка, которая затем корректируется. Усечённое среднее, винзоризованное среднее, M-оценки Хубера - все они отталкиваются от классического среднего как от точки отсчёта. Оценка агентов в production требует понимания, как агрегированные метрики соотносятся с распределением реальных результатов.

Заключение: среднее как инструмент - мощный, но требующий осторожности

Среднее арифметическое - элегантный математический объект с трёхвековой историей и строгим обоснованием. Слабый закон больших чисел гарантирует его сходимость. Метод наименьших квадратов делает его оптимальным для квадратичных потерь. Эти свойства объясняют его вездесущность в статистике и машинном обучении.

Ограничения столь же фундаментальны: неспособность отражать форму распределения, чувствительность к выбросам, синтетическая природа. История с кабиной ВВС США - практическое доказательство того, что проектирование под среднее может привести к системам, не подходящим никому.

Практическая рекомендация: всегда визуализируйте распределение перед тем, как интерпретировать среднее. Проверяйте данные на выбросы. Рассматривайте медиану и моду как дополнительные метрики. Среднее - модель реальности, а не сама реальность. Глубокое понимание таких основ позволяет строить более надёжные ML-модели и принимать обоснованные решения на основе данных. Отделение сигнала от шума начинается с корректной работы с базовыми статистическими концепциями.

Подписаться на канал