StatWin

Раздел · 7 материалов

Статистика простыми словами: полный гид без формул 2026

Как понимать статистику и не дать себя обмануть: среднее против медианы, корреляция и причинность, p-value, размер выборки, ошибка выжившего.

Карандашный набросок кривых распределения на листе бумаги

Статистика — это не про формулы, а про то, чтобы вас не обманули. Каждый день реклама, новости и «исследования» бросаются цифрами, и большинство из них подобраны так, чтобы подтолкнуть к нужному выводу. Этот раздел учит видеть приёмы — без единой формулы, на живых примерах.

Наш подход: не заучивать определения, а понимать, где цифра честная, а где манипуляция. Потому что за каждым числом стоит решение, как его посчитать, — и в этом решении вся честность анализа.

Четыре вопроса, которые проверяют любую цифру

Прежде чем разбираться в темах по отдельности, стоит запомнить короткий чек-лист. Он отсеивает большую часть манипуляций за минуту.

ВопросЧто проверяемГде подробно
Среднее или медиана?Не перекошены ли данные редкими экстремумамиСреднее против медианы
Связь или причина?Не выдают ли совпадение за механизмКорреляция ≠ причинность
Сколько наблюдений и как набраны?Хватает ли данных и честен ли отборРазмер выборки
Как нарисован график?Не искажает ли подачаКак врут графики

Эти четыре вопроса работают в любой ситуации — от новости про среднюю зарплату до презентации подрядчика.

Первая ловушка: «типичное» значение

Самая частая манипуляция — не подделка чисел, а выбор способа их усреднить.

Представьте комнату: девять человек с зарплатой 50 тысяч и один с зарплатой 5 миллионов. Среднее — 545 тысяч. Формально верно; по сути ложь: девять из десяти получают 50 тысяч. Медиана — значение ровно посередине — даёт 50 тысяч и описывает эту комнату честно.

Разница в том, что среднее учитывает величину каждого значения, поэтому один экстремум сдвигает его резко, а медиана учитывает только порядок, и потому устойчива. Отсюда правило: для перекошенных данных (доходы, цены на жильё, время ответа сервера) честнее медиана; для симметричных (рост, температура) годится среднее.

Практический признак манипуляции: если сообщают только среднее по данным, где заведомо есть «хвост» больших значений, — скорее всего, цифру хотели сделать больше. Подробный разбор с примерами — в статье «Среднее против медианы», а понятия — в словаре: среднее, медиана, распределение.

Вторая ловушка: совпадение вместо причины

Летом растут продажи мороженого и число утоплений. Данные подтверждают: корреляция есть. Значит ли это, что мороженое топит людей? Нет — обе величины поднимает жара.

Когда две величины меняются вместе, возможны четыре объяснения: A вызывает B; B вызывает A; общий фактор вызывает оба; чистая случайность. Наблюдая только корреляцию, вы не знаете, какое из четырёх перед вами, — а решения зависят от этого целиком.

Доказать причину наблюдением нельзя, нужен эксперимент: изменить один фактор, всё остальное держать одинаковым, посмотреть на результат. Это логика A/B-теста, и случайное разделение групп в нём — не формальность, а именно то, что уравнивает прочие факторы.

Для работы с ИИ это критично: нейросеть по природе — машина корреляций. Она находит, что с чем меняется вместе, и на этом строит предсказания. Пока модель предсказывает, всё в порядке; как только на её выводах основывают действия, ложная причинность превращается в дорогую ошибку. Родственная ловушка — ошибка выжившего, где причину ищут не там, потому что не видят отсеявшихся.

Третья ловушка: сколько данных достаточно

«Учёные выяснили» — а потом оказывается, что опросили двенадцать человек.

На маленькой выборке один нетипичный участник сдвигает результат на десятки процентов. Отсюда два следствия: результат неустойчив (повторите замер — получите другое) и склонен к экстремумам. Именно поэтому «самые здоровые» и «самые больные» регионы в исследованиях часто оказываются маленькими — не потому что там особая жизнь, а потому что мало данных.

Контринтуитивная деталь: важен не процент от населения, а абсолютное число наблюдений. Тысяча случайно отобранных человек даёт примерно одинаковую точность и для города в сто тысяч, и для страны в сто миллионов.

Но размер — не главное. Большая, но кривая выборка врёт увереннее маленькой честной: классический провал 1936 года, когда журнал опросил два миллиона человек по телефонным справочникам и предсказал не того победителя выборов, — телефон тогда был у обеспеченных, и выборка оказалась смещённой. Сначала честный отбор, потом достаточный размер — подробнее в статье о выборке.

Четвёртая ловушка: подача вместо содержания

График не обязан врать цифрами, чтобы обмануть. Достаточно подать правду так, чтобы вы сделали нужный вывод.

Самый частый приём — обрезанная ось Y: если вертикальная ось начинается не с нуля, рост со 100 до 103 выглядит как взлёт, хотя это плюс три процента. Второй по частоте — черри-пикинг периода: показывают отрезок, где тренд удобен, и обрезают остальное. Третий — двойная ось, которой две линии «подгоняют» друг под друга, создавая иллюзию связи.

Защита не требует знаний: посмотрите на оси, а не на картинку. С чего начинается Y? Равномерный ли шаг? Какой период по X и почему именно он? Нет ли второй оси? Полный разбор десяти приёмов — в статье «Как врут графики», а как строить честные — в обзоре инструментов визуализации.

Значимость: что означает и чего не означает

Отдельный узел путаницы — «статистически значимый результат».

P-value отвечает на один узкий вопрос: насколько вероятно получить такой результат случайно, если эффекта нет. Маленькое значение означает «случайностью объяснить трудно» — и ничего о величине эффекта.

Три заблуждения, которые стоит развести раз и навсегда:

  • p-value не вероятность того, что гипотеза верна;
  • p-value не размер эффекта: значимый ≠ большой;
  • «статистически значимо» не равно «практически важно» — на большой выборке значимым становится ничтожное различие.

Поэтому значимость читают в паре с доверительным интервалом, который показывает не только «есть ли эффект», но и «насколько он велик и насколько мы в этом уверены». Одна цифра без «вилки» создаёт ложную определённость: оценка «45%» может означать 45 ± 2 (надёжно) или 45 ± 15 (почти шум).

Зачем это в журнале про данные и ИИ

Статистика — фундамент искусственного интеллекта, а не соседняя дисциплина.

Нейросеть учится на данных, а данные описываются ровно теми понятиями, что разобраны выше: выборка, распределение, разброс, корреляция. И ловушки переносятся один в один:

  • нерепрезентативная выборка в опросе → предвзятая модель в машинном обучении;
  • корреляция вместо причины у аналитика → модель, «выучившая», что зонтики вызывают дождь;
  • малый размер выборки → переобучение, когда модель заучила примеры вместо закономерности;
  • погоня за значимостью → принятые за сигнал случайные улучшения метрики.

Отсюда практический вывод: понимать статистику полезнее, чем знать архитектуры моделей. Модель — отражение данных, а качество данных оценивается статистикой.

Порядок изучения

Если начинаете с нуля, разумный маршрут такой:

  1. Среднее против медианы — самая частая манипуляция и самая простая для понимания.
  2. Как врут графики — быстрый практический навык, применимый ежедневно.
  3. Корреляция и причинность — главная концептуальная ошибка в анализе.
  4. Размер выборки и ошибка выжившего — почему данные бывают обманчивы сами по себе.
  5. P-value и доверительные интервалы — язык, на котором говорят исследования.

Все термины собраны в словаре данных и статистики. Ниже — материалы раздела.

Статистика Среднее против медианы: когда среднее врёт Чем среднее отличается от медианы простыми словами, почему «средняя зарплата» вводит в заблуждение и как … Статистика Ошибка выжившего: почему мы учимся не у тех Ошибка выжившего простыми словами: почему мы делаем выводы по «выжившим» и не видим проигравших, пример с … Статистика Корреляция ≠ причинность: разбор на примерах Почему корреляция не означает причинно-следственную связь: разбор на примерах, три объяснения любого … Статистика Как врут графики: 10 приёмов манипуляции данными Десять приёмов, которыми графики вводят в заблуждение: обрезанная ось, искажённый масштаб, подмена типа … Статистика P-value и статзначимость на пальцах Что такое p-value и статистическая значимость простыми словами, что p-value НЕ означает, порог 0,05 и почему … Статистика Размер выборки: сколько данных достаточно Почему размер выборки решает надёжность вывода, почему важен не процент, а абсолютное число, и как маленькие … Статистика Доверительные интервалы простыми словами Что такое доверительный интервал простыми словами, почему одна цифра без «вилки» неполна, что означает «95%» и …

Вопросы и ответы

С чего начать разбираться в статистике?

С трёх вещей, которые чаще всего вводят в заблуждение: разницы между средним и медианой, различия корреляции и причинности, и приёмов, которыми манипулируют графики. Поняв их, вы уже не купитесь на большинство статистических уловок в рекламе и новостях. Формулы для этого не нужны.

Нужна ли математика, чтобы понимать статистику?

Для практического понимания — почти нет. Ключевые идеи объясняются на примерах: почему среднее по зарплатам обманчиво, почему совпадение не значит причину, почему маленькая выборка ненадёжна. Формулы нужны, чтобы считать; чтобы не дать себя обмануть — достаточно нескольких понятий и здравого смысла.

Почему статистике нельзя верить на слово?

Потому что за каждой цифрой стоит решение, как её посчитать: какое среднее взять, какую выборку, за какой период, как нарисовать график. Эти решения меняют вывод, оставаясь формально честными. Статистика не врёт сама — врут те, кто выбирает удобный способ подачи.

Как быстро проверить статистику в новости?

Четыре вопроса. Первый: среднее или медиана — и не перекошены ли данные. Второй: это корреляция или доказанная причина. Третий: какой размер выборки и как её набрали. Четвёртый: с чего начинается ось на графике и за какой период он построен. Большинство манипуляций отсеиваются этими четырьмя вопросами за минуту.

Что означает «статистически значимо»?

Только то, что результат трудно объяснить случайностью, — и ничего о его величине и важности. На большой выборке значимым становится ничтожное различие без практического смысла. Поэтому значимость всегда читают вместе с размером эффекта и доверительным интервалом.

Зачем статистика тем, кто работает с ИИ?

Потому что нейросеть учится на данных, а данные описываются статистикой. Те же ловушки, что обманывают человека в новостях, обманывают и модель при обучении: смещённая выборка даёт предвзятый ИИ, а найденная корреляция выдаётся за закономерность. Понимание статистики — это понимание, почему модели ошибаются.