Раздел · 7 материалов
Статистика простыми словами: полный гид без формул 2026
Как понимать статистику и не дать себя обмануть: среднее против медианы, корреляция и причинность, p-value, размер выборки, ошибка выжившего.

Статистика — это не про формулы, а про то, чтобы вас не обманули. Каждый день реклама, новости и «исследования» бросаются цифрами, и большинство из них подобраны так, чтобы подтолкнуть к нужному выводу. Этот раздел учит видеть приёмы — без единой формулы, на живых примерах.
Наш подход: не заучивать определения, а понимать, где цифра честная, а где манипуляция. Потому что за каждым числом стоит решение, как его посчитать, — и в этом решении вся честность анализа.
Четыре вопроса, которые проверяют любую цифру
Прежде чем разбираться в темах по отдельности, стоит запомнить короткий чек-лист. Он отсеивает большую часть манипуляций за минуту.
| Вопрос | Что проверяем | Где подробно |
|---|---|---|
| Среднее или медиана? | Не перекошены ли данные редкими экстремумами | Среднее против медианы |
| Связь или причина? | Не выдают ли совпадение за механизм | Корреляция ≠ причинность |
| Сколько наблюдений и как набраны? | Хватает ли данных и честен ли отбор | Размер выборки |
| Как нарисован график? | Не искажает ли подача | Как врут графики |
Эти четыре вопроса работают в любой ситуации — от новости про среднюю зарплату до презентации подрядчика.
Первая ловушка: «типичное» значение
Самая частая манипуляция — не подделка чисел, а выбор способа их усреднить.
Представьте комнату: девять человек с зарплатой 50 тысяч и один с зарплатой 5 миллионов. Среднее — 545 тысяч. Формально верно; по сути ложь: девять из десяти получают 50 тысяч. Медиана — значение ровно посередине — даёт 50 тысяч и описывает эту комнату честно.
Разница в том, что среднее учитывает величину каждого значения, поэтому один экстремум сдвигает его резко, а медиана учитывает только порядок, и потому устойчива. Отсюда правило: для перекошенных данных (доходы, цены на жильё, время ответа сервера) честнее медиана; для симметричных (рост, температура) годится среднее.
Практический признак манипуляции: если сообщают только среднее по данным, где заведомо есть «хвост» больших значений, — скорее всего, цифру хотели сделать больше. Подробный разбор с примерами — в статье «Среднее против медианы», а понятия — в словаре: среднее, медиана, распределение.
Вторая ловушка: совпадение вместо причины
Летом растут продажи мороженого и число утоплений. Данные подтверждают: корреляция есть. Значит ли это, что мороженое топит людей? Нет — обе величины поднимает жара.
Когда две величины меняются вместе, возможны четыре объяснения: A вызывает B; B вызывает A; общий фактор вызывает оба; чистая случайность. Наблюдая только корреляцию, вы не знаете, какое из четырёх перед вами, — а решения зависят от этого целиком.
Доказать причину наблюдением нельзя, нужен эксперимент: изменить один фактор, всё остальное держать одинаковым, посмотреть на результат. Это логика A/B-теста, и случайное разделение групп в нём — не формальность, а именно то, что уравнивает прочие факторы.
Для работы с ИИ это критично: нейросеть по природе — машина корреляций. Она находит, что с чем меняется вместе, и на этом строит предсказания. Пока модель предсказывает, всё в порядке; как только на её выводах основывают действия, ложная причинность превращается в дорогую ошибку. Родственная ловушка — ошибка выжившего, где причину ищут не там, потому что не видят отсеявшихся.
Третья ловушка: сколько данных достаточно
«Учёные выяснили» — а потом оказывается, что опросили двенадцать человек.
На маленькой выборке один нетипичный участник сдвигает результат на десятки процентов. Отсюда два следствия: результат неустойчив (повторите замер — получите другое) и склонен к экстремумам. Именно поэтому «самые здоровые» и «самые больные» регионы в исследованиях часто оказываются маленькими — не потому что там особая жизнь, а потому что мало данных.
Контринтуитивная деталь: важен не процент от населения, а абсолютное число наблюдений. Тысяча случайно отобранных человек даёт примерно одинаковую точность и для города в сто тысяч, и для страны в сто миллионов.
Но размер — не главное. Большая, но кривая выборка врёт увереннее маленькой честной: классический провал 1936 года, когда журнал опросил два миллиона человек по телефонным справочникам и предсказал не того победителя выборов, — телефон тогда был у обеспеченных, и выборка оказалась смещённой. Сначала честный отбор, потом достаточный размер — подробнее в статье о выборке.
Четвёртая ловушка: подача вместо содержания
График не обязан врать цифрами, чтобы обмануть. Достаточно подать правду так, чтобы вы сделали нужный вывод.
Самый частый приём — обрезанная ось Y: если вертикальная ось начинается не с нуля, рост со 100 до 103 выглядит как взлёт, хотя это плюс три процента. Второй по частоте — черри-пикинг периода: показывают отрезок, где тренд удобен, и обрезают остальное. Третий — двойная ось, которой две линии «подгоняют» друг под друга, создавая иллюзию связи.
Защита не требует знаний: посмотрите на оси, а не на картинку. С чего начинается Y? Равномерный ли шаг? Какой период по X и почему именно он? Нет ли второй оси? Полный разбор десяти приёмов — в статье «Как врут графики», а как строить честные — в обзоре инструментов визуализации.
Значимость: что означает и чего не означает
Отдельный узел путаницы — «статистически значимый результат».
P-value отвечает на один узкий вопрос: насколько вероятно получить такой результат случайно, если эффекта нет. Маленькое значение означает «случайностью объяснить трудно» — и ничего о величине эффекта.
Три заблуждения, которые стоит развести раз и навсегда:
- p-value не вероятность того, что гипотеза верна;
- p-value не размер эффекта: значимый ≠ большой;
- «статистически значимо» не равно «практически важно» — на большой выборке значимым становится ничтожное различие.
Поэтому значимость читают в паре с доверительным интервалом, который показывает не только «есть ли эффект», но и «насколько он велик и насколько мы в этом уверены». Одна цифра без «вилки» создаёт ложную определённость: оценка «45%» может означать 45 ± 2 (надёжно) или 45 ± 15 (почти шум).
Зачем это в журнале про данные и ИИ
Статистика — фундамент искусственного интеллекта, а не соседняя дисциплина.
Нейросеть учится на данных, а данные описываются ровно теми понятиями, что разобраны выше: выборка, распределение, разброс, корреляция. И ловушки переносятся один в один:
- нерепрезентативная выборка в опросе → предвзятая модель в машинном обучении;
- корреляция вместо причины у аналитика → модель, «выучившая», что зонтики вызывают дождь;
- малый размер выборки → переобучение, когда модель заучила примеры вместо закономерности;
- погоня за значимостью → принятые за сигнал случайные улучшения метрики.
Отсюда практический вывод: понимать статистику полезнее, чем знать архитектуры моделей. Модель — отражение данных, а качество данных оценивается статистикой.
Порядок изучения
Если начинаете с нуля, разумный маршрут такой:
- Среднее против медианы — самая частая манипуляция и самая простая для понимания.
- Как врут графики — быстрый практический навык, применимый ежедневно.
- Корреляция и причинность — главная концептуальная ошибка в анализе.
- Размер выборки и ошибка выжившего — почему данные бывают обманчивы сами по себе.
- P-value и доверительные интервалы — язык, на котором говорят исследования.
Все термины собраны в словаре данных и статистики. Ниже — материалы раздела.
Статистика
Среднее против медианы: когда среднее врёт
Чем среднее отличается от медианы простыми словами, почему «средняя зарплата» вводит в заблуждение и как …
Статистика
Ошибка выжившего: почему мы учимся не у тех
Ошибка выжившего простыми словами: почему мы делаем выводы по «выжившим» и не видим проигравших, пример с …
Статистика
Корреляция ≠ причинность: разбор на примерах
Почему корреляция не означает причинно-следственную связь: разбор на примерах, три объяснения любого …
Статистика
Как врут графики: 10 приёмов манипуляции данными
Десять приёмов, которыми графики вводят в заблуждение: обрезанная ось, искажённый масштаб, подмена типа …
Статистика
P-value и статзначимость на пальцах
Что такое p-value и статистическая значимость простыми словами, что p-value НЕ означает, порог 0,05 и почему …
Статистика
Размер выборки: сколько данных достаточно
Почему размер выборки решает надёжность вывода, почему важен не процент, а абсолютное число, и как маленькие …
Вопросы и ответы
С чего начать разбираться в статистике?
С трёх вещей, которые чаще всего вводят в заблуждение: разницы между средним и медианой, различия корреляции и причинности, и приёмов, которыми манипулируют графики. Поняв их, вы уже не купитесь на большинство статистических уловок в рекламе и новостях. Формулы для этого не нужны.
Нужна ли математика, чтобы понимать статистику?
Для практического понимания — почти нет. Ключевые идеи объясняются на примерах: почему среднее по зарплатам обманчиво, почему совпадение не значит причину, почему маленькая выборка ненадёжна. Формулы нужны, чтобы считать; чтобы не дать себя обмануть — достаточно нескольких понятий и здравого смысла.
Почему статистике нельзя верить на слово?
Потому что за каждой цифрой стоит решение, как её посчитать: какое среднее взять, какую выборку, за какой период, как нарисовать график. Эти решения меняют вывод, оставаясь формально честными. Статистика не врёт сама — врут те, кто выбирает удобный способ подачи.
Как быстро проверить статистику в новости?
Четыре вопроса. Первый: среднее или медиана — и не перекошены ли данные. Второй: это корреляция или доказанная причина. Третий: какой размер выборки и как её набрали. Четвёртый: с чего начинается ось на графике и за какой период он построен. Большинство манипуляций отсеиваются этими четырьмя вопросами за минуту.
Что означает «статистически значимо»?
Только то, что результат трудно объяснить случайностью, — и ничего о его величине и важности. На большой выборке значимым становится ничтожное различие без практического смысла. Поэтому значимость всегда читают вместе с размером эффекта и доверительным интервалом.
Зачем статистика тем, кто работает с ИИ?
Потому что нейросеть учится на данных, а данные описываются статистикой. Те же ловушки, что обманывают человека в новостях, обманывают и модель при обучении: смещённая выборка даёт предвзятый ИИ, а найденная корреляция выдаётся за закономерность. Понимание статистики — это понимание, почему модели ошибаются.