StatWin

Статистика

Размер выборки: сколько данных достаточно

Почему размер выборки решает надёжность вывода, почему важен не процент, а абсолютное число, и как маленькие выборки дают яркие, но ложные результаты.

⟳ 28.05.2026 ◔ 2 мин ✎ Ольга Данилова
Миска с фасолью и ложка, зачерпнувшая небольшую часть

Коротко

  • Маленькая выборка даёт неустойчивый результат: пара случайных значений сильно двигает вывод.
  • Важен не процент от населения, а абсолютное число наблюдений: 1000 человек достаточно и для города, и для страны.
  • Маленькие выборки чаще дают экстремальные результаты — отсюда ложные «сенсации».
  • Репрезентативность важнее размера: большая, но кривая выборка хуже маленькой честной.

«Учёные выяснили» — а потом оказывается, что «учёные» опросили 12 человек. Размер выборки — то, что превращает наблюдение в надёжный вывод или в случайный шум. И интуиция здесь часто подводит: люди недооценивают маленькие выборки и переоценивают роль процента от населения.

Почему маленькая выборка обманывает

На выборке из 10 человек один нетипичный участник сдвигает результат на десятки процентов. Отсюда два следствия:

  • Неустойчивость. Повторите замер на других 10 людях — получите заметно другой результат, хотя реальность не менялась.
  • Экстремальность. Маленькие выборки чаще дают крайние значения. Именно поэтому «самые здоровые» и «самые больные» регионы в исследованиях часто оказываются маленькими — не потому что там особая жизнь, а потому что мало данных, и разброс велик.

Эта тяга маленьких выборок к экстремумам — источник бесконечных ложных «сенсаций»: нашли яркий результат на крошечных данных, опубликовали, а он не воспроизвёлся.

Процент не важен, число важно

Частая ошибка — думать, что для страны нужна выборка больше, чем для города. Это не так. Точность оценки определяется абсолютным числом наблюдений, а не долей от населения. Тысяча случайно отобранных человек даёт примерно одинаковую точность и для города в сто тысяч, и для страны в сто миллионов.

Причина в математике выборки: разброс оценки падает с ростом числа наблюдений, а размер «генеральной совокупности» почти не участвует, пока она много больше выборки.

Репрезентативность важнее размера

И всё же размер — не главное. Большая, но кривая выборка врёт увереннее маленькой честной. Знаменитый провал 1936 года: журнал опросил два миллиона человек по телефонным справочникам и предсказал не того победителя выборов — потому что телефон тогда был у обеспеченных, и выборка оказалась смещённой. Два миллиона не спасли от кривого отбора.

Правило: сначала честный, случайный отбор, потом достаточный размер. Одно без другого не работает.

Связь с ИИ

Для нейросетей всё то же самое, только масштабнее. Модель, обученная на маленьком или смещённом наборе данных, выучивает случайные особенности выборки вместо реальных закономерностей — это переобучение. А вопрос «сколько данных реально нужно модели» — прямое продолжение темы размера выборки. И помните про p-value: на большой выборке значимым станет любой пустяк.

Вопросы и ответы

Сколько нужно человек для надёжного опроса?

Обычно порядка 1000–1500 случайно отобранных человек дают приемлемую точность для оценки мнения даже целой страны. Удивительно, но размер населения почти не влияет: важно абсолютное число опрошенных и их случайный, непредвзятый отбор, а не процент от населения.

Почему маленькая выборка ненадёжна?

Потому что каждое отдельное значение сильно влияет на результат. На выборке из 10 человек один нетипичный участник сдвигает вывод на десятки процентов. Маленькие выборки дают неустойчивую и часто экстремальную картину — сегодня один результат, завтра противоположный, хотя реальность не менялась.

Что важнее — размер выборки или её репрезентативность?

Репрезентативность. Большая, но перекошенная выборка (опросили только читателей одного сайта) врёт увереннее маленькой честной. Классический провал — огромные телефонные опросы, предсказавшие не того победителя выборов, потому что телефон был не у всех. Сначала честный отбор, потом размер.

Источники и что почитать

  • Принцип независимости точности от размера популяции — основа теории выборки; пример телефонных опросов — классический кейс ошибки отбора (Literary Digest, 1936).