StatWin

Раздел · 15 материалов

Словарь данных и статистики

Короткие честные определения терминов статистики и машинного обучения: датасет, выборка, медиана, дисперсия, корреляция, bias, переобучение, p-value.

Веер из белых карточек и ручка на светлом столе

Термины статистики, данных и машинного обучения без академической воды: что это, зачем нужно и где встречается на практике. Каждое определение связано с подробными материалами журнала.

Как устроен словарь

Термины образуют три связанные группы — и связь между ними не случайна, потому что машинное обучение выросло из статистики.

Почему это одни и те же понятия

Полезное наблюдение для тех, кто приходит в ИИ из другой области: большинство «новых» терминов машинного обучения — это старые статистические под другим именем.

В статистикеВ машинном обучении
ВыборкаДатасет
ПеременнаяПризнак
Смещение выборкиBias модели
Подгонка под данныеПереобучение

Отсюда практический вывод: разобравшись в статистике, вы автоматически понимаете половину терминологии ИИ — и, что важнее, видите те же ловушки в новой обёртке.

Bias (смещение)Bias — систематический перекос в данных, который модель выучивает и воспроизводит. Что это … P-valueP-value — вероятность увидеть результат случайно, если эффекта нет. Что это простыми … ВыборкаВыборка — часть данных, по которой судят о целом. Что это, чем отличается от генеральной … ДатасетДатасет — организованный набор данных для обучения и проверки модели. Что это, из чего … Дисперсия и разбросДисперсия — мера разброса данных вокруг среднего. Что это простыми словами, зачем нужна и … Доверительный интервалДоверительный интервал — «вилка», в которой правдоподобно лежит истинное значение. Что это … КлассификацияКлассификация — предсказание категории (спам/не спам). Что это простыми словами и чем … КорреляцияКорреляция — согласованное изменение двух величин. Что это простыми словами и почему … МедианаМедиана — значение ровно посередине упорядоченного ряда. Что это, чем лучше среднего на … Нейронная сетьНейронная сеть — модель, которая учится на примерах, а не по правилам. Что это простыми … Переобучение (overfitting)Переобучение — когда модель заучила примеры вместо закономерности. Что это простыми … Признак (feature)Признак — отдельная характеристика примера, по которой модель делает вывод. Что это … РаспределениеРаспределение — как значения раскладываются по величине. Что такое нормальное и … РегрессияРегрессия — предсказание числа (цена, температура). Что это простыми словами и чем … Среднее (арифметическое)Среднее арифметическое — сумма значений, делённая на их количество. Что это, чем …

Вопросы и ответы

С каких терминов начать изучение статистики?

С четырёх: среднее и медиана (чем отличаются и когда какое честнее), выборка (почему её размер и способ отбора решают всё) и корреляция (почему связь не равна причине). Эти понятия закрывают большинство ситуаций, где статистикой вводят в заблуждение.

Чем термины статистики отличаются от терминов машинного обучения?

Во многом это одни и те же понятия под разными названиями: выборка в статистике — датасет в ML, признак — переменная, смещение выборки — bias модели. Машинное обучение выросло из статистики, поэтому понимание базовых терминов автоматически переносится на ИИ.