Лекція 4. Перевірка статистичних гіпотез
Огляд
У Лекції 3 ми навчилися оцінювати невідомі параметри генеральної сукупності за вибіркою — будувати точкові оцінки й довірчі інтервали. Але часто питання ставлять інакше: не «чому дорівнює параметр?», а «чи узгоджуються дані з певним припущенням про нього?». Чи справді нова версія сайта підвищила середній час на сторінці? Чи однакова точність (розкид) двох виробничих ліній? Чи відрізняється частка відмов від заявлених 5 %? Такі питання — про рішення, яке треба ухвалити за даними, і відповідає на них перевірка статистичних гіпотез (англ. statistical hypothesis testing).
Ідея методу проста й глибока водночас. Ми формулюємо гіпотезу, тимчасово вважаємо її істинною й запитуємо: наскільки ймовірно було б отримати таку саму або ще екстремальнішу вибірку, якби гіпотеза справді була правильна? Якщо ця ймовірність мала — дані «незручні» для гіпотези, і ми її відхиляємо; якщо ні — підстав відхиляти немає. У цьому розділі ми вводимо основну й альтернативну гіпотези, два типи помилок, рівень значущості та критичну область, формулюємо загальний алгоритм із шести кроків, а потім застосовуємо його до найважливіших параметричних критеріїв — про середнє, дисперсію, рівність двох середніх і двох дисперсій та про частку. Ці критерії — робочий інструмент, який далі знадобиться в Лекції 5 (регресійний і кореляційний аналіз) та скрізь, де модель треба перевірити на даних.
Практичний бік. Обчислення статистик критеріїв і критичних значень «руками» ви виконаєте в аудиторній частині, а перевірку гіпотез про рівність дисперсій та середніх двох вибірок реалізуєте програмою в Лабораторній роботі 4.
4.1 Статистична гіпотеза
Означення (статистична гіпотеза). Статистичною гіпотезою (англ. statistical hypothesis) називають будь-яке припущення щодо генеральної сукупності, яке можна перевірити за вибірковими даними, — про значення параметра (середнього, дисперсії, частки) або про сам вид розподілу.
Гіпотези бувають параметричні (про числове значення параметра, напр., «середній чек дорівнює 250 грн») і непараметричні (про вид розподілу, напр., «дані розподілені нормально» — критерії згоди розглянуто далі в курсі). У цій лекції йдеться про параметричні гіпотези.
Ключова обережність: гіпотезу перевіряють, не знаючи генеральної сукупності, — є лише вибірка. Тому висновок ніколи не буває цілком достовірним; він завжди супроводжується ризиком помилки, який ми свідомо контролюємо (§4.3–4.4).
4.2 Основна та альтернативна гіпотези
Перевірку завжди будують навколо пари взаємовиключних гіпотез.
Означення (нульова та альтернативна гіпотези). Нульова (основна) гіпотеза — це припущення, яке беруть за замовчуванням («ефекту немає», «відмінності немає», «параметр дорівнює заданому значенню»). Альтернативна гіпотеза (або ) — суперечне до твердження, яке приймають, якщо відхилено.
Наприклад, для параметра (скажімо, середнього ) з гіпотетичним значенням типова пара має вигляд
Форма визначає напрям перевірки:
- двобічна (англ. two-sided): — відхилення в будь-який бік;
- правобічна (right-sided): ;
- лівобічна (left-sided): .
Асиметрія ролей. і не рівноправні. Перевірка спроможна лише відхилити (коли дані їй суперечать) або не відхилити її (коли не суперечать). «Не відхилити» — це не «довести істинність »: можливо, вибірки просто забракло, щоб виявити наявну відмінність. Тому формулюють як твердження, яке хочуть спростувати (аналог «презумпції невинуватості»: — «невинний», доки дані не доведуть протилежне «поза розумним сумнівом»).
Приклад 4.1 (формулювання). Виробник стверджує, що середній ресурс лампи — год. Аналітик підозрює, що насправді ресурс інший. Тоді , (двобічна). Якби перевіряли лише підозру «ресурс менший за заявлений», альтернатива була б лівобічною: .
4.3 Помилки I та II роду
Оскільки рішення ухвалюють за випадковою вибіркою, можливі два різновиди хибних висновків. Зведемо всі чотири випадки в таблицю.
| істинна | хибна | |
|---|---|---|
| Не відхилити | правильно () | помилка II роду () |
| Відхилити | помилка I роду () | правильно (потужність ) |
Означення (помилки I та II роду). Помилка I роду (англ. type I error) — відхилити правильну ; її ймовірність позначають . Помилка II роду (type II error) — не відхилити хибну ; її ймовірність — . Величину називають потужністю критерію (power) — це ймовірність правильно виявити наявний ефект.

Помилки конфліктують: за фіксованого обсягу вибірки зменшення (обережніше відхиляти ) збільшує (частіше пропускати справжній ефект). Одночасно зменшити обидві можна лише збільшивши обсяг вибірки . На практиці спершу фіксують допустиме (бо помилка I роду зазвичай «дорожча»), а тоді дбають про потужність, обираючи достатнє .
Типова помилка (симетрія помилок). Студенти часто вважають і взаємодоповняльними () — це неправильно. Це ймовірності за різних умов ( істинна проти хибна) і незалежно керовані. Пов’язані лише і потужність: .
4.4 Рівень значущості та статистика критерію
Означення (рівень значущості). Рівнем значущості (англ. significance level) називають наперед задану максимально допустиму ймовірність помилки I роду. Типові значення — , , .
Рівень значущості обирають до перегляду даних. означає: ми згодні помилково відхиляти правильну не частіше, ніж у 5 % випадків.
Щоб ухвалити рішення, вибірку згортають в одне число — статистику критерію.
Означення (статистика критерію). Статистика критерію (англ. test statistic) — це функція від вибірки, розподіл якої за істинної відомий. Спостережене значення статистики порівнюють із тим, чого слід було б очікувати, якби була правильна.
Наприклад, для середнього при відомій статистикою буде стандартизоване відхилення вибіркового середнього від гіпотетичного значення (§4.7), і за істинної воно має стандартний нормальний розподіл . Знаючи розподіл статистики, ми можемо вказати, які її значення «неправдоподібні» за .
4.5 Критична область
Означення (критична область). Критична область (область відхилення, англ. critical / rejection region) — це множина таких значень статистики критерію, за яких відхиляють. Її доповнення називають областю прийняття. Межі між ними — критичні точки (квантилі розподілу статистики).
Критичну область будують так, щоб за істинної ймовірність влучити в неї дорівнювала саме . Форма області повторює форму альтернативи (§4.2):
- правобічна : область , де — квантиль рівня ;
- лівобічна : область (квантиль рівня );
- двобічна : область , де — квантиль рівня (усе ділять навпіл між двома хвостами).

Саме тому для двобічної перевірки на рівні беруть квантиль (напр., ), а не : по ймовірності лишають у кожному хвості.

Типова помилка (хвіст критерію). Для двобічної перевірки помилково беруть квантиль рівня замість . Завжди зіставляйте кількість хвостів критичної області з формою : одна нерівність ( або ) — один хвіст із усім ; знак — два хвости по .
4.6 Алгоритм перевірки гіпотез
Усі критерії цієї лекції вкладаються в один загальний алгоритм із шести кроків.
ПеревіркаГіпотези(вибірка, твердження про параметр, alpha):
1. Сформулювати H0 і H1 (обрати одно- чи двобічну альтернативу)
2. Задати рівень значущості alpha
3. Обрати статистику критерію K та її розподіл за істинної H0
4. Визначити критичну область (критичні точки за alpha і формою H1)
5. Обчислити спостережене значення статистики K_сп за вибіркою
6. Висновок:
якщо K_сп потрапляє в критичну область -> ВІДХИЛИТИ H0 (на користь H1)
інакше -> H0 НЕ ВІДХИЛЯЄМО

Альтернатива: p-значення
Замість порівняння статистики з критичною точкою рішення часто ухвалюють за p-значенням.
Означення (p-значення). p-значення (англ. p-value) — це ймовірність за істинної отримати значення статистики таке саме або ще екстремальніше, ніж спостережене. Правило рішення: якщо — відхилити , інакше не відхиляти.
Обидва підходи еквівалентні (дають те саме рішення), бо рівносильно влученню статистики в критичну область. Перевага p-значення в тому, що воно показує наскільки сильно дані суперечать (напр., переконливіше за ), і не потребує окремої критичної точки для кожного .

У наступних параграфах пройдемо цим алгоритмом для семи класичних критеріїв. Для
всіх критичних значень і p-значень нижче використано функції розподілів з
scipy.stats (norm.ppf, t.ppf, chi2.ppf, f.ppf) — той самий інструмент, що
й у статистичних таблицях.
4.7 Гіпотеза про математичне сподівання при відомій дисперсії (Z-критерій)
Нехай вибірку взято з нормальної сукупності з відомим середньоквадратичним відхиленням . Перевіряємо . За істинної вибіркове середнє має розподіл , тож стандартизована статистика
має стандартний нормальний розподіл . Критичні точки — квантилі : для двобічної перевірки ( при ).
Приклад 4.2. Технологічна норма ваги пакета — г при відомому г. Вибірка пакетів дала г. Чи змістилося середнє (, двобічна)?
Розв’язання. , . Статистика:
Критична точка . Оскільки , потрапляє в критичну область — відхиляємо: середня вага значуще відрізняється від норми ().
4.8 Гіпотеза про математичне сподівання при невідомій дисперсії (t-критерій)
На практиці майже завжди невідома. Тоді її замінюють вибірковим (незміщеним) СКВ , а нормальний розподіл статистики поступається розподілу Стьюдента:
За істинної ця статистика має розподіл Стьюдента з ступенями свободи (англ. degrees of freedom, df). Критичні точки — квантилі -розподілу . Розподіл Стьюдента має «важчі хвости», ніж , тож його критичні значення більші — це плата за незнання ; при великих () різниця зникає, і -критерій наближається до -критерію.
Приклад 4.3. Гіпотетичне середнє . Вибірка дала , . Перевіримо проти при .
Критична точка . Оскільки — відхиляємо (). Якби ми помилково скористалися , висновок збігся б, але для малих вибірок таке спрощення небезпечне: при між і воно дало б хибне відхилення.

4.9 Гіпотеза про числове значення дисперсії (-критерій)
Іноді цікавить не середнє, а розкид — напр., стабільність (точність) процесу. Для нормальної сукупності перевіряють статистикою
яка за істинної має розподіл хі-квадрат із ступенями свободи. Розподіл несиметричний (додатний), тож критичні точки для двох хвостів різні:
- правобічна : область ;
- лівобічна : область ;
- двобічна: .
Приклад 4.4. Норма дисперсії розміру деталі — . Вибірка дала . Чи зросла мінливість (, правобічна)?
Розв’язання. , .
Критична точка . Оскільки — відхиляємо: мінливість значуще зросла, хоча й на межі (). Такий граничний результат — привід зібрати більше даних, перш ніж утручатися в процес.
4.10 Гіпотеза про рівність двох дисперсій (F-критерій Фішера)
Порівняймо розкид двох незалежних вибірок із нормальних сукупностей: . Статистика — відношення вибіркових дисперсій:
яка за істинної має розподіл Фішера . Ставлячи більшу дисперсію в чисельник, ми гарантуємо і порівнюємо лише з верхньою критичною точкою (двобічна перевірка ).
Приклад 4.5. Дві лінії дали () та (). Чи різна їхня точність (, двобічна)?
Розв’язання. , . Більша дисперсія — :
Критична точка . Оскільки — не відхиляємо (): відмінність дисперсій статистично незначуща. Це типовий перший крок перед порівнянням середніх: якщо дисперсії можна вважати рівними, для середніх беруть об’єднану оцінку (§4.11); якщо ні — критерій Уелча (§4.12).

Типова помилка (менша дисперсія в чисельнику). Якщо поставити меншу дисперсію згори, вийде , і порівняння з верхньою критичною точкою завжди дасть «не відхиляємо» — критерій втратить чутливість. Домовленість «більша над меншою» усуває цю пастку.
4.11 Гіпотеза про рівність двох середніх при рівних дисперсіях
Найчастіше питання — чи однакові середні двох груп (контроль проти нової версії, до проти після). Якщо дисперсії сукупностей можна вважати рівними (перевірено -критерієм, §4.10), їх поєднують в одну об’єднану (англ. pooled) оцінку:
Об’єднана дисперсія — це середньозважене (за ступенями свободи) двох вибіркових дисперсій; вона точніше оцінює спільну дисперсію, ніж кожна окремо. За істинної статистика має розподіл Стьюдента з ступенями свободи.
Приклад 4.6. Дві групи: , , ; , , (дисперсії вважаємо рівними). Чи різні середні (, двобічна)?
Розв’язання. Об’єднана дисперсія:
Статистика:
Критична точка . Оскільки — відхиляємо (): середні значуще різняться.
4.12 Гіпотеза про рівність двох середніх при різних дисперсіях (критерій Уелча)
Якщо -критерій показав, що дисперсії різні (або немає підстав вважати їх рівними), об’єднувати їх не можна. Тоді застосовують критерій Уелча (англ. Welch’s t-test): статистику будують на окремих дисперсіях, а ступені свободи обчислюють за наближенням Уелча–Саттертвейта:
Ступені свободи Уелча зазвичай дробові; на практиці їх округлюють униз (це консервативніше — критична точка трохи більша). Критерій Уелча надійніший за об’єднаний -критерій, коли дисперсії й обсяги груп неоднакові, і майже не поступається йому, коли дисперсії справді рівні, — тому багато статистичних пакетів беруть його за замовчуванням.
Приклад 4.7. Група 1: , , ; група 2: , , (дисперсії явно різні). Перевіримо рівність середніх (, двобічна).
Розв’язання.
Ступені свободи Уелча:
Критична точка . Оскільки — не відхиляємо (): попри різницю середніх у 3 одиниці, великий розкид другої групи не дає визнати відмінність значущою.
4.13 Гіпотеза про числове значення ймовірності події (частку)
Для частки (ймовірності «успіху») перевіряють за вибіркою з незалежних випробувань, у яких трапилося успіхів. Вибіркова частка ; за центральною граничною теоремою при досить великому вона приблизно нормальна, тож
У знаменнику стоїть (а не ), бо стандартне відхилення обчислюють за істинної . Наближення надійне, коли і .
Приклад 4.8. Монету підкинули разів, «орел» випав разів. Чи симетрична монета (, , двобічна)?
Розв’язання. .
Критична точка . Оскільки — відхиляємо (): відхилення від симетрії статистично значуще.
Застосування в аналітиці даних
- A/B-тестування. Порівняння конверсії (частка) або середнього доходу двох варіантів продукту — це рівно критерії §4.11–4.13. Рівень значущості й потужність визначають потрібний обсяг трафіку.
- Контроль якості. -критерій про дисперсію (§4.9) і -критерій (§4.10) стежать за стабільністю процесу — зростання розкиду сигналізує про розладнання.
- Валідація ознак і моделей. Перш ніж включати ознаку в модель, перевіряють, чи значуще її середнє різниться між класами (-критерій) — це найпростіший відбір ознак; значущість коефіцієнтів регресії (Лекція 5) перевіряють тим самим -критерієм.
- Обережність із p-значеннями. Статистична значущість — не те саме, що практична: за великих мізерний ефект стає «значущим». Завжди дивіться на розмір ефекту (різницю середніх, довірчий інтервал), а не лише на . Багаторазові перевірки на тих самих даних роздувають сумарну помилку I роду (проблема множинних порівнянь).
Підсумок
- Статистична гіпотеза — перевірне припущення про генеральну сукупність. Перевірку будують на парі (основна, «ефекту немає») і (альтернативна), причому критерій здатний лише відхилити або не відхилити .
- Помилка I роду () — відхилити правильну ; помилка II роду () — не відхилити хибну; потужність . За фіксованого вони конфліктують.
- Рівень значущості задають наперед; критична область повторює форму (ліво-, право- чи двобічна), причому для двобічної ділять навпіл ().
- Алгоритм із 6 кроків: гіпотези → → статистика → критична область → спостережене значення → висновок. Еквівалентне правило — за p-значенням ( відхилити).
- Критерії (нормальна сукупність):
- середнє, відома — ;
- середнє, невідома — , df ;
- дисперсія — , df ;
- дві дисперсії — , df ;
- два середніх, дисперсії рівні — об’єднана , df ;
- два середніх, дисперсії різні — Уелч, df за Уелчем–Саттертвейтом;
- частка — .
Вправи
Для розігріву
- Поясніть різницю між і . Чому «не відхилити » не означає «довести »? Наведіть аналогію із судовим процесом.
- Що таке помилки I та II роду? Чому не можна одночасно зменшити і , не збільшуючи обсяг вибірки? Чи правда, що ?
- Для випишіть критичні точки для лівобічної, правобічної та двобічної перевірок за . Поясніть, чому для двобічної беруть квантиль , а не .
Стандартні
- Відома . Вибірка дала при нормі . Перевірте проти (-критерій, ). Який висновок?
- Мала вибірка (). Перевірте гіпотезу проти (-критерій, ): обчисліть , , , знайдіть і зробіть висновок.
- Дві вибірки: () і (). Перевірте рівність дисперсій (-критерій, , двобічна). Яку дисперсію ставите в чисельник і чому?
- Частка. Із відвідувачів купівлю зробили . Перевірте гіпотезу проти (-критерій, ).
Підвищеної складності
- Дві групи: , , ; , , . (а) -критерієм перевірте рівність дисперсій; (б) залежно від результату застосуйте об’єднаний -критерій або критерій Уелча до рівності середніх ().
- Поясніть зв’язок двобічної перевірки на рівні з довірчим інтервалом для надійності (Лекція 3): чому « поза інтервалом» рівносильне «відхилити »?
- Продемонструйте на числах, чому за дуже великого навіть крихітна різниця дає значущий результат. Який висновок про співвідношення статистичної та практичної значущості це підказує?
- Виведіть, чому статистика має саме (а не ) ступенів свободи. (Підказка: одна умова — оцінювання — «забирає» один ступінь свободи.)