Лекція 5. Регресійний та кореляційний аналіз
Огляд
У Лекціях 1–4 ми описували одну випадкову величину: її розподіл, числові характеристики, довірчі інтервали, перевірку гіпотез про середнє чи дисперсію. Але найцікавіші питання аналітики — про зв’язок: чи залежить час відгуку сервера від навантаження, обсяг продажів — від витрат на рекламу, вибір кандидата — від регіону? Тут у гру входять дві змінні одразу.
Ця лекція — про двовимірні дані та про те, як виявити, виміряти й змоделювати залежність між двома змінними. Маршрут визначає природа змінних. Для якісних (категоріальних) змінних ми будуємо таблицю спряженості (contingency table), перевіряємо незалежність критерієм згоди Пірсона () — це прямий нащадок перевірки гіпотез із Лекції 4. Для кількісних змінних ми малюємо діаграму розсіювання, вимірюємо силу лінійного зв’язку коефіцієнтом кореляції , будуємо лінійну регресію методом найменших квадратів і оцінюємо її якість коефіцієнтом детермінації . Наприкінці — місток до якісних предикторів через фіктивні змінні (dummy variables), який веде до методів класифікації Лекції 6.
Практичний бік. Коефіцієнт кореляції, рівняння регресії та ви обчислите «руками» й програмою в Лабораторній роботі 5.
5.1 Двовимірна статистика
Досі спостереження було одним числом . Тепер кожне спостереження — це пара : для кожного об’єкта ми фіксуємо дві ознаки одночасно.
Означення (двовимірна вибірка). Двовимірною вибіркою називають набір пар , де кожна пара — це два значення, виміряні на одному й тому самому об’єкті.
Змінні в парі відіграють нерівноправні ролі:
- Незалежна змінна (independent / explanatory variable, регресор, предиктор) — та, що вважається «входом», причиною, керованим фактором.
- Залежна змінна (dependent / response variable, відгук) — та, що ми прагнемо пояснити або спрогнозувати через .
Поділ на і задає дослідник, виходячи зі змісту задачі (витрати на рекламу продажі, а не навпаки). Мета двовимірного аналізу — відповісти на три питання: чи є зв’язок між і ; наскільки він сильний; і яка його форма (щоб прогнозувати за ).
За типом змінних розрізняють три ситуації, і кожна має свій інструмент:
| Інструмент | ||
|---|---|---|
| якісна | якісна | таблиця спряженості, критерій |
| кількісна | кількісна | кореляція, регресія |
| якісна | кількісна | порівняння середніх, фіктивні змінні |
5.2 Види залежності
Сказати « залежить від » можна по-різному, і ці способи утворюють ієрархію від найсильнішого до найслабшого.
- Повна (статистична) незалежність. Умовний розподіл не залежить від значення : для всіх . Знання не дає жодної інформації про . Рівносильно — спільна ймовірність факторизується: .
- Незалежність за математичним сподіванням. Слабша умова: від не залежить лише середнє , , хоча розкид чи форма розподілу ще можуть змінюватися з .
- Відсутність кореляції (некорельованість). Найслабша умова: дорівнює нулю коваріація , тобто немає лінійного зв’язку.
Властивість (ієрархія). Повна незалежність незалежність за сподіванням некорельованість. Зворотні імплікації хибні.
Приклад 5.1 (некорельовані, але залежні). Нехай набуває значень (симетрично), а . Тоді повністю визначається (залежність жорстка), проте вибірковий коефіцієнт кореляції дорівнює рівно нулю: додатні відхилення компенсуються від’ємними. Цей приклад — головне застереження курсу: кореляція вловлює лише лінійний зв’язок; означає «немає лінійного зв’язку», а не «немає зв’язку взагалі».
5.3 Залежність категоріальних змінних. Таблиця спряженості
Коли обидві змінні якісні, дані зводять у таблицю спряженості — таблицю частот усіх комбінацій категорій.
Означення (таблиця спряженості). Таблицею спряженості розміру називають таблицю, у клітинці якої стоїть частота — кількість об’єктів, що потрапили одночасно в категорію змінної-рядка та категорію змінної-стовпця. Суми по рядках і стовпцях називають граничними (маргінальними) підсумками.
Приклад 5.2 (голосування). Досліджують зв’язок між вибором кандидата (рядки) та областю проживання виборця (стовпці). Наведемо фрагмент таблиці — дві області з багатьох; повна вибірка охоплює виборців:
| Львівська обл. | Харківська обл. | Усього | ||
|---|---|---|---|---|
| Кандидат 1 | 548 | 1126 | 13 542 | |
| Кандидат 2 | 676 | 146 | 4 522 | |
| Усього | 1224 | 1272 | 18 064 |
Граничні підсумки узгоджені: у Львівській , у Харківській ; за кандидатами — .
Імовірнісна інтерпретація
Поділивши кожну частоту на загальну кількість , дістаємо спільні ймовірності , а з граничних підсумків — граничні ймовірності:
| Львівська | Харківська | Усього | |
|---|---|---|---|
| Кандидат 1 | 0.030 | 0.062 | 0.750 |
| Кандидат 2 | 0.037 | 0.008 | 0.250 |
| Усього | 0.068 | 0.070 | 1.000 |
Наприклад, , а гранична : кандидат 1 набирає загалом близько 75 %.
Умовні ймовірності
Найінформативніший погляд — умовні ймовірності (порівн. Лекцію 1). У розрізі стовпців ділимо клітинку на підсумок стовпця, дістаючи — розподіл голосів усередині кожної області:
| Львівська | Харківська | |
|---|---|---|
| Кандидат 1 | 0.448 | 0.885 |
| Кандидат 2 | 0.552 | 0.115 |
| Усього | 1.000 | 1.000 |
Тут , а . У розрізі рядків ділимо на підсумок рядка, дістаючи : , .
Критерій незалежності через ймовірності. Змінні незалежні тоді й лише тоді, коли умовний розподіл збігається з граничним: для кожної області. У прикладі — отже, вибір кандидата залежить від області.
5.4 Очікувані частоти за припущення незалежності
Щоб виміряти залежність числом, порівняємо спостережувані частоти з тими, які були б очікуваними, якби змінні були незалежні. За незалежності , тож очікувана кількість у клітинці дорівнює , помноженому на добуток граничних імовірностей:
Приклад 5.3 (очікувані голоси). Кандидат 1 має загальну частку . Тоді за незалежності від нього очікувалося б у Львівській області голосів, а фактично . Аналогічно для двох показаних областей:
| Львівська | Харківська | |
|---|---|---|
| Кандидат 1 | 918 | 954 |
| Кандидат 2 | 306 | 318 |
Розбіжність велика ( проти , проти ) — сильний сигнал залежності. Щоб перетворити «велику розбіжність» на число з порогом прийняття рішення, застосовують критерій Пірсона.
5.5 Критерій згоди Пірсона ()
Критерій формально перевіряє гіпотезу незалежності, порівнюючи всі з (порівн. алгоритм перевірки гіпотез, Лекція 4).
Означення (статистика Пірсона). Для таблиці спряженості
де сума береться по всіх клітинках. Число ступенів свободи
Логіка. За незалежності , тож малий; що сильніша залежність, то більший . Гіпотези:
- : змінні незалежні;
- : змінні залежні.
Правило рішення. Обравши рівень значущості (зазвичай ), знаходять критичне значення (квантиль розподілу з ступенями свободи). Якщо — гіпотезу незалежності відхиляють.
Приклад 5.4 (повний розрахунок ). У групі з студентів досліджують зв’язок між формою навчання (очна / дистанційна) та результатом іспиту (склав / не склав). Спостережувана таблиця:
| Склав | Не склав | Усього | |
|---|---|---|---|
| Очна | 80 | 20 | 100 |
| Дистанційна | 60 | 40 | 100 |
| Усього | 140 | 60 | 200 |

Крок 1. Очікувані частоти :
Крок 2. Внески клітинок :
Крок 3. Статистика й рішення.
Критичне значення . Оскільки , гіпотезу незалежності відхиляємо: форма навчання та результат іспиту пов’язані (на очній частка тих, хто склав, вища).
Умови застосовності. Критерій наближений і надійний, коли очікувані частоти достатньо великі — практичне правило: у всіх клітинках. Для таблиць програмні пакети часто застосовують поправку Єйтса (неперервності), яка трохи зменшує ; щоб відтворити «формульне» значення , у
scipy.stats.chi2_contingencyвимикають поправку (correction=False).
Типова помилка (частоти, а не частки). рахують лише за абсолютними частотами (кількостями). Підставляти у формулу відсотки чи ймовірності не можна — результат втратить зв’язок з обсягом вибірки і буде беззмістовним.
5.6 Залежності в кількісних даних. Діаграма розсіювання
Коли обидві змінні кількісні, перший крок аналізу — діаграма розсіювання (scatter plot): кожну пару зображують точкою на площині ( — по горизонталі, — по вертикалі). Оком з діаграми зчитують:
- напрям — зростає з (додатній зв’язок) чи спадає (від’ємний);
- силу — наскільки щільно точки лягають уздовж уявної лінії;
- форму — лінійна залежність чи криволінійна;
- викиди — окремі точки, що різко вибиваються із загальної картини.
Діаграма розсіювання — обов’язкова передумова кореляційно-регресійного аналізу: вона показує, чи взагалі доречна лінійна модель (згадайте Приклад 5.1, де зв’язок є, але він не лінійний).
5.7 Вибірковий коефіцієнт кореляції
Діаграма дає якісне враження; коефіцієнт кореляції перетворює його на число.

Означення (вибірковий коефіцієнт кореляції Пірсона).
Чисельник — це (з точністю до множника ) коваріація, а знаменник нормує її на розкиди обох змінних, тож безрозмірний.
Властивості. ; знак показує напрям зв’язку; — точний лінійний зв’язок (усі точки на одній прямій); — лінійного зв’язку немає. Орієнтовна шкала сили:
| | Сила лінійного зв’язку | |:–:|—| | – | дуже слабкий / відсутній | | – | слабкий | | – | помірний | | – | сильний | | – | дуже сильний |
Для ручних обчислень зручніша алгебраїчно рівносильна форма через суми (без попереднього віднімання середніх):
Значущість кореляції. Навіть за відсутності зв’язку в генеральній сукупності вибірковий рідко дорівнює точно нулю. Значущість перевіряють статистикою
порівнюючи з критичним (розподіл Стьюдента, Лекція 2). Це та сама логіка перевірки гіпотез, що й у Лекції 4, з .
5.8 Основа регресійного аналізу. Метод найменших квадратів
Кореляція вимірює силу зв’язку; регресія задає його форму — рівняння, за яким прогнозують .
Означення (проста лінійна регресія). Лінійною регресійною моделлю називають , де — коефіцієнт нахилу (на скільки в середньому змінюється зі зростанням на одиницю), — вільний член (значення при ). Різницю між фактом і прогнозом називають залишком (residual).
Метод найменших квадратів (ordinary least squares, OLS) обирає пряму, що мінімізує суму квадратів залишків . Прирівнявши частинні похідні за до нуля, дістають єдиний розв’язок:
Формула для означає, що пряма регресії завжди проходить через центр даних . Нахил і кореляція пов’язані: — тому знаки і завжди збігаються.
Усі величини обчислюють за один прохід по даних, накопичуючи п’ять сум:
Вхід: пари (x_1, y_1), …, (x_n, y_n)
n ← 0; Sx ← 0; Sy ← 0; Sxy ← 0; Sxx ← 0; Syy ← 0
для кожної пари (x, y):
n ← n + 1
Sx ← Sx + x; Sy ← Sy + y
Sxy ← Sxy + x*y
Sxx ← Sxx + x*x; Syy ← Syy + y*y
Dxy ← n*Sxy − Sx*Sy
Dxx ← n*Sxx − Sx*Sx
Dyy ← n*Syy − Sy*Sy
r ← Dxy / sqrt(Dxx * Dyy)
b1 ← Dxy / Dxx
b0 ← (Sy − b1*Sx) / n
R2 ← r*r // для простої лінійної регресії
Вихід: r, b0, b1, R2
Приклад 5.5 (побудова регресії). Досліджують зв’язок між кількістю годин підготовки та балом за тест для студентів. Складемо розрахункову таблицю:
| 2 | 35 | 70 | 4 | 1225 |
| 4 | 45 | 180 | 16 | 2025 |
| 5 | 48 | 240 | 25 | 2304 |
| 6 | 58 | 348 | 36 | 3364 |
| 8 | 72 | 576 | 64 | 5184 |
| 9 | 78 | 702 | 81 | 6084 |
| 34 | 336 | 2116 | 226 | 20186 |
Тут , , . Проміжні величини:
Тоді
Рівняння регресії: . Кожна додаткова година підготовки додає в середньому бала. Прогноз для годин: бала.

Значущість. ; критичне . Оскільки , кореляція значуща.
Типова помилка (екстраполяція). Рівняння надійне лише в межах діапазону спостережуваних . Підставляти значення далеко за межами вибірки (напр., , коли всі дані мають ) — ризиковано: модель там не перевірена, а може навіть не мати змістовної інтерпретації.
5.9 Коефіцієнт детермінації та дисперсійний аналіз
Наскільки добре пряма описує дані? Відповідь дає розклад суми квадратів. Загальний розкид навколо середнього розпадається на дві частини — пояснену регресією та залишкову:
- SST (total sum of squares) — уся варіація ;
- SSR (regression) — варіація, яку пояснює модель;
- SSE (error) — варіація залишків, яку модель не пояснює.

Означення (коефіцієнт детермінації). Частка поясненої варіації
Для простої лінійної регресії .
Приклад 5.6 (продовження 5.5). Для тієї самої моделі . Обчисливши прогнози та залишки, дістаємо і (перевірка: ). Тоді
Модель пояснює 98.4 % розкиду балів — години підготовки майже повністю визначають результат. Так стає мірою якості підгонки: що ближчий до 1, то щільніше точки лягають на пряму.

5.10 Залежність кількісного від якісного. Фіктивні змінні
Що робити, коли предиктор якісний (стать, регіон, тип пристрою)? Категорію не можна прямо помножити на . Розв’язок — фіктивна (індикаторна) змінна.
Означення (фіктивна змінна). Фіктивна змінна (dummy variable) кодує наявність категорії числами та : , якщо об’єкт належить категорії, і інакше.
У моделі коефіцієнт дорівнює середньому у базовій групі (), а — різниці середніх між групами.

Приклад 5.7. Порівнюють зарплату у двох відділах. Кодуємо відділ як ( — відділ A, — відділ B). Нехай середні зарплати і тис. Регресія на дає (середнє в A) та (наскільки B у середньому вище), тобто .
Для якісної змінної з категоріями беруть фіктивних змінних (одна категорія лишається базовою). Брати всі не можна:
Типова помилка (пастка фіктивних змінних). Якщо ввести фіктивні змінні для всіх категорій разом із вільним членом, їхня сума тотожно дорівнює — виникає повна колінеарність (dummy variable trap), і коефіцієнти визначити неможливо. Завжди лишайте одну категорію базовою.
Фіктивні змінні поєднують кількісні та якісні предиктори в одній моделі й ведуть до множинної регресії та методів класифікації Лекції 6.
Застосування в аналітиці даних
- Прогнозування. Лінійна регресія — базовий інструмент прогнозу відгуку за предиктором (продажі за рекламою, навантаження за кількістю користувачів).
- Виявлення зв’язків. Таблиці спряженості та показують, чи пов’язані категоріальні ознаки (канал залучення й конверсія, регіон і вибір продукту).
- Оцінка якості моделі. — стандартна метрика частки поясненої варіації; розклад SST SSR SSE лежить в основі дисперсійного аналізу (ANOVA).
- Обережність з причинністю. Кореляція та значуща регресія свідчать про зв’язок, а не про причину: за ним може стояти прихований третій фактор.
- Підготовка ознак. Кодування категорій фіктивними змінними — обов’язковий крок перед подачею даних у більшість моделей машинного навчання.
Підсумок
- Двовимірна вибірка — пари ; — незалежна змінна, — залежна. Види незалежності за спаданням сили: повна за сподіванням некорельованість; зворотне не так ( дає ).
- Для якісних змінних будують таблицю спряженості; спільні, граничні та умовні ймовірності описують зв’язок. Незалежність умовний розподіл дорівнює граничному.
- Очікувані частоти за незалежності: .
- Критерій Пірсона: , ; порівнюють з .
- Для кількісних змінних: діаграма розсіювання, коефіцієнт кореляції (лише лінійний зв’язок).
- Метод найменших квадратів: , ; пряма проходить через .
- Якість: SST SSR SSE; ; для простої лінійної регресії .
- Фіктивні змінні кодують якісний предиктор (); для категорій — змінних (уникайте пастки колінеарності).
Вправи
Для розігріву
- Поясніть різницю між незалежною () та залежною () змінними на власному прикладі. Хто задає цей поділ?
- Чому з не випливає незалежність змінних? Наведіть приклад.
- Для таблиці спряженості обчисліть число ступенів свободи критерію .
- Кореляція між зростом і вагою дорівнює . Що можна сказати про силу та напрям зв’язку? Скільки відсотків варіації ваги пояснює лінійна модель?
Стандартні
- У таблиці спряженості маємо частоти . Обчисліть очікувані частоти, статистику та порівняйте з . Зробіть висновок про незалежність.
- Для вибірки обчисліть , рівняння регресії та . Спрогнозуйте при .
- Доведіть, що пряма найменших квадратів проходить через точку , виходячи з формули .
- Поясніть зміст SST, SSR і SSE. Що означає для якості моделі?
Підвищеної складності
- Виведіть формули методу найменших квадратів, мінімізуючи (прирівняйте частинні похідні та до нуля).
- Доведіть тотожність для простої лінійної регресії, скориставшись зв’язком та означеннями SSR і SST.
- Якісна змінна має категорії. Скільки фіктивних змінних потрібно й чому не можна взяти всі чотири разом із вільним членом? Опишіть, як інтерпретувати коефіцієнти отриманої моделі.
- Поясніть, чому статистично значуща кореляція не доводить причинного зв’язку. Наведіть приклад удаваної кореляції (spurious correlation) через прихований третій фактор.