2. Методичні вказівки
Цей розділ самодостатній : у ньому зібрано теорію кореляції, лінійної регресії
та критерію χ 2 \chi^2 χ 2 , потрібну для аудиторних задач (3classroom.md )
і домашньої програми (4task.md ). Ширше ту саму теорію викладено в
Лекції 5 .
2.1 Двовимірна вибірка
Двовимірна вибірка — це n n n пар ( x i , y i ) (x_i, y_i) ( x i , y i ) , виміряних на одному об’єкті. У
парі X X X — незалежна змінна (предиктор), Y Y Y — залежна (відгук). Мета:
з’ясувати, чи є зв’язок, виміряти його силу й задати форму для прогнозу Y Y Y за X X X .
2.2 Вибірковий коефіцієнт кореляції
Коефіцієнт кореляції Пірсона вимірює силу й напрям лінійного зв’язку:
r = ∑ ( x i − x ˉ ) ( y i − y ˉ ) ∑ ( x i − x ˉ ) 2 ∑ ( y i − y ˉ ) 2 . r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}
{\sqrt{\sum (x_i - \bar{x})^2 \; \sum (y_i - \bar{y})^2}}.
r = ∑ ( x i − x ˉ ) 2 ∑ ( y i − y ˉ ) 2 ∑ ( x i − x ˉ ) ( y i − y ˉ ) .
Для ручних обчислень зручніша рівносильна форма через суми (розрахункова
таблиця з колонками x x x , y y y , x y xy x y , x 2 x^2 x 2 , y 2 y^2 y 2 ):
r = n ∑ x y − ∑ x ∑ y [ n ∑ x 2 − ( ∑ x ) 2 ] [ n ∑ y 2 − ( ∑ y ) 2 ] . r = \frac{n \sum xy - \sum x \sum y}
{\sqrt{\big[n \sum x^2 - (\sum x)^2\big]\big[n \sum y^2 - (\sum y)^2\big]}}.
r = [ n ∑ x 2 − ( ∑ x ) 2 ] [ n ∑ y 2 − ( ∑ y ) 2 ] n ∑ x y − ∑ x ∑ y .
Властивості: − 1 ≤ r ≤ 1 -1 \le r \le 1 − 1 ≤ r ≤ 1 ; знак задає напрям; ∣ r ∣ = 1 |r| = 1 ∣ r ∣ = 1 — точний лінійний
зв’язок; r = 0 r = 0 r = 0 — лінійного зв’язку немає (але нелінійний може бути). Орієнтовна
шкала сили: ∣ r ∣ < 0.3 |r| < 0.3 ∣ r ∣ < 0.3 — дуже слабкий; 0.3 0.3 0.3 –0.5 0.5 0.5 — слабкий; 0.5 0.5 0.5 –0.7 0.7 0.7 —
помірний; 0.7 0.7 0.7 –0.9 0.9 0.9 — сильний; > 0.9 > 0.9 > 0.9 — дуже сильний.
Значущість. Перевіряють статистикою
t = r n − 2 1 − r 2 , d f = n − 2 , t = r\,\sqrt{\frac{n - 2}{1 - r^2}}, \qquad \mathrm{df} = n - 2,
t = r 1 − r 2 n − 2 , df = n − 2 ,
порівнюючи ∣ t ∣ |t| ∣ t ∣ з критичним t α / 2 , n − 2 t_{\alpha/2,\,n-2} t α /2 , n − 2 : якщо ∣ t ∣ > t кр |t| > t_{\text{кр}} ∣ t ∣ > t кр ,
кореляція значуща (відмінна від нуля).
2.3 Лінійна регресія (метод найменших квадратів)
Модель: y ^ = b 0 + b 1 x \hat{y} = b_0 + b_1 x y ^ = b 0 + b 1 x , де b 1 b_1 b 1 — нахил, b 0 b_0 b 0 — вільний член.
Метод найменших квадратів мінімізує суму квадратів залишків
∑ ( y i − y ^ i ) 2 \sum (y_i - \hat{y}_i)^2 ∑ ( y i − y ^ i ) 2 і дає
b 1 = ∑ ( x i − x ˉ ) ( y i − y ˉ ) ∑ ( x i − x ˉ ) 2 = n ∑ x y − ∑ x ∑ y n ∑ x 2 − ( ∑ x ) 2 , b 0 = y ˉ − b 1 x ˉ . b_1 = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2}
= \frac{n \sum xy - \sum x \sum y}{n \sum x^2 - (\sum x)^2},
\qquad
b_0 = \bar{y} - b_1 \bar{x}.
b 1 = ∑ ( x i − x ˉ ) 2 ∑ ( x i − x ˉ ) ( y i − y ˉ ) = n ∑ x 2 − ( ∑ x ) 2 n ∑ x y − ∑ x ∑ y , b 0 = y ˉ − b 1 x ˉ .
Пряма завжди проходить через центр даних ( x ˉ , y ˉ ) (\bar{x}, \bar{y}) ( x ˉ , y ˉ ) . Знаки b 1 b_1 b 1 і r r r
збігаються.
2.4 Коефіцієнт детермінації
Розклад суми квадратів відхилень:
∑ ( y i − y ˉ ) 2 ⏟ SST = ∑ ( y ^ i − y ˉ ) 2 ⏟ SSR + ∑ ( y i − y ^ i ) 2 ⏟ SSE . \underbrace{\sum (y_i - \bar{y})^2}_{\text{SST}}
= \underbrace{\sum (\hat{y}_i - \bar{y})^2}_{\text{SSR}}
+ \underbrace{\sum (y_i - \hat{y}_i)^2}_{\text{SSE}}.
SST ∑ ( y i − y ˉ ) 2 = SSR ∑ ( y ^ i − y ˉ ) 2 + SSE ∑ ( y i − y ^ i ) 2 .
Коефіцієнт детермінації — частка поясненої варіації:
R 2 = SSR SST = 1 − SSE SST , 0 ≤ R 2 ≤ 1. R^2 = \frac{\text{SSR}}{\text{SST}} = 1 - \frac{\text{SSE}}{\text{SST}}, \qquad 0 \le R^2 \le 1.
R 2 = SST SSR = 1 − SST SSE , 0 ≤ R 2 ≤ 1.
Для простої лінійної регресії R 2 = r 2 R^2 = r^2 R 2 = r 2 — це зручний спосіб перевірки.
2.5 Таблиця спряженості та критерій χ 2 \chi^2 χ 2
Для двох якісних змінних будують таблицю спряженості розміру r × c r \times c r × c
зі спостережуваними частотами O i j O_{ij} O ij . За припущення незалежності очікувані
частоти
E i j = ( сума рядка i ) ( сума стовпця j ) N . E_{ij} = \frac{(\text{сума рядка}_i)\,(\text{сума стовпця}_j)}{N}.
E ij = N ( сума рядка i ) ( сума стовпця j ) .
Статистика Пірсона та число ступенів свободи:
χ 2 = ∑ i , j ( O i j − E i j ) 2 E i j , d f = ( r − 1 ) ( c − 1 ) . \chi^2 = \sum_{i, j} \frac{(O_{ij} - E_{ij})^2}{E_{ij}}, \qquad \mathrm{df} = (r - 1)(c - 1).
χ 2 = i , j ∑ E ij ( O ij − E ij ) 2 , df = ( r − 1 ) ( c − 1 ) .
Якщо χ 2 > χ α , d f 2 \chi^2 > \chi^2_{\alpha,\,\mathrm{df}} χ 2 > χ α , df 2 (критичне значення), гіпотезу
незалежності відхиляють — змінні пов’язані. Практичне правило застосовності:
E i j ≥ 5 E_{ij} \ge 5 E ij ≥ 5 у всіх клітинках.
2.6 Демонстраційний приклад (на інших даних, ніж у задачах)
(а) Кореляція та регресія. Нехай n = 5 n = 5 n = 5 пар:
x i x_i x i
y i y_i y i
x i y i x_i y_i x i y i
x i 2 x_i^2 x i 2
y i 2 y_i^2 y i 2
1
3
3
1
9
2
5
10
4
25
3
4
12
9
16
4
7
28
16
49
5
8
40
25
64
∑ \sum ∑
15
27
93
55
163
Тут x ˉ = 15 / 5 = 3 \bar{x} = 15/5 = 3 x ˉ = 15/5 = 3 , y ˉ = 27 / 5 = 5.4 \bar{y} = 27/5 = 5.4 y ˉ = 27/5 = 5.4 . Проміжні величини:
n ∑ x y − ∑ x ∑ y = 5 ⋅ 93 − 15 ⋅ 27 = 465 − 405 = 60 , n\sum xy - \sum x \sum y = 5 \cdot 93 - 15 \cdot 27 = 465 - 405 = 60,
n ∑ x y − ∑ x ∑ y = 5 ⋅ 93 − 15 ⋅ 27 = 465 − 405 = 60 ,
n ∑ x 2 − ( ∑ x ) 2 = 5 ⋅ 55 − 15 2 = 275 − 225 = 50 , n\sum x^2 - (\sum x)^2 = 5 \cdot 55 - 15^2 = 275 - 225 = 50,
n ∑ x 2 − ( ∑ x ) 2 = 5 ⋅ 55 − 1 5 2 = 275 − 225 = 50 ,
n ∑ y 2 − ( ∑ y ) 2 = 5 ⋅ 163 − 27 2 = 815 − 729 = 86. n\sum y^2 - (\sum y)^2 = 5 \cdot 163 - 27^2 = 815 - 729 = 86.
n ∑ y 2 − ( ∑ y ) 2 = 5 ⋅ 163 − 2 7 2 = 815 − 729 = 86.
Отже,
b 1 = 60 50 = 1.2 , b 0 = 5.4 − 1.2 ⋅ 3 = 1.8 , b_1 = \frac{60}{50} = 1.2, \qquad b_0 = 5.4 - 1.2 \cdot 3 = 1.8,
b 1 = 50 60 = 1.2 , b 0 = 5.4 − 1.2 ⋅ 3 = 1.8 ,
r = 60 50 ⋅ 86 = 60 65.57 = 0.915. r = \frac{60}{\sqrt{50 \cdot 86}} = \frac{60}{65.57} = 0.915.
r = 50 ⋅ 86 60 = 65.57 60 = 0.915.
Рівняння регресії: y ^ = 1.8 + 1.2 x \hat{y} = 1.8 + 1.2\,x y ^ = 1.8 + 1.2 x . Прогнози
y ^ = 3.0 , 4.2 , 5.4 , 6.6 , 7.8 \hat{y} = 3.0,\ 4.2,\ 5.4,\ 6.6,\ 7.8 y ^ = 3.0 , 4.2 , 5.4 , 6.6 , 7.8 ; залишки малі. Розклад варіації:
SST = 86 / 5 = 17.2 \text{SST} = 86/5 = 17.2 SST = 86/5 = 17.2 , SSR = 14.4 \text{SSR} = 14.4 SSR = 14.4 , SSE = 2.8 \text{SSE} = 2.8 SSE = 2.8 (перевірка:
14.4 + 2.8 = 17.2 14.4 + 2.8 = 17.2 14.4 + 2.8 = 17.2 ), тож
R 2 = 14.4 17.2 = 0.837 = r 2 = 0.915 2 . R^2 = \frac{14.4}{17.2} = 0.837 = r^2 = 0.915^2.
R 2 = 17.2 14.4 = 0.837 = r 2 = 0.91 5 2 .
Кореляція сильна (r = 0.915 r = 0.915 r = 0.915 ), модель пояснює ≈ 84 % \approx 84\,\% ≈ 84 % розкиду Y Y Y .
(б) Критерій χ 2 \chi^2 χ 2 . Нехай таблиця спряженості 2 × 2 2 \times 2 2 × 2 (N = 100 N = 100 N = 100 ):
Стовпець 1
Стовпець 2
Усього
Рядок 1
38
12
50
Рядок 2
22
28
50
Усього
60
40
100
Очікувані частоти E i j = ( рядок i ) ( стовпець j ) / N E_{ij} = (\text{рядок}_i)(\text{стовпець}_j)/N E ij = ( рядок i ) ( стовпець j ) / N :
E 11 = 50 ⋅ 60 100 = 30 , E 12 = 20 , E 21 = 30 , E 22 = 20. E_{11} = \frac{50 \cdot 60}{100} = 30, \quad E_{12} = 20, \quad E_{21} = 30, \quad E_{22} = 20.
E 11 = 100 50 ⋅ 60 = 30 , E 12 = 20 , E 21 = 30 , E 22 = 20.
Внески клітинок і статистика:
χ 2 = ( 38 − 30 ) 2 30 + ( 12 − 20 ) 2 20 + ( 22 − 30 ) 2 30 + ( 28 − 20 ) 2 20 = 2.133 + 3.2 + 2.133 + 3.2 = 10.667. \chi^2 = \frac{(38 - 30)^2}{30} + \frac{(12 - 20)^2}{20} + \frac{(22 - 30)^2}{30} + \frac{(28 - 20)^2}{20}
= 2.133 + 3.2 + 2.133 + 3.2 = 10.667.
χ 2 = 30 ( 38 − 30 ) 2 + 20 ( 12 − 20 ) 2 + 30 ( 22 − 30 ) 2 + 20 ( 28 − 20 ) 2 = 2.133 + 3.2 + 2.133 + 3.2 = 10.667.
d f = ( 2 − 1 ) ( 2 − 1 ) = 1 \mathrm{df} = (2-1)(2-1) = 1 df = ( 2 − 1 ) ( 2 − 1 ) = 1 ; критичне χ 0.05 , 1 2 = 3.841 \chi^2_{0.05,\,1} = 3.841 χ 0.05 , 1 2 = 3.841 . Оскільки
10.667 > 3.841 10.667 > 3.841 10.667 > 3.841 , гіпотезу незалежності відхиляємо — змінні пов’язані.
2.7 Робочий контрольний список
Спершу побудуйте розрахункову таблицю (x x x , y y y , x y xy x y , x 2 x^2 x 2 , y 2 y^2 y 2 ) і
знайдіть п’ять сум — далі все зводиться до підстановки у формули.
Обчисліть r r r , потім b 1 b_1 b 1 і b 0 b_0 b 0 ; перевірте, що знаки r r r і b 1 b_1 b 1 збігаються.
Для R 2 R^2 R 2 скористайтесь рівністю R 2 = r 2 R^2 = r^2 R 2 = r 2 (проста лінійна регресія) як
швидкою перевіркою розкладу SST = = = SSR + + + SSE.
Для χ 2 \chi^2 χ 2 спершу випишіть усі очікувані частоти E i j E_{ij} E ij і переконайтесь,
що їхні суми по рядках/стовпцях збігаються зі спостережуваними.
Порівнюйте χ 2 \chi^2 χ 2 саме з χ α , d f 2 \chi^2_{\alpha,\,\mathrm{df}} χ α , df 2 при правильному
d f = ( r − 1 ) ( c − 1 ) \mathrm{df} = (r-1)(c-1) df = ( r − 1 ) ( c − 1 ) , а не з фіксованим числом.
Laboratory/Laboratory5/2method.md · 7.8 KB · updated 2026-08-04 23:15