Raw

2. Методичні вказівки

Цей розділ самодостатній: у ньому зібрано теорію кореляції, лінійної регресії та критерію χ2\chi^2, потрібну для аудиторних задач (3classroom.md) і домашньої програми (4task.md). Ширше ту саму теорію викладено в Лекції 5.

2.1 Двовимірна вибірка

Двовимірна вибірка — це nn пар (xi,yi)(x_i, y_i), виміряних на одному об’єкті. У парі XXнезалежна змінна (предиктор), YYзалежна (відгук). Мета: з’ясувати, чи є зв’язок, виміряти його силу й задати форму для прогнозу YY за XX.

2.2 Вибірковий коефіцієнт кореляції

Коефіцієнт кореляції Пірсона вимірює силу й напрям лінійного зв’язку:

r=(xixˉ)(yiyˉ)(xixˉ)2  (yiyˉ)2.r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})} {\sqrt{\sum (x_i - \bar{x})^2 \; \sum (y_i - \bar{y})^2}}.

Для ручних обчислень зручніша рівносильна форма через суми (розрахункова таблиця з колонками xx, yy, xyxy, x2x^2, y2y^2):

r=nxyxy[nx2(x)2][ny2(y)2].r = \frac{n \sum xy - \sum x \sum y} {\sqrt{\big[n \sum x^2 - (\sum x)^2\big]\big[n \sum y^2 - (\sum y)^2\big]}}.

Властивості: 1r1-1 \le r \le 1; знак задає напрям; r=1|r| = 1 — точний лінійний зв’язок; r=0r = 0 — лінійного зв’язку немає (але нелінійний може бути). Орієнтовна шкала сили: r<0.3|r| < 0.3 — дуже слабкий; 0.30.30.50.5 — слабкий; 0.50.50.70.7 — помірний; 0.70.70.90.9 — сильний; >0.9> 0.9 — дуже сильний.

Значущість. Перевіряють статистикою

t=rn21r2,df=n2,t = r\,\sqrt{\frac{n - 2}{1 - r^2}}, \qquad \mathrm{df} = n - 2,

порівнюючи t|t| з критичним tα/2,n2t_{\alpha/2,\,n-2}: якщо t>tкр|t| > t_{\text{кр}}, кореляція значуща (відмінна від нуля).

2.3 Лінійна регресія (метод найменших квадратів)

Модель: y^=b0+b1x\hat{y} = b_0 + b_1 x, де b1b_1 — нахил, b0b_0 — вільний член. Метод найменших квадратів мінімізує суму квадратів залишків (yiy^i)2\sum (y_i - \hat{y}_i)^2 і дає

b1=(xixˉ)(yiyˉ)(xixˉ)2=nxyxynx2(x)2,b0=yˉb1xˉ.b_1 = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2} = \frac{n \sum xy - \sum x \sum y}{n \sum x^2 - (\sum x)^2}, \qquad b_0 = \bar{y} - b_1 \bar{x}.

Пряма завжди проходить через центр даних (xˉ,yˉ)(\bar{x}, \bar{y}). Знаки b1b_1 і rr збігаються.

2.4 Коефіцієнт детермінації

Розклад суми квадратів відхилень:

(yiyˉ)2SST=(y^iyˉ)2SSR+(yiy^i)2SSE.\underbrace{\sum (y_i - \bar{y})^2}_{\text{SST}} = \underbrace{\sum (\hat{y}_i - \bar{y})^2}_{\text{SSR}} + \underbrace{\sum (y_i - \hat{y}_i)^2}_{\text{SSE}}.

Коефіцієнт детермінації — частка поясненої варіації:

R2=SSRSST=1SSESST,0R21.R^2 = \frac{\text{SSR}}{\text{SST}} = 1 - \frac{\text{SSE}}{\text{SST}}, \qquad 0 \le R^2 \le 1.

Для простої лінійної регресії R2=r2R^2 = r^2 — це зручний спосіб перевірки.

2.5 Таблиця спряженості та критерій χ2\chi^2

Для двох якісних змінних будують таблицю спряженості розміру r×cr \times c зі спостережуваними частотами OijO_{ij}. За припущення незалежності очікувані частоти

Eij=(сума рядкаi)(сума стовпцяj)N.E_{ij} = \frac{(\text{сума рядка}_i)\,(\text{сума стовпця}_j)}{N}.

Статистика Пірсона та число ступенів свободи:

χ2=i,j(OijEij)2Eij,df=(r1)(c1).\chi^2 = \sum_{i, j} \frac{(O_{ij} - E_{ij})^2}{E_{ij}}, \qquad \mathrm{df} = (r - 1)(c - 1).

Якщо χ2>χα,df2\chi^2 > \chi^2_{\alpha,\,\mathrm{df}} (критичне значення), гіпотезу незалежності відхиляють — змінні пов’язані. Практичне правило застосовності: Eij5E_{ij} \ge 5 у всіх клітинках.

2.6 Демонстраційний приклад (на інших даних, ніж у задачах)

(а) Кореляція та регресія. Нехай n=5n = 5 пар:

xix_i yiy_i xiyix_i y_i xi2x_i^2 yi2y_i^2
1 3 3 1 9
2 5 10 4 25
3 4 12 9 16
4 7 28 16 49
5 8 40 25 64
\sum
15 27 93 55 163

Тут xˉ=15/5=3\bar{x} = 15/5 = 3, yˉ=27/5=5.4\bar{y} = 27/5 = 5.4. Проміжні величини:

nxyxy=5931527=465405=60,n\sum xy - \sum x \sum y = 5 \cdot 93 - 15 \cdot 27 = 465 - 405 = 60,

nx2(x)2=555152=275225=50,n\sum x^2 - (\sum x)^2 = 5 \cdot 55 - 15^2 = 275 - 225 = 50,

ny2(y)2=5163272=815729=86.n\sum y^2 - (\sum y)^2 = 5 \cdot 163 - 27^2 = 815 - 729 = 86.

Отже,

b1=6050=1.2,b0=5.41.23=1.8,b_1 = \frac{60}{50} = 1.2, \qquad b_0 = 5.4 - 1.2 \cdot 3 = 1.8,

r=605086=6065.57=0.915.r = \frac{60}{\sqrt{50 \cdot 86}} = \frac{60}{65.57} = 0.915.

Рівняння регресії: y^=1.8+1.2x\hat{y} = 1.8 + 1.2\,x. Прогнози y^=3.0, 4.2, 5.4, 6.6, 7.8\hat{y} = 3.0,\ 4.2,\ 5.4,\ 6.6,\ 7.8; залишки малі. Розклад варіації: SST=86/5=17.2\text{SST} = 86/5 = 17.2, SSR=14.4\text{SSR} = 14.4, SSE=2.8\text{SSE} = 2.8 (перевірка: 14.4+2.8=17.214.4 + 2.8 = 17.2), тож

R2=14.417.2=0.837=r2=0.9152.R^2 = \frac{14.4}{17.2} = 0.837 = r^2 = 0.915^2.

Кореляція сильна (r=0.915r = 0.915), модель пояснює 84%\approx 84\,\% розкиду YY.

(б) Критерій χ2\chi^2. Нехай таблиця спряженості 2×22 \times 2 (N=100N = 100):

Стовпець 1 Стовпець 2 Усього
Рядок 1 38 12 50
Рядок 2 22 28 50
Усього 60 40 100

Очікувані частоти Eij=(рядокi)(стовпецьj)/NE_{ij} = (\text{рядок}_i)(\text{стовпець}_j)/N:

E11=5060100=30,E12=20,E21=30,E22=20.E_{11} = \frac{50 \cdot 60}{100} = 30, \quad E_{12} = 20, \quad E_{21} = 30, \quad E_{22} = 20.

Внески клітинок і статистика:

χ2=(3830)230+(1220)220+(2230)230+(2820)220=2.133+3.2+2.133+3.2=10.667.\chi^2 = \frac{(38 - 30)^2}{30} + \frac{(12 - 20)^2}{20} + \frac{(22 - 30)^2}{30} + \frac{(28 - 20)^2}{20} = 2.133 + 3.2 + 2.133 + 3.2 = 10.667.

df=(21)(21)=1\mathrm{df} = (2-1)(2-1) = 1; критичне χ0.05,12=3.841\chi^2_{0.05,\,1} = 3.841. Оскільки 10.667>3.84110.667 > 3.841, гіпотезу незалежності відхиляємо — змінні пов’язані.

2.7 Робочий контрольний список

  • Спершу побудуйте розрахункову таблицю (xx, yy, xyxy, x2x^2, y2y^2) і знайдіть п’ять сум — далі все зводиться до підстановки у формули.
  • Обчисліть rr, потім b1b_1 і b0b_0; перевірте, що знаки rr і b1b_1 збігаються.
  • Для R2R^2 скористайтесь рівністю R2=r2R^2 = r^2 (проста лінійна регресія) як швидкою перевіркою розкладу SST == SSR ++ SSE.
  • Для χ2\chi^2 спершу випишіть усі очікувані частоти EijE_{ij} і переконайтесь, що їхні суми по рядках/стовпцях збігаються зі спостережуваними.
  • Порівнюйте χ2\chi^2 саме з χα,df2\chi^2_{\alpha,\,\mathrm{df}} при правильному df=(r1)(c1)\mathrm{df} = (r-1)(c-1), а не з фіксованим числом.

Laboratory/Laboratory5/2method.md · 7.8 KB · updated 2026-08-04 23:15