# 3. Аудиторні задачі з розв'язаннями Ці задачі розбирають **в аудиторії «руками»**. Перша показує обчислення, які потім автоматизує домашня програма ([4task.md](4task.md)); друга — критерій $\chi^2$ для таблиці спряженості. Теорія й формули — у [методичних вказівках](2method.md). ## Задача 1. Кореляція, регресія та $R^2$ **Дано** вибірку з $n = 7$ пар: $x$ — середньодобова температура ($^\circ$C), $y$ — денний обсяг продажів морозива (умовні одиниці): | $x$ | 15 | 18 | 20 | 22 | 25 | 28 | 30 | |---|:--:|:--:|:--:|:--:|:--:|:--:|:--:| | $y$ | 20 | 24 | 28 | 30 | 38 | 42 | 47 | **Знайти** коефіцієнт кореляції $r$, рівняння регресії $\hat{y} = b_0 + b_1 x$ та коефіцієнт детермінації $R^2$; спрогнозувати продажі при $x = 24\,^\circ$C. **Розв'язання.** Складемо **розрахункову таблицю**: | $x_i$ | $y_i$ | $x_i y_i$ | $x_i^2$ | $y_i^2$ | |:--:|:--:|:--:|:--:|:--:| | 15 | 20 | 300 | 225 | 400 | | 18 | 24 | 432 | 324 | 576 | | 20 | 28 | 560 | 400 | 784 | | 22 | 30 | 660 | 484 | 900 | | 25 | 38 | 950 | 625 | 1444 | | 28 | 42 | 1176 | 784 | 1764 | | 30 | 47 | 1410 | 900 | 2209 | | **$\sum$ 158** | **229** | **5488** | **3742** | **8077** | Отже, $n = 7$, $\bar{x} = 158/7 \approx 22.571$, $\bar{y} = 229/7 \approx 32.714$. Проміжні величини: $$ n\sum xy - \sum x \sum y = 7 \cdot 5488 - 158 \cdot 229 = 38\,416 - 36\,182 = 2234, $$ $$ n\sum x^2 - (\sum x)^2 = 7 \cdot 3742 - 158^2 = 26\,194 - 24\,964 = 1230, $$ $$ n\sum y^2 - (\sum y)^2 = 7 \cdot 8077 - 229^2 = 56\,539 - 52\,441 = 4098. $$ **Коефіцієнт кореляції:** $$ r = \frac{2234}{\sqrt{1230 \cdot 4098}} = \frac{2234}{\sqrt{5\,040\,540}} = \frac{2234}{2245.1} = 0.995. $$ Зв'язок **дуже сильний** і **додатний**: продажі зростають з температурою. **Рівняння регресії:** $$ b_1 = \frac{2234}{1230} = 1.816, \qquad b_0 = 32.714 - 1.816 \cdot 22.571 = -8.281. $$ Отже, $\hat{y} = -8.281 + 1.816\,x$. Нахил $b_1 = 1.816$: кожен додатковий градус підвищує продажі в середньому на $\approx 1.8$ од. **Коефіцієнт детермінації.** Повна варіація $\text{SST} = (n\sum y^2 - (\sum y)^2)/n = 4098/7 = 585.43$. Для простої лінійної регресії $R^2 = r^2$: $$ R^2 = 0.995^2 = 0.990, $$ тобто $\text{SSR} = R^2 \cdot \text{SST} = 579.65$, а $\text{SSE} = \text{SST} - \text{SSR} = 5.78$. Модель пояснює **99 %** розкиду продажів. **Прогноз** при $x = 24$: $\hat{y} = -8.281 + 1.816 \cdot 24 = 35.31$ од. **Значущість** (за бажанням): $t = r\sqrt{(n-2)/(1-r^2)} = 0.995\sqrt{5/0.0099} = 22.4$; критичне $t_{0.025,\,5} = 2.571$. Оскільки $22.4 > 2.571$, кореляція **значуща**. **Відповідь:** $r = 0.995$; $\hat{y} = -8.281 + 1.816\,x$; $R^2 = 0.990$; прогноз при $24\,^\circ$C — близько $35$ од. ![Діаграма розсіювання продажів морозива від температури з лінією регресії ŷ = −8.281 + 1.816·x та позначеним прогнозом при 24 °C; r = 0.995, R^2 = 0.990](img/lab5_scatter_regression.png) > **Застереження про екстраполяцію.** Вільний член $b_0 = -8.281$ формально > означав би «продажі при $0\,^\circ$C», але $x = 0$ **поза** діапазоном даних > ($15$–$30\,^\circ$C), тож цю величину змістовно тлумачити не можна. Прогноз > надійний лише всередині діапазону спостережень. ## Задача 2. Критерій згоди Пірсона ($\chi^2$) **Дано** таблицю спряженості: опитано $N = 300$ глядачів двох вікових груп про улюблений жанр фільмів (спостережувані частоти): | | Комедія | Драма | Бойовик | **Усього** | |---|:--:|:--:|:--:|:--:| | **До 30 років** | 60 | 55 | 35 | 150 | | **30 і старші** | 30 | 65 | 55 | 150 | | **Усього** | 90 | 120 | 90 | **300** | **Перевірити** на рівні значущості $\alpha = 0.05$ гіпотезу про **незалежність** віку та жанрових уподобань. **Розв'язання.** Гіпотези: $H_0$ — вік і жанр незалежні; $H_1$ — пов'язані. **Крок 1. Очікувані частоти** $E_{ij} = (\text{рядок}_i)(\text{стовпець}_j)/N$. Оскільки обидва рядки мають підсумок $150$, для кожного стовпця $E = 150 \cdot (\text{сума стовпця})/300$: | | Комедія | Драма | Бойовик | |---|:--:|:--:|:--:| | **До 30 років** | 45 | 60 | 45 | | **30 і старші** | 45 | 60 | 45 | Перевірка: суми $E$ по стовпцях $45+45=90$, $60+60=120$, $45+45=90$ — збігаються зі спостережуваними. Усі $E_{ij} \ge 5$, тож критерій застосовний. **Крок 2. Внески клітинок** $(O - E)^2 / E$: $$ \frac{(60-45)^2}{45} = \frac{225}{45} = 5, \quad \frac{(55-60)^2}{60} = \frac{25}{60} = 0.417, \quad \frac{(35-45)^2}{45} = \frac{100}{45} = 2.222, $$ $$ \frac{(30-45)^2}{45} = 5, \quad \frac{(65-60)^2}{60} = 0.417, \quad \frac{(55-45)^2}{45} = 2.222. $$ **Крок 3. Статистика й рішення.** $$ \chi^2 = 5 + 0.417 + 2.222 + 5 + 0.417 + 2.222 = 15.278, $$ $$ \mathrm{df} = (2 - 1)(3 - 1) = 2. $$ Критичне значення $\chi^2_{0.05,\,2} = 5.991$. Оскільки $15.278 > 5.991$, гіпотезу незалежності **відхиляємо**. **Відповідь:** $\chi^2 = 15.278 > 5.991 = \chi^2_{0.05,\,2}$ — вік і жанрові уподобання **статистично пов'язані** (молодші тяжіють до комедій, старші — до драм і бойовиків). ![Теплова карта таблиці спряженості «вік × жанр»: спостережені частоти та очікувані за незалежності; хі-квадрат = 15.28 при двох ступенях свободи](img/lab5_contingency.png) > **Зв'язок із домашнім завданням.** Саме кроки Задачі 1 — прочитати пари, > накопичити суми $\sum x$, $\sum y$, $\sum xy$, $\sum x^2$, $\sum y^2$, обчислити > $r$, $b_0$, $b_1$ та $R^2$ — виконуватиме ваша програма для довільної вибірки > пар ([4task.md](4task.md)). Дані Задачі 1 — зручний **тест**: подайте ці сім пар > на вхід і переконайтесь, що програма повертає $r \approx 0.995$, > $\hat{y} = -8.281 + 1.816\,x$, $R^2 \approx 0.990$.