# 2. Методичні вказівки Цей розділ **самодостатній**: у ньому зібрано теорію числових характеристик дискретної випадкової величини та вибіркових оцінок, потрібну для аудиторних задач ([3classroom.md](3classroom.md)) і домашньої програми ([4task.md](4task.md)). Ширше ту саму теорію викладено в [Лекції 2](../../Lectures/DA-L02.md). ## 2.1 Випадкова величина та ряд розподілу **Дискретна випадкова величина** $X$ набуває скінченної (чи зліченної) множини значень $x_1, x_2, \dots, x_n$ з імовірностями $p_1, p_2, \dots, p_n$. Її задають **рядом розподілу** — таблицею «значення → ймовірність»: | $X$ | $x_1$ | $x_2$ | $\dots$ | $x_n$ | |---|:--:|:--:|:--:|:--:| | $P$ | $p_1$ | $p_2$ | $\dots$ | $p_n$ | Ймовірності невід'ємні й **нормовані**: $$ \sum_{i=1}^{n} p_i = 1. $$ ## 2.2 Математичне сподівання **Математичне сподівання** (середнє значення) — це «центр ваги» розподілу: $$ M(X) = \sum_{i=1}^{n} x_i\, p_i. $$ Основні властивості: $M(C) = C$ для сталої $C$; $M(CX) = C\,M(X)$; $M(X + Y) = M(X) + M(Y)$. ## 2.3 Дисперсія та середньоквадратичне відхилення **Дисперсія** вимірює розкид значень навколо сподівання: $$ D(X) = M\big[(X - M(X))^2\big] = \sum_{i=1}^{n} (x_i - M(X))^2\, p_i. $$ На практиці зручніша **обчислювальна формула** (той самий результат, менше арифметики): $$ D(X) = M(X^2) - \big(M(X)\big)^2, \qquad M(X^2) = \sum_{i=1}^{n} x_i^2\, p_i. $$ **Середньоквадратичне відхилення (СКВ)** повертає розкид у ті самі одиниці, що й сама величина: $$ \sigma(X) = \sqrt{D(X)}. $$ Властивості: $D(C) = 0$; $D(CX) = C^2 D(X)$; для **незалежних** $X, Y$ — $D(X + Y) = D(X) + D(Y)$. ## 2.4 Вибіркові оцінки На практиці розподіл невідомий — є лише **вибірка** $x_1, x_2, \dots, x_n$ (результати експерименту). Тоді характеристики **оцінюють** за даними. **Вибіркове середнє** (оцінка $M(X)$): $$ \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i. $$ **Вибіркова дисперсія** буває у двох версіях: $$ \underbrace{s_n^2 = \frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^2}_{\text{зміщена}}, \qquad \underbrace{s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2}_{\text{незміщена}}. $$ Ділення на $n-1$ (**поправка Бесселя**) робить оцінку **незміщеною** — у середньому вона дорівнює справжній $D(X)$; саме її зазвичай беруть як «вибіркову дисперсію» в статистиці (див. [Лекцію 3](../../Lectures/DA-L03.md)). Ділення на $n$ дає характеристику **наявних** даних як генеральної сукупності. СКВ вибірки — корінь із відповідної дисперсії. ## 2.5 Варіаційний (частотний) ряд Коли дискретне значення повторюється, вибірку зручно згорнути в **частотний ряд**: кожному унікальному значенню $x_j$ ставлять у відповідність **частоту** $f_j$ (скільки разів воно трапилось), $\sum_j f_j = n$. Тоді $$ \bar{x} = \frac{1}{n} \sum_j f_j\, x_j, \qquad s_n^2 = \frac{1}{n} \sum_j f_j\, (x_j - \bar{x})^2 = \frac{1}{n}\sum_j f_j x_j^2 - \bar{x}^2. $$ **Відносна частота** $p_j = f_j / n$ — це емпіричний аналог імовірності; частотний ряд — емпіричний аналог ряду розподілу. Саме так природно опрацьовувати «дискретні значення експерименту» з файлу CSV у домашньому завданні. ## 2.6 Демонстраційний приклад (на інших даних, ніж у задачах) **(а) За рядом розподілу.** Нехай | $X$ | 0 | 1 | 2 | 3 | |---|:--:|:--:|:--:|:--:| | $P$ | 0.1 | 0.3 | 0.4 | 0.2 | Перевірка нормування: $0.1+0.3+0.4+0.2 = 1$. Тоді $$ M(X) = 0(0.1) + 1(0.3) + 2(0.4) + 3(0.2) = 1.7, $$ $$ M(X^2) = 0(0.1) + 1(0.3) + 4(0.4) + 9(0.2) = 3.7, $$ $$ D(X) = 3.7 - 1.7^2 = 3.7 - 2.89 = 0.81, \qquad \sigma = \sqrt{0.81} = 0.9. $$ **(б) За вибіркою (частотний ряд).** Нехай значення $\{2, 4, 6\}$ трапились із частотами $\{2, 5, 3\}$, тобто $n = 10$: $$ \bar{x} = \frac{2\cdot 2 + 4\cdot 5 + 6\cdot 3}{10} = \frac{42}{10} = 4.2, $$ $$ \frac{1}{n}\sum f_j x_j^2 = \frac{4\cdot 2 + 16\cdot 5 + 36\cdot 3}{10} = \frac{196}{10} = 19.6, $$ $$ s_n^2 = 19.6 - 4.2^2 = 19.6 - 17.64 = 1.96, \qquad \sigma = \sqrt{1.96} = 1.4. $$ ![Ілюстрація розкиду навколо середнього для частотного ряду значень 2, 4, 6 (частоти 2, 5, 3): смуга x̄±σ з x̄=4.2 і σ=1.4](img/lab2_spread.png) Незміщена оцінка: $s^2 = \dfrac{n}{n-1}\, s_n^2 = \dfrac{10}{9}\cdot 1.96 \approx 2.18$, звідки $\sigma \approx 1.48$. ## 2.7 Робочий контрольний список - Спершу переконайтесь, що ймовірності **нормовані** ($\sum p_i = 1$) — для ряду розподілу. - Дисперсію рахуйте формулою $M(X^2) - (M(X))^2$: коротше й менше похибок. - Для вибірки одразу вирішіть, яка дисперсія потрібна — **зміщена** ($/n$) чи **незміщена** ($/(n-1)$) — і зазначте це. - Повтори дискретних значень зводьте у **частотний ряд**; тоді програма для CSV зводиться до одного проходу з накопиченням $\sum x$, $\sum x^2$ і $n$.