Raw

2. Методичні вказівки

Цей розділ самодостатній: у ньому зібрано теорію описової статистики та довірчих інтервалів, потрібну для аудиторних задач (3classroom.md) і домашньої програми (4task.md). Ширше ту саму теорію викладено в Лекції 3.

2.1 Вибірка та варіаційний ряд

Вибірка x1,x2,,xnx_1, x_2, \dots, x_n — це nn результатів експерименту (спостережень) над випадковою величиною. Упорядкувавши їх за неспаданням, дістають варіаційний ряд x(1)x(2)x(n)x_{(1)} \le x_{(2)} \le \dots \le x_{(n)}; крайні члени — xminx_{\min} і xmaxx_{\max}, а R=xmaxxminR = x_{\max} - x_{\min}розмах. Упорядкування потрібне для медіани та квартилів.

2.2 Характеристики центру

Вибіркове середнє (оцінка математичного сподівання μ\mu):

xˉ=1ni=1nxi.\bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i.

Медіана Me\mathrm{Me} — центральний член варіаційного ряду:

Me={x(n+12),n непарне,12(x(n2)+x(n2+1)),n парне.\mathrm{Me} = \begin{cases} x_{\left(\frac{n+1}{2}\right)}, & n \text{ непарне}, \\[4pt] \dfrac{1}{2}\left( x_{\left(\frac{n}{2}\right)} + x_{\left(\frac{n}{2}+1\right)} \right), & n \text{ парне}. \end{cases}

Мода Mo\mathrm{Mo} — значення з найбільшою частотою (може бути відсутньою, якщо всі значення різні, або неєдиною). Середнє використовує всі дані, але чутливе до викидів; медіана робастна (стійка до викидів); мода придатна і для якісних даних.

2.3 Квантилі, квартилі та IQR

Квантиль рівня pp — значення QpQ_p, ліворуч від якого лежить частка pp даних. Квартилі Q1Q_1 (p=0.25p = 0.25), Q2=MeQ_2 = \mathrm{Me} (p=0.5p = 0.5), Q3Q_3 (p=0.75p = 0.75) ділять дані на чотири рівні частини. За методом лінійної інтерполяції (нумерація з нуля) беруть позицію h=(n1)ph = (n - 1)p: якщо hh ціле, Qp=x(h)Q_p = x_{(h)}, інакше інтерполюють між сусідніми членами. Міжквартильний розмах

IQR=Q3Q1\mathrm{IQR} = Q_3 - Q_1

— робастна міра розкиду; значення поза межами [Q11.5IQR, Q3+1.5IQR][\,Q_1 - 1.5\,\mathrm{IQR},\ Q_3 + 1.5\,\mathrm{IQR}\,] вважають викидами.

2.4 Вибіркова дисперсія та ступені свободи

Незміщена вибіркова дисперсія (оцінка σ2\sigma^2) ділить на n1n - 1:

s2=1n1i=1n(xixˉ)2=1n1(i=1nxi2nxˉ2),s=s2.s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2 = \frac{1}{n-1}\left( \sum_{i=1}^{n} x_i^2 - n\,\bar{x}^2 \right), \qquad s = \sqrt{s^2}.

Друга форма (через xi2\sum x_i^2 і xˉ\bar{x}) зручніша для програми — потрібні лише суми xi\sum x_i і xi2\sum x_i^2. Ділять на n1n - 1 (поправка Бесселя), бо відхилення беруть від вибіркового xˉ\bar{x}; вони зв’язані тотожністю (xixˉ)=0\sum (x_i - \bar{x}) = 0, тож вільних відхилень лише n1n - 1 — стільки й ступенів свободи.

2.5 Довірчий інтервал: суть

Довірчий інтервал із довірчою ймовірністю (надійністю) 1α1 - \alpha — проміжок, що накриває невідомий параметр із цією ймовірністю; α\alphaрівень значущості. Двобічний інтервал відрізає по α/2\alpha/2 з кожного хвоста. Критичне значення позначаємо за площею праворуч від нього; у scipy.stats (функція ppf дає площу ліворуч):

tα/2,n1=t.ppf(1α/2, n1),χα/2,n12=chi2.ppf(1α/2, n1),χ1α/2,n12=chi2.ppf(α/2, n1).t_{\alpha/2,\,n-1} = \texttt{t.ppf}(1 - \alpha/2,\ n-1), \quad \chi^2_{\alpha/2,\,n-1} = \texttt{chi2.ppf}(1 - \alpha/2,\ n-1), \quad \chi^2_{1-\alpha/2,\,n-1} = \texttt{chi2.ppf}(\alpha/2,\ n-1).

2.6 ДІ для математичного сподівання (невідома σ\sigma)

Коли σ\sigma невідома (звичайний випадок), її замінюють на ss, а критичне значення беруть із розподілу Стьюдента з n1n - 1 ступенями свободи:

xˉ±tα/2,n1sn,E=tα/2,n1sn — похибка оцінки.\bar{x} \pm t_{\alpha/2,\,n-1}\,\frac{s}{\sqrt{n}}, \qquad E = t_{\alpha/2,\,n-1}\,\frac{s}{\sqrt{n}} \ \text{— похибка оцінки}.

(Якщо σ\sigma відома, то замість tt і ss беруть zα/2z_{\alpha/2} і σ\sigma: xˉ±zα/2σ/n\bar{x} \pm z_{\alpha/2}\,\sigma/\sqrt{n}.)

2.7 ДІ для дисперсії (розподіл χ2\chi^2)

Величина (n1)s2/σ2(n-1)s^2/\sigma^2 має розподіл χ2\chi^2 з n1n - 1 ступенями свободи, звідки несиметричний інтервал:

((n1)s2χα/2,n12,(n1)s2χ1α/2,n12).\left( \frac{(n-1)\,s^2}{\chi^2_{\alpha/2,\,n-1}}, \quad \frac{(n-1)\,s^2}{\chi^2_{1-\alpha/2,\,n-1}} \right).

У знаменнику нижньої межі — більше критичне значення, верхньої — менше. Інтервал для σ\sigma дістають добуванням кореня з меж.

2.8 Демонстраційний приклад (на інших даних, ніж у задачах)

Дано вибірку (n=9n = 9):

4, 6, 7, 9, 10, 11, 12, 15, 16.4,\ 6,\ 7,\ 9,\ 10,\ 11,\ 12,\ 15,\ 16.

(а) Описові характеристики. Вибірка вже впорядкована. Сума xi=90\sum x_i = 90, тож

xˉ=909=10,Me=x(5)=10,Mo — відсутня (усі значення різні).\bar{x} = \frac{90}{9} = 10, \qquad \mathrm{Me} = x_{(5)} = 10, \qquad \mathrm{Mo} \ \text{— відсутня (усі значення різні)}.

Квартилі (нумерація з нуля): h25=(91)0.25=2Q1=7h_{25} = (9-1)\cdot 0.25 = 2 \Rightarrow Q_1 = 7; h75=6Q3=12h_{75} = 6 \Rightarrow Q_3 = 12; отже IQR=127=5\mathrm{IQR} = 12 - 7 = 5. Межі викидів [77.5, 12+7.5]=[0.5; 19.5][\,7 - 7.5,\ 12 + 7.5\,] = [-0.5;\ 19.5] — викидів немає.

(б) Вибіркова дисперсія. Відхилення від xˉ=10\bar{x} = 10: 6,4,3,1,0,1,2,5,6-6, -4, -3, -1, 0, 1, 2, 5, 6; квадрати: 36,16,9,1,0,1,4,25,3636, 16, 9, 1, 0, 1, 4, 25, 36; їх сума (xixˉ)2=128\sum (x_i - \bar{x})^2 = 128. Тоді

s2=128n1=1288=16,s=16=4.s^2 = \frac{128}{n - 1} = \frac{128}{8} = 16, \qquad s = \sqrt{16} = 4.

(в) ДІ для математичного сподівання (α=0.05\alpha = 0.05, невідома σ\sigma). Ступенів свободи n1=8n - 1 = 8; критичне значення t0.025,8=2.3060t_{0.025,\,8} = 2.3060. Похибка

E=t0.025,8sn=2.306049=2.3060433.075.E = t_{0.025,\,8}\,\frac{s}{\sqrt{n}} = 2.3060\cdot \frac{4}{\sqrt{9}} = 2.3060\cdot \frac{4}{3} \approx 3.075.

Отже, 95%95\% ДІ для μ\mu:

10±3.075  (6.925; 13.075).10 \pm 3.075 \ \Rightarrow\ (6.925;\ 13.075).

(г) ДІ для дисперсії (α=0.05\alpha = 0.05, n1=8n - 1 = 8). Критичні значення χ0.025,82=17.5345\chi^2_{0.025,\,8} = 17.5345 і χ0.975,82=2.1797\chi^2_{0.975,\,8} = 2.1797; чисельник (n1)s2=816=128(n-1)s^2 = 8\cdot 16 = 128. Тоді

(12817.5345, 1282.1797)=(7.30; 58.72)для σ2,(7.30; 58.72)=(2.70; 7.66)для σ.\left( \frac{128}{17.5345},\ \frac{128}{2.1797} \right) = (7.30;\ 58.72) \quad \text{для } \sigma^2, \qquad (\sqrt{7.30};\ \sqrt{58.72}) = (2.70;\ 7.66) \quad \text{для } \sigma.

Інтервал для дисперсії явно несиметричний відносно s2=16s^2 = 16 — така природа розподілу χ2\chi^2.

2.9 Робочий контрольний список

  • Спершу впорядкуйте вибірку — це потрібно для медіани та квартилів.
  • Дисперсію рахуйте через суми: s2=(xi2nxˉ2)/(n1)s^2 = \big(\sum x_i^2 - n\bar{x}^2\big)/(n-1) — один прохід по даних.
  • Перед побудовою ДІ переконайтесь, що взяли правильний критичний розподіл: Стьюдента (з n1n - 1 ст. св.) для μ\mu при невідомій σ\sigma; χ2\chi^2n1n - 1 ст. св.) для σ2\sigma^2.
  • Для χ2\chi^2-інтервалу не переплутайте хвости: більше критичне значення — у знаменнику нижньої межі.
  • Значення α\alpha беріть лише з дозволених: 0.050.05, 0.010.01, 0.10.1.

Laboratory/Laboratory3/2method.md · 8.8 KB · updated 2026-08-04 23:32