2. Методичні вказівки
Цей розділ самодостатній : у ньому зібрано теорію описової статистики та
довірчих інтервалів, потрібну для аудиторних задач (3classroom.md )
і домашньої програми (4task.md ). Ширше ту саму теорію викладено в
Лекції 3 .
2.1 Вибірка та варіаційний ряд
Вибірка x 1 , x 2 , … , x n x_1, x_2, \dots, x_n x 1 , x 2 , … , x n — це n n n результатів експерименту (спостережень)
над випадковою величиною. Упорядкувавши їх за неспаданням, дістають варіаційний
ряд x ( 1 ) ≤ x ( 2 ) ≤ ⋯ ≤ x ( n ) x_{(1)} \le x_{(2)} \le \dots \le x_{(n)} x ( 1 ) ≤ x ( 2 ) ≤ ⋯ ≤ x ( n ) ; крайні члени — x min x_{\min} x m i n і
x max x_{\max} x m a x , а R = x max − x min R = x_{\max} - x_{\min} R = x m a x − x m i n — розмах . Упорядкування потрібне для
медіани та квартилів.
2.2 Характеристики центру
Вибіркове середнє (оцінка математичного сподівання μ \mu μ ):
x ˉ = 1 n ∑ i = 1 n x i . \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i.
x ˉ = n 1 i = 1 ∑ n x i .
Медіана M e \mathrm{Me} Me — центральний член варіаційного ряду:
M e = { x ( n + 1 2 ) , n непарне , 1 2 ( x ( n 2 ) + x ( n 2 + 1 ) ) , n парне . \mathrm{Me} = \begin{cases} x_{\left(\frac{n+1}{2}\right)}, & n \text{ непарне}, \\[4pt] \dfrac{1}{2}\left( x_{\left(\frac{n}{2}\right)} + x_{\left(\frac{n}{2}+1\right)} \right), & n \text{ парне}. \end{cases}
Me = ⎩ ⎨ ⎧ x ( 2 n + 1 ) , 2 1 ( x ( 2 n ) + x ( 2 n + 1 ) ) , n непарне , n парне .
Мода M o \mathrm{Mo} Mo — значення з найбільшою частотою (може бути відсутньою, якщо
всі значення різні, або неєдиною). Середнє використовує всі дані, але чутливе до
викидів; медіана робастна (стійка до викидів); мода придатна і для якісних
даних.
2.3 Квантилі, квартилі та IQR
Квантиль рівня p p p — значення Q p Q_p Q p , ліворуч від якого лежить частка p p p даних.
Квартилі Q 1 Q_1 Q 1 (p = 0.25 p = 0.25 p = 0.25 ), Q 2 = M e Q_2 = \mathrm{Me} Q 2 = Me (p = 0.5 p = 0.5 p = 0.5 ), Q 3 Q_3 Q 3
(p = 0.75 p = 0.75 p = 0.75 ) ділять дані на чотири рівні частини. За методом лінійної
інтерполяції (нумерація з нуля) беруть позицію h = ( n − 1 ) p h = (n - 1)p h = ( n − 1 ) p : якщо h h h ціле,
Q p = x ( h ) Q_p = x_{(h)} Q p = x ( h ) , інакше інтерполюють між сусідніми членами. Міжквартильний
розмах
I Q R = Q 3 − Q 1 \mathrm{IQR} = Q_3 - Q_1
IQR = Q 3 − Q 1
— робастна міра розкиду; значення поза межами
[ Q 1 − 1.5 I Q R , Q 3 + 1.5 I Q R ] [\,Q_1 - 1.5\,\mathrm{IQR},\ Q_3 + 1.5\,\mathrm{IQR}\,] [ Q 1 − 1.5 IQR , Q 3 + 1.5 IQR ] вважають викидами .
2.4 Вибіркова дисперсія та ступені свободи
Незміщена вибіркова дисперсія (оцінка σ 2 \sigma^2 σ 2 ) ділить на n − 1 n - 1 n − 1 :
s 2 = 1 n − 1 ∑ i = 1 n ( x i − x ˉ ) 2 = 1 n − 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) , s = s 2 . s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2 = \frac{1}{n-1}\left( \sum_{i=1}^{n} x_i^2 - n\,\bar{x}^2 \right), \qquad s = \sqrt{s^2}.
s 2 = n − 1 1 i = 1 ∑ n ( x i − x ˉ ) 2 = n − 1 1 ( i = 1 ∑ n x i 2 − n x ˉ 2 ) , s = s 2 .
Друга форма (через ∑ x i 2 \sum x_i^2 ∑ x i 2 і x ˉ \bar{x} x ˉ ) зручніша для програми — потрібні лише
суми ∑ x i \sum x_i ∑ x i і ∑ x i 2 \sum x_i^2 ∑ x i 2 . Ділять на n − 1 n - 1 n − 1 (поправка Бесселя ), бо
відхилення беруть від вибіркового x ˉ \bar{x} x ˉ ; вони зв’язані тотожністю
∑ ( x i − x ˉ ) = 0 \sum (x_i - \bar{x}) = 0 ∑ ( x i − x ˉ ) = 0 , тож вільних відхилень лише n − 1 n - 1 n − 1 — стільки й
ступенів свободи .
2.5 Довірчий інтервал: суть
Довірчий інтервал із довірчою ймовірністю (надійністю) 1 − α 1 - \alpha 1 − α —
проміжок, що накриває невідомий параметр із цією ймовірністю; α \alpha α — рівень
значущості . Двобічний інтервал відрізає по α / 2 \alpha/2 α /2 з кожного хвоста. Критичне
значення позначаємо за площею праворуч від нього; у scipy.stats (функція ppf
дає площу ліворуч ):
t α / 2 , n − 1 = t.ppf ( 1 − α / 2 , n − 1 ) , χ α / 2 , n − 1 2 = chi2.ppf ( 1 − α / 2 , n − 1 ) , χ 1 − α / 2 , n − 1 2 = chi2.ppf ( α / 2 , n − 1 ) . t_{\alpha/2,\,n-1} = \texttt{t.ppf}(1 - \alpha/2,\ n-1), \quad \chi^2_{\alpha/2,\,n-1} = \texttt{chi2.ppf}(1 - \alpha/2,\ n-1), \quad \chi^2_{1-\alpha/2,\,n-1} = \texttt{chi2.ppf}(\alpha/2,\ n-1).
t α /2 , n − 1 = t.ppf ( 1 − α /2 , n − 1 ) , χ α /2 , n − 1 2 = chi2.ppf ( 1 − α /2 , n − 1 ) , χ 1 − α /2 , n − 1 2 = chi2.ppf ( α /2 , n − 1 ) .
2.6 ДІ для математичного сподівання (невідома σ \sigma σ )
Коли σ \sigma σ невідома (звичайний випадок), її замінюють на s s s , а критичне значення
беруть із розподілу Стьюдента з n − 1 n - 1 n − 1 ступенями свободи:
x ˉ ± t α / 2 , n − 1 s n , E = t α / 2 , n − 1 s n — похибка оцінки . \bar{x} \pm t_{\alpha/2,\,n-1}\,\frac{s}{\sqrt{n}}, \qquad E = t_{\alpha/2,\,n-1}\,\frac{s}{\sqrt{n}} \ \text{— похибка оцінки}.
x ˉ ± t α /2 , n − 1 n s , E = t α /2 , n − 1 n s — похибка оцінки .
(Якщо σ \sigma σ відома , то замість t t t і s s s беруть z α / 2 z_{\alpha/2} z α /2 і σ \sigma σ :
x ˉ ± z α / 2 σ / n \bar{x} \pm z_{\alpha/2}\,\sigma/\sqrt{n} x ˉ ± z α /2 σ / n .)
2.7 ДІ для дисперсії (розподіл χ 2 \chi^2 χ 2 )
Величина ( n − 1 ) s 2 / σ 2 (n-1)s^2/\sigma^2 ( n − 1 ) s 2 / σ 2 має розподіл χ 2 \chi^2 χ 2 з n − 1 n - 1 n − 1 ступенями свободи,
звідки несиметричний інтервал:
( ( n − 1 ) s 2 χ α / 2 , n − 1 2 , ( n − 1 ) s 2 χ 1 − α / 2 , n − 1 2 ) . \left( \frac{(n-1)\,s^2}{\chi^2_{\alpha/2,\,n-1}}, \quad \frac{(n-1)\,s^2}{\chi^2_{1-\alpha/2,\,n-1}} \right).
( χ α /2 , n − 1 2 ( n − 1 ) s 2 , χ 1 − α /2 , n − 1 2 ( n − 1 ) s 2 ) .
У знаменнику нижньої межі — більше критичне значення, верхньої — менше.
Інтервал для σ \sigma σ дістають добуванням кореня з меж.
2.8 Демонстраційний приклад (на інших даних, ніж у задачах)
Дано вибірку (n = 9 n = 9 n = 9 ):
4 , 6 , 7 , 9 , 10 , 11 , 12 , 15 , 16. 4,\ 6,\ 7,\ 9,\ 10,\ 11,\ 12,\ 15,\ 16.
4 , 6 , 7 , 9 , 10 , 11 , 12 , 15 , 16.
(а) Описові характеристики. Вибірка вже впорядкована. Сума ∑ x i = 90 \sum x_i = 90 ∑ x i = 90 , тож
x ˉ = 90 9 = 10 , M e = x ( 5 ) = 10 , M o — відсутня (усі значення різні) . \bar{x} = \frac{90}{9} = 10, \qquad \mathrm{Me} = x_{(5)} = 10, \qquad \mathrm{Mo} \ \text{— відсутня (усі значення різні)}.
x ˉ = 9 90 = 10 , Me = x ( 5 ) = 10 , Mo — відсутня ( усі значення різні ) .
Квартилі (нумерація з нуля): h 25 = ( 9 − 1 ) ⋅ 0.25 = 2 ⇒ Q 1 = 7 h_{25} = (9-1)\cdot 0.25 = 2 \Rightarrow Q_1 = 7 h 25 = ( 9 − 1 ) ⋅ 0.25 = 2 ⇒ Q 1 = 7 ;
h 75 = 6 ⇒ Q 3 = 12 h_{75} = 6 \Rightarrow Q_3 = 12 h 75 = 6 ⇒ Q 3 = 12 ; отже I Q R = 12 − 7 = 5 \mathrm{IQR} = 12 - 7 = 5 IQR = 12 − 7 = 5 . Межі викидів
[ 7 − 7.5 , 12 + 7.5 ] = [ − 0.5 ; 19.5 ] [\,7 - 7.5,\ 12 + 7.5\,] = [-0.5;\ 19.5] [ 7 − 7.5 , 12 + 7.5 ] = [ − 0.5 ; 19.5 ] — викидів немає.
(б) Вибіркова дисперсія. Відхилення від x ˉ = 10 \bar{x} = 10 x ˉ = 10 :
− 6 , − 4 , − 3 , − 1 , 0 , 1 , 2 , 5 , 6 -6, -4, -3, -1, 0, 1, 2, 5, 6 − 6 , − 4 , − 3 , − 1 , 0 , 1 , 2 , 5 , 6 ; квадрати: 36 , 16 , 9 , 1 , 0 , 1 , 4 , 25 , 36 36, 16, 9, 1, 0, 1, 4, 25, 36 36 , 16 , 9 , 1 , 0 , 1 , 4 , 25 , 36 ;
їх сума ∑ ( x i − x ˉ ) 2 = 128 \sum (x_i - \bar{x})^2 = 128 ∑ ( x i − x ˉ ) 2 = 128 . Тоді
s 2 = 128 n − 1 = 128 8 = 16 , s = 16 = 4. s^2 = \frac{128}{n - 1} = \frac{128}{8} = 16, \qquad s = \sqrt{16} = 4.
s 2 = n − 1 128 = 8 128 = 16 , s = 16 = 4.
(в) ДІ для математичного сподівання (α = 0.05 \alpha = 0.05 α = 0.05 , невідома σ \sigma σ ).
Ступенів свободи n − 1 = 8 n - 1 = 8 n − 1 = 8 ; критичне значення t 0.025 , 8 = 2.3060 t_{0.025,\,8} = 2.3060 t 0.025 , 8 = 2.3060 .
Похибка
E = t 0.025 , 8 s n = 2.3060 ⋅ 4 9 = 2.3060 ⋅ 4 3 ≈ 3.075. E = t_{0.025,\,8}\,\frac{s}{\sqrt{n}} = 2.3060\cdot \frac{4}{\sqrt{9}} = 2.3060\cdot \frac{4}{3} \approx 3.075.
E = t 0.025 , 8 n s = 2.3060 ⋅ 9 4 = 2.3060 ⋅ 3 4 ≈ 3.075.
Отже, 95 % 95\% 95% ДІ для μ \mu μ :
10 ± 3.075 ⇒ ( 6.925 ; 13.075 ) . 10 \pm 3.075 \ \Rightarrow\ (6.925;\ 13.075).
10 ± 3.075 ⇒ ( 6.925 ; 13.075 ) .
(г) ДІ для дисперсії (α = 0.05 \alpha = 0.05 α = 0.05 , n − 1 = 8 n - 1 = 8 n − 1 = 8 ). Критичні значення
χ 0.025 , 8 2 = 17.5345 \chi^2_{0.025,\,8} = 17.5345 χ 0.025 , 8 2 = 17.5345 і χ 0.975 , 8 2 = 2.1797 \chi^2_{0.975,\,8} = 2.1797 χ 0.975 , 8 2 = 2.1797 ; чисельник
( n − 1 ) s 2 = 8 ⋅ 16 = 128 (n-1)s^2 = 8\cdot 16 = 128 ( n − 1 ) s 2 = 8 ⋅ 16 = 128 . Тоді
( 128 17.5345 , 128 2.1797 ) = ( 7.30 ; 58.72 ) для σ 2 , ( 7.30 ; 58.72 ) = ( 2.70 ; 7.66 ) для σ . \left( \frac{128}{17.5345},\ \frac{128}{2.1797} \right) = (7.30;\ 58.72) \quad \text{для } \sigma^2, \qquad (\sqrt{7.30};\ \sqrt{58.72}) = (2.70;\ 7.66) \quad \text{для } \sigma.
( 17.5345 128 , 2.1797 128 ) = ( 7.30 ; 58.72 ) для σ 2 , ( 7.30 ; 58.72 ) = ( 2.70 ; 7.66 ) для σ .
Інтервал для дисперсії явно несиметричний відносно s 2 = 16 s^2 = 16 s 2 = 16 — така природа
розподілу χ 2 \chi^2 χ 2 .
2.9 Робочий контрольний список
Спершу впорядкуйте вибірку — це потрібно для медіани та квартилів.
Дисперсію рахуйте через суми: s 2 = ( ∑ x i 2 − n x ˉ 2 ) / ( n − 1 ) s^2 = \big(\sum x_i^2 - n\bar{x}^2\big)/(n-1) s 2 = ( ∑ x i 2 − n x ˉ 2 ) / ( n − 1 ) —
один прохід по даних.
Перед побудовою ДІ переконайтесь, що взяли правильний критичний розподіл:
Стьюдента (з n − 1 n - 1 n − 1 ст. св.) для μ \mu μ при невідомій σ \sigma σ ; χ 2 \chi^2 χ 2 (з
n − 1 n - 1 n − 1 ст. св.) для σ 2 \sigma^2 σ 2 .
Для χ 2 \chi^2 χ 2 -інтервалу не переплутайте хвости: більше критичне значення —
у знаменнику нижньої межі.
Значення α \alpha α беріть лише з дозволених: 0.05 0.05 0.05 , 0.01 0.01 0.01 , 0.1 0.1 0.1 .
Laboratory/Laboratory3/2method.md · 8.8 KB · updated 2026-08-04 23:32