# Лекція 1. Базові поняття аналітики даних. Ймовірнісний підхід ## Огляд **Аналітика даних** (data analytics) та **інтелектуальний аналіз даних** (data mining) — це дисципліни про здобуття корисних знань із даних: закономірностей, залежностей, груп, прогнозів. Дані майже завжди містять **випадковість** — шум вимірювань, природну мінливість, неповноту. Тому мовою, якою описують дані й міркують про них, є **теорія ймовірностей**. Перш ніж класифікувати об'єкти, шукати кластери чи будувати регресії, треба навчитися **вимірювати невизначеність**. У цьому вступному розділі ми вводимо базові поняття курсу: що таке **дані** та які бувають **типи змінних**; далі будуємо апарат теорії ймовірностей — **події**, **класична ймовірність**, **умовна ймовірність**, теореми **додавання** та **множення**, формула **повної ймовірності** й **теорема Байєса** (яка ще повернеться в [Лекції 8](DA-L08.md) як окремий метод класифікації). Потім пригадуємо **комбінаторику** (перестановки, розміщення, сполучення), потрібну, щоб лічити рівноможливі наслідки, і завершуємо **статистичною ймовірністю** та **законом великих чисел** — містком, що дозволяє оцінювати ймовірності за даними. > **Практичний бік.** Комбінаторні задачі за варіантами ви розв'язуватимете в > [Лабораторній роботі 1](../Laboratory/Laboratory1/main.md); класичну ймовірність > і теорему Байєса — там само в аудиторній частині. --- ## 1.1 Дані та типи змінних > **Означення (дані).** **Дані** (data) — це зафіксовані значення ознак > **об'єктів** (спостережень). Таблиця даних складається з **рядків** (об'єкти, > англ. *observations, records*) і **стовпців** (ознаки, англ. *features, > variables, attributes*). Тип ознаки визначає, які операції та методи до неї застосовні: - **Якісні (категоріальні)** змінні: - **номінальні** (nominal) — назви без порядку: колір, місто, стать; - **порядкові** (ordinal) — є природний порядок, але не відстань: оцінка «низький / середній / високий», рейтинг. - **Кількісні (числові)** змінні: - **дискретні** (discrete) — окремі значення, зазвичай цілі: кількість покупок; - **неперервні** (continuous) — будь-яке значення з проміжку: зріст, час. За **шкалою вимірювання** розрізняють номінальну, порядкову, інтервальну (є відстань, немає абсолютного нуля: температура за Цельсієм) та шкалу відношень (є абсолютний нуль: маса, довжина). > **Типова помилка (числовий код ≠ кількісна змінна).** Якщо міста закодувати > числами $1, 2, 3$, це **не** робить змінну кількісною: середнє «місто $= 1.7$» > позбавлене сенсу. Кодування категорій числами не додає їм порядку чи відстані. Правильне визначення типу змінної — перший крок будь-якого аналізу: від нього залежить і візуалізація (Лекція 3), і вибір методу класифікації чи кластеризації. ![Ієрархія типів змінних: якісні (номінальні, порядкові) та кількісні (дискретні, неперервні)](img/l01_variable_types.png) --- ## 1.2 Події та класична ймовірність **Випадковий експеримент** — це дослід із кількома можливими наслідками, який (у принципі) можна повторювати. Множину всіх елементарних наслідків позначають $\Omega$ (простір наслідків). > **Означення (подія).** **Подія** $A$ — це підмножина простору наслідків > $A \subseteq \Omega$. Кажуть, що подія **настала**, якщо наслідок експерименту > належить $A$. **Достовірна** подія — це $\Omega$, **неможлива** — порожня > множина $\varnothing$. > **Означення (класична ймовірність).** Якщо всі $n = |\Omega|$ елементарних > наслідків **рівноможливі**, то ймовірність події $A$, якій сприяють $m = |A|$ > наслідків, дорівнює > $$ P(A) = \frac{m}{n} = \frac{\text{кількість сприятливих наслідків}}{\text{загальна кількість наслідків}}. $$ Звідси одразу: $0 \le P(A) \le 1$, $\ P(\varnothing) = 0$, $\ P(\Omega) = 1$. **Приклад 1.1.** Кидаємо два гральні кубики. Простір має $n = 6 \cdot 6 = 36$ рівноможливих наслідків. Подія $A$ — «сума очок дорівнює $7$» — настає для пар $(1,6), (2,5), (3,4), (4,3), (5,2), (6,1)$, тобто $m = 6$. Отже, $P(A) = 6/36 = 1/6$. ![Таблиця 6×6 наслідків для двох кубиків із виділеними шістьма клітинками, де сума очок дорівнює 7](img/l01_dice_sample_space.png) --- ## 1.3 Протилежна подія > **Означення (протилежна подія).** **Протилежною** до $A$ називають подію > $\bar{A}$ («$A$ не настала»). Оскільки $A$ і $\bar{A}$ разом покривають $\Omega$ > й не перетинаються, > $$ P(\bar{A}) = 1 - P(A). $$ Перехід до протилежної події часто спрощує підрахунок: імовірність «хоча б одного» зручно рахувати через «жодного». ![Діаграма Венна: протилежна подія як заштрихована область простору поза колом події A](img/l01_complement.png) **Приклад 1.2.** Кидаємо монету $3$ рази; знайти ймовірність «випаде хоча б один орел». Простір: $2^3 = 8$ наслідків. Протилежна подія — «жодного орла» (усі решки) — має $1$ наслідок, тож $P(\bar{A}) = 1/8$, а $P(A) = 1 - 1/8 = 7/8$. --- ## 1.4 Операції над подіями та теорема додавання Події можна комбінувати як множини: **сума** $A \cup B$ («$A$ **або** $B$»), **добуток** $A \cap B$ («$A$ **і** $B$»). Події **несумісні** (взаємовиключні), якщо $A \cap B = \varnothing$. > **Теорема (додавання ймовірностей).** Для будь-яких подій > $$ P(A \cup B) = P(A) + P(B) - P(A \cap B). $$ > Для **несумісних** подій ($A \cap B = \varnothing$) — просто > $P(A \cup B) = P(A) + P(B)$. Спільну частину віднімають, щоб не полічити її двічі (той самий принцип включення-виключення, що й для множин). **Приклад 1.3.** З колоди $52$ карт витягають одну. Подія $A$ — «король» ($P(A) = 4/52$), подія $B$ — «черва» ($P(B) = 13/52$); їхній перетин — «король черв» ($P(A \cap B) = 1/52$). Тоді $P(A \cup B) = \dfrac{4}{52} + \dfrac{13}{52} - \dfrac{1}{52} = \dfrac{16}{52} = \dfrac{4}{13}$. ![Діаграма Венна об'єднання подій A і B на прикладі колоди карт: 3, 1 та 12 у відповідних областях](img/l01_venn_addition.png) --- ## 1.5 Умовна ймовірність і теорема множення > **Означення (умовна ймовірність).** Імовірність події $A$ **за умови**, що > сталася подія $B$ (з $P(B) > 0$): > $$ P(A \mid B) = \frac{P(A \cap B)}{P(B)}. $$ ![Дві діаграми Венна: повний простір та його звуження до події B для умовної ймовірності](img/l01_conditional.png) Умова $B$ «звужує» простір наслідків до $B$. Звідси **теорема множення**: $$ P(A \cap B) = P(B)\, P(A \mid B) = P(A)\, P(B \mid A). $$ > **Означення (незалежність).** Події $A$ і $B$ **незалежні**, якщо настання > однієї не змінює ймовірності іншої: $P(A \mid B) = P(A)$, що рівносильно > $$ P(A \cap B) = P(A)\, P(B). $$ Незалежність — ключове (і часто ідеалізоване) припущення: саме на ньому будується **наївний** баєсів класифікатор ([Лекція 8](DA-L08.md)). **Приклад 1.4.** В урні $3$ білі та $7$ чорних куль. Витягають **дві** кулі поспіль **без повернення**. Імовірність, що обидві білі: $P = P(\text{1-ша біла}) \cdot P(\text{2-га біла} \mid \text{1-ша біла}) = \dfrac{3}{10} \cdot \dfrac{2}{9} = \dfrac{6}{90} = \dfrac{1}{15}$. Без повернення події залежні: друга ймовірність змінилася з $3/10$ на $2/9$. --- ## 1.6 Формула повної ймовірності та теорема Байєса Нехай **гіпотези** $H_1, H_2, \dots, H_k$ утворюють **повну групу** несумісних подій (одна з них неодмінно настає, разом вони дають $\Omega$). Тоді для будь-якої події $A$: > **Формула повної ймовірності.** > $$ P(A) = \sum_{i=1}^{k} P(H_i)\, P(A \mid H_i). $$ Вона «збирає» ймовірність $A$ з усіх сценаріїв. Обернена задача — за наслідком $A$ переоцінити ймовірність гіпотези — розв'язується **теоремою Байєса**: > **Теорема Байєса.** > $$ P(H_i \mid A) = \frac{P(H_i)\, P(A \mid H_i)}{\sum_{j=1}^{k} P(H_j)\, P(A \mid H_j)} = \frac{P(H_i)\, P(A \mid H_i)}{P(A)}. $$ > $P(H_i)$ — **апріорна** ймовірність (до спостереження), $P(H_i \mid A)$ — > **апостеріорна** (після спостереження $A$). **Приклад 1.5 (тест на захворювання).** Хворобу має $1\%$ населення: $P(H) = 0.01$. Тест виявляє хворобу з імовірністю $P(+ \mid H) = 0.95$, але дає хибнопозитивний результат $P(+ \mid \bar{H}) = 0.05$. Яка ймовірність хвороби при позитивному тесті? $$ P(H \mid +) = \frac{0.01 \cdot 0.95}{0.01 \cdot 0.95 + 0.99 \cdot 0.05} = \frac{0.0095}{0.0095 + 0.0495} = \frac{0.0095}{0.059} \approx 0.161. $$ Попри «точний» тест, апостеріорна ймовірність — лише $\approx 16\%$: рідкісна хвороба + хибні спрацювання дають багато хибнопозитивних. Це фундаментальний для аналітики ефект, який ми ще побачимо в оцінюванні класифікаторів (Лекція 6). ![Дерево ймовірностей для тесту на захворювання з гілками до позитивного і негативного результату](img/l01_bayes_tree.png) --- ## 1.7 Елементи комбінаторики Щоб застосувати класичну ймовірність, треба вміти **лічити** наслідки. Два базові правила: - **Правило добутку:** якщо перший вибір можна зробити $n_1$ способами, а (для кожного) другий — $n_2$ способами, то разом — $n_1 \cdot n_2$ способів. - **Правило суми:** якщо вибір можна зробити або $n_1$ способами, або (несумісно) $n_2$ способами, то разом — $n_1 + n_2$ способів. Три класичні схеми вибору $k$ елементів із $n$: | Схема | Порядок важливий? | Формула | |---|:--:|---| | **Перестановки** $P_n$ (усіх $n$ елементів) | так | $P_n = n!$ | | **Розміщення** $A_n^k$ (вибір $k$ із $n$, без повернення) | так | $A_n^k = \dfrac{n!}{(n-k)!}$ | | **Сполучення** $C_n^k$ (вибір $k$ із $n$, без повернення) | ні | $C_n^k = \dbinom{n}{k} = \dfrac{n!}{k!\,(n-k)!}$ | Коли елементи можна **повторювати** (вибір із поверненням): упорядкований вибір $k$ із $n$ — це $n^k$; кількість сполучень із повтореннями — $C_{n+k-1}^{k}$. ![Схема 2×2 комбінаторних формул за ознаками порядку та повторень](img/l01_combinatorics.png) **Приклад 1.6 (правило добутку).** Номер авто — $4$ літери (з алфавіту у $12$ літер) і $4$ цифри. Різних номерів: $12^4 \cdot 10^4 = 20736 \cdot 10000 = 207\,360\,000$. **Приклад 1.7 (перестановки).** П'ять різних книжок на полиці можна розставити $P_5 = 5! = 120$ способами. **Приклад 1.8 (розміщення).** У команді з $11$ гравців обрати **капітана** та **заступника** (порядок важливий): $A_{11}^2 = \dfrac{11!}{9!} = 11 \cdot 10 = 110$. **Приклад 1.9 (сполучення).** Обрати $4$ фарби із $7$ (порядок неважливий): $C_7^4 = \dfrac{7!}{4!\,3!} = 35$. > **Типова помилка (розміщення проти сполучень).** Головне питання — **чи > важливий порядок**. «Капітан і заступник» — порядок важливий (розміщення); > «команда з двох» — неважливий (сполучення). Плутанина цих двох схем — найчастіша > помилка в комбінаторних задачах. --- ## 1.8 Статистична ймовірність і закон великих чисел Класична ймовірність вимагає **рівноможливих** наслідків — це рідкість для реальних даних. Тоді ймовірність оцінюють **емпірично**. > **Означення (статистична ймовірність, відносна частота).** Якщо в $n$ > випробуваннях подія $A$ настала $m$ разів, її **відносна частота** — > $W(A) = m/n$. При зростанні $n$ відносна частота стабілізується біля деякого > числа, яке й приймають за **статистичну ймовірність** події. > **Закон великих чисел (наслідок для частот, теорема Бернуллі).** Відносна > частота події при необмеженому зростанні числа незалежних випробувань прямує > (за ймовірністю) до її ймовірності: > $$ W(A) = \frac{m}{n} \xrightarrow[n \to \infty]{} P(A). $$ ![Графік відносної частоти орлів у трьох серіях кидків монети, що прямує до 0.5 зі зростанням n](img/l01_lln.png) Це — **теоретичне обґрунтування всієї аналітики даних**: саме тому за **вибіркою** можна оцінювати характеристики **генеральної сукупності** (Лекція 3), а частоти в навчальній вибірці слугують оцінками ймовірностей у класифікаторах (Лекція 8). Без закону великих чисел «навчання на даних» не мало б сенсу. --- ## Застосування в аналітиці даних - **Оцінювання за даними.** Закон великих чисел дозволяє замінювати невідомі ймовірності відносними частотами — основа статистичного оцінювання. - **Теорема Байєса** — не лише формула, а й окремий метод класифікації (Лекція 8) та фільтрації спаму. - **Комбінаторика** дає розмір простору можливостей — від числа конфігурацій моделі до складності повного перебору в кластеризації (число Стірлінга, Лекція 9). - **Типи змінних** визначають придатні візуалізації, метрики відстані (Лекція 6) та критерії розбиття в деревах рішень (Лекція 7). ## Підсумок - **Дані** — значення **ознак** об'єктів; ознаки бувають **якісні** (номінальні, порядкові) та **кількісні** (дискретні, неперервні). Числовий код категорії не робить її кількісною. - **Класична ймовірність** $P(A) = m/n$ для рівноможливих наслідків; $0 \le P(A) \le 1$, $P(\bar{A}) = 1 - P(A)$. - **Додавання:** $P(A \cup B) = P(A) + P(B) - P(A \cap B)$. - **Умовна ймовірність** $P(A \mid B) = P(A \cap B)/P(B)$; **множення** $P(A \cap B) = P(B)P(A \mid B)$; **незалежність** $P(A \cap B) = P(A)P(B)$. - **Повна ймовірність** $P(A) = \sum P(H_i)P(A \mid H_i)$ і **теорема Байєса** $P(H_i \mid A) = P(H_i)P(A \mid H_i)/P(A)$ (апріорна → апостеріорна). - **Комбінаторика:** правила суми й добутку; $P_n = n!$; $A_n^k = n!/(n-k)!$; $C_n^k = n!/(k!(n-k)!)$; з повтореннями — $n^k$. - **Статистична ймовірність** — відносна частота; **закон великих чисел** обґрунтовує оцінювання ймовірностей за даними. ## Вправи ### Для розігріву 1. Класифікуйте як номінальну / порядкову / дискретну / неперервну: колір очей; оцінка «A/B/C»; кількість дітей; час реакції; поштовий індекс. 2. Кидають один кубик. Знайдіть $P(\text{парне})$, $P(\text{більше } 4)$, $P(\text{парне або більше } 4)$. 3. Обчисліть $P_4$, $A_6^2$, $C_6^2$. ### Стандартні 4. У групі $25$ студентів; $15$ вивчають Python, $12$ — SQL, $7$ — обидві мови. Знайдіть імовірність, що навмання обраний студент вивчає **хоча б одну** з мов. 5. Дві машини виробляють $60\%$ і $40\%$ деталей; частка браку — $2\%$ і $5\%$ відповідно. Навмання взята деталь виявилася бракованою. Скориставшись теоремою Байєса, знайдіть імовірність, що її виготовила **друга** машина. 6. Скількома способами $10$ книжок розставити на полиці? Скількома способами обрати з них $3$ для подарунка? Поясніть, чому відповіді різні (порядок). ### Підвищеної складності 7. Доведіть формулу повної ймовірності, спираючись на теорему множення та несумісність гіпотез $H_1, \dots, H_k$. 8. У задачі про тест на захворювання (Приклад 1.5) знайдіть, за якої поширеності $P(H)$ апостеріорна ймовірність $P(H \mid +)$ перевищить $0.5$. Прокоментуйте результат для рідкісних хвороб.