Лекція 1. Базові поняття аналітики даних. Ймовірнісний підхід
Огляд
Аналітика даних (data analytics) та інтелектуальний аналіз даних (data mining) — це дисципліни про здобуття корисних знань із даних: закономірностей, залежностей, груп, прогнозів. Дані майже завжди містять випадковість — шум вимірювань, природну мінливість, неповноту. Тому мовою, якою описують дані й міркують про них, є теорія ймовірностей. Перш ніж класифікувати об’єкти, шукати кластери чи будувати регресії, треба навчитися вимірювати невизначеність.
У цьому вступному розділі ми вводимо базові поняття курсу: що таке дані та які бувають типи змінних; далі будуємо апарат теорії ймовірностей — події, класична ймовірність, умовна ймовірність, теореми додавання та множення, формула повної ймовірності й теорема Байєса (яка ще повернеться в Лекції 8 як окремий метод класифікації). Потім пригадуємо комбінаторику (перестановки, розміщення, сполучення), потрібну, щоб лічити рівноможливі наслідки, і завершуємо статистичною ймовірністю та законом великих чисел — містком, що дозволяє оцінювати ймовірності за даними.
Практичний бік. Комбінаторні задачі за варіантами ви розв’язуватимете в Лабораторній роботі 1; класичну ймовірність і теорему Байєса — там само в аудиторній частині.
1.1 Дані та типи змінних
Означення (дані). Дані (data) — це зафіксовані значення ознак об’єктів (спостережень). Таблиця даних складається з рядків (об’єкти, англ. observations, records) і стовпців (ознаки, англ. features, variables, attributes).
Тип ознаки визначає, які операції та методи до неї застосовні:
- Якісні (категоріальні) змінні:
- номінальні (nominal) — назви без порядку: колір, місто, стать;
- порядкові (ordinal) — є природний порядок, але не відстань: оцінка «низький / середній / високий», рейтинг.
- Кількісні (числові) змінні:
- дискретні (discrete) — окремі значення, зазвичай цілі: кількість покупок;
- неперервні (continuous) — будь-яке значення з проміжку: зріст, час.
За шкалою вимірювання розрізняють номінальну, порядкову, інтервальну (є відстань, немає абсолютного нуля: температура за Цельсієм) та шкалу відношень (є абсолютний нуль: маса, довжина).
Типова помилка (числовий код ≠ кількісна змінна). Якщо міста закодувати числами , це не робить змінну кількісною: середнє «місто » позбавлене сенсу. Кодування категорій числами не додає їм порядку чи відстані.
Правильне визначення типу змінної — перший крок будь-якого аналізу: від нього залежить і візуалізація (Лекція 3), і вибір методу класифікації чи кластеризації.

1.2 Події та класична ймовірність
Випадковий експеримент — це дослід із кількома можливими наслідками, який (у принципі) можна повторювати. Множину всіх елементарних наслідків позначають (простір наслідків).
Означення (подія). Подія — це підмножина простору наслідків . Кажуть, що подія настала, якщо наслідок експерименту належить . Достовірна подія — це , неможлива — порожня множина .
Означення (класична ймовірність). Якщо всі елементарних наслідків рівноможливі, то ймовірність події , якій сприяють наслідків, дорівнює
Звідси одразу: , , .
Приклад 1.1. Кидаємо два гральні кубики. Простір має рівноможливих наслідків. Подія — «сума очок дорівнює » — настає для пар , тобто . Отже, .

1.3 Протилежна подія
Означення (протилежна подія). Протилежною до називають подію (« не настала»). Оскільки і разом покривають й не перетинаються,
Перехід до протилежної події часто спрощує підрахунок: імовірність «хоча б одного» зручно рахувати через «жодного».

Приклад 1.2. Кидаємо монету рази; знайти ймовірність «випаде хоча б один орел». Простір: наслідків. Протилежна подія — «жодного орла» (усі решки) — має наслідок, тож , а .
1.4 Операції над подіями та теорема додавання
Події можна комбінувати як множини: сума (« або »), добуток (« і »). Події несумісні (взаємовиключні), якщо .
Теорема (додавання ймовірностей). Для будь-яких подій
Для несумісних подій () — просто .
Спільну частину віднімають, щоб не полічити її двічі (той самий принцип включення-виключення, що й для множин).
Приклад 1.3. З колоди карт витягають одну. Подія — «король» (), подія — «черва» (); їхній перетин — «король черв» (). Тоді .

1.5 Умовна ймовірність і теорема множення
Означення (умовна ймовірність). Імовірність події за умови, що сталася подія (з ):

Умова «звужує» простір наслідків до . Звідси теорема множення:
Означення (незалежність). Події і незалежні, якщо настання однієї не змінює ймовірності іншої: , що рівносильно
Незалежність — ключове (і часто ідеалізоване) припущення: саме на ньому будується наївний баєсів класифікатор (Лекція 8).
Приклад 1.4. В урні білі та чорних куль. Витягають дві кулі поспіль без повернення. Імовірність, що обидві білі: . Без повернення події залежні: друга ймовірність змінилася з на .
1.6 Формула повної ймовірності та теорема Байєса
Нехай гіпотези утворюють повну групу несумісних подій (одна з них неодмінно настає, разом вони дають ). Тоді для будь-якої події :
Формула повної ймовірності.
Вона «збирає» ймовірність з усіх сценаріїв. Обернена задача — за наслідком переоцінити ймовірність гіпотези — розв’язується теоремою Байєса:
Теорема Байєса.
— апріорна ймовірність (до спостереження), — апостеріорна (після спостереження ).
Приклад 1.5 (тест на захворювання). Хворобу має населення: . Тест виявляє хворобу з імовірністю , але дає хибнопозитивний результат . Яка ймовірність хвороби при позитивному тесті?
Попри «точний» тест, апостеріорна ймовірність — лише : рідкісна хвороба + хибні спрацювання дають багато хибнопозитивних. Це фундаментальний для аналітики ефект, який ми ще побачимо в оцінюванні класифікаторів (Лекція 6).

1.7 Елементи комбінаторики
Щоб застосувати класичну ймовірність, треба вміти лічити наслідки. Два базові правила:
- Правило добутку: якщо перший вибір можна зробити способами, а (для кожного) другий — способами, то разом — способів.
- Правило суми: якщо вибір можна зробити або способами, або (несумісно) способами, то разом — способів.
Три класичні схеми вибору елементів із :
| Схема | Порядок важливий? | Формула |
|---|---|---|
| Перестановки (усіх елементів) | так | |
| Розміщення (вибір із , без повернення) | так | |
| Сполучення (вибір із , без повернення) | ні |
Коли елементи можна повторювати (вибір із поверненням): упорядкований вибір із — це ; кількість сполучень із повтореннями — .

Приклад 1.6 (правило добутку). Номер авто — літери (з алфавіту у літер) і цифри. Різних номерів: .
Приклад 1.7 (перестановки). П’ять різних книжок на полиці можна розставити способами.
Приклад 1.8 (розміщення). У команді з гравців обрати капітана та заступника (порядок важливий): .
Приклад 1.9 (сполучення). Обрати фарби із (порядок неважливий): .
Типова помилка (розміщення проти сполучень). Головне питання — чи важливий порядок. «Капітан і заступник» — порядок важливий (розміщення); «команда з двох» — неважливий (сполучення). Плутанина цих двох схем — найчастіша помилка в комбінаторних задачах.
1.8 Статистична ймовірність і закон великих чисел
Класична ймовірність вимагає рівноможливих наслідків — це рідкість для реальних даних. Тоді ймовірність оцінюють емпірично.
Означення (статистична ймовірність, відносна частота). Якщо в випробуваннях подія настала разів, її відносна частота — . При зростанні відносна частота стабілізується біля деякого числа, яке й приймають за статистичну ймовірність події.
Закон великих чисел (наслідок для частот, теорема Бернуллі). Відносна частота події при необмеженому зростанні числа незалежних випробувань прямує (за ймовірністю) до її ймовірності:

Це — теоретичне обґрунтування всієї аналітики даних: саме тому за вибіркою можна оцінювати характеристики генеральної сукупності (Лекція 3), а частоти в навчальній вибірці слугують оцінками ймовірностей у класифікаторах (Лекція 8). Без закону великих чисел «навчання на даних» не мало б сенсу.
Застосування в аналітиці даних
- Оцінювання за даними. Закон великих чисел дозволяє замінювати невідомі ймовірності відносними частотами — основа статистичного оцінювання.
- Теорема Байєса — не лише формула, а й окремий метод класифікації (Лекція 8) та фільтрації спаму.
- Комбінаторика дає розмір простору можливостей — від числа конфігурацій моделі до складності повного перебору в кластеризації (число Стірлінга, Лекція 9).
- Типи змінних визначають придатні візуалізації, метрики відстані (Лекція 6) та критерії розбиття в деревах рішень (Лекція 7).
Підсумок
- Дані — значення ознак об’єктів; ознаки бувають якісні (номінальні, порядкові) та кількісні (дискретні, неперервні). Числовий код категорії не робить її кількісною.
- Класична ймовірність для рівноможливих наслідків; , .
- Додавання: .
- Умовна ймовірність ; множення ; незалежність .
- Повна ймовірність і теорема Байєса (апріорна → апостеріорна).
- Комбінаторика: правила суми й добутку; ; ; ; з повтореннями — .
- Статистична ймовірність — відносна частота; закон великих чисел обґрунтовує оцінювання ймовірностей за даними.
Вправи
Для розігріву
- Класифікуйте як номінальну / порядкову / дискретну / неперервну: колір очей; оцінка «A/B/C»; кількість дітей; час реакції; поштовий індекс.
- Кидають один кубик. Знайдіть , , .
- Обчисліть , , .
Стандартні
- У групі студентів; вивчають Python, — SQL, — обидві мови. Знайдіть імовірність, що навмання обраний студент вивчає хоча б одну з мов.
- Дві машини виробляють і деталей; частка браку — і відповідно. Навмання взята деталь виявилася бракованою. Скориставшись теоремою Байєса, знайдіть імовірність, що її виготовила друга машина.
- Скількома способами книжок розставити на полиці? Скількома способами обрати з них для подарунка? Поясніть, чому відповіді різні (порядок).
Підвищеної складності
- Доведіть формулу повної ймовірності, спираючись на теорему множення та несумісність гіпотез .
- У задачі про тест на захворювання (Приклад 1.5) знайдіть, за якої поширеності апостеріорна ймовірність перевищить . Прокоментуйте результат для рідкісних хвороб.