# Аналітика даних — Лекції Лекційна складова дисципліни **«Аналітика даних»** (українська мова навчання). Файли `DA-L.md` — це **самодостатні конспекти підручникового типу**: мотивація, означення, формули з виведенням, покрокові приклади обчислень, псевдокод алгоритмів, зауваження, типові помилки, застосування, підсумок і вправи — по одному розділу на лекцію. Курс має **14 лекційних занять** (по 2 год), згрупованих у 6 змістових модулів (лекції **1–14**). ## Розташування Тут лежать розділи `DA-L01.md … DA-L14.md` та презентації в [`Slides/`](Slides/) — `DA-L01.pptx … DA-L14.pptx` (по одній на лекцію). Номер розділу збігається з номером лекції та відповідної лабораторної роботи. > **Ілюстрації.** Курс на цьому етапі — **текст-перш**: діаграми (розподіли, > діаграми розсіювання, дерева рішень, дендрограми тощо) додаватимуться окремим > проходом у теку `img/`. Наведені у конспектах таблиці, формули та покрокові > приклади самодостатні й не потребують рисунків для розуміння. ## Зміст ### Модуль 1 — Вступ до інтелектуального аналізу даних | № | Назва | Фокус | |:--:|---|---| | 1 | [Базові поняття аналітики даних](DA-L01.md) | дані та типи змінних; події, ймовірність, умовна ймовірність; теореми множення, Байєса й додавання; перестановки, розміщення, сполучення; статистична ймовірність і закон великих чисел | | 2 | [Аналіз ймовірнісних даних](DA-L02.md) | випадкові величини; функція розподілу та щільність; математичне сподівання й дисперсія; розподіли Бернуллі, біноміальний, рівномірний, нормальний (правило $3\sigma$); розподіли $\chi^2$, Стьюдента, Фішера | ### Модуль 2 — Математична статистика | № | Назва | Фокус | |:--:|---|---| | 3 | [Статистичний аналіз та візуалізація даних](DA-L03.md) | типи вибірок; візуалізація; варіаційний ряд; середнє, мода, медіана; квантилі та міжквартильний розмах; статистичні оцінки та їх властивості; вибіркова дисперсія, ступені свободи; довірчі інтервали | | 4 | [Перевірка статистичних гіпотез](DA-L04.md) | статистична гіпотеза, $H_0/H_1$; помилки I та II роду; рівень значущості й критична область; алгоритм перевірки; критерії для середнього, дисперсії, рівності дисперсій ($F$) та середніх ($t$), частки | | 5 | [Регресійний та кореляційний аналіз](DA-L05.md) | двовимірна статистика; таблиці спряженості; критерій згоди Пірсона; коефіцієнт кореляції; метод найменших квадратів; лінійна регресія; коефіцієнт детермінації; дисперсійний аналіз; фіктивні змінні | ### Модуль 3 — Методи класифікації | № | Назва | Фокус | |:--:|---|---| | 6 | [Класифікація. Метод $k$ найближчих сусідів](DA-L06.md) | класифікація та машинне навчання; типи навчання й класифікацій; тренувальна й тестова множини; матриця невідповідності, точність, повнота, $F$-міра, MCC; kNN, функції відстані, вплив $k$, зважений kNN | | 7 | [Ординарні методи класифікації. Дерева рішень](DA-L07.md) | алгоритм One Rule; дерева рішень; ентропія та ID3; приріст інформації (C4.5); індекс Джині (CART) | | 8 | [Ймовірнісні методи класифікації](DA-L08.md) | наївний баєсів класифікатор; апостеріорна ймовірність; оцінка ймовірностей з вибірки; проблеми (залежність атрибутів, нульові ймовірності); адитивне згладжування; баєсів спам-фільтр | ### Модуль 4 — Методи категоризації (кластеризації) | № | Назва | Фокус | |:--:|---|---| | 9 | [Задачі кластеризації. Метод $k$-середніх](DA-L09.md) | задача кластеризації; число Стірлінга й переборна складність; класи методів; функції відстані; $k$-середніх і сума квадратів помилок; критерій збіжності; нечіткий $c$-середніх | | 10 | [Ієрархічні методи кластеризації](DA-L10.md) | вкладені групування й дендрограма; агломеративний алгоритм; метрики зв'язку (одиночний, повний, середній, Варда); поділяючий алгоритм (DIANA); оцінка якості (індекс Данна, силует) | ### Модуль 5 — Асоціативні правила | № | Назва | Фокус | |:--:|---|---| | 11 | [Пошук асоціативних правил](DA-L11.md) | транзакційна база даних; асоціативне правило; підтримка, достовірність, підйом, переконливість; відбір цікавих правил; алгоритми Apriori та Eclat | | 12 | [Алгоритм FP-Growth](DA-L12.md) | обмеження Apriori; FP-дерево та заголовна таблиця; умовні бази образів і умовні FP-дерева; рекурсивний видобуток частих наборів без кандидатів; порівняння Apriori / Eclat / FP-Growth | ### Модуль 6 — Розширені методи аналітики даних | № | Назва | Фокус | |:--:|---|---| | 13 | [Зменшення розмірності. Метод головних компонент (PCA)](DA-L13.md) | прокляття розмірності; відбір vs виділення ознак; коваріаційна матриця; власні вектори й значення; головні компоненти; частка поясненої дисперсії; вибір числа компонент | | 14 | [Аналіз часових рядів](DA-L14.md) | компоненти ряду (тренд, сезонність, шум); ковзне середнє; експоненційне згладжування; автокореляція; прогнозування; оцінка похибки (MAE, RMSE, MAPE) | ## Як користуватися Опрацьовуйте розділи послідовно — кожен спирається на попередні (зокрема весь курс тримається на ймовірності й статистиці лекцій 1–5). Означення подано **напівжирним**; ключові результати оформлені як **Означення / Теореми / Властивості**. Кожну лекцію завершено підсумком і вправами; після лекції виконують **лабораторну роботу з тим самим номером**. ## Швидкий довідник позначень | Символ | Значення | | Символ | Значення | |:--:|---|---|:--:|---| | $P(A)$ | ймовірність події $A$ | | $\bar{x},\ s^2,\ s$ | вибіркові середнє, дисперсія, СКВ | | $P(A\mid B)$ | умовна ймовірність | | $\mu,\ \sigma^2,\ \sigma$ | генеральні середнє, дисперсія, СКВ | | $C_n^k=\binom{n}{k}$ | сполучення | | $H_0,\ H_1$ | основна й альтернативна гіпотези | | $A_n^k$ | розміщення | | $\alpha$ | рівень значущості | | $P_n=n!$ | перестановки | | $\hat{y},\ R^2$ | прогноз, коефіцієнт детермінації | | $M(X),\ D(X)$ | сподівання, дисперсія | | $r$ | коефіцієнт кореляції | | $F(x),\ f(x)$ | функція розподілу, щільність | | $d(x,y)$ | відстань між об'єктами | | $N(\mu,\sigma^2)$ | нормальний розподіл | | $H(D)$ | ентропія множини $D$ | | $\chi^2,\ t,\ F$ | розподіли Пірсона, Стьюдента, Фішера | | $\text{supp},\ \text{conf}$ | підтримка, достовірність правила | ## Додаткова література - Han J., Kamber M., Pei J. *Data Mining: Concepts and Techniques*. - James G., Witten D., Hastie T., Tibshirani R. *An Introduction to Statistical Learning*. - Гмурман В. Є. *Теорія ймовірностей і математична статистика*.