Аналітика даних — Лекції
Лекційна складова дисципліни «Аналітика даних» (українська мова навчання).
Файли DA-L<NN>.md — це самодостатні конспекти підручникового типу:
мотивація, означення, формули з виведенням, покрокові приклади обчислень,
псевдокод алгоритмів, зауваження, типові помилки, застосування, підсумок і
вправи — по одному розділу на лекцію. Курс має 14 лекційних занять (по 2
год), згрупованих у 6 змістових модулів (лекції 1–14).
Розташування
Тут лежать розділи DA-L01.md … DA-L14.md та презентації в
Slides/ — DA-L01.pptx … DA-L14.pptx (по одній на лекцію). Номер
розділу збігається з номером лекції та відповідної лабораторної роботи.
Ілюстрації. Курс на цьому етапі — текст-перш: діаграми (розподіли, діаграми розсіювання, дерева рішень, дендрограми тощо) додаватимуться окремим проходом у теку
img/. Наведені у конспектах таблиці, формули та покрокові приклади самодостатні й не потребують рисунків для розуміння.
Зміст
Модуль 1 — Вступ до інтелектуального аналізу даних
| № | Назва | Фокус |
|---|---|---|
| 1 | Базові поняття аналітики даних | дані та типи змінних; події, ймовірність, умовна ймовірність; теореми множення, Байєса й додавання; перестановки, розміщення, сполучення; статистична ймовірність і закон великих чисел |
| 2 | Аналіз ймовірнісних даних | випадкові величини; функція розподілу та щільність; математичне сподівання й дисперсія; розподіли Бернуллі, біноміальний, рівномірний, нормальний (правило ); розподіли , Стьюдента, Фішера |
Модуль 2 — Математична статистика
| № | Назва | Фокус |
|---|---|---|
| 3 | Статистичний аналіз та візуалізація даних | типи вибірок; візуалізація; варіаційний ряд; середнє, мода, медіана; квантилі та міжквартильний розмах; статистичні оцінки та їх властивості; вибіркова дисперсія, ступені свободи; довірчі інтервали |
| 4 | Перевірка статистичних гіпотез | статистична гіпотеза, ; помилки I та II роду; рівень значущості й критична область; алгоритм перевірки; критерії для середнього, дисперсії, рівності дисперсій () та середніх (), частки |
| 5 | Регресійний та кореляційний аналіз | двовимірна статистика; таблиці спряженості; критерій згоди Пірсона; коефіцієнт кореляції; метод найменших квадратів; лінійна регресія; коефіцієнт детермінації; дисперсійний аналіз; фіктивні змінні |
Модуль 3 — Методи класифікації
| № | Назва | Фокус |
|---|---|---|
| 6 | Класифікація. Метод найближчих сусідів | класифікація та машинне навчання; типи навчання й класифікацій; тренувальна й тестова множини; матриця невідповідності, точність, повнота, -міра, MCC; kNN, функції відстані, вплив , зважений kNN |
| 7 | Ординарні методи класифікації. Дерева рішень | алгоритм One Rule; дерева рішень; ентропія та ID3; приріст інформації (C4.5); індекс Джині (CART) |
| 8 | Ймовірнісні методи класифікації | наївний баєсів класифікатор; апостеріорна ймовірність; оцінка ймовірностей з вибірки; проблеми (залежність атрибутів, нульові ймовірності); адитивне згладжування; баєсів спам-фільтр |
Модуль 4 — Методи категоризації (кластеризації)
| № | Назва | Фокус |
|---|---|---|
| 9 | Задачі кластеризації. Метод -середніх | задача кластеризації; число Стірлінга й переборна складність; класи методів; функції відстані; -середніх і сума квадратів помилок; критерій збіжності; нечіткий -середніх |
| 10 | Ієрархічні методи кластеризації | вкладені групування й дендрограма; агломеративний алгоритм; метрики зв’язку (одиночний, повний, середній, Варда); поділяючий алгоритм (DIANA); оцінка якості (індекс Данна, силует) |
Модуль 5 — Асоціативні правила
| № | Назва | Фокус |
|---|---|---|
| 11 | Пошук асоціативних правил | транзакційна база даних; асоціативне правило; підтримка, достовірність, підйом, переконливість; відбір цікавих правил; алгоритми Apriori та Eclat |
| 12 | Алгоритм FP-Growth | обмеження Apriori; FP-дерево та заголовна таблиця; умовні бази образів і умовні FP-дерева; рекурсивний видобуток частих наборів без кандидатів; порівняння Apriori / Eclat / FP-Growth |
Модуль 6 — Розширені методи аналітики даних
| № | Назва | Фокус |
|---|---|---|
| 13 | Зменшення розмірності. Метод головних компонент (PCA) | прокляття розмірності; відбір vs виділення ознак; коваріаційна матриця; власні вектори й значення; головні компоненти; частка поясненої дисперсії; вибір числа компонент |
| 14 | Аналіз часових рядів | компоненти ряду (тренд, сезонність, шум); ковзне середнє; експоненційне згладжування; автокореляція; прогнозування; оцінка похибки (MAE, RMSE, MAPE) |
Як користуватися
Опрацьовуйте розділи послідовно — кожен спирається на попередні (зокрема весь курс тримається на ймовірності й статистиці лекцій 1–5). Означення подано напівжирним; ключові результати оформлені як Означення / Теореми / Властивості. Кожну лекцію завершено підсумком і вправами; після лекції виконують лабораторну роботу з тим самим номером.
Швидкий довідник позначень
| Символ | Значення | Символ | Значення | |
|---|---|---|---|---|
| ймовірність події | вибіркові середнє, дисперсія, СКВ | |||
| умовна ймовірність | генеральні середнє, дисперсія, СКВ | |||
| сполучення | основна й альтернативна гіпотези | |||
| розміщення | рівень значущості | |||
| перестановки | прогноз, коефіцієнт детермінації | |||
| сподівання, дисперсія | коефіцієнт кореляції | |||
| функція розподілу, щільність | відстань між об’єктами | |||
| нормальний розподіл | ентропія множини | |||
| розподіли Пірсона, Стьюдента, Фішера | підтримка, достовірність правила |
Додаткова література
- Han J., Kamber M., Pei J. Data Mining: Concepts and Techniques.
- James G., Witten D., Hastie T., Tibshirani R. An Introduction to Statistical Learning.
- Гмурман В. Є. Теорія ймовірностей і математична статистика.