Raw

Аналітика даних — Лекції

Лекційна складова дисципліни «Аналітика даних» (українська мова навчання). Файли DA-L<NN>.md — це самодостатні конспекти підручникового типу: мотивація, означення, формули з виведенням, покрокові приклади обчислень, псевдокод алгоритмів, зауваження, типові помилки, застосування, підсумок і вправи — по одному розділу на лекцію. Курс має 14 лекційних занять (по 2 год), згрупованих у 6 змістових модулів (лекції 1–14).

Розташування

Тут лежать розділи DA-L01.md … DA-L14.md та презентації в Slides/DA-L01.pptx … DA-L14.pptx (по одній на лекцію). Номер розділу збігається з номером лекції та відповідної лабораторної роботи.

Ілюстрації. Курс на цьому етапі — текст-перш: діаграми (розподіли, діаграми розсіювання, дерева рішень, дендрограми тощо) додаватимуться окремим проходом у теку img/. Наведені у конспектах таблиці, формули та покрокові приклади самодостатні й не потребують рисунків для розуміння.

Зміст

Модуль 1 — Вступ до інтелектуального аналізу даних

Назва Фокус
1 Базові поняття аналітики даних дані та типи змінних; події, ймовірність, умовна ймовірність; теореми множення, Байєса й додавання; перестановки, розміщення, сполучення; статистична ймовірність і закон великих чисел
2 Аналіз ймовірнісних даних випадкові величини; функція розподілу та щільність; математичне сподівання й дисперсія; розподіли Бернуллі, біноміальний, рівномірний, нормальний (правило 3σ3\sigma); розподіли χ2\chi^2, Стьюдента, Фішера

Модуль 2 — Математична статистика

Назва Фокус
3 Статистичний аналіз та візуалізація даних типи вибірок; візуалізація; варіаційний ряд; середнє, мода, медіана; квантилі та міжквартильний розмах; статистичні оцінки та їх властивості; вибіркова дисперсія, ступені свободи; довірчі інтервали
4 Перевірка статистичних гіпотез статистична гіпотеза, H0/H1H_0/H_1; помилки I та II роду; рівень значущості й критична область; алгоритм перевірки; критерії для середнього, дисперсії, рівності дисперсій (FF) та середніх (tt), частки
5 Регресійний та кореляційний аналіз двовимірна статистика; таблиці спряженості; критерій згоди Пірсона; коефіцієнт кореляції; метод найменших квадратів; лінійна регресія; коефіцієнт детермінації; дисперсійний аналіз; фіктивні змінні

Модуль 3 — Методи класифікації

Назва Фокус
6 Класифікація. Метод kk найближчих сусідів класифікація та машинне навчання; типи навчання й класифікацій; тренувальна й тестова множини; матриця невідповідності, точність, повнота, FF-міра, MCC; kNN, функції відстані, вплив kk, зважений kNN
7 Ординарні методи класифікації. Дерева рішень алгоритм One Rule; дерева рішень; ентропія та ID3; приріст інформації (C4.5); індекс Джині (CART)
8 Ймовірнісні методи класифікації наївний баєсів класифікатор; апостеріорна ймовірність; оцінка ймовірностей з вибірки; проблеми (залежність атрибутів, нульові ймовірності); адитивне згладжування; баєсів спам-фільтр

Модуль 4 — Методи категоризації (кластеризації)

Назва Фокус
9 Задачі кластеризації. Метод kk-середніх задача кластеризації; число Стірлінга й переборна складність; класи методів; функції відстані; kk-середніх і сума квадратів помилок; критерій збіжності; нечіткий cc-середніх
10 Ієрархічні методи кластеризації вкладені групування й дендрограма; агломеративний алгоритм; метрики зв’язку (одиночний, повний, середній, Варда); поділяючий алгоритм (DIANA); оцінка якості (індекс Данна, силует)

Модуль 5 — Асоціативні правила

Назва Фокус
11 Пошук асоціативних правил транзакційна база даних; асоціативне правило; підтримка, достовірність, підйом, переконливість; відбір цікавих правил; алгоритми Apriori та Eclat
12 Алгоритм FP-Growth обмеження Apriori; FP-дерево та заголовна таблиця; умовні бази образів і умовні FP-дерева; рекурсивний видобуток частих наборів без кандидатів; порівняння Apriori / Eclat / FP-Growth

Модуль 6 — Розширені методи аналітики даних

Назва Фокус
13 Зменшення розмірності. Метод головних компонент (PCA) прокляття розмірності; відбір vs виділення ознак; коваріаційна матриця; власні вектори й значення; головні компоненти; частка поясненої дисперсії; вибір числа компонент
14 Аналіз часових рядів компоненти ряду (тренд, сезонність, шум); ковзне середнє; експоненційне згладжування; автокореляція; прогнозування; оцінка похибки (MAE, RMSE, MAPE)

Як користуватися

Опрацьовуйте розділи послідовно — кожен спирається на попередні (зокрема весь курс тримається на ймовірності й статистиці лекцій 1–5). Означення подано напівжирним; ключові результати оформлені як Означення / Теореми / Властивості. Кожну лекцію завершено підсумком і вправами; після лекції виконують лабораторну роботу з тим самим номером.

Швидкий довідник позначень

Символ Значення Символ Значення
P(A)P(A) ймовірність події AA xˉ, s2, s\bar{x},\ s^2,\ s вибіркові середнє, дисперсія, СКВ
P(AB)P(A\mid B) умовна ймовірність μ, σ2, σ\mu,\ \sigma^2,\ \sigma генеральні середнє, дисперсія, СКВ
Cnk=(nk)C_n^k=\binom{n}{k} сполучення H0, H1H_0,\ H_1 основна й альтернативна гіпотези
AnkA_n^k розміщення α\alpha рівень значущості
Pn=n!P_n=n! перестановки y^, R2\hat{y},\ R^2 прогноз, коефіцієнт детермінації
M(X), D(X)M(X),\ D(X) сподівання, дисперсія rr коефіцієнт кореляції
F(x), f(x)F(x),\ f(x) функція розподілу, щільність d(x,y)d(x,y) відстань між об’єктами
N(μ,σ2)N(\mu,\sigma^2) нормальний розподіл H(D)H(D) ентропія множини DD
χ2, t, F\chi^2,\ t,\ F розподіли Пірсона, Стьюдента, Фішера supp, conf\text{supp},\ \text{conf} підтримка, достовірність правила

Додаткова література

  • Han J., Kamber M., Pei J. Data Mining: Concepts and Techniques.
  • James G., Witten D., Hastie T., Tibshirani R. An Introduction to Statistical Learning.
  • Гмурман В. Є. Теорія ймовірностей і математична статистика.

Lectures/README.md · 10.1 KB · updated 2026-08-05 11:18