# Робоча програма навчальної дисципліни «Аналітика даних» > Course study program — *Data Analytics* (мова навчання — українська) ## Складові курсу / Навігація | Компонент | Тека | |---|---| | 📚 Лекції | [Lectures/](Lectures/) | | 🧪 Лабораторні (аудиторні обчислення + домашня програма) | [Laboratory/](Laboratory/) | | ❓ Контроль | Підсумковий тест (залік) | --- | | | |---|---| | **Рівень вищої освіти** | Бакалаврський | | **Спеціальність** | F3. Комп'ютерні науки | | **Освітньо-професійна програма** | Комп'ютерні науки | | **Мова навчання** | Українська | | **Місто, рік** | Харків, 2026 | > **Структура курсу.** Матеріали (`.md`) покривають усі **6 змістових модулів** — > лекції та лабораторні **1–14**. Кожна лабораторна робота відповідає лекції з тим > самим номером і поєднує аудиторні обчислення з домашньою програмою. --- ## 1. Опис навчальної дисципліни | Показник | Значення | |---|---| | Кількість кредитів ЄКТС | 5 | | Кількість змістових модулів | 6 | | Загальна кількість годин | 150 | | Рік навчання / Семестр | 3 / осінній | | Лекції | 14 (28 год) | | Лабораторні роботи | 14 (28 год) | | Самостійна робота | 94 год | | Вид підсумкового контролю | залік | | Форма навчання | денна | Розподіл годин: $28 + 28 + 94 = 150$ год. ## 2. Мета курсу та очікувані результати ### 2.1 Мета курсу Метою дисципліни є формування системи знань і практичних навичок з **інтелектуального аналізу даних** (data mining) — від імовірнісно-статистичного підґрунтя до сучасних методів класифікації, кластеризації та пошуку асоціативних правил. Курс навчає ставити задачу аналізу даних точною мовою, обирати й застосовувати відповідний метод до реального набору даних, **оцінювати якість** побудованої моделі, **інтерпретувати** результат і **реалізовувати** метод програмно. Дисципліна поєднує математичну строгість (означення, формули, покрокові обчислення) з інженерною практикою (робота з наборами даних у форматі CSV, написання власних реалізацій алгоритмів). ### 2.2 Очікувані результати навчання За результатами вивчення дисципліни здобувач повинен **знати:** - базові поняття аналітики даних, типи змінних і даних, основи теорії ймовірностей (події, умовна ймовірність, теореми Байєса, додавання й множення) та комбінаторики; - випадкові величини, функції розподілу, числові характеристики (математичне сподівання, дисперсія) і ключові розподіли (Бернуллі, біноміальний, рівномірний, нормальний, $\chi^2$, Стьюдента, Фішера); - методи описової статистики та візуалізації, побудову довірчих інтервалів і перевірку статистичних гіпотез; - регресійний та кореляційний аналіз, метод найменших квадратів, таблиці спряженості й критерій згоди Пірсона; - методи класифікації — $k$ найближчих сусідів (kNN), дерева рішень (One Rule, ID3, C4.5, CART), наївний баєсів класифікатор — та метрики їх якості; - методи кластеризації — $k$-середніх, нечіткий $c$-середніх, ієрархічні (агломеративні та поділяючі) — і метрики якості кластеризації; - пошук асоціативних правил (алгоритми Apriori та Eclat) і міри інтересовності (підтримка, достовірність, підйом, переконливість); **вміти:** - обчислювати описові характеристики вибірки та будувати їх візуалізації; - будувати й інтерпретувати довірчі інтервали, формулювати й перевіряти статистичні гіпотези про середні, дисперсії та частки; - будувати лінійні регресійні моделі методом найменших квадратів і оцінювати їх якість коефіцієнтом детермінації; - застосовувати алгоритми класифікації та кластеризації до наборів даних і **оцінювати якість** результату (матриця невідповідності, точність, повнота, $F$-міра, MCC; індекс Данна, силует); - знаходити асоціативні правила та відбирати цікаві з них за мірами інтересовності; - **реалізовувати** перелічені методи програмно (мову програмування студент обирає самостійно), читаючи вхідні дані з файлів CSV. ### 2.3 Пререквізити Вища математика (математичний аналіз, лінійна алгебра); основи теорії ймовірностей; основи програмування (робота з файлами, структури даних). ## 3. Програма курсу Чотирнадцять лекційних занять (по 2 год) згруповано у **шість змістових модулів**. Кожній лекції відповідає **лабораторна робота з тим самим номером**, що містить дві частини: **аудиторні задачі** (математичні обчислення «руками») та **домашнє завдання** (написання програми). Докладніше про формат — [Laboratory/README.md](Laboratory/README.md). ### Змістовий модуль 1. Вступ до інтелектуального аналізу даних | Тема | Лекція | Слайди | Лабораторна | |---|---|---|---| | Базові поняття аналітики даних. Ймовірнісний підхід до збору даних | [L01](Lectures/DA-L01.md) | [PPTX](Lectures/Slides/DA-L01.pptx) | [Лб 1](Laboratory/Laboratory1/main.md) | | Аналіз ймовірнісних даних. Випадкові величини та розподіли | [L02](Lectures/DA-L02.md) | [PPTX](Lectures/Slides/DA-L02.pptx) | [Лб 2](Laboratory/Laboratory2/main.md) | ### Змістовий модуль 2. Математична статистика | Тема | Лекція | Слайди | Лабораторна | |---|---|---|---| | Статистичний аналіз, візуалізація даних та довірчі інтервали | [L03](Lectures/DA-L03.md) | [PPTX](Lectures/Slides/DA-L03.pptx) | [Лб 3](Laboratory/Laboratory3/main.md) | | Перевірка статистичних гіпотез | [L04](Lectures/DA-L04.md) | [PPTX](Lectures/Slides/DA-L04.pptx) | [Лб 4](Laboratory/Laboratory4/main.md) | | Регресійний та кореляційний аналіз | [L05](Lectures/DA-L05.md) | [PPTX](Lectures/Slides/DA-L05.pptx) | [Лб 5](Laboratory/Laboratory5/main.md) | ### Змістовий модуль 3. Методи класифікації | Тема | Лекція | Слайди | Лабораторна | |---|---|---|---| | Класифікація. Метод $k$ найближчих сусідів (kNN) | [L06](Lectures/DA-L06.md) | [PPTX](Lectures/Slides/DA-L06.pptx) | [Лб 6](Laboratory/Laboratory6/main.md) | | Ординарні методи класифікації. Дерева рішень (ID3, C4.5, CART) | [L07](Lectures/DA-L07.md) | [PPTX](Lectures/Slides/DA-L07.pptx) | [Лб 7](Laboratory/Laboratory7/main.md) | | Ймовірнісні методи класифікації. Наївний баєсів класифікатор | [L08](Lectures/DA-L08.md) | [PPTX](Lectures/Slides/DA-L08.pptx) | [Лб 8](Laboratory/Laboratory8/main.md) | ### Змістовий модуль 4. Методи категоризації (кластеризації) | Тема | Лекція | Слайди | Лабораторна | |---|---|---|---| | Задачі кластеризації. Метод $k$-середніх | [L09](Lectures/DA-L09.md) | [PPTX](Lectures/Slides/DA-L09.pptx) | [Лб 9](Laboratory/Laboratory9/main.md) | | Ієрархічні методи кластеризації | [L10](Lectures/DA-L10.md) | [PPTX](Lectures/Slides/DA-L10.pptx) | [Лб 10](Laboratory/Laboratory10/main.md) | ### Змістовий модуль 5. Асоціативні правила | Тема | Лекція | Слайди | Лабораторна | |---|---|---|---| | Пошук асоціативних правил. Алгоритми Apriori та Eclat | [L11](Lectures/DA-L11.md) | [PPTX](Lectures/Slides/DA-L11.pptx) | [Лб 11](Laboratory/Laboratory11/main.md) | | Алгоритм FP-Growth. Пошук частих наборів без генерації кандидатів | [L12](Lectures/DA-L12.md) | [PPTX](Lectures/Slides/DA-L12.pptx) | [Лб 12](Laboratory/Laboratory12/main.md) | ### Змістовий модуль 6. Розширені методи аналітики даних | Тема | Лекція | Слайди | Лабораторна | |---|---|---|---| | Зменшення розмірності. Метод головних компонент (PCA) | [L13](Lectures/DA-L13.md) | [PPTX](Lectures/Slides/DA-L13.pptx) | [Лб 13](Laboratory/Laboratory13/main.md) | | Аналіз часових рядів | [L14](Lectures/DA-L14.md) | [PPTX](Lectures/Slides/DA-L14.pptx) | [Лб 14](Laboratory/Laboratory14/main.md) | > **Теми L12–L14** додано понад вихідний архів курсу; усі матеріали — лекції, > лабораторні та слайди — підготовлено в межах проєкту. ## 4. Методи контролю та розподіл балів Загальна оцінка — за 100-бальною шкалою. Мінімальне позитивне значення відповідає **60 %** від максимуму. | Складник оцінювання | Бали | |---|---| | Лабораторні роботи (поточний контроль, 14 робіт) | 60 | | Підсумковий тест | 40 | | **Разом** | **100** | **Підсумковий контроль — залік.** Окремого іспиту немає: підсумкову оцінку (залік) виставляють за **сумою** балів — лабораторні роботи (**60**, поточний контроль) і **підсумковий тест** (**40**). Позитивний залік — від **60** балів. Матеріали підсумкового тесту (банк питань, імпорт у Moodle) — поза цим репозиторієм (окремий проєкт). **Оцінювання лабораторних.** Кожну лабораторну оцінюють за **трирівневою** шкалою (базовий / середній / високий) — оцінка відповідає найвищому повністю виконаному рівню. Зараховуються **обидві** частини роботи: аудиторні обчислення та захищене домашнє завдання (програма). Умови рівнів наведено у файлі `4task.md` кожної роботи. ## 5. Методи навчання Лекції з розбором математичних методів і покрокових прикладів; лабораторні роботи з двох частин — **аудиторний розбір** типових задач «руками» та **самостійна реалізація** методу у вигляді програми; робота з реальними наборами даних (зокрема з відкритих джерел, як-от [Kaggle](https://www.kaggle.com/)). ## 6. Рекомендована література **Основна:** - Han J., Kamber M., Pei J. *Data Mining: Concepts and Techniques*. — Morgan Kaufmann. - James G., Witten D., Hastie T., Tibshirani R. *An Introduction to Statistical Learning*. — Springer. - Hastie T., Tibshirani R., Friedman J. *The Elements of Statistical Learning*. — Springer. - Гмурман В. Є. *Теорія ймовірностей і математична статистика*. **Допоміжна:** - Aggarwal C. C. *Data Mining: The Textbook*. — Springer. - Tan P.-N., Steinbach M., Kumar V. *Introduction to Data Mining*. — Pearson. ## 7. Інформаційні ресурси та інструменти - **Python** з бібліотеками `numpy`, `pandas`, `scikit-learn`, `scipy`, `matplotlib` — рекомендоване середовище для лабораторних (мову студент обирає самостійно). - **[Kaggle](https://www.kaggle.com/datasets)** — відкриті набори даних для навчальних вибірок. - **[scikit-learn documentation](https://scikit-learn.org/stable/)** — довідник з методів машинного навчання (для перевірки власних реалізацій).