Робоча програма навчальної дисципліни «Аналітика даних»
Course study program — Data Analytics (мова навчання — українська)
Складові курсу / Навігація
| Компонент | Тека |
|---|---|
| 📚 Лекції | Lectures/ |
| 🧪 Лабораторні (аудиторні обчислення + домашня програма) | Laboratory/ |
| ❓ Контроль | Підсумковий тест (залік) |
| Рівень вищої освіти | Бакалаврський |
| Спеціальність | F3. Комп’ютерні науки |
| Освітньо-професійна програма | Комп’ютерні науки |
| Мова навчання | Українська |
| Місто, рік | Харків, 2026 |
Структура курсу. Матеріали (
.md) покривають усі 6 змістових модулів — лекції та лабораторні 1–14. Кожна лабораторна робота відповідає лекції з тим самим номером і поєднує аудиторні обчислення з домашньою програмою.
1. Опис навчальної дисципліни
| Показник | Значення |
|---|---|
| Кількість кредитів ЄКТС | 5 |
| Кількість змістових модулів | 6 |
| Загальна кількість годин | 150 |
| Рік навчання / Семестр | 3 / осінній |
| Лекції | 14 (28 год) |
| Лабораторні роботи | 14 (28 год) |
| Самостійна робота | 94 год |
| Вид підсумкового контролю | залік |
| Форма навчання | денна |
Розподіл годин: год.
2. Мета курсу та очікувані результати
2.1 Мета курсу
Метою дисципліни є формування системи знань і практичних навичок з інтелектуального аналізу даних (data mining) — від імовірнісно-статистичного підґрунтя до сучасних методів класифікації, кластеризації та пошуку асоціативних правил. Курс навчає ставити задачу аналізу даних точною мовою, обирати й застосовувати відповідний метод до реального набору даних, оцінювати якість побудованої моделі, інтерпретувати результат і реалізовувати метод програмно. Дисципліна поєднує математичну строгість (означення, формули, покрокові обчислення) з інженерною практикою (робота з наборами даних у форматі CSV, написання власних реалізацій алгоритмів).
2.2 Очікувані результати навчання
За результатами вивчення дисципліни здобувач повинен
знати:
- базові поняття аналітики даних, типи змінних і даних, основи теорії ймовірностей (події, умовна ймовірність, теореми Байєса, додавання й множення) та комбінаторики;
- випадкові величини, функції розподілу, числові характеристики (математичне сподівання, дисперсія) і ключові розподіли (Бернуллі, біноміальний, рівномірний, нормальний, , Стьюдента, Фішера);
- методи описової статистики та візуалізації, побудову довірчих інтервалів і перевірку статистичних гіпотез;
- регресійний та кореляційний аналіз, метод найменших квадратів, таблиці спряженості й критерій згоди Пірсона;
- методи класифікації — найближчих сусідів (kNN), дерева рішень (One Rule, ID3, C4.5, CART), наївний баєсів класифікатор — та метрики їх якості;
- методи кластеризації — -середніх, нечіткий -середніх, ієрархічні (агломеративні та поділяючі) — і метрики якості кластеризації;
- пошук асоціативних правил (алгоритми Apriori та Eclat) і міри інтересовності (підтримка, достовірність, підйом, переконливість);
вміти:
- обчислювати описові характеристики вибірки та будувати їх візуалізації;
- будувати й інтерпретувати довірчі інтервали, формулювати й перевіряти статистичні гіпотези про середні, дисперсії та частки;
- будувати лінійні регресійні моделі методом найменших квадратів і оцінювати їх якість коефіцієнтом детермінації;
- застосовувати алгоритми класифікації та кластеризації до наборів даних і оцінювати якість результату (матриця невідповідності, точність, повнота, -міра, MCC; індекс Данна, силует);
- знаходити асоціативні правила та відбирати цікаві з них за мірами інтересовності;
- реалізовувати перелічені методи програмно (мову програмування студент обирає самостійно), читаючи вхідні дані з файлів CSV.
2.3 Пререквізити
Вища математика (математичний аналіз, лінійна алгебра); основи теорії ймовірностей; основи програмування (робота з файлами, структури даних).
3. Програма курсу
Чотирнадцять лекційних занять (по 2 год) згруповано у шість змістових модулів. Кожній лекції відповідає лабораторна робота з тим самим номером, що містить дві частини: аудиторні задачі (математичні обчислення «руками») та домашнє завдання (написання програми). Докладніше про формат — Laboratory/README.md.
Змістовий модуль 1. Вступ до інтелектуального аналізу даних
| Тема | Лекція | Слайди | Лабораторна |
|---|---|---|---|
| Базові поняття аналітики даних. Ймовірнісний підхід до збору даних | L01 | PPTX | Лб 1 |
| Аналіз ймовірнісних даних. Випадкові величини та розподіли | L02 | PPTX | Лб 2 |
Змістовий модуль 2. Математична статистика
| Тема | Лекція | Слайди | Лабораторна |
|---|---|---|---|
| Статистичний аналіз, візуалізація даних та довірчі інтервали | L03 | PPTX | Лб 3 |
| Перевірка статистичних гіпотез | L04 | PPTX | Лб 4 |
| Регресійний та кореляційний аналіз | L05 | PPTX | Лб 5 |
Змістовий модуль 3. Методи класифікації
| Тема | Лекція | Слайди | Лабораторна |
|---|---|---|---|
| Класифікація. Метод найближчих сусідів (kNN) | L06 | PPTX | Лб 6 |
| Ординарні методи класифікації. Дерева рішень (ID3, C4.5, CART) | L07 | PPTX | Лб 7 |
| Ймовірнісні методи класифікації. Наївний баєсів класифікатор | L08 | PPTX | Лб 8 |
Змістовий модуль 4. Методи категоризації (кластеризації)
| Тема | Лекція | Слайди | Лабораторна |
|---|---|---|---|
| Задачі кластеризації. Метод -середніх | L09 | PPTX | Лб 9 |
| Ієрархічні методи кластеризації | L10 | PPTX | Лб 10 |
Змістовий модуль 5. Асоціативні правила
| Тема | Лекція | Слайди | Лабораторна |
|---|---|---|---|
| Пошук асоціативних правил. Алгоритми Apriori та Eclat | L11 | PPTX | Лб 11 |
| Алгоритм FP-Growth. Пошук частих наборів без генерації кандидатів | L12 | PPTX | Лб 12 |
Змістовий модуль 6. Розширені методи аналітики даних
| Тема | Лекція | Слайди | Лабораторна |
|---|---|---|---|
| Зменшення розмірності. Метод головних компонент (PCA) | L13 | PPTX | Лб 13 |
| Аналіз часових рядів | L14 | PPTX | Лб 14 |
Теми L12–L14 додано понад вихідний архів курсу; усі матеріали — лекції, лабораторні та слайди — підготовлено в межах проєкту.
4. Методи контролю та розподіл балів
Загальна оцінка — за 100-бальною шкалою. Мінімальне позитивне значення відповідає 60 % від максимуму.
| Складник оцінювання | Бали |
|---|---|
| Лабораторні роботи (поточний контроль, 14 робіт) | 60 |
| Підсумковий тест | 40 |
| Разом | 100 |
Підсумковий контроль — залік. Окремого іспиту немає: підсумкову оцінку (залік) виставляють за сумою балів — лабораторні роботи (60, поточний контроль) і підсумковий тест (40). Позитивний залік — від 60 балів. Матеріали підсумкового тесту (банк питань, імпорт у Moodle) — поза цим репозиторієм (окремий проєкт).
Оцінювання лабораторних. Кожну лабораторну оцінюють за трирівневою шкалою
(базовий / середній / високий) — оцінка відповідає найвищому повністю виконаному
рівню. Зараховуються обидві частини роботи: аудиторні обчислення та захищене
домашнє завдання (програма). Умови рівнів наведено у файлі 4task.md кожної
роботи.
5. Методи навчання
Лекції з розбором математичних методів і покрокових прикладів; лабораторні роботи з двох частин — аудиторний розбір типових задач «руками» та самостійна реалізація методу у вигляді програми; робота з реальними наборами даних (зокрема з відкритих джерел, як-от Kaggle).
6. Рекомендована література
Основна:
- Han J., Kamber M., Pei J. Data Mining: Concepts and Techniques. — Morgan Kaufmann.
- James G., Witten D., Hastie T., Tibshirani R. An Introduction to Statistical Learning. — Springer.
- Hastie T., Tibshirani R., Friedman J. The Elements of Statistical Learning. — Springer.
- Гмурман В. Є. Теорія ймовірностей і математична статистика.
Допоміжна:
- Aggarwal C. C. Data Mining: The Textbook. — Springer.
- Tan P.-N., Steinbach M., Kumar V. Introduction to Data Mining. — Pearson.
7. Інформаційні ресурси та інструменти
- Python з бібліотеками
numpy,pandas,scikit-learn,scipy,matplotlib— рекомендоване середовище для лабораторних (мову студент обирає самостійно). - Kaggle — відкриті набори даних для навчальних вибірок.
- scikit-learn documentation — довідник з методів машинного навчання (для перевірки власних реалізацій).