Raw

Робоча програма навчальної дисципліни «Аналітика даних»

Course study program — Data Analytics (мова навчання — українська)

Складові курсу / Навігація

Компонент Тека
📚 Лекції Lectures/
🧪 Лабораторні (аудиторні обчислення + домашня програма) Laboratory/
❓ Контроль Підсумковий тест (залік)

Рівень вищої освіти Бакалаврський
Спеціальність F3. Комп’ютерні науки
Освітньо-професійна програма Комп’ютерні науки
Мова навчання Українська
Місто, рік Харків, 2026

Структура курсу. Матеріали (.md) покривають усі 6 змістових модулів — лекції та лабораторні 1–14. Кожна лабораторна робота відповідає лекції з тим самим номером і поєднує аудиторні обчислення з домашньою програмою.


1. Опис навчальної дисципліни

Показник Значення
Кількість кредитів ЄКТС 5
Кількість змістових модулів 6
Загальна кількість годин 150
Рік навчання / Семестр 3 / осінній
Лекції 14 (28 год)
Лабораторні роботи 14 (28 год)
Самостійна робота 94 год
Вид підсумкового контролю залік
Форма навчання денна

Розподіл годин: 28+28+94=15028 + 28 + 94 = 150 год.

2. Мета курсу та очікувані результати

2.1 Мета курсу

Метою дисципліни є формування системи знань і практичних навичок з інтелектуального аналізу даних (data mining) — від імовірнісно-статистичного підґрунтя до сучасних методів класифікації, кластеризації та пошуку асоціативних правил. Курс навчає ставити задачу аналізу даних точною мовою, обирати й застосовувати відповідний метод до реального набору даних, оцінювати якість побудованої моделі, інтерпретувати результат і реалізовувати метод програмно. Дисципліна поєднує математичну строгість (означення, формули, покрокові обчислення) з інженерною практикою (робота з наборами даних у форматі CSV, написання власних реалізацій алгоритмів).

2.2 Очікувані результати навчання

За результатами вивчення дисципліни здобувач повинен

знати:

  • базові поняття аналітики даних, типи змінних і даних, основи теорії ймовірностей (події, умовна ймовірність, теореми Байєса, додавання й множення) та комбінаторики;
  • випадкові величини, функції розподілу, числові характеристики (математичне сподівання, дисперсія) і ключові розподіли (Бернуллі, біноміальний, рівномірний, нормальний, χ2\chi^2, Стьюдента, Фішера);
  • методи описової статистики та візуалізації, побудову довірчих інтервалів і перевірку статистичних гіпотез;
  • регресійний та кореляційний аналіз, метод найменших квадратів, таблиці спряженості й критерій згоди Пірсона;
  • методи класифікації — kk найближчих сусідів (kNN), дерева рішень (One Rule, ID3, C4.5, CART), наївний баєсів класифікатор — та метрики їх якості;
  • методи кластеризації — kk-середніх, нечіткий cc-середніх, ієрархічні (агломеративні та поділяючі) — і метрики якості кластеризації;
  • пошук асоціативних правил (алгоритми Apriori та Eclat) і міри інтересовності (підтримка, достовірність, підйом, переконливість);

вміти:

  • обчислювати описові характеристики вибірки та будувати їх візуалізації;
  • будувати й інтерпретувати довірчі інтервали, формулювати й перевіряти статистичні гіпотези про середні, дисперсії та частки;
  • будувати лінійні регресійні моделі методом найменших квадратів і оцінювати їх якість коефіцієнтом детермінації;
  • застосовувати алгоритми класифікації та кластеризації до наборів даних і оцінювати якість результату (матриця невідповідності, точність, повнота, FF-міра, MCC; індекс Данна, силует);
  • знаходити асоціативні правила та відбирати цікаві з них за мірами інтересовності;
  • реалізовувати перелічені методи програмно (мову програмування студент обирає самостійно), читаючи вхідні дані з файлів CSV.

2.3 Пререквізити

Вища математика (математичний аналіз, лінійна алгебра); основи теорії ймовірностей; основи програмування (робота з файлами, структури даних).

3. Програма курсу

Чотирнадцять лекційних занять (по 2 год) згруповано у шість змістових модулів. Кожній лекції відповідає лабораторна робота з тим самим номером, що містить дві частини: аудиторні задачі (математичні обчислення «руками») та домашнє завдання (написання програми). Докладніше про формат — Laboratory/README.md.

Змістовий модуль 1. Вступ до інтелектуального аналізу даних

Тема Лекція Слайди Лабораторна
Базові поняття аналітики даних. Ймовірнісний підхід до збору даних L01 PPTX Лб 1
Аналіз ймовірнісних даних. Випадкові величини та розподіли L02 PPTX Лб 2

Змістовий модуль 2. Математична статистика

Тема Лекція Слайди Лабораторна
Статистичний аналіз, візуалізація даних та довірчі інтервали L03 PPTX Лб 3
Перевірка статистичних гіпотез L04 PPTX Лб 4
Регресійний та кореляційний аналіз L05 PPTX Лб 5

Змістовий модуль 3. Методи класифікації

Тема Лекція Слайди Лабораторна
Класифікація. Метод kk найближчих сусідів (kNN) L06 PPTX Лб 6
Ординарні методи класифікації. Дерева рішень (ID3, C4.5, CART) L07 PPTX Лб 7
Ймовірнісні методи класифікації. Наївний баєсів класифікатор L08 PPTX Лб 8

Змістовий модуль 4. Методи категоризації (кластеризації)

Тема Лекція Слайди Лабораторна
Задачі кластеризації. Метод kk-середніх L09 PPTX Лб 9
Ієрархічні методи кластеризації L10 PPTX Лб 10

Змістовий модуль 5. Асоціативні правила

Тема Лекція Слайди Лабораторна
Пошук асоціативних правил. Алгоритми Apriori та Eclat L11 PPTX Лб 11
Алгоритм FP-Growth. Пошук частих наборів без генерації кандидатів L12 PPTX Лб 12

Змістовий модуль 6. Розширені методи аналітики даних

Тема Лекція Слайди Лабораторна
Зменшення розмірності. Метод головних компонент (PCA) L13 PPTX Лб 13
Аналіз часових рядів L14 PPTX Лб 14

Теми L12–L14 додано понад вихідний архів курсу; усі матеріали — лекції, лабораторні та слайди — підготовлено в межах проєкту.

4. Методи контролю та розподіл балів

Загальна оцінка — за 100-бальною шкалою. Мінімальне позитивне значення відповідає 60 % від максимуму.

Складник оцінювання Бали
Лабораторні роботи (поточний контроль, 14 робіт) 60
Підсумковий тест 40
Разом 100

Підсумковий контроль — залік. Окремого іспиту немає: підсумкову оцінку (залік) виставляють за сумою балів — лабораторні роботи (60, поточний контроль) і підсумковий тест (40). Позитивний залік — від 60 балів. Матеріали підсумкового тесту (банк питань, імпорт у Moodle) — поза цим репозиторієм (окремий проєкт).

Оцінювання лабораторних. Кожну лабораторну оцінюють за трирівневою шкалою (базовий / середній / високий) — оцінка відповідає найвищому повністю виконаному рівню. Зараховуються обидві частини роботи: аудиторні обчислення та захищене домашнє завдання (програма). Умови рівнів наведено у файлі 4task.md кожної роботи.

5. Методи навчання

Лекції з розбором математичних методів і покрокових прикладів; лабораторні роботи з двох частин — аудиторний розбір типових задач «руками» та самостійна реалізація методу у вигляді програми; робота з реальними наборами даних (зокрема з відкритих джерел, як-от Kaggle).

6. Рекомендована література

Основна:

  • Han J., Kamber M., Pei J. Data Mining: Concepts and Techniques. — Morgan Kaufmann.
  • James G., Witten D., Hastie T., Tibshirani R. An Introduction to Statistical Learning. — Springer.
  • Hastie T., Tibshirani R., Friedman J. The Elements of Statistical Learning. — Springer.
  • Гмурман В. Є. Теорія ймовірностей і математична статистика.

Допоміжна:

  • Aggarwal C. C. Data Mining: The Textbook. — Springer.
  • Tan P.-N., Steinbach M., Kumar V. Introduction to Data Mining. — Pearson.

7. Інформаційні ресурси та інструменти

  • Python з бібліотеками numpy, pandas, scikit-learn, scipy, matplotlib — рекомендоване середовище для лабораторних (мову студент обирає самостійно).
  • Kaggle — відкриті набори даних для навчальних вибірок.
  • scikit-learn documentation — довідник з методів машинного навчання (для перевірки власних реалізацій).

README.md · 14.9 KB · updated 2026-08-05 11:18