6. Контрольні запитання
Ці запитання допомагають перевірити готовність до роботи й самоконтроль після неї. Відповіді спираються на методичні вказівки та Лекцію 10.
Ієрархічна кластеризація та дендрограма
- Що таке ієрархічна кластеризація? Чим вкладене розбиття відрізняється від довільного набору кластерів? Що таке листя й корінь дерева?
- Що зображує дендрограма і що означає висота з’єднання? Як за дендрограмою отримати розбиття на задане число кластерів ?
- Чим ієрархічні методи відрізняються від -середніх? Назвіть їх переваги (не треба задавати наперед; детермінованість) і недоліки (обчислювальна вартість).
Агломеративний алгоритм
- Опишіть чотири кроки агломеративного алгоритму «знизу догори». Що відбувається з матрицею відстаней після кожного злиття?
- Чому після злиття двох кластерів рядки/стовпці для них у матриці замінюють одним? Яка типова помилка тут виникає?
Метрики зв’язку
- Дайте означення одиночного (найближчого сусіда) та повного (найдальшого сусіда) зв’язку. Запишіть формули через і .
- Що таке середній зв’язок (груповий середній, UPGMA), центроїдний метод і метод Варда? Чим Ward відрізняється за критерієм злиття?
- Що таке ефект ланцюжка (chaining) в одиночному зв’язку? Для яких форм кластерів одиночний зв’язок добрий, а для яких — ні? Яка метрика дає компактніші кластери?
- Поясніть на прикладі, чому одиночний і повний зв’язок можуть дати різне розбиття однієї й тієї самої вибірки (місткова точка).
Поділяючий метод
- Опишіть алгоритм DIANA (згори донизу). Як обирають кластер для поділу і зерно відколотої групи? За якою умовою точку переносять у відколоту групу?
Оцінка якості
- Дайте означення індексу Данна. Що в ньому чисельник і знаменник? Чому більше значення означає кращу кластеризацію?
- Дайте означення силуетного коефіцієнта точки . Що означають та ? Як тлумачити , , ?
- Як чесно порівняти якість ієрархічної кластеризації з -means? Чому порівнювати міри якості на різному некоректно?
Реалізація
- Як побудувати матрицю попарних відстаней для об’єктів із CSV? Яка її розмірність для об’єктів і чому це визначає обчислювальну вартість методу?
- Навіщо буває потрібна нормалізація ознак перед обчисленням відстаней? Що станеться, якщо одна ознака має набагато більший масштаб за інші?