# 6. Контрольні запитання Ці запитання допомагають перевірити готовність до роботи й самоконтроль після неї. Відповіді спираються на [методичні вказівки](2method.md) та [Лекцію 10](../../Lectures/DA-L10.md). ## Ієрархічна кластеризація та дендрограма 1. Що таке **ієрархічна кластеризація**? Чим **вкладене** розбиття відрізняється від довільного набору кластерів? Що таке **листя** й **корінь** дерева? 2. Що зображує **дендрограма** і що означає **висота** з'єднання? Як за дендрограмою отримати розбиття на задане число кластерів $k$? 3. Чим ієрархічні методи відрізняються від $k$-**середніх**? Назвіть їх переваги (не треба задавати $k$ наперед; детермінованість) і недоліки (обчислювальна вартість). ## Агломеративний алгоритм 4. Опишіть **чотири кроки** агломеративного алгоритму «знизу догори». Що відбувається з матрицею відстаней після кожного злиття? 5. Чому після злиття двох кластерів рядки/стовпці для них у матриці **замінюють одним**? Яка типова помилка тут виникає? ## Метрики зв'язку 6. Дайте означення **одиночного** (найближчого сусіда) та **повного** (найдальшого сусіда) зв'язку. Запишіть формули через $\min$ і $\max$. 7. Що таке **середній зв'язок** (груповий середній, UPGMA), **центроїдний** метод і метод **Варда**? Чим Ward відрізняється за критерієм злиття? 8. Що таке **ефект ланцюжка** (chaining) в одиночному зв'язку? Для яких форм кластерів одиночний зв'язок добрий, а для яких — ні? Яка метрика дає компактніші кластери? 9. Поясніть на прикладі, чому одиночний і повний зв'язок можуть дати **різне** розбиття однієї й тієї самої вибірки (місткова точка). ## Поділяючий метод 10. Опишіть алгоритм **DIANA** (згори донизу). Як обирають кластер для поділу і **зерно** відколотої групи? За якою умовою точку переносять у відколоту групу? ## Оцінка якості 11. Дайте означення **індексу Данна**. Що в ньому чисельник і знаменник? Чому **більше** значення означає кращу кластеризацію? 12. Дайте означення **силуетного коефіцієнта** точки $s(i)=\dfrac{b-a}{\max(a,b)}$. Що означають $a(i)$ та $b(i)$? Як тлумачити $s(i)\approx 1$, $s(i)\approx 0$, $s(i)<0$? 13. Як **чесно** порівняти якість ієрархічної кластеризації з $k$-**means**? Чому порівнювати міри якості на **різному** $k$ некоректно? ## Реалізація 14. Як побудувати **матрицю попарних відстаней** для об'єктів із CSV? Яка її розмірність для $n$ об'єктів і чому це визначає обчислювальну вартість методу? 15. Навіщо буває потрібна **нормалізація** ознак перед обчисленням відстаней? Що станеться, якщо одна ознака має набагато більший масштаб за інші?