Raw

6. Контрольні запитання

Ці запитання допомагають перевірити готовність до роботи й самоконтроль після неї. Відповіді спираються на методичні вказівки та Лекцію 10.

Ієрархічна кластеризація та дендрограма

  1. Що таке ієрархічна кластеризація? Чим вкладене розбиття відрізняється від довільного набору кластерів? Що таке листя й корінь дерева?
  2. Що зображує дендрограма і що означає висота з’єднання? Як за дендрограмою отримати розбиття на задане число кластерів kk?
  3. Чим ієрархічні методи відрізняються від kk-середніх? Назвіть їх переваги (не треба задавати kk наперед; детермінованість) і недоліки (обчислювальна вартість).

Агломеративний алгоритм

  1. Опишіть чотири кроки агломеративного алгоритму «знизу догори». Що відбувається з матрицею відстаней після кожного злиття?
  2. Чому після злиття двох кластерів рядки/стовпці для них у матриці замінюють одним? Яка типова помилка тут виникає?

Метрики зв’язку

  1. Дайте означення одиночного (найближчого сусіда) та повного (найдальшого сусіда) зв’язку. Запишіть формули через min\min і max\max.
  2. Що таке середній зв’язок (груповий середній, UPGMA), центроїдний метод і метод Варда? Чим Ward відрізняється за критерієм злиття?
  3. Що таке ефект ланцюжка (chaining) в одиночному зв’язку? Для яких форм кластерів одиночний зв’язок добрий, а для яких — ні? Яка метрика дає компактніші кластери?
  4. Поясніть на прикладі, чому одиночний і повний зв’язок можуть дати різне розбиття однієї й тієї самої вибірки (місткова точка).

Поділяючий метод

  1. Опишіть алгоритм DIANA (згори донизу). Як обирають кластер для поділу і зерно відколотої групи? За якою умовою точку переносять у відколоту групу?

Оцінка якості

  1. Дайте означення індексу Данна. Що в ньому чисельник і знаменник? Чому більше значення означає кращу кластеризацію?
  2. Дайте означення силуетного коефіцієнта точки s(i)=bamax(a,b)s(i)=\dfrac{b-a}{\max(a,b)}. Що означають a(i)a(i) та b(i)b(i)? Як тлумачити s(i)1s(i)\approx 1, s(i)0s(i)\approx 0, s(i)<0s(i)<0?
  3. Як чесно порівняти якість ієрархічної кластеризації з kk-means? Чому порівнювати міри якості на різному kk некоректно?

Реалізація

  1. Як побудувати матрицю попарних відстаней для об’єктів із CSV? Яка її розмірність для nn об’єктів і чому це визначає обчислювальну вартість методу?
  2. Навіщо буває потрібна нормалізація ознак перед обчисленням відстаней? Що станеться, якщо одна ознака має набагато більший масштаб за інші?

Laboratory/Laboratory10/6questions.md · 4.3 KB · updated 2026-08-04 23:26