# 6. Контрольні запитання Ці запитання допомагають перевірити готовність до роботи й самоконтроль після неї. Відповіді спираються на [методичні вказівки](2method.md) та [Лекцію 13](../../Lectures/DA-L13.md). ## Розмірність і постановка задачі 1. Що таке **прокляття розмірності**? Наведіть принаймні два його прояви й поясніть, чому воно псує методи на основі відстаней (kNN, $k$-середніх). 2. Чим **відбір ознак** (feature selection) відрізняється від **виділення ознак** (feature extraction)? До якого з них належить PCA? 3. Навіщо зменшують розмірність? Перелічіть щонайменше три мотиви (візуалізація, шум, швидкість, перенавчання). ## Коваріаційна матриця 4. Дайте означення **коваріації** двох ознак і **коваріаційної матриці** набору. Якого вона розміру для $p$ ознак і що стоїть на її головній діагоналі? 5. Чому коваріаційна матриця **симетрична**? Що таке її **слід** і як він пов'язаний із загальною дисперсією даних? 6. Навіщо перед обчисленням коваріаційної матриці **центрувати** дані? Коли потрібна ще й **стандартизація** і до якої матриці тоді зводиться PCA? ## Власні значення, вектори, головні компоненти 7. Що таке **власний вектор** і **власне значення** матриці? Запишіть рівняння $\Sigma v = \lambda v$ і поясніть його геометричний зміст. 8. Що таке **головні компоненти**? Чому перша з них — напрямок **максимальної дисперсії**, і чому дисперсія даних уздовж $i$-ї компоненти дорівнює $\lambda_i$? 9. Чому головні компоненти **ортогональні**? Як через **характеристичне рівняння** $\det(\Sigma - \lambda I) = 0$ знайти власні значення матриці $2 \times 2$? ## Проєкція, частка дисперсії, вибір числа компонент 10. Як обчислити **проєкцію** об'єкта на головну компоненту? Що таке **частка поясненої дисперсії** і як її рахують? 11. Як обрати число компонент $k$? Поясніть **поріг накопиченої дисперсії**, **scree-графік** («лікоть») і **правило Кайзера**. 12. Назвіть **обмеження** PCA (лінійність, інтерпретованість, незалежність від міток класів, чутливість до масштабу). Наведіть приклад, коли перша головна компонента **марна** для класифікації. ## Реалізація 13. Опишіть кроки **алгоритму PCA** від сирої матриці даних до проєкції на $k$ компонент. Який крок обов'язковий, а який — за потреби? 14. Які **крайні випадки** має опрацьовувати програма (порожній файл, нечислові значення, пропуски, один стовпець)? Як перевірити правильність результату (напр., що дисперсія проєкцій на $i$-ту компоненту дорівнює $\lambda_i$)?