2. Методичні вказівки
Цей розділ самодостатній: у ньому зібрано теорію наївного баєсового класифікатора, потрібну для аудиторних задач (3classroom.md) і домашньої програми (4task.md). Ширше ту саму теорію викладено в Лекції 8.
2.1 Задача ймовірнісної класифікації
Класифікація — побудова правила, що за значеннями предикторів (вхідних атрибутів) об’єкта передбачає його клас (категоріальну цільову ознаку). Ймовірнісний класифікатор іде далі: він оцінює ймовірність належності об’єкта до кожного класу — — і лише потім обирає клас. Такий вихід дає не лише рішення, а й упевненість у ньому та змогу порівнювати її з порогом.
2.2 Теорема Байєса та правило класифікації
За теоремою Байєса апостеріорна ймовірність класу
де — апріорна ймовірність класу, — правдоподібність ознак у класі, — спільна ймовірність ознак (свідчення). Знаменник не залежить від класу, тож при виборі класу його відкидають:
2.3 Наївне припущення та апостеріорна ймовірність
Правдоподібність — ймовірність цілої комбінації ознак — надійно оцінити частотою неможливо: комбінацій надто багато. Наївне припущення вважає ознаки умовно незалежними за класом:
Звідси робоча формула методу:
Припущення часто хибне (ознаки бувають залежні), але для вибору класу класифікатор усе одно працює на диво добре.
2.4 Оцінювання ймовірностей за частотами
Нехай вибірка має об’єктів, з них — класу . Тоді
де — число об’єктів класу зі значенням ознаки .
2.5 Класифікація та нормування
Для об’єкта обчислюють оцінку кожного класу , обирають найбільшу, а щоб отримати самі ймовірності — нормують на суму оцінок усіх класів (це і є знаменник за формулою повної ймовірності):
2.6 Проблема нульової ймовірності та згладжування Лапласа
Якщо значення ознаки жодного разу не трапилось у класі , то і весь добуток занулюється — навіть якщо решта ознак переконливо свідчать на користь . Це проблема нульової ймовірності (переповнення). Її усуває адитивне (лапласове) згладжування:
де — кількість різних значень ознаки . Додавання у чисельник прибирає нулі, а у знаменнику зберігає нормування (). Пов’язана обчислювальна вада — зникнення в нуль (underflow) добутку багатьох малих чисел; на практиці замість добутку беруть суму логарифмів .
2.7 Порівняння з деревом ID3
Наївний Байєс і дерево рішень ID3 (Лекція 7) розв’язують ту саму задачу класифікації, але по-різному: дерево будує ієрархію однозначних перевірок і повертає ярлик; наївний Байєс перемножує ймовірності ознак і повертає ярлик разом з упевненістю . Їх зіставляють за прогнозами на кожному об’єкті, за точністю (часткою правильних прогнозів) і за матрицею невідповідності — таблицею, що показує, на скількох об’єктах методи дали однакові/різні класи.
2.8 Демонстраційний приклад (на інших даних, ніж у задачах)
Розглянемо навчальну вибірку «Морозиво»: за погодою та настроєм покупця передбачаємо, чи купить він морозиво.
| № | Погода | Настрій | Морозиво? |
|---|---|---|---|
| 1 | Спекотно | Гарний | Так |
| 2 | Спекотно | Гарний | Так |
| 3 | Спекотно | Поганий | Так |
| 4 | Прохолодно | Гарний | Так |
| 5 | Прохолодно | Поганий | Ні |
| 6 | Прохолодно | Поганий | Ні |
| 7 | Спекотно | Поганий | Ні |
| 8 | Прохолодно | Гарний | Ні |
Класи збалансовані: 4 «Так» і 4 «Ні» , тож .
(а) Умовні ймовірності (частоти).
| Ознака | ||
|---|---|---|
| Погода Спекотно | ||
| Погода Прохолодно | ||
| Настрій Гарний | ||
| Настрій Поганий |
(б) Класифікація об’єкта (Спекотно, Гарний настрій).
Нормуємо:
Прогноз — «Так» (купить) з упевненістю . Симетрично для об’єкта (Прохолодно, Поганий настрій) вийде , тобто «Ні».
(в) Згладжування Лапласа (демонстрація механіки). Хоча в цій вибірці нулів немає, покажемо формулу. Обидві ознаки мають значення, тож зі згладжуванням
і сума — нормування збережено. Згладжування «підтягує» ймовірності до середини (порівняйте ), роблячи оцінки менш категоричними.
2.9 Робочий контрольний список
- Спершу оцініть апріорні ймовірності (або візьміть задані).
- Для кожної ознаки й кожного класу порахуйте умовні ймовірності ; зведіть їх у таблицю.
- Оцінку класу рахуйте як добуток ; клас — за argmax; ймовірність — нормуванням на суму оцінок.
- Побачили нуль серед — застосуйте згладжування Лапласа (не забудьте у знаменнику).
- Для порівняння з ID3 проженіть обидва класифікатори по тих самих об’єктах і зіставте прогнози з правдою (точність, матриця невідповідності).