Лого на 91. НЕГ „Проф. Константин Гълъбов“

Избираем модул · Урок 11

Линейната регресия — най-простият модел

Права през точки: тегло, отместване и функция на загубата. Тук се вижда в чист вид какво означава „моделът се обучава“.

Един модел, който се вижда с просто око

Осем апартамента с известна площ и цена. Нанасяме ги като точки. Виждаме, че по-голямата площ върви с по-висока цена — и прекарваме права. Това е линейна регресия и това е цял модел на машинното обучение.

площ (м²)цена (хил. лв.)y = w·x + bчервено: грешките
Правата не минава през нито една точка. Целта не е да ги улови, а да е възможно най-близо до всички.

Двете числа, които моделът търси

y = w · x + b
  • x — признакът (площта). Известен ни е.
  • y — предсказаната стойност (цената).
  • wтегло (наклон): с колко се променя цената при +1 м².
  • bотместване: къде правата пресича оста.

Обучение

Намиране на онези стойности на w и b, при които предсказанията са възможно най-близо до истинските стойности.

Това е целият модел

Обучен модел = две числа, записани някъде. Големите езикови модели са същото, само че числата са стотици милиарди и се наричат параметри.

Как се мери „близо“

За всяка точка има грешка — разликата между истинската цена и тази, която дава правата. Едни грешки са нагоре, други надолу; ако просто ги съберем, ще се унищожат. Затова се повдигат на квадрат.

Функция на загубата (loss)

Число, което казва колко зле се справя моделът. За регресия обикновено е средна квадратична грешка: MSE = средно от (истинско − предсказано)².

Защо на квадрат

  • Знакът изчезва — отклонение нагоре и надолу тежат еднакво.
  • Големите грешки се наказват непропорционално: грешка 10 тежи 100, а грешка 2 тежи 4.
  • Функцията става гладка, което ще е важно в следващия урок.

Обратната страна: един силно отклонен пример (грешно записана цена) може да измести цялата права. Затова понякога се използва средна абсолютна грешка, която е по-устойчива.

Обучението е задача за минимум

Търсим w и b, при които загубата е най-малка. Оттук нататък цялото машинно обучение е една и съща задача: намери параметрите, които минимизират загубата.

Повече от един признак

Апартаментът има площ, брой стаи и етаж. Всеки признак получава свое тегло:

y = w₁·площ + w₂·стаи + w₃·етаж + b

Вече не е права, а равнина (при три и повече признака — хиперравнина), но математиката е същата. Теглата носят и полезна информация: ако w₂ е близо до нула, броят стаи почти не влияе на цената — при условие че признаците са нормализирани.

Тегло не значи причина

Голямото тегло пред признак показва, че моделът го използва, а не че този признак причинява резултата. Броят пожарникари на местопроизшествие корелира с щетите, но не ги причинява.