Един модел, който се вижда с просто око
Осем апартамента с известна площ и цена. Нанасяме ги като точки. Виждаме, че по-голямата площ върви с по-висока цена — и прекарваме права. Това е линейна регресия и това е цял модел на машинното обучение.
Двете числа, които моделът търси
y = w · x + bx— признакът (площта). Известен ни е.y— предсказаната стойност (цената).w— тегло (наклон): с колко се променя цената при +1 м².b— отместване: къде правата пресича оста.
Обучение
Намиране на онези стойности на w и b, при които предсказанията са възможно най-близо до истинските стойности.
Това е целият модел
Обучен модел = две числа, записани някъде. Големите езикови модели са същото, само че числата са стотици милиарди и се наричат параметри.
Как се мери „близо“
За всяка точка има грешка — разликата между истинската цена и тази, която дава правата. Едни грешки са нагоре, други надолу; ако просто ги съберем, ще се унищожат. Затова се повдигат на квадрат.
Функция на загубата (loss)
Число, което казва колко зле се справя моделът. За регресия обикновено е средна квадратична грешка: MSE = средно от (истинско − предсказано)².
Защо на квадрат
- Знакът изчезва — отклонение нагоре и надолу тежат еднакво.
- Големите грешки се наказват непропорционално: грешка 10 тежи 100, а грешка 2 тежи 4.
- Функцията става гладка, което ще е важно в следващия урок.
Обратната страна: един силно отклонен пример (грешно записана цена) може да измести цялата права. Затова понякога се използва средна абсолютна грешка, която е по-устойчива.
Обучението е задача за минимум
Търсим w и b, при които загубата е най-малка. Оттук нататък цялото машинно обучение е една и съща задача: намери параметрите, които минимизират загубата.
Повече от един признак
Апартаментът има площ, брой стаи и етаж. Всеки признак получава свое тегло:
y = w₁·площ + w₂·стаи + w₃·етаж + bВече не е права, а равнина (при три и повече признака — хиперравнина), но математиката е същата. Теглата носят и полезна информация: ако w₂ е близо до нула, броят стаи почти не влияе на цената — при условие че признаците са нормализирани.
Тегло не значи причина
Голямото тегло пред признак показва, че моделът го използва, а не че този признак причинява резултата. Броят пожарникари на местопроизшествие корелира с щетите, но не ги причинява.