Моделът повтаря данните си
Алгоритъмът няма мнение и няма намерения. Той намира закономерности в примерите, които сме му дали — включително закономерности, които не бихме искали да научи. Ако в данните жените са получавали по-ниски заплати, моделът ще предскаже по-ниска заплата за жена. Не защото „смята“ така, а защото това е закономерността в числата.
Пристрастие (bias)
Систематична грешка, при която моделът се справя различно добре с различни групи или възпроизвежда несправедливост, съдържаща се в данните.
Четирите източника
| Източник | Какво се случва | Пример |
|---|---|---|
| Изкривена извадка | данните не отразяват тези, за които ще се използва моделът | гласово разпознаване, обучено само с мъжки гласове от САЩ |
| Историческо пристрастие | данните са верни, но описват несправедливо минало | кой е бил повишаван досега |
| Обозначаване | хората, които са слагали етикетите, са били непоследователни или пристрастни | коя снимка е „професионална“ |
| Обратна връзка | решенията на модела създават новите данни и усилват първоначалния наклон | полиция патрулира там, където моделът предсказва престъпления, и намира повече престъпления там |
Най-коварният е четвъртият
При обратната връзка моделът сам си произвежда доказателства, че е прав. Всеки следващ цикъл на обучение затвърждава наклона, а измерените резултати изглеждат все по-добри.
Три случая, които струваха скъпо
Подбор на кадри
Голяма технологична компания разработва модел за подбор на кандидати, обучен върху автобиографиите от последните десет години. Тъй като в тях преобладават мъже, моделът се научава да понижава оценките на автобиографии, съдържащи думата „женски“ (например „капитан на женския отбор“). Проектът е спрян, защото не успяват да гарантират, че моделът няма да намери заобиколни признаци.
Разпознаване на лица
Изследване от 2018 г. измерва грешките на търговски системи по групи. За светлокожи мъже грешката е под 1%, за тъмнокожи жени — над 30%. Общата отчетена точност е висока; проблемът се вижда едва когато резултатът се раздели по групи.
Медицински приоритет
Модел определя кои пациенти се нуждаят от допълнителни грижи, като използва разходите за лечение като приблизителна мярка за тежест на заболяването. Но една група исторически е получавала по-малко лечение при същото заболяване — и моделът я оценява като по-здрава. Признакът е бил „разумен“, а последицата — не.
Как се открива
Общата точност е средно число и средните числа крият разликите. Единственият надежден начин е да се измери по групи.
- Изберете групите, за които има смисъл да се пита — език, възраст, регион, устройство, осветление.
- Пресметнете точност, прецизност и обхват отделно за всяка група.
- Сравнете и с дела на групата в данните: 3% от примерите почти винаги значат по-лош резултат.
- Гледайте и кои грешки се случват, не само колко са.
Премахването на признака не решава проблема
Изтриването на колоната „пол“ не прави модела сляп за пола. Останалите признаци — професия, увлечения, дори дължината на текста — могат да го възстановят. Затова се мери резултатът по групи, а не само какви колони сме подали.
Какво може да се направи
- Проверете състава на данните, преди да обучавате: кой е представен и кой липсва.
- Доберете примери за групите, за които има малко данни.
- Мерете по групи и публикувайте разбивката, а не само общата точност.
- Задайте въпроса „каква е цената на грешката за човека отсреща“ — при висока цена решението не бива да е автоматично.
- Оставете човек в решаващата верига там, където последиците са сериозни.
Няма модел без пристрастие
Целта не е съвършена неутралност — тя не е постижима. Целта е пристрастията да са известни, измерени и обявени, за да може някой да реши дали системата изобщо да се използва.