Задачата
Ръкописните цифри са задачата, с която е израснало цялото разпознаване на образи. Наборът MNIST — 70 000 снимки 28×28 — е бил сериозно предизвикателство през 90-те; днес се решава в браузъра за минути.
Ще сравните три модела от този раздел върху едни и същи данни: k-NN, случайна гора и невронна мрежа. Целта не е най-високият процент, а честно сравнение и разбор на грешките.
Какво се предава
- Тетрадка от Colab (връзка или файл
.ipynb), която се изпълнява от начало до край без грешки. - Таблица за сравнение — три модела, точност върху обучаващите и върху тестовите данни, време за обучение.
- Объркваща матрица на най-добрия модел с кратък коментар кои цифри се бъркат.
- Пет сгрешени изображения с вашето обяснение за всяко.
- Извод — кой модел бихте избрали за реално приложение и защо (не непременно най-точният).
Оценяване
| Критерий | Тежест | Какво търсим |
|---|---|---|
| Коректно сравнение | 30% | едно и също разделяне на данните за трите модела, оценка само върху тестовите |
| Разбор на грешките | 30% | конкретни изображения с обяснение, а не общи изречения |
| Обосновка на избора | 20% | отчита се точност, скорост и обяснимост, а не само процентът |
| Работеща тетрадка | 10% | изпълнява се от начало до край |
| Оформление | 10% | четими графики и подписани таблици |
Автоматична нула за едно нещо
Оценка, направена върху обучаващите данни. Това е грешката от урок 7 и тук е дисквалифицираща — целият проект е за честно измерване.
Съвети
Започнете с малкия набор
load_digits има 1797 снимки 8×8 и се обучава за секунди. Направете всичко върху него и чак когато работи, минете на пълния MNIST, ако имате време.
Едно разделяне за трите модела
Направете train_test_split веднъж, с фиксиран random_state, и обучете и трите модела върху точно същите обучаващи данни. Иначе сравнението не значи нищо.
Гледайте грешките, не само числата
Най-интересната част от проекта са петте сгрешени изображения. Често се оказва, че моделът бърка там, където и човек би се поколебал — а понякога греши там, където отговорът е очевиден. И двете са находки.