Лого на 91. НЕГ „Проф. Константин Гълъбов“

Избираем модул · Урок 29

Дипломен проект: данни и извличане

Час за зареждане на данните, нарязване, векторизиране и първо измерване на търсенето.

Целта на часа

В края на часа в базата има реални данни, търсенето работи и има първо число за качеството му. Без това следващият час няма върху какво да стъпи.

ГотовоПроверка
Данни в базатапоне 50 парчета с източници
Векториизчислени за всички парчета, с записан модел
Търсеневръща смислени резултати за 5 въпроса
Набор от заявкипоне 15, от които 3 без отговор
Първо числоrecall@5 записан с дата

Ред на работа

  1. Заредете суровите данни в базата.
  2. Нарежете на парчета и запишете с източник.
  3. Изчислете векторите на партиди.
  4. Пуснете 5 въпроса на око — работи ли изобщо.
  5. Съставете набора от заявки.
  6. Измерете и запишете.

Не подреждайте обратно

Съблазнително е да се настройва размерът на парчето, преди да има измерване. Тогава настройвате по усещане и няма как да разберете дали помагате.

Чести спънки

Данните не са в подходящ вид

PDF без текстов слой, таблици в изображения, документи с еднакво съдържание. Ако извличането на текст отнеме повече от 30 минути, минете на по-малка колекция и го отбележете в документацията.

Всичко е с ниска близост

Проверете дали въпросът и парчетата минават през един и същ модел и дали нормализирането е еднакво. Това е причина номер едно.

Векторизирането е бавно

На партиди от 32–64 и само веднъж — резултатът се записва в базата. Ако се смята при всяко пускане, нещо не е наред в кода.