Какво се представя днес
Първата половина от годината приключва с работеща система за търсене върху ваши данни и число, което я описва. Това е основата, върху която през втория срок се надгражда AI функцията.
| Част | Време | Съдържание |
|---|---|---|
| Данните | 1 мин | какви са, откъде, колко записа, как са нарязани |
| Демонстрация | 1.5 мин | три заявки на живо, включително една трудна |
| Числата | 1.5 мин | recall@5, MRR и как са измерени |
| Слабости | 1 мин | коя заявка се проваля и защо |
Изисквания
- Поне 50 парчета в базата, с източник за всяко.
- Работещо търсене — смислово, а още по-добре хибридно.
- Набор от поне 20 заявки с отбелязан верен отговор, от които 3 без отговор.
- Измерени recall@5 и MRR.
- Поне едно сравнение: два варианта на системата с числа за двата.
Какво се цени
Не най-високото число, а честното измерване и разбирането защо числото е такова. Система с recall 0.65 и точен анализ струва повече от 0.95 без обяснение откъде идва.
Чести проблеми и бързи поправки
Всичко се намира прекалено добре
Проверете дали заявките не са писани по документите. Дайте на съученик да състави пет въпроса, без да е чел парчетата, и измерете пак.
Нищо не се намира
Проверете дали векторите са изчислени с един и същ модел за документите и за заявката, и дали нормализирането е еднакво. Това е причина номер едно.
Търсенето е бавно
При под 10 000 парчета не е нужен индекс. Ако все пак е бавно, вероятно изчислявате векторите на документите при всяка заявка — те се смятат веднъж и се пазят.