Лого на 91. НЕГ „Проф. Константин Гълъбов“

Избираем модул · Урок 31

Халюцинации и оценяване на AI система

Защо моделът измисля уверено, кои мерки помагат и как се прави набор от тестове (evals), с който твърдението „работи“ става проверимо.

Уверено и грешно

Най-опасната грешка на езиковия модел не е, че не знае — а че не звучи като незнаещ. Изходът му е еднакво гладък и когато цитира истински закон, и когато измисля несъществуващ.

Халюцинация

Уверено твърдение, което не съответства на действителността или на подадените документи.

Причината я знаем от урок 21: моделът тегли от вероятностно разпределение и никога не остава без отговор. Няма вътрешна разлика между „помня този факт“ и „това звучи както трябва“.

Кога рискът е най-голям

  • Редки и конкретни факти: точни цитати, номера на членове, дати, статистика.
  • Неща след датата на обучението.
  • Въпроси, които съдържат невярна предпоставка („кога Х е направил Y“, когато Y не се е случило).
  • Дълги вериги разсъждения, където една ранна грешка се пренася нататък.
  • Език с по-малко данни в обучението — включително български.

Смъртоносната комбинация

Уверен тон + правдоподобни подробности + бърз отговор. Точно изглеждащото като най-добър отговор е и най-трудното за проверка.

Какво намалява халюцинациите

МяркаКак действаКолко помага
Подаване на източника (RAG)моделът отговаря по текст, а не по паметнай-много
Изрично разрешение „не знам“дава допустим изход при липса на даннимного
Искане за цитатправи проверката възможнамного
Ниска температурапо-малко случайност при фактисредно
Втора проверка от моделдруг промпт проверява твърдението спрямо източникасредно
Човек в решаващата веригапоследната дума е на човекзадължително при последици

Нито една от мерките не премахва халюцинациите напълно. Затова системите се проектират така, че грешката да е откриваема и поправима, а не невъзможна.

Как се измерва AI система

В урок 6 измервахме класификатор с точност и обхват. Тук няма един верен отговор, но това не значи, че не може да се мери.

Набор от тестове (evals)

Списък от входове с очаквано поведение, който се пуска при всяка промяна на промпта или модела.

  1. Съберете 20–30 реални входа, включително трудни и такива без отговор.
  2. За всеки запишете какво е приемливо поведение — не непременно точния текст.
  3. Направете проверката автоматична, където е възможно: съдържа ли ключова стойност, валиден ли е JSON, признава ли незнание.
  4. Пуснете и запишете броя минали тестове — това е вашата база за сравнение.
  5. След всяка промяна пускайте същия набор. Ако едно се подобри, а две се влошат, промяната е лоша.

Видове проверки

  • Точна — изходът съдържа конкретна стойност или съответства на схема. Най-надеждната.
  • По правило — дължина, език, наличие на цитат, липса на забранени думи.
  • С модел като съдия — друг модел оценява отговора по зададени критерии. Удобно, но самият съдия греши — проверява се върху примери, оценени от човек.
  • От човек — най-скъпо и най-надеждно; използва се за малка извадка.

Правилото

„Пробвах няколко въпроса и работи“ не е измерване. Числото „18 от 25 теста минават“ — е.