Лого на 91. НЕГ „Проф. Константин Гълъбов“

Избираем модул · Урок 21

Езиковият модел предсказва следващата дума

Цялата магия е една задача: какъв е следващият токен. Вероятности, температура и защо един и същ въпрос дава различни отговори.

Една задача, от която следва всичко

Езиковият модел прави точно едно нещо: получава начало на текст и връща вероятности за това какъв е следващият токен. Нищо повече.

„Утре отивам на …“ → вероятности за следващия токенучилище41%работа22%къщи14%магазина9%лекар5%9%Моделът не „избира правилния“ отговор — той тегли от това разпределение.
Изходът не е дума, а разпределение на вероятности върху целия речник — десетки хиляди числа.

После избраният токен се долепя към текста и всичко се повтаря. Дума по дума — така се получава цял отговор. Това се нарича авторегресивно генериране.

Езиков модел

Модел, обучен да предсказва следващия токен по предходните. Обучението му не изисква обозначаване от човек — верният отговор е следващата дума в текста.

Защо това дава толкова много

Изглежда като евтин номер, но за да предсказваш добре следващата дума в произволен текст, трябва да си усвоил доста:

  • „Столицата на Франция е …“ — трябват факти.
  • „2 + 2 = …“ — трябва аритметика.
  • „Кодът хвърли изключение, защото …“ — трябва разбиране за програмиране.
  • „Той влезе в стаята и видя, че …“ — трябва усет за разказ.

Затова се получава

Способностите не са програмирани. Те се появяват като страничен ефект от една проста задача, приложена върху огромно количество текст.

Температура

Температура

Настройка, която променя колко „смело“ моделът тегли от разпределението.

  • 0 — винаги най-вероятният токен. Отговорите са предвидими и повторяеми; подходящо за извличане на данни, код, класификация.
  • 0.7 — обичайното за разговор: разнообразно, но свързано.
  • 1.5 и нагоре — редките токени получават шанс. Полезно за хрумвания, но текстът бързо се разпада.

Оттук идва въпросът „защо отговорът е различен всеки път“

Защото при температура над нула изборът е случаен. Един и същ въпрос може да даде различен отговор — и това не е грешка, а настройка.

Откъде идват халюцинациите

Моделът винаги има какво да отговори — разпределението никога не е празно. Ако не „знае“ факта, най-вероятните токени пак ще образуват правдоподобно изречение. Няма вътрешен механизъм, който да различава „това го помня“ от „това звучи както трябва“.

Какво помага

  • Да му дадем източника в самия въпрос (урок 26).
  • Да поискаме цитат и да проверим дали съществува.
  • Ниска температура за фактически задачи.
  • Изрично разрешение да каже „не знам“ — иначе ще предпочете да отговори.

Трите етапа на обучението

  1. Предварително обучение — четене на огромно количество текст с предсказване на следващия токен. Тук се появяват знанията.
  2. Донастройване по инструкции — хора пишат примерни двойки „задача → добър отговор“. Тук моделът се научава да отговаря на въпроси, вместо да продължава текста.
  3. Обучение по човешки предпочитания — хора сравняват отговори по двойки; от сравненията се строи награда. Тук се настройват тонът, отказите и полезността.

Ако говорите с „суров“ модел от първия етап, той няма да отговори на въпроса ви — ще продължи да пише още въпроси. Способността да води разговор идва от втория и третия етап.