Една задача, от която следва всичко
Езиковият модел прави точно едно нещо: получава начало на текст и връща вероятности за това какъв е следващият токен. Нищо повече.
После избраният токен се долепя към текста и всичко се повтаря. Дума по дума — така се получава цял отговор. Това се нарича авторегресивно генериране.
Езиков модел
Модел, обучен да предсказва следващия токен по предходните. Обучението му не изисква обозначаване от човек — верният отговор е следващата дума в текста.
Защо това дава толкова много
Изглежда като евтин номер, но за да предсказваш добре следващата дума в произволен текст, трябва да си усвоил доста:
- „Столицата на Франция е …“ — трябват факти.
- „2 + 2 = …“ — трябва аритметика.
- „Кодът хвърли изключение, защото …“ — трябва разбиране за програмиране.
- „Той влезе в стаята и видя, че …“ — трябва усет за разказ.
Затова се получава
Способностите не са програмирани. Те се появяват като страничен ефект от една проста задача, приложена върху огромно количество текст.
Температура
Температура
Настройка, която променя колко „смело“ моделът тегли от разпределението.
0— винаги най-вероятният токен. Отговорите са предвидими и повторяеми; подходящо за извличане на данни, код, класификация.0.7— обичайното за разговор: разнообразно, но свързано.1.5и нагоре — редките токени получават шанс. Полезно за хрумвания, но текстът бързо се разпада.
Оттук идва въпросът „защо отговорът е различен всеки път“
Защото при температура над нула изборът е случаен. Един и същ въпрос може да даде различен отговор — и това не е грешка, а настройка.
Откъде идват халюцинациите
Моделът винаги има какво да отговори — разпределението никога не е празно. Ако не „знае“ факта, най-вероятните токени пак ще образуват правдоподобно изречение. Няма вътрешен механизъм, който да различава „това го помня“ от „това звучи както трябва“.
Какво помага
- Да му дадем източника в самия въпрос (урок 26).
- Да поискаме цитат и да проверим дали съществува.
- Ниска температура за фактически задачи.
- Изрично разрешение да каже „не знам“ — иначе ще предпочете да отговори.
Трите етапа на обучението
- Предварително обучение — четене на огромно количество текст с предсказване на следващия токен. Тук се появяват знанията.
- Донастройване по инструкции — хора пишат примерни двойки „задача → добър отговор“. Тук моделът се научава да отговаря на въпроси, вместо да продължава текста.
- Обучение по човешки предпочитания — хора сравняват отговори по двойки; от сравненията се строи награда. Тук се настройват тонът, отказите и полезността.
Ако говорите с „суров“ модел от първия етап, той няма да отговори на въпроса ви — ще продължи да пише още въпроси. Способността да води разговор идва от втория и третия етап.