Сметката на един отговор
Услугите таксуват на токен, отделно за вход и за изход. Изходът е няколко пъти по-скъп, но входът обикновено е много повече на брой — там влиза целият контекст.
Пример за един отговор в RAG система:
системно указание 120 токена
4 парчета контекст 1 600 токена
история на разговора 400 токена
въпрос 30 токена
────────────────────────────────────
вход 2 150 токена
изход 180 токена
при 0.30 $ / млн вход и 2.50 $ / млн изход:
вход: 2150 / 1e6 × 0.30 = 0.000645 $
изход: 180 / 1e6 × 2.50 = 0.000450 $
общо ≈ 0.0011 $ ≈ 0.002 лв. за отговорУмножете по мащаба
0.002 лв. изглежда нищожно. При 500 ученици по 10 въпроса дневно за 180 учебни дни това е около 1800 лв. годишно — и вече е решение, което някой трябва да вземе.
Къде отиват парите
| Пера | Обичаен дял | Как расте незабелязано |
|---|---|---|
| Контекст от документите | най-голямото | повече парчета „за всеки случай“ |
| История на разговора | голямо при дълги чатове | цялата история вместо последните N |
| Системно указание | малко, но при всяка заявка | натрупване на правила с времето |
| Изход | средно | липса на ограничение за дължина |
| Повторни опити | малко | агресивни повторения при аварии |
Основното наблюдение: цената се определя от контекста, а не от въпроса. Затова оптимизацията почти винаги започва от входа.
Седем начина да падне разходът
- По-малко парчета. 3 вместо 6 често дава същия отговор. Проверява се с набора от урок 13 — ако recall@3 е близък до recall@6, разликата е чиста загуба.
- По-малки парчета. 300 токена вместо 800, ако измерването позволява.
- Съкратена история. Последните 6 съобщения плюс обобщение на по-старото.
- Таван на изхода.
maxOutputTokensспоред задачата, не по подразбиране. - По-малък модел за прости задачи. Класификация и насочване не изискват най-силния модел.
- Кеш. Едни и същи въпроси се повтарят повече, отколкото очаквате.
- Ранно спиране. Ако търсенето не намери нищо подходящо, отговорът „не се съдържа“ се дава без извикване на модела.
Последното е най-подценявано
Проверка на близостта преди извикването спестява и пари, и халюцинации: щом най-близкото парче е с близост 0.2, няма смисъл да се пита моделът.
Кеширане
Точен кеш
Ключ: нормализиран въпрос плюс версия на промпта плюс версия на модела. При съвпадение се връща записаният отговор. Просто и безопасно; хваща само повторени дословно въпроси.
Смислов кеш
Ако новият въпрос е много близък до вече отговорен (близост над 0.95), се връща старият отговор. По-мощно, но рисковано — „кога е изпитът по химия“ и „кога е изпитът по физика“ може да са опасно близки.
Кешът и правата
Кешът трябва да отчита правата на потребителя. Отговор, съставен по документи с високо ниво на достъп, не бива да се връща на друг потребител.
Кога да не оптимизирате
- Преди да сте измерили разхода — оптимизирате наслуки.
- Когато системата все още се променя всеки ден.
- Когато цената е малка спрямо ползата — един час ваше време струва повече от месечната сметка.
Оптимизацията има смисъл, когато е измерена и когато не влошава качеството. Затова всяка промяна минава през същия златен набор.