Обратната задача
Езиковият модел добавя дума след дума. Моделите за изображения работят иначе: тръгват от правоъгълник чист шум и постепенно го изчистват, докато се появи образ.
Дифузия
Обучение, при което на снимка се добавя шум на стъпки, а моделът се учи да предсказва добавения шум. После процесът се пуска наобратно — от шум към образ.
Обучението е гениално просто: взимаме милиони снимки с описания, разваляме ги със шум и караме модела да познае какво е било добавено. Щом умее това, умее и обратното.
Откъде идва връзката с текста
Промптът се превръща във вектор (урок 20) и участва във всяка стъпка на изчистването. Затова описанието влияе на резултата през целия процес, а не само в началото.
- Конкретните описания работят по-добре от общите: „черна котка на дървен перваз, вечерна светлина“ вместо „котка“.
- Стилът се задава изрично: акварел, техническа схема, снимка с широкоъгълен обектив.
- Има и отрицателен промпт: какво да няма в изображението.
- Едно и също описание с различно начално състояние дава различни изображения — както температурата при текста.
Какво не могат
- Текст в изображението — става по-добре, но остава ненадеждно.
- Точен брой обекти: „седем ябълки“ често дава шест или осем.
- Последователност: същият герой в друга поза е отделен проблем.
- Технически верни схеми — моделът рисува нещо, което прилича на схема.
Ръцете вече не са проблем
Шегата с шестте пръста беше вярна за моделите от 2022 г. Оттогава слабостите се преместиха — затова не се доверявайте на стар списък с признаци, а проверявайте.
Звук и музика
Същият подход работи и за звук: генерира се спектрограма (урок 10) или направо звуковата вълна. Оттам идват синтезът на глас, клонирането на глас по няколко секунди запис и генерирането на музика по описание.
Гласът на човек е негов
Клонирането на чужд глас без съгласие е и неетично, и в много случаи незаконно. В курса — само собствен глас и само с ваше съгласие.
Разпознаване на генерирано съдържание
Какво помага
- Метаданни и водни знаци — вграждат се от част от услугите, но се губят при обработка.
- Обратно търсене на изображението — истинската снимка обикновено има история в мрежата.
- Контекст: кой го публикува, откъде идва, има ли други източници за същото събитие.
- Несъответствия в детайлите: отражения, сенки, текст на фона, повтарящи се шарки.
Какво не помага
„Детекторите“ на генерирано съдържание грешат често и в двете посоки. Присъдата „това е генерирано, защото детекторът каза“ е ненадеждна — особено когато има последици за човек.
Правилото за днес
Тежестта на доказване се измества: важното вече не е дали изображението изглежда истинско, а откъде идва.