Лого на 91. НЕГ „Проф. Константин Гълъбов“

Избираем модул · Урок 28

Генериране на изображения и звук

Как от шум се получава образ: идеята на дифузията. Какво могат и какво не могат тези модели и как се разпознава генерирано съдържание.

Обратната задача

Езиковият модел добавя дума след дума. Моделите за изображения работят иначе: тръгват от правоъгълник чист шум и постепенно го изчистват, докато се появи образ.

чист шумстъпка 10стъпка 25стъпка 40готовоНа всяка стъпка моделът маха малко шум — насочван от текста на промпта.
Всяка стъпка е предсказване „кой шум да махна“, при това съобразено с текста на промпта.

Дифузия

Обучение, при което на снимка се добавя шум на стъпки, а моделът се учи да предсказва добавения шум. После процесът се пуска наобратно — от шум към образ.

Обучението е гениално просто: взимаме милиони снимки с описания, разваляме ги със шум и караме модела да познае какво е било добавено. Щом умее това, умее и обратното.

Откъде идва връзката с текста

Промптът се превръща във вектор (урок 20) и участва във всяка стъпка на изчистването. Затова описанието влияе на резултата през целия процес, а не само в началото.

  • Конкретните описания работят по-добре от общите: „черна котка на дървен перваз, вечерна светлина“ вместо „котка“.
  • Стилът се задава изрично: акварел, техническа схема, снимка с широкоъгълен обектив.
  • Има и отрицателен промпт: какво да няма в изображението.
  • Едно и също описание с различно начално състояние дава различни изображения — както температурата при текста.

Какво не могат

  • Текст в изображението — става по-добре, но остава ненадеждно.
  • Точен брой обекти: „седем ябълки“ често дава шест или осем.
  • Последователност: същият герой в друга поза е отделен проблем.
  • Технически верни схеми — моделът рисува нещо, което прилича на схема.

Ръцете вече не са проблем

Шегата с шестте пръста беше вярна за моделите от 2022 г. Оттогава слабостите се преместиха — затова не се доверявайте на стар списък с признаци, а проверявайте.

Звук и музика

Същият подход работи и за звук: генерира се спектрограма (урок 10) или направо звуковата вълна. Оттам идват синтезът на глас, клонирането на глас по няколко секунди запис и генерирането на музика по описание.

Гласът на човек е негов

Клонирането на чужд глас без съгласие е и неетично, и в много случаи незаконно. В курса — само собствен глас и само с ваше съгласие.

Разпознаване на генерирано съдържание

Какво помага

  • Метаданни и водни знаци — вграждат се от част от услугите, но се губят при обработка.
  • Обратно търсене на изображението — истинската снимка обикновено има история в мрежата.
  • Контекст: кой го публикува, откъде идва, има ли други източници за същото събитие.
  • Несъответствия в детайлите: отражения, сенки, текст на фона, повтарящи се шарки.

Какво не помага

„Детекторите“ на генерирано съдържание грешат често и в двете посоки. Присъдата „това е генерирано, защото детекторът каза“ е ненадеждна — особено когато има последици за човек.

Правилото за днес

Тежестта на доказване се измества: важното вече не е дали изображението изглежда истинско, а откъде идва.