Тема субъективного восприятия обработанных изображений долго оставалась недостаточно изученной. Несколько вариантов обработки одной и той же сцены могут восприниматься как одинаково удачные, а предпочтения зависят от личного, культурного и ситуативного контекста. Именно поэтому традиционные метрики качества изображения работают ограниченно. Они обучены находить технические деградации (артефакты сжатия, шумы и т.п.) и потому часто ставят почти одинаковые оценки стилистически разным, но с технической точки зрения одинаково чистым изображениям. А возможно ли вообще сравнивать эстетику изображений?

В то время как научный подход позволяет объективно судить о степени различия между конкретными цветами (этим занимается колориметрия), реальной индустрии (производителям смартфонов и камер) требуется разрабатывать алгоритмы для рендеринга эстетически наиболее предпочтительных изображений. Несмотря на то, что эти задачи выглядят близкими (ведь изображение складывается из набора цветных пикселей), между ними пролегает методологическая пропасть, ведь для колориметриста изображение — это сложно-семантический стимул и на текущий момент хорошей модели image appearance model (IAM) ещё не представлено. В этой ситуации разумно обратиться к большим данным.
Ученые Института AIRI, ИППИ РАН, МФТИ и профессиональный фотограф Майкл Фриман предложили специализированный бенчмарк REPID — первый набор данных, который сосредоточен на эстетическом восприятии обработки фотографий через сравнение рендеров одной сцены реальными зрителями.
REPID построен на основе набора MIT-Adobe FiveK, который включает 5000 сцен, снятых профессиональными фотографами в разных условиях. Для каждой сцены использовались пять авторских рендеров и один автоматический вариант от Adobe Photoshop. Затем для каждой пары рендеров одной сцены исследователи собрали по 25 пользовательских голосов, чтобы измерить предпочтительность той или иной обработки. Сбор оценок проходил на краудсорсинговой платформе Яндекс.Задания. Участникам показывали по шесть пар фотографий на нейтральном сером фоне и задавали вопрос: «Какое изображение предпочтительнее?». Можно было выбрать левую картинку, правую или ответить, что они не отличаются. Для проверки внимательности на каждой странице добавляли контрольную пару одинаковых изображений. Всего в исследовании участвовали 13 648 человек, которые оставили более 2,5 миллиона оценок.

Исследователи сравнивали цветовые параметры обработки, такие как температура, оттенок, насыщенность и тональные – яркость, экспозиция, контрастность, высветления и тени. Универсального стиля обработки, который нравился бы всем и всегда, исследователи не обнаружили — выбор зрителей зависит от того, что именно изображено в кадре. Однако общая тенденция все же есть. Чаще люди отдавали предпочтение более сдержанным версиям снимков, а не ярко выраженным авторским интерпретациям. Так, один из фотографов в наборе данных предлагал визуально интересные, но ненатуралистичные рендеры и почти всегда проигрывал в голосовании. Это показывает, что универсальные алгоритмы автоматической обработки ограничены, и более перспективными выглядят контентно-зависимые решения.

Исследование влияния различных настроек обработки изображения показало, что несмотря на то, что в редакторах десятки ползунков, по сути, они сводятся всего к четырем базовым параметрам: яркость (экспозиция), контраст, цветовая температура и насыщенность; остальное — просто вариации или уточнения этих же осей. Выделяется, что в большинстве случаев самым или одним из самых важных параметров является shadows/highlight recovery — настройки, которые изменяют яркость и контраст только в самых темных или самых светлых частях фото, не затрагивая середину.
При анализе результатов исследователи совершили попытку получить ценный ответ на вопрос «Как создать инструкцию по обработке различных изображений?». В среднем автоматическая обработка действительно уступает авторским версиям, но стоит посмотреть на конкретные примеры — там, где разброс между обработками особенно заметен — выясняется, что есть кейсы, где фотографы справились хуже алгоритма. «В среднем» и «в конкретном случае» — это две большие разницы. При анализе первой иллюстрации видно, что первый автор стабильно хуже второго. А по статистике — все ровно наоборот. Разметка не врёт, глаз не обманывает — просто конкретный пример и статистика по всему датасету — это разные вещи.
Похожая ситуация сложилась с цветовой температурой. Есть тренд, показывающий, что самая «холодная» обработка почти всегда обречена на низкие оценки, но обязательно найдется пример, где всё будет наоборот. Сами по себе перечисленные факты не несут статистической значимости, но вместе подводят к одной мысли: твёрдо утверждать что-то про предпочтительность конкретного вида обработки, конкретного автора и т.п. — некорректно. Слишком много контекста теряется в любом обобщении. В самой статье были предложены общие качественные инструкции от профессионального фотографа, такие как рекомендация использовать диапазон цветовых температур 5000-5500K и т.п., которые аналогично не были экспериментально подтверждены в исследовании.
Был получен интересный инсайт по процессу обработки изображений: авторы часто делают очень похожие правки, и разметчики не особо их различали. Из-за этого большая часть рейтингов в разметке находится в состоянии «не определились» — вероятность того, что левая картинка лучше правой, находится в районе 1/2. Работа с такими данными требует аккуратного подхода к интерпретации с точки зрения теории неопреленностей.

«Результаты нашей работы можно применять в самых разных задачах: для обучения моделей эстетической оценки, персонализированных рекомендаций в фоторедакторах и галереях, для автоматического подбора визуально приятных стилей обработки. Одно из самых перспективных направлений использование обученной модели IRQA как функции потерь для алгоритмов, которые смогут автоматически генерировать наиболее привлекательные для зрителя обработки».
Всеволод Плохотнюк, научный сотрудник группы «Цветовая вычислительная фотография» Института AIRI
В дальнейшем исследователи планируют расширять датасет новыми стилями, а также разрабатывать модели, способные лучше объяснять, почему именно та или иная стилизация оказывается лучшей для конкретной сцены.
