Как сочетать предпочтения и критерии при дообучении моделей изображений
Arena объединила 5 млн парных голосов, проверку следования промпту и защиту от оптимизации под неверный сигнал. Разбираем устройство награды, заявленные результаты и ограничения эксперимента.
Красивое изображение не обязательно точно выполняет запрос. Модель может выдать убедительную композицию, но пропустить предмет, перепутать пространственное отношение или превратить пиксельную сцену в фотографию. Обратная проблема тоже реальна: буквальное следование длинному списку условий может ухудшить цельность и визуальное качество. В новой работе Arena предлагает не выбирать один из этих ориентиров, а составить награду из нескольких сигналов.
Авторы обучили модель предпочтений примерно на 5 млн парных голосов пользователей Text-to-Image Arena и добавили проверки по явно сформулированным критериям. По заявлению Arena, полученная схема улучшила две уже сильные модели: посттренированная FLUX.2-dev прибавила 69 баллов в живом рейтинге, а Ideogram 4 получила 1224 балла. Это результаты самой Arena в её инфраструктуре и по состоянию рейтинга на 4 сентября 2026 года, а не независимое воспроизведение.
Почему одного человеческого выбора мало
Первый компонент — reward model на основе модели Брэдли—Терри. Она получает промпт и изображение и выдаёт скалярную оценку предпочтительности. Обучающие пары собраны из сравнений более чем ста моделей. Такой сигнал хорошо отражает общую привлекательность результата: композицию, эстетику и визуальное качество. Arena также сообщает, что эффект последующего RL рос с объёмом данных, использованных для обучения reward model.
Но парный выбор сжимает несколько причин в один ответ. Пользователь может предпочесть более эффектное изображение, даже если оно хуже выполняет отдельное условие. Исследование Arena-T2I Hard, на которое ссылается команда, специально разделяет эту проблему на критерии. Авторы собрали 310 сложных промптов из журналов Arena и в среднем разложили каждый примерно на 30 вопросов «да или нет» в шести категориях. По их данным, среди 11 проверенных систем разрыв между результатами достигал примерно 33 процентных пунктов, а лучший закрытый сервис набрал 0,855. Эти числа относятся к опубликованному авторами бенчмарку, а не к тесту TheTimeAI.
Как устроена авторубрика
Для каждого обучающего промпта языковая модель строит древовидный чек-лист. Отдельные вопросы проверяют наличие объекта, его свойства, взаимное расположение предметов и сохранение требуемого стиля. Зависимости важны: бессмысленно оценивать цвет предмета, которого нет в кадре. Поэтому дочерний критерий учитывается только после выполнения родительского.
Затем vision-language model отвечает на вопросы по сгенерированному изображению. Доля выполненных пунктов становится наградой за faithful prompt following. Такой сигнал точнее указывает, где именно модель потеряла инструкцию, чем единая оценка «нравится — не нравится». В более ранней работе Arena-T2I Hard авторы объединяли checklist reward с эстетической наградой и сообщали о более выгодном компромиссе между точностью промпта и визуальным качеством на SD3.5-Medium и FLUX.1-dev по своему протоколу MMRB2.

Почему чек-листа тоже недостаточно
Рубрика, построенная только из текста запроса, не всегда видит неявное намерение. Фраза может оставлять место для творчества, а отрицательное условие — запрещать элемент или стиль, который легко добавить ради более эффектной картинки. Кроме того, заранее составленный список не знает, какой обходной путь модель найдёт уже во время RL.
Arena поэтому добавила награду за соблюдение ограничений. Она должна отмечать лишние объекты, смену заданного стиля и нарушение отрицательных инструкций. Команда применяет этот сигнал только к промптам, где нужна сравнительно строгая точность, чтобы не подавлять творческую свободу в открытых запросах.
Отдельные детекторы следят за повторяющимися способами обмана награды. Среди примеров Arena называет бессмысленный текст и уход в фотореализм, когда промпт требует нефотографический стиль. Этот сигнал не становится ещё одной самостоятельной целью. Он работает как заслонка: если детектор видит reward hacking, положительная нормализованная награда предпочтений обнуляется, а отрицательная сохраняется. Идея в том, чтобы пресечь известный обходной путь, не дав политике новую метрику, под которую можно оптимизироваться.
Зачем понадобилось усреднение весов
Даже при общей архитектуре разные наборы наград развивают разные сильные стороны. Вместо долгого поиска единственного коэффициента Arena независимо оптимизировала несколько политик, нормализовала сигналы и затем усреднила обновления весов. Этот приём родственен model soups: несколько дообученных вариантов объединяются в пространстве весов без добавления отдельной модели на этапе генерации.

Что показал офлайн-эксперимент
Arena сообщает, что обучение проводилось на 10 тысячах реальных пользовательских промптов, а оценка — на отдельной тысяче промптов. Каждый checkpoint сравнивали с замороженной базовой моделью по парному протоколу MMRBv2. В качестве судьи использовали Gemini-3.5-Flash; пары показывали в обоих порядках, чтобы снизить позиционное смещение.
По таблице авторов, preference-only дала win rate 50,7% с Arena RM. Комбинация предпочтений, faithful checklist и проверки ограничений достигла 64,2%. Добавление anti-hack gate отдельно дало 63,5%, а итоговое усреднение политик подняло показатель до 66,0%. С открытой PickScore последовательность была слабее по абсолютным значениям, но финальный вариант всё равно получил лучший результат в этой таблице — 62,6%. Все эти цифры относятся к выбранным авторами данным, judge-модели и протоколу.
Живая оценка дополняет офлайн-таблицу, но не устраняет её границы. Arena указывает рост FLUX.2-dev с 1132,8 до 1202 баллов и Ideogram 4 с 1204 до 1224 в слепых парных сравнениях пользователей. Рейтинг динамический, а публикация фиксирует снимок на 4 сентября. Заявление о превосходстве Ideogram 4 над всеми публично перечисленными open-source моделями также принадлежит Arena и ограничено этим снимком списка.
Как соотносятся офлайн- и живые оценки
Две группы результатов отвечают на разные вопросы. Офлайн-протокол позволяет сравнивать варианты награды на одном отложенном наборе и с одним судьёй. Это делает абляцию более контролируемой, но переносит предпочтения и ошибки Gemini-3.5-Flash в итоговый win rate. Показ изображений в обоих порядках снижает позиционное смещение, однако не проверяет, одинаково ли judge-модель понимает редкие стили, мелкий текст и сложные пространственные отношения.
Живой рейтинг использует слепые парные выборы людей и поэтому ближе к общему пользовательскому впечатлению. При этом состав аудитории, поток промптов, набор конкурирующих моделей и число голосов меняются со временем. Баллы из снимка рейтинга нельзя напрямую приравнять к процентам офлайн-побед. Согласованное улучшение в двух режимах делает заявление Arena содержательнее, но не превращает его в независимую проверку: обе оценки организованы той же компанией, а публикация не раскрывает полный анализ неопределённости и затрат.
Что работа пока не доказывает
Публикация не даёт независимого воспроизведения, доверительных интервалов для живых баллов и подробной оценки вычислительной стоимости. Неясно, как результат меняется при другой judge-модели, на иных промптах и после более долгого RL. Автоматические рубрики зависят от качества языковой модели, а их проверка — от ошибок vision-language model. Если обе систематически пропускают один и тот же тип нарушения, награда закрепит слепую зону.
Есть и инженерный риск: набор anti-hack правил описывает уже замеченные обходы. Новая стратегия может не попасть в список. Слишком строгая рубрика способна наказать допустимую интерпретацию открытого запроса, а слабая — оставить модели привычный короткий путь. Поэтому prompt-dependent gating выглядит не мелкой деталью, а условием применения всей схемы.
Практический смысл схемы
Предпочтение хорошо измеряет целостное впечатление, чек-лист превращает требования в локальные проверяемые сигналы, а детектор обходов ограничивает оптимизацию там, где единая метрика даёт неверный стимул. Эти части не заменяют друг друга. Работа Arena показывает один способ собрать их в систему и заявляет улучшения в офлайн- и живой оценке. Следующий шаг для внешней проверки — воспроизвести результат с опубликованным протоколом, несколькими судьями, затратами на обучение и анализом ошибок, а не только с итоговым win rate.
Фотографии и лицензии. Обложка — Nacho Kamenov and Humans in the Loop, «A trainer instructing a data annotator on how to label images»: https://commons.wikimedia.org/w/index.php?curid=130959986 . Разметка данных — те же авторы, «Data annotators labeling data»: https://commons.wikimedia.org/w/index.php?curid=130959995 . Обе фотографии — BBC / Better Images of AI, CC BY 4.0: https://creativecommons.org/licenses/by/4.0/ . Серверная стойка — Abigor, собственная работа: https://commons.wikimedia.org/w/index.php?curid=17976040 ; CC BY-SA 3.0: https://creativecommons.org/licenses/by-sa/3.0/ . Все снимки уменьшены до ширины 1280 пикселей. Это тематические архивные фотографии, не изображения эксперимента Arena.