MiLM Plus от Xiaomi представляет PROVE: метрики удаления объектов RC-S и RC-T, согласованные с восприятием, и реалистичный видеобенчмарк
Модели удаления объектов совершенствовались быстрее, чем метрики, используемые для их оценки. Диффузионные ластики теперь убедительно восстанавливают тени, отражения и затенённую структуру, однако PSNR, SSIM, LPIPS, ReMOVE и CFD часто ранжируют их результаты неверно. Корень проблемы носит структурный характер: удаление — это некорректно поставленная задача с множеством решений, поэтому не существует единственного эталона для сравнения. Команда из MiLM Plus, Xiaomi Inc. выпустила PROVE (Perceptual RemOVal cohErence), принятую на конференцию ACM MM 2026, чтобы устранить этот пробел. PROVE объединяет две метрики, согласованные с человеческим восприятием, — RC-S для пространственной когерентности и RC-T для временной согласованности — с PROVE-Bench, двухуровневым бенчмарком реальных видео. Обе метрики локально оценивают отредактированную область, используя скользящее окно и Maximum Mean Discrepancy по признакам DINOv2, и ни одной из них не требуется эталонное видео.
Готово ли решение к внедрению?
Да — как инструментарий для оценки, но не как функция продукта. PROVE поставляется в виде репозитория PyTorch под лицензией Apache 2.0 с единой точкой входа CLI (run_prove_metrics.py). Требуются Python 3.10+, PyTorch 2.6+, Transformers 4.51+ и веса DINOv2-giant. Маски обязательны; белые пиксели обозначают удалённый объект.
- Уровень компаний: Любая команда с одним GPU и конвейером создания масок. RC-S работает со скоростью 134,6 мс/кадр на одной RTX 4090, поэтому ночные проверки в CI доступны стартапам; наибольшую выгоду получают предприятия с большими каталогами редактирования, поскольку парные эталонные данные не требуются.
- Отрасли: Галереи и приложения камер для смартфонов, редактирование коротких видео, очистка каталогов электронной коммерции, рекламные и стоковые медиа, постпродакшен фильмов и визуальных эффектов, изображения недвижимости, а также редактирование данных для защиты конфиденциальности в картографических архивах.
- Применение: Сравнение моделей, проверки в CI по RC-S/RC-T, настройка количества шагов инференса или квантования без эталонного видео, фильтрация обучающих данных и формирование моделей вознаграждения.
- Кто будет использовать: В первую очередь исследователи в области компьютерного зрения и инженеры прикладного AI/ML в командах редактирования; во вторую — инженеры MLOps, подключающие оценку к CI; в третью — менеджеры продуктов, проводящие сравнение поставщиков.
- Где решение не подходит: Оценка в реальном времени на устройстве и побочные эффекты, такие как большие тени или отражения, выходящие за пределы обрезанной области оценки.
Три задокументированных режима отказа
Удаление объектов — некорректно поставленная задача с множеством решений: для одной и той же пустоты правдоподобными могут быть разные варианты восстановления, поэтому единственного эталона не существует.
- Смещение в пользу методов с полным эталоном: PSNR, SSIM и LPIPS предполагают поточечное соответствие, поэтому вознаграждают копирование и вставку вместо настоящего удаления. Остаточные тени занимают мало пикселей и почти не штрафуются. Что ещё хуже, сокращение числа шагов диффузионного инференса улучшает PSNR и SSIM, тогда как визуальное качество резко падает — регрессия к среднему.
- Слепые зоны методов без эталона: В ROSE-Bench авторы постепенно размывают замаскированную область. Ни ReMOVE, ни CFD не демонстрируют ухудшения; в итоге оба превосходят свои базовые показатели без размытия. Термин галлюцинаций CFD на основе SAM также даёт сбой: корректно восстановленное велосипедное сиденье помечается как галлюцинация и получает оценку хуже, чем необработанный исходный кадр.
- Нечувствительность к временным изменениям: Temporal Consistency и Temporal Flickering работают с признаками всего кадра. Поскольку отредактированная область занимает лишь небольшую часть кадра, внесённые в DAVIS искажения Random Drop и Random Replace почти не влияют на них, а иногда изменяют показатели в неправильную сторону.
RC-S и RC-T
В основе обеих метрик лежит одна идея: локальное сопоставление распределений в пространстве глубоких признаков вместо глобальной агрегации.
RC-S (пространственная согласованность): Анализ связанных компонентов разделяет маску на независимые объекты. Каждая ограничивающая рамка расширяется на одну треть длины каждой стороны, после чего фрагмент передаётся в DINOv2, а маска уменьшается до разрешения признаков. По карте признаков скользит окно размером w×w, вычисляя квадратичную величину Maximum Mean Discrepancy с гауссовым RBF-ядром между признаками маскированной области и локального фона. Оценки усредняются для каждого объекта, а затем между объектами.
RC-T (временная согласованность): Соседние кадры совместно обрезаются по объединению их масок, чтобы избежать смещения, после чего MMD вычисляется только внутри пересечения — области, восстановленной в обоих кадрах. Абляционное исследование показывает, что удаление обрезки делает RC-T невосприимчивой к внесённым искажениям.
Результаты
При сравнении с человеческими ранжированиями, полученными от 20 участников и агрегированными методом Борда, RC-S достигает среднего значения τ Кендалла 0,59 и ρ Спирмена 0,66 против 0,26/0,29 у ReMOVE и 0,16/0,18 у CFD. Она занимает первое место в пяти из шести бенчмарков. Варианты FR, использующие только фон, демонстрируют отрицательную корреляцию в большинстве наборов данных. В RORD-Val RC-S предпочитает чистое изображение размытому и вариантам с заменой областей в 100% случаев; при размытии ReMOVE достигает 60,06%, а CFD — 49,27%. RC-T монотонно реагирует на усиление искажений, тогда как TC и TF этого не делают.
Абляционные исследования выделяют вклад каждого компонента: DINOv2 (среднее τ 0,59) превосходит DINOv3 (0,51) и SAM (0,44); отказ от скользящего окна снижает показатель на 0,11; замена MMD на косинусную меру снижает его на 0,07. RC-S также является самой дешёвой из протестированных пространственных метрик — она в 13,7 раза быстрее CFD.
PROVE-Bench
PROVE-M содержит 80 парных видео: входные кадры, снятые со штатива, и целевые видео без объекта, снятые в течение двух минут; маски SAM3 уточнялись покадрово, после чего проходили трёхэтапный контроль качества, а затем к триплету синхронно применялась аугментация движения в стиле Кена Бёрнса. Каждый клип состоит из 81 кадра с разрешением 1080p. PROVE-H добавляет 100 сложных видео без эталонных данных — с толпами людей, текущей водой, пламенем, текстурированным ландшафтом, отражениями в нескольких лужах и быстрым движением; намеренно используются неуточнённые маски SAM3.
В публичной таблице лидеров SVOR (1.3B) лидирует по совокупному RC-S с результатом 0,5197; EffectErase лидирует по RC-T с результатом 0,2525.
Основные выводы
- RC-S и RC-T оценивают удаление локально с помощью MMD в скользящем окне по признакам DINOv2; эталонные данные не требуются.
- RC-S достигает среднего значения τ Кендалла 0,59 при сравнении с человеческими ранжированиями против 0,26 у ReMOVE и 0,16 у CFD.
- ReMOVE и CFD оба вознаграждают размытие; RC-S ухудшается монотонно и выигрывает в 100% тестов на возмущения.
- PROVE-Bench добавляет 80 парных видео с аугментацией движения и 100 сложных видео без эталонных данных — все реальные, с разрешением 1080p.
- Код под лицензией Apache 2.0 и набор данных на Hugging Face; RC-S работает со скоростью 134,6 мс/кадр и обходится в 13,7 раза дешевле CFD.
Ознакомьтесь с публикацией, репозиторием GitHub, страницей проекта и набором данных. Также подписывайтесь на Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией более 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.