Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

MiLM Plus на Xiaomi представя PROVE: съобразени с човешкото възприятие метрики за премахване на обекти RC-S и RC-T с реален видео бенчмарк

Моделите за премахване на обекти се подобряват по-бързо от метриките, използвани за оценяването им. Дифузионните модели за заличаване вече възстановяват убедително сенки, отражения и закрита структура, но PSNR, SSIM, LPIPS, ReMOVE и CFD често подреждат резултатите в неправилен ред. Коренът на проблема е структурен: заличаването е некоректно поставена задача с множество възможни решения, така че не съществува единствена еталонна истина, с която да се сравнява. Екип от MiLM Plus, Xiaomi Inc. представи PROVE (Perceptual RemOVal cohErence), приет на ACM MM 2026, за да запълни тази празнина. PROVE съчетава две метрики, съобразени с човешкото възприятие — RC-S за пространствена съгласуваност и RC-T за времева последователност — с PROVE-Bench, реален видео бенчмарк на две нива. И двете метрики оценяват локално редактираната област, като използват Maximum Mean Discrepancy с плъзгащ се прозорец върху DINOv2 характеристики, и нито една от тях не изисква референтно видео.

Може ли да бъде внедрено?

Да — като инструментариум за оценяване, а не като продуктова функция. PROVE се предоставя като PyTorch хранилище с лиценз Apache 2.0 и една входна точка за CLI (run_prove_metrics.py). Необходими са Python 3.10+, PyTorch 2.6+, Transformers 4.51+ и теглата на DINOv2-giant. Маските са задължителни; белите пиксели обозначават премахнатия обект.

  • Ниво на компанията: Всеки екип с един GPU и конвейер за маски. RC-S работи със 134.6 ms/кадър на един RTX 4090, така че нощните CI проверки са практични за стартъпи; най-голяма полза имат предприятията с големи каталози за редактиране, тъй като не е необходима сдвоена еталонна истина.
  • Индустрии: Галерии и приложения за камери на смартфони, редактиране на кратки видеа, почистване на каталози за електронна търговия, реклама и стокови медии, постпродукция на филми/VFX, изображения на недвижими имоти и заличаване на лични данни в картографски архиви.
  • Приложения: Сравнителни тестове на модели, CI проверки чрез RC-S/RC-T, настройване на инференс стъпки или квантизация без референтно видео, филтриране на тренировъчни данни и оформяне на модели за награди.
  • Кой го внедрява: Първо изследователи в областта на компютърното зрение и инженери по приложен AI/ML в екипи за редактиране; второ — MLOps инженери, които интегрират оценката в CI; трето — продуктови мениджъри, провеждащи сравнения между доставчици.
  • Къде не е подходящо: Оценяване в реално време на устройство и странични ефекти като големи сенки или отражения, простиращи се извън изрязаната област за оценяване.

Три документирани режима на отказ

Премахването на обекти е некоректно поставена задача с множество възможни решения: за една и съща празнина са възможни множество правдоподобни възстановявания, така че не съществува единствена еталонна истина.

  • Предубеденост към методите с пълна референция: PSNR, SSIM и LPIPS предполагат точково съответствие, така че възнаграждават копирането и поставянето вместо истинското заличаване. Остатъчните сенки заемат малко пиксели и почти не се наказват. Още по-лошо, намаляването на инференс стъпките на дифузионния модел подобрява PSNR и SSIM, докато визуалното качество се срива — регресия към средната стойност.
  • Слепи зони при методите без референция: В ROSE-Bench авторите постепенно размиват маскираната област. Нито ReMOVE, нито CFD се влошава; в крайна сметка и двата метода надминават своите базови резултати без размазване. Терминът за халюцинации на CFD, базиран на SAM, също дава грешен сигнал: реално възстановена седалка на велосипед е маркирана като халюцинация и получава по-лош резултат от нередактирания вход.
  • Нечувствителност към времето: Temporal Consistency и Temporal Flickering работят с характеристики на целия кадър. Тъй като редактираната област е малка част от кадъра, въведените изкривявания Random Drop и Random Replace в DAVIS почти не ги променят, а понякога ги променят в неправилната посока.

RC-S и RC-T

И двете споделят една идея: локално съпоставяне на разпределения в пространството на дълбоките характеристики вместо глобално агрегиране.

RC-S (пространствена): Анализът на свързаните компоненти разделя маската на независими цели. Всяка ограничителна рамка се разширява с една трета от дължината на страната си, изрязаният фрагмент се подава към DINOv2, а маската се намалява до резолюцията на характеристиките. Прозорец с размер w×w се плъзга по картата на характеристиките, като изчислява квадратичната Maximum Mean Discrepancy с гаусов RBF kernel между маскираните характеристики и локалните характеристики на фона. Резултатите се осредняват за всяка цел, а след това и между целите.

RC-T (времева): Съседните кадри се изрязват съвместно в рамките на обединението на техните маски, за да се избегне разминаване, след което MMD се изчислява само в рамките на сечението — областта, възстановена и в двата кадъра. Аблационно изследване показва, че премахването на изрязването прави RC-T сляпа за въведени изкривявания.

Резултати

В сравнение с човешки оценки от 20 участници, агрегирани чрез ранжиране по Борда, RC-S достига средна стойност 0.59 за Kendall’s τ и 0.66 за Spearman’s ρ срещу 0.26/0.29 за ReMOVE и 0.16/0.18 за CFD. Тя се класира на първо място в пет от шест бенчмарка. Вариантите с пълна референция, използващи само фона, показват отрицателна корелация в повечето набори от данни. В RORD-Val RC-S предпочита чистото изображение пред размазаните и вариантите със сменени области в 100% от случаите; при размазване ReMOVE постига 60.06%, а CFD — 49.27%. RC-T реагира монотонно на нарастващото изкривяване, докато TC и TF не го правят.

Аблационните изследвания изолират приноса на всеки компонент: DINOv2 (0.59 средно τ) надминава DINOv3 (0.51) и SAM (0.44); премахването на плъзгащия се прозорец води до спад от 0.11; замяната на MMD с косинусова мярка води до спад от 0.07. RC-S е и най-евтината пространствена метрика сред тестваните — 13.7 пъти по-бърза от CFD.

PROVE-Bench

PROVE-M съдържа 80 сдвоени видеа: входни видеа, заснети със статив, и видеа без целеви обект, заснети в рамките на две минути, маски от SAM3, прецизирани кадър по кадър, тристепенен контрол на качеството, след което към тройката синхронно се прилага аугментация на движението в стил Ken Burns. Всеки клип е от 81 кадъра с резолюция 1080p. PROVE-H добавя 100 трудни видеа без еталонна истина — тълпи, течаща вода, пламъци, текстуриран терен, отражения в множество локви и бързо движение — като нарочно използва непрецизирани маски от SAM3.

В публичната класация SVOR (1.3B) води по комбинирания RC-S с 0.5197; EffectErase води по RC-T с 0.2525.

Ключови изводи

  • RC-S и RC-T оценяват локално премахването чрез MMD с плъзгащ се прозорец върху характеристики на DINOv2, без да е необходима еталонна истина.
  • RC-S достига среден Kendall’s τ от 0.59 спрямо човешките оценки, в сравнение с 0.26 за ReMOVE и 0.16 за CFD.
  • ReMOVE и CFD и двата възнаграждават размазването; RC-S се влошава монотонно и печели 100% от тестовете с пертурбации.
  • PROVE-Bench добавя 80 сдвоени видеа с аугментирано движение плюс 100 трудни видеа без GT, всички реални и с резолюция 1080p.
  • Код с лиценз Apache 2.0 и набор от данни в Hugging Face; RC-S работи със 134.6 ms/кадър и е 13.7 пъти по-евтин от CFD.

Разгледайте статията, GitHub хранилището, страницата на проекта и набора от данни. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! Имате ли Telegram? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини