Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

MiLM Plus від Xiaomi представляє PROVE: узгоджені зі сприйняттям метрики видалення об’єктів RC-S і RC-T із реалістичним відеобенчмарком

Моделі видалення об’єктів удосконалювалися швидше, ніж метрики, за якими їх оцінюють. Дифузійні засоби стирання тепер переконливо відтворюють тіні, відбиття та закриту структуру, однак PSNR, SSIM, LPIPS, ReMOVE і CFD часто неправильно ранжують їхні результати. Першопричина має структурний характер: стирання — це некоректно поставлене завдання з множинними можливими результатами, тому не існує єдиного еталону для порівняння. Команда з MiLM Plus, Xiaomi Inc. випустила PROVE (Perceptual RemOVal cohErence), прийняту до ACM MM 2026, щоб усунути цю прогалину. PROVE поєднує дві метрики, узгоджені зі сприйняттям, — RC-S для просторової узгодженості та RC-T для часової узгодженості — з PROVE-Bench, дворівневим бенчмарком відео з реального світу. Обидві метрики локально оцінюють відредаговану область, використовуючи Maximum Mean Discrepancy у ковзному вікні над ознаками DINOv2, і жодна з них не потребує еталонного відео.

Чи придатна система до розгортання?

Так — як засіб оцінювання, а не функція продукту. PROVE постачається як репозиторій PyTorch за ліцензією Apache 2.0 з однією точкою входу CLI (run_prove_metrics.py). Потрібні Python 3.10+, PyTorch 2.6+, Transformers 4.51+ і ваги DINOv2-giant. Маски є обов’язковими; білі пікселі позначають видалений об’єкт.

  • Рівень компанії: Будь-яка команда з одним GPU і конвеєром створення масок. RC-S працює зі швидкістю 134,6 мс/кадр на одній RTX 4090, тож нічні перевірки CI є практичними для стартапів; найбільше виграють підприємства з великими каталогами редагувань, оскільки парні еталонні дані не потрібні.
  • Галузі: Галереї та застосунки камер для смартфонів, редагування коротких відео, очищення каталогів електронної комерції, реклама та стокові медіа, постпродакшн у кіно та VFX, зображення нерухомості, а також редагування даних для захисту приватності в картографічних архівах.
  • Застосування: Порівняння моделей, перевірки CI за RC-S/RC-T, налаштування кількості кроків інференсу або квантування без еталонного відео, фільтрація навчальних даних і формування моделей винагороди.
  • Хто використовуватиме: Спочатку дослідники комп’ютерного зору та інженери прикладного AI/ML у командах редагування; потім інженери MLOps, які інтегрують оцінку в CI; далі продакт-менеджери, що проводять порівняння постачальників.
  • Де система не підходить: Оцінювання в реальному часі на пристрої, а також побічні ефекти на кшталт великих тіней або відбиттів, що виходять за межі обрізаної області оцінювання.

Три задокументовані режими відмови

Видалення об’єктів є некоректно поставленим завданням із множинними можливими результатами: для тієї самої порожнини можливі численні правдоподібні відновлення, тому унікального еталону не існує.

  • Упередженість повнореференсних метрик: PSNR, SSIM і LPIPS припускають відповідність «точка до точки», тому винагороджують копіювання замість справжнього стирання. Залишкові тіні займають небагато пікселів і майже не штрафуються. Що гірше, скорочення кількості кроків дифузійного інференсу покращує PSNR і SSIM, тоді як візуальна якість руйнується — регресія до середнього.
  • Сліпі зони безреференсних метрик: У ROSE-Bench автори поступово розмивають замасковану область. Ні ReMOVE, ні CFD не погіршуються; зрештою обидві метрики перевершують свої базові показники без розмиття. Термін галюцинацій CFD на основі SAM також дає хибний результат: коректно відновлене сидіння велосипеда позначається як галюцинація й отримує гіршу оцінку, ніж невідредагований вхідний кадр.
  • Нечутливість до часу: Temporal Consistency і Temporal Flickering працюють із повнокадровими ознаками. Оскільки відредагована область становить невелику частку кадру, внесені до DAVIS спотворення Random Drop і Random Replace майже не впливають на них, а іноді навіть змінюють їх у неправильному напрямку.

RC-S і RC-T

В основі обох лежить одна ідея: локальне зіставлення розподілів у просторі глибоких ознак замість глобальної агрегації.

RC-S (просторова): Аналіз зв’язаних компонентів розділяє маску на незалежні цілі. Кожна обмежувальна рамка розширюється на одну третину довжини її сторони, після чого обрізаний фрагмент передається до DINOv2, а маска зменшується до роздільної здатності ознак. Вікно розміру w×w ковзає картою ознак, обчислюючи квадрат Maximum Mean Discrepancy з гауссовим ядром RBF між ознаками маски та локального фону. Оцінки усереднюються для кожної цілі, а потім між цілями.

RC-T (часова): Сусідні кадри обрізаються спільно за об’єднанням їхніх масок, щоб уникнути розцентрування, після чого MMD обчислюється лише всередині перетину — області, відновленої в обох кадрах. Абляційне дослідження показує, що вилучення обрізання робить RC-T нечутливою до внесеного спотворення.

Результати

Порівняно з оцінками людей, отриманими від 20 учасників і агрегованими за підрахунком Борда, RC-S досягає середнього значення τ Кендалла 0,59 і ρ Спірмена 0,66, тоді як для ReMOVE ці показники становлять 0,26/0,29, а для CFD — 0,16/0,18. Вона посідає перше місце у п’яти з шести бенчмарків. Варіанти FR, що використовують лише фон, мають негативну кореляцію на більшості наборів даних. На RORD-Val RC-S віддає перевагу чистому зображенню перед розмитими варіантами та варіантами із заміною області у 100% випадків; за розмиття ReMOVE досягає 60,06%, а CFD — 49,27%. RC-T монотонно реагує на зростання спотворення, тоді як TC і TF — ні.

Абляційні дослідження виокремлюють внесок кожного компонента: DINOv2 (середнє τ 0,59) перевершує DINOv3 (0,51) і SAM (0,44); вилучення ковзного вікна знижує показник на 0,11; заміна MMD на косинусну подібність знижує його на 0,07. RC-S також є найдешевшою серед протестованих просторових метрик — вона у 13,7 раза швидша за CFD.

PROVE-Bench

PROVE-M містить 80 парних відео: вхідні відео, зняті зі штатива, та відео без еталонних даних, зняті протягом двох хвилин, маски SAM3, уточнені покадрово, триетапний контроль якості, після чого до трійки відео синхронно застосовується аугментація рухом у стилі Ken Burns. Кожен кліп містить 81 кадр у роздільній здатності 1080p. PROVE-H додає 100 складних відео без еталонних даних — натовпи, текуча вода, полум’я, текстурований рельєф, відбиття в кількох калюжах, швидкий рух — навмисно використовуючи неуточнені маски SAM3.

У публічній таблиці лідерів SVOR (1.3B) очолює комбінований показник RC-S зі значенням 0,5197; EffectErase очолює RC-T зі значенням 0,2525.

Основні висновки

  • RC-S і RC-T локально оцінюють видалення за допомогою MMD у ковзному вікні над ознаками DINOv2, причому еталонні дані не потрібні.
  • RC-S досягає середнього τ Кендалла 0,59 порівняно з оцінками людей, тоді як для ReMOVE цей показник становить 0,26, а для CFD — 0,16.
  • ReMOVE і CFD обидві винагороджують розмиття; RC-S погіршується монотонно й перемагає у 100% тестів зі спотвореннями.
  • PROVE-Bench додає 80 парних відео з аугментацією рухом і 100 складних відео без еталонних даних, усі з реального світу у 1080p.
  • Код за ліцензією Apache 2.0 і набір даних на Hugging Face; RC-S працює зі швидкістю 134,6 мс/кадр і коштує у 13,7 раза дешевше за CFD.

Ознайомтеся з науковою статтею, репозиторієм GitHub, сторінкою проєкту та набором даних. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддиту про ML із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібне партнерство з нами для просування вашого репозиторію GitHub АБО сторінки на Hugging Face, АБО релізу продукту, АБО вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини