Netflix тестує мовну модель як альтернативу вручну створеній логіці рекомендацій
Ключові моменти
- Netflix створила GenRec — систему рекомендацій на основі мовної моделі, яка перевершує наявні методи й потребує значно менше навчальних даних.
- Система перетворює поведінку користувачів на звичайний текст замість використання складних вручну створених ознак. Доопрацьована модель із відкритими вагами аналізує цю історію та за один прохід оцінює всі відповідні назви.
- І офлайн-тести, і реальний A/B-експеримент із користувачами продемонстрували вимірюване покращення якості рекомендацій. Netflix вважає це частиною ширшого переходу до мовних моделей загального призначення та відмови від архітектур, створених спеціально для окремих завдань.
Netflix зіставила свій багаторічний механізм рекомендацій із мовною моделлю й заявила, що отримала кращі результати. Системі GenRec знадобилася лише частина розмічених навчальних даних, потрібних старій системі.
За даними допису технічної команди Netflix у блозі, нинішня система рекомендацій Netflix використовує тисячі вручну створених ознак про користувачів, назви та взаємодії. Така складність ускладнює й здорожчує додавання нових типів контенту — наприклад, ігор, прямих трансляцій або подкастів — і розширення нових розділів інтерфейсу Netflix. Але готові мовні моделі також не підходять для рекомендацій. Вони надмірно віддають перевагу популярному контенту, вигадують назви, яких немає в каталозі, та ігнорують бізнес-правила.
GenRec покликана заповнити цю прогалину. Netflix навчає власну модель у два етапи. Спочатку неназвану мовну модель із відкритими вагами доопрацьовують на даних Netflix, щоб вона розуміла каталог і поведінку користувачів. Потім другий раунд спеціалізованого навчання перетворює базову модель на ранжувальник рекомендацій. Цей другий етап оновлюють частіше, щоб враховувати нові назви та зміни в уподобаннях.

Історія переглядів перетворюється на звичайний текст
Замість кодування даних користувачів у щільні числові вектори Netflix перетворює їх на звичайний текст. Перегляди, тривалість перегляду, оцінки «подобається» або «не подобається», додавання до списку та припинення перегляду стають своєрідним діалогом між користувачем і системою рекомендацій. Модель самостійно виявляє такі закономірності, як жанрові вподобання або зміни інтересів, замість того щоб отримувати їх у вигляді вручну розроблених ознак.

Повна текстова версія кожної взаємодії вийшла б за межі контекстного вікна моделі, тому Netflix активно фільтрує дані. Події з високою інформативністю, як-от тривалі сеанси перегляду, зберігаються в повному обсязі, тоді як короткі натискання або швидке прокручування відкидаються, а сеанси безперервного перегляду стискаються. Щоб модель не пропонувала назви, яких насправді немає, Netflix додає окремий компонент, що оцінює лише реальні записи каталогу.

GenRec працює на vLLM у режимі, в якому модель зчитує вхідні дані один раз і за один прохід оцінює всіх кандидатів, не генеруючи жодного тексту. Це дає змогу контролювати витрати.
Невеликі, але статистично надійні покращення
Порівняно з робочою системою, яку вдосконалювали багато років, GenRec продемонструвала приблизно на 1,6 відсотка кращу якість ранжування в офлайн-тестах. Для цього на другому етапі навчання їй знадобилося приблизно у 40 разів менше розмічених прикладів. Це порівняння стосується саме цієї фази, а не всіх навчальних даних.

Для онлайн-тесту Netflix провела чотиритижневий A/B-експеримент приблизно на десяти відсотках трафіку, обмежившись розділами рекомендацій із попередніми обчисленнями. Короткострокова метрика, що відстежує поведінку користувачів на головному екрані, зросла на 0,115 відсотка, а довгострокова ключова метрика покращилася на 0,006 відсотка. За даними Netflix, обидва покращення надто великі, щоб пояснювати їх випадковістю.

Спеціалізоване доопрацювання для рекомендацій на фазі 2 додає ще 35–50 відсотків до показників базової моделі. Коли базовій моделі вже два тижні, розрив збільшується приблизно до 80 відсотків, оскільки базова модель більше не враховує нові назви та зміни в уподобаннях. Рекомендаційні моделі швидко застарівають.
Інженерія контексту замінює інженерію ознак
Netflix розглядає GenRec як частину ширшого переходу, що також проявляється в таких проєктах, як PLUM, GLIDE і OneRec-Think. Замість створення спеціальних архітектур для кожного завдання рекомендацій одна мовна модель обробляє кілька випадків використання. Робота зміщується від створення дедалі більшої кількості ознак до визначення того, які сигнали мають потрапляти на вхід моделі та який їхній обсяг слід використовувати. Інфраструктура також переходить до GPU-серверів та інструментів для LLM.
Команда Netflix називає GenRec «раннім, але перспективним кроком» і описує систему як сильну альтернативу традиційним рекомендаційним моделям. Повна заміна наявної системи поки що не розглядається.
Netflix уже багато років використовує машинне навчання не лише у своїх списках рекомендацій. Ще у 2020 році компанія описала, як графи знань і карти схожості передбачають, до якої категорії контенту належатиме запланована назва та яку аудиторію вона може охопити в кожній країні. Тоді мовна модель BERT від Google обробляла лише написані людьми описи назв і передавала машинозчитувані представлення моделям наступного етапу. Netflix також почала створювати власні моделі для виробничих процесів і часом публікує їх, як-от фреймворк VOID для видалення об’єктів із відео.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб отримати читання без реклами, щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.