Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← До новин

Netflix тестує мовну модель як альтернативу вручну створеній логіці рекомендацій

Netflix тестує мовну модель як альтернативу власній логіці рекомендацій
Джонатан Кемпер
22 серпня 2026 року
Nano Banana Pro за запитом THE DECODER

Ключові моменти

  • Netflix створила GenRec — систему рекомендацій на основі мовної моделі, яка перевершує наявні методи й потребує значно менше навчальних даних.
  • Система перетворює поведінку користувачів на звичайний текст замість використання складних вручну створених ознак. Доопрацьована модель із відкритими вагами аналізує цю історію та за один прохід оцінює всі відповідні назви.
  • І офлайн-тести, і реальний A/B-експеримент із користувачами продемонстрували вимірюване покращення якості рекомендацій. Netflix вважає це частиною ширшого переходу до мовних моделей загального призначення та відмови від архітектур, створених спеціально для окремих завдань.

Netflix зіставила свій багаторічний механізм рекомендацій із мовною моделлю й заявила, що отримала кращі результати. Системі GenRec знадобилася лише частина розмічених навчальних даних, потрібних старій системі.

За даними допису технічної команди Netflix у блозі, нинішня система рекомендацій Netflix використовує тисячі вручну створених ознак про користувачів, назви та взаємодії. Така складність ускладнює й здорожчує додавання нових типів контенту — наприклад, ігор, прямих трансляцій або подкастів — і розширення нових розділів інтерфейсу Netflix. Але готові мовні моделі також не підходять для рекомендацій. Вони надмірно віддають перевагу популярному контенту, вигадують назви, яких немає в каталозі, та ігнорують бізнес-правила.

GenRec покликана заповнити цю прогалину. Netflix навчає власну модель у два етапи. Спочатку неназвану мовну модель із відкритими вагами доопрацьовують на даних Netflix, щоб вона розуміла каталог і поведінку користувачів. Потім другий раунд спеціалізованого навчання перетворює базову модель на ранжувальник рекомендацій. Цей другий етап оновлюють частіше, щоб враховувати нові назви та зміни в уподобаннях.

Схема конвеєра GenRec від Netflix, у якій необроблені журнали з історією користувача, інформацією про елементи та контекстом перетворюються на токени за допомогою вербалізації та інженерії контексту, оцінюються GenRec-LLM і видаються як рейтинг рекомендацій із назвами на кшталт «Академія Амбрелла», «Пітьма» та «Пуститися берега».
GenRec перетворює історію переглядів і контекст на природну мову замість моделювання їх як вручну створених ознак. | Зображення: Netflix

Історія переглядів перетворюється на звичайний текст

Замість кодування даних користувачів у щільні числові вектори Netflix перетворює їх на звичайний текст. Перегляди, тривалість перегляду, оцінки «подобається» або «не подобається», додавання до списку та припинення перегляду стають своєрідним діалогом між користувачем і системою рекомендацій. Модель самостійно виявляє такі закономірності, як жанрові вподобання або зміни інтересів, замість того щоб отримувати їх у вигляді вручну розроблених ознак.

Схема процесу з трьома червоними блоками: OSS Models за допомогою попереднього навчання Cadence веде до базової LLM (фаза 1), яка через часте, орієнтоване на завдання подальше навчання перетворюється на GenRec (фаза 2).
На фазі 1 Netflix адаптує модель із відкритим кодом до власних даних. На фазі 2 вона доопрацьовується спеціально для ранжування. | Зображення: Netflix

Повна текстова версія кожної взаємодії вийшла б за межі контекстного вікна моделі, тому Netflix активно фільтрує дані. Події з високою інформативністю, як-от тривалі сеанси перегляду, зберігаються в повному обсязі, тоді як короткі натискання або швидке прокручування відкидаються, а сеанси безперервного перегляду стискаються. Щоб модель не пропонувала назви, яких насправді немає, Netflix додає окремий компонент, що оцінює лише реальні записи каталогу.

Лінійний графік нормалізованої офлайн-метрики залежно від кількості подій користувача в підказці: мінус 7,9 відсотка при N, базова лінія та позначена точка перелому при 2N, плюс 1,7 відсотка при 3N.
Після поточної довжини контексту кожна додаткова подія в підказці майже не покращує якість ранжування, але збільшує обчислювальні витрати. | Зображення: Netflix

GenRec працює на vLLM у режимі, в якому модель зчитує вхідні дані один раз і за один прохід оцінює всіх кандидатів, не генеруючи жодного тексту. Це дає змогу контролювати витрати.

Невеликі, але статистично надійні покращення

Порівняно з робочою системою, яку вдосконалювали багато років, GenRec продемонструвала приблизно на 1,6 відсотка кращу якість ранжування в офлайн-тестах. Для цього на другому етапі навчання їй знадобилося приблизно у 40 разів менше розмічених прикладів. Це порівняння стосується саме цієї фази, а не всіх навчальних даних.

Лінійний графік нормалізованої офлайн-метрики залежно від обсягу навчальних даних у логарифмічному масштабі від 1x до 20x: крива зростає від 1,00 до 1,16 і поступово вирівнюється.
Більший обсяг навчальних даних фази 2 покращує якість ранжування моделі приблизно з десятьма мільярдами параметрів, хоча за більших обсягів віддача зменшується. | Зображення: Netflix

Для онлайн-тесту Netflix провела чотиритижневий A/B-експеримент приблизно на десяти відсотках трафіку, обмежившись розділами рекомендацій із попередніми обчисленнями. Короткострокова метрика, що відстежує поведінку користувачів на головному екрані, зросла на 0,115 відсотка, а довгострокова ключова метрика покращилася на 0,006 відсотка. За даними Netflix, обидва покращення надто великі, щоб пояснювати їх випадковістю.

Дві стовпчикові діаграми порівнюють GenRec із робочою моделлю як нульовою базою: плюс 0,115 відсотка для короткострокової метрики взаємодії з головною сторінкою та плюс 0,006 відсотка для довгострокової ключової метрики; обидва результати позначені як статистично значущі.
В A/B-тесті приблизно на десяти відсотках трафіку GenRec перевершила робочу модель ранжування за обома метриками. | Зображення: Netflix

Спеціалізоване доопрацювання для рекомендацій на фазі 2 додає ще 35–50 відсотків до показників базової моделі. Коли базовій моделі вже два тижні, розрив збільшується приблизно до 80 відсотків, оскільки базова модель більше не враховує нові назви та зміни в уподобаннях. Рекомендаційні моделі швидко застарівають.

Інженерія контексту замінює інженерію ознак

Netflix розглядає GenRec як частину ширшого переходу, що також проявляється в таких проєктах, як PLUMGLIDE і OneRec-Think. Замість створення спеціальних архітектур для кожного завдання рекомендацій одна мовна модель обробляє кілька випадків використання. Робота зміщується від створення дедалі більшої кількості ознак до визначення того, які сигнали мають потрапляти на вхід моделі та який їхній обсяг слід використовувати. Інфраструктура також переходить до GPU-серверів та інструментів для LLM.

Команда Netflix називає GenRec «раннім, але перспективним кроком» і описує систему як сильну альтернативу традиційним рекомендаційним моделям. Повна заміна наявної системи поки що не розглядається.

Netflix уже багато років використовує машинне навчання не лише у своїх списках рекомендацій. Ще у 2020 році компанія описала, як графи знань і карти схожості передбачають, до якої категорії контенту належатиме запланована назва та яку аудиторію вона може охопити в кожній країні. Тоді мовна модель BERT від Google обробляла лише написані людьми описи назв і передавала машинозчитувані представлення моделям наступного етапу. Netflix також почала створювати власні моделі для виробничих процесів і часом публікує їх, як-от фреймворк VOID для видалення об’єктів із відео.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб отримати читання без реклами, щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерело: Netflix Tech Blog

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини