Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← К новостям

Netflix тестирует языковую модель как альтернативу логике рекомендаций, созданной вручную

Netflix тестирует языковую модель как альтернативу созданной вручную логике рекомендаций
Jonathan Kemper
22 авг. 2026
Nano Banana Pro по запросу THE DECODER

Ключевые моменты

  • Netflix создала GenRec — систему рекомендаций на основе языковой модели, которая превосходит существующие методы компании, используя при этом значительно меньше обучающих данных.
  • Система преобразует поведение пользователей в обычный текст, вместо того чтобы полагаться на сложные признаки, созданные вручную. Дообученная модель с открытыми весами анализирует эту историю и оценивает все подходящие названия за один проход.
  • И офлайн-тесты, и живой A/B-эксперимент с реальными пользователями показали измеримое повышение качества рекомендаций. Netflix рассматривает это как часть более широкого перехода к языковым моделям общего назначения и отказа от архитектур, создаваемых специально под конкретные задачи.

Netflix сравнила свою многолетнюю систему рекомендаций с языковой моделью и заявила, что получила лучшие результаты. Системе GenRec потребовалась лишь малая доля размеченных обучающих данных, необходимых старой системе.

Согласно сообщению технической команды Netflix в блоге, текущая система рекомендаций Netflix опирается на тысячи созданных вручную признаков, описывающих пользователей, названия и взаимодействия. Такая сложность делает дорогостоящим подключение новых типов контента, например игр, прямых трансляций или подкастов, а также расширение рекомендаций на новые разделы интерфейса Netflix. Однако готовые языковые модели тоже не подходят для рекомендаций. Они чрезмерно ориентируются на популярный контент, выдумывают названия, которых нет в каталоге, и игнорируют бизнес-правила.

GenRec призвана закрыть этот пробел. Netflix обучает специализированную модель в два этапа. Сначала неназванную языковую модель с открытыми весами дообучают на данных Netflix, чтобы она понимала каталог и поведение пользователей. Затем второй этап специализированного обучения превращает базовую модель в ранжировщик рекомендаций. Этот второй этап обновляется чаще, чтобы учитывать новые названия и меняющиеся предпочтения.

Схема конвейера GenRec от Netflix, в которой необработанные журналы с историей пользователя, информацией об объекте и контекстом преобразуются в токены с помощью вербализации и контекстной инженерии, оцениваются LLM GenRec и выдаются в виде ранжированного списка рекомендаций с названиями вроде «Академии Амбрелла», «Тьмы» и «Во все тяжкие».
GenRec преобразует историю просмотров и контекст в естественный язык, вместо того чтобы моделировать их как созданные вручную признаки. | Изображение: Netflix

История просмотров превращается в обычный текст

Вместо кодирования пользовательских данных в плотные числовые векторы Netflix преобразует их в обычный текст. Просмотры, длительность просмотра, отметки «нравится» или «не нравится», добавления в список и прекращение просмотра превращаются в своего рода диалог между пользователем и системой рекомендаций. Модель самостоятельно выявляет такие закономерности, как предпочтения по жанрам или меняющиеся интересы, вместо того чтобы получать их в явном виде через вручную разработанные признаки.

Блок-схема с тремя красными блоками: OSS Models через предварительное обучение с определённой периодичностью приводит к базовой LLM (этап 1), которая посредством частого специализированного дообучения превращается в GenRec (этап 2).
На этапе 1 Netflix адаптирует модель с открытым исходным кодом к собственным данным. На этапе 2 она дообучается специально для ранжирования. | Изображение: Netflix

Полная текстовая версия каждого взаимодействия превысила бы размер контекстного окна модели, поэтому Netflix активно фильтрует данные. События с высокой информативностью, например длительные сеансы просмотра, сохраняются во всех подробностях, а краткие нажатия или быстрые прокрутки отбрасываются, тогда как сеансы просмотра нескольких серий подряд сжимаются. Чтобы модель не рекомендовала названия, которых на самом деле нет, Netflix добавляет отдельный компонент, который оценивает только реальные записи каталога.

Линейный график нормализованной офлайн-метрики в зависимости от количества событий пользователя в запросе: минус 7,9 процента при N, базовый уровень и отмеченная точка перегиба при 2N, плюс 1,7 процента при 3N.
После текущей выбранной длины контекста каждое дополнительное событие в запросе почти не повышает качество ранжирования, но увеличивает вычислительные затраты. | Изображение: Netflix

GenRec работает на vLLM в режиме, при котором модель считывает входные данные один раз и оценивает всех кандидатов за один проход, не генерируя текст. Это позволяет удерживать затраты на приемлемом уровне.

Небольшой, но статистически надёжный прирост

По сравнению с рабочей системой, которую совершенствовали на протяжении многих лет, GenRec показала примерно на 1,6 процента более высокое качество ранжирования в офлайн-тестах. Для достижения этого результата на втором этапе обучения ей потребовалось примерно в 40 раз меньше размеченных примеров. Это сравнение относится к данному конкретному этапу, а не ко всем обучающим данным.

Линейный график нормализованной офлайн-метрики в зависимости от объёма обучающих данных по логарифмической шкале от 1x до 20x: кривая растёт с 1,00 до 1,16 и постепенно выравнивается.
Дополнительные обучающие данные на этапе 2 повышают качество ранжирования модели примерно с десятью миллиардами параметров, хотя при больших объёмах отдача снижается. | Изображение: Netflix

Для онлайн-теста Netflix провела четырёхнедельный A/B-эксперимент примерно на десяти процентах трафика, ограничив его разделами рекомендаций, для которых списки вычисляются заранее. Краткосрочная метрика, отслеживающая поведение пользователей на главном экране, выросла на 0,115 процента, а долгосрочная ключевая метрика улучшилась на 0,006 процента. Согласно Netflix, оба показателя изменились слишком значительно, чтобы объяснить это случайностью.

Две столбчатые диаграммы сравнивают GenRec с рабочей моделью как нулевой точкой отсчёта: плюс 0,115 процента по краткосрочной метрике вовлечённости на главной странице и плюс 0,006 процента по долгосрочной ключевой метрике; оба результата отмечены как статистически значимые.
В A/B-тесте примерно на десяти процентах трафика GenRec превзошла рабочую модель ранжирования по обеим метрикам. | Изображение: Netflix

Специализированное дообучение для рекомендаций на этапе 2 добавляет ещё 35–50 процентов к результативности базовой модели. Если базовой модели уже две недели, разрыв увеличивается примерно до 80 процентов, поскольку базовая модель больше не отражает новые названия и изменившиеся предпочтения. Модели рекомендаций быстро устаревают.

Контекстная инженерия заменяет разработку признаков

Netflix рассматривает GenRec как часть более широкого сдвига, который также проявляется в таких работах, как PLUM, GLIDE и OneRec-Think. Вместо создания специализированной архитектуры для каждой задачи рекомендаций одна языковая модель обрабатывает несколько вариантов использования. Фокус смещается от разработки всё большего числа признаков к определению того, какие сигналы должны поступать на вход модели и в каком объёме. Инфраструктура также переходит к GPU-серверам и инструментам для LLM.

Команда Netflix называет GenRec «ранним, но многообещающим шагом» и описывает систему как сильную альтернативу традиционным моделям рекомендаций. Полная замена существующей системы пока не рассматривается.

Netflix уже много лет применяет машинное обучение за пределами списков рекомендаций. Ещё в 2020 году компания описала, как графы знаний и карты сходства прогнозируют, к какой категории контента относится планируемое название и какую аудиторию оно может собрать в каждой стране. В то время языковая модель BERT от Google обрабатывала только написанные людьми описания названий и передавала машиночитаемые представления последующим моделям. Netflix также начала создавать собственные модели для производственных процессов и иногда выпускает их публично — например, фреймворк VOID для удаления объектов из видео.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: Netflix Tech Blog

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости