Netflix тестирует языковую модель как альтернативу логике рекомендаций, созданной вручную
Ключевые моменты
- Netflix создала GenRec — систему рекомендаций на основе языковой модели, которая превосходит существующие методы компании, используя при этом значительно меньше обучающих данных.
- Система преобразует поведение пользователей в обычный текст, вместо того чтобы полагаться на сложные признаки, созданные вручную. Дообученная модель с открытыми весами анализирует эту историю и оценивает все подходящие названия за один проход.
- И офлайн-тесты, и живой A/B-эксперимент с реальными пользователями показали измеримое повышение качества рекомендаций. Netflix рассматривает это как часть более широкого перехода к языковым моделям общего назначения и отказа от архитектур, создаваемых специально под конкретные задачи.
Netflix сравнила свою многолетнюю систему рекомендаций с языковой моделью и заявила, что получила лучшие результаты. Системе GenRec потребовалась лишь малая доля размеченных обучающих данных, необходимых старой системе.
Согласно сообщению технической команды Netflix в блоге, текущая система рекомендаций Netflix опирается на тысячи созданных вручную признаков, описывающих пользователей, названия и взаимодействия. Такая сложность делает дорогостоящим подключение новых типов контента, например игр, прямых трансляций или подкастов, а также расширение рекомендаций на новые разделы интерфейса Netflix. Однако готовые языковые модели тоже не подходят для рекомендаций. Они чрезмерно ориентируются на популярный контент, выдумывают названия, которых нет в каталоге, и игнорируют бизнес-правила.
GenRec призвана закрыть этот пробел. Netflix обучает специализированную модель в два этапа. Сначала неназванную языковую модель с открытыми весами дообучают на данных Netflix, чтобы она понимала каталог и поведение пользователей. Затем второй этап специализированного обучения превращает базовую модель в ранжировщик рекомендаций. Этот второй этап обновляется чаще, чтобы учитывать новые названия и меняющиеся предпочтения.

История просмотров превращается в обычный текст
Вместо кодирования пользовательских данных в плотные числовые векторы Netflix преобразует их в обычный текст. Просмотры, длительность просмотра, отметки «нравится» или «не нравится», добавления в список и прекращение просмотра превращаются в своего рода диалог между пользователем и системой рекомендаций. Модель самостоятельно выявляет такие закономерности, как предпочтения по жанрам или меняющиеся интересы, вместо того чтобы получать их в явном виде через вручную разработанные признаки.

Полная текстовая версия каждого взаимодействия превысила бы размер контекстного окна модели, поэтому Netflix активно фильтрует данные. События с высокой информативностью, например длительные сеансы просмотра, сохраняются во всех подробностях, а краткие нажатия или быстрые прокрутки отбрасываются, тогда как сеансы просмотра нескольких серий подряд сжимаются. Чтобы модель не рекомендовала названия, которых на самом деле нет, Netflix добавляет отдельный компонент, который оценивает только реальные записи каталога.

GenRec работает на vLLM в режиме, при котором модель считывает входные данные один раз и оценивает всех кандидатов за один проход, не генерируя текст. Это позволяет удерживать затраты на приемлемом уровне.
Небольшой, но статистически надёжный прирост
По сравнению с рабочей системой, которую совершенствовали на протяжении многих лет, GenRec показала примерно на 1,6 процента более высокое качество ранжирования в офлайн-тестах. Для достижения этого результата на втором этапе обучения ей потребовалось примерно в 40 раз меньше размеченных примеров. Это сравнение относится к данному конкретному этапу, а не ко всем обучающим данным.

Для онлайн-теста Netflix провела четырёхнедельный A/B-эксперимент примерно на десяти процентах трафика, ограничив его разделами рекомендаций, для которых списки вычисляются заранее. Краткосрочная метрика, отслеживающая поведение пользователей на главном экране, выросла на 0,115 процента, а долгосрочная ключевая метрика улучшилась на 0,006 процента. Согласно Netflix, оба показателя изменились слишком значительно, чтобы объяснить это случайностью.

Специализированное дообучение для рекомендаций на этапе 2 добавляет ещё 35–50 процентов к результативности базовой модели. Если базовой модели уже две недели, разрыв увеличивается примерно до 80 процентов, поскольку базовая модель больше не отражает новые названия и изменившиеся предпочтения. Модели рекомендаций быстро устаревают.
Контекстная инженерия заменяет разработку признаков
Netflix рассматривает GenRec как часть более широкого сдвига, который также проявляется в таких работах, как PLUM, GLIDE и OneRec-Think. Вместо создания специализированной архитектуры для каждой задачи рекомендаций одна языковая модель обрабатывает несколько вариантов использования. Фокус смещается от разработки всё большего числа признаков к определению того, какие сигналы должны поступать на вход модели и в каком объёме. Инфраструктура также переходит к GPU-серверам и инструментам для LLM.
Команда Netflix называет GenRec «ранним, но многообещающим шагом» и описывает систему как сильную альтернативу традиционным моделям рекомендаций. Полная замена существующей системы пока не рассматривается.
Netflix уже много лет применяет машинное обучение за пределами списков рекомендаций. Ещё в 2020 году компания описала, как графы знаний и карты сходства прогнозируют, к какой категории контента относится планируемое название и какую аудиторию оно может собрать в каждой стране. В то время языковая модель BERT от Google обрабатывала только написанные людьми описания названий и передавала машиночитаемые представления последующим моделям. Netflix также начала создавать собственные модели для производственных процессов и иногда выпускает их публично — например, фреймворк VOID для удаления объектов из видео.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.