Netflix тества езиков модел като алтернатива на ръчно изградена логика за препоръки
Основни акценти
- Netflix създаде GenRec — система за препоръки, базирана на езиков модел, която превъзхожда съществуващите му методи, като същевременно се нуждае от много по-малко тренировъчни данни.
- Системата преобразува поведението на потребителите в обикновен текст, вместо да разчита на сложни ръчно създадени характеристики. Модел с отворени тегла, дообучен за целта, анализира тази история и оценява всички съвпадащи заглавия с едно преминаване.
- Както офлайн тестовете, така и живият A/B експеримент с реални потребители показаха измерими подобрения в качеството на препоръките. Netflix вижда това като част от по-широк преход към езикови модели с общо предназначение и отказ от специално изградени архитектури.
Netflix изправи своята препоръчваща система на години срещу езиков модел и твърди, че е получил по-добри резултати. Системата, наречена GenRec, се нуждаеше от малка част от обозначените тренировъчни данни, необходими на старата система.
Настоящата система за препоръки на Netflix разчита на хиляди ръчно създадени характеристики за потребителите, заглавията и взаимодействията, според публикация в блога на технологичния екип на Netflix. Тази сложност прави скъпо добавянето на нови типове съдържание като игри, формати на живо или подкасти, както и разширяването към нови области в интерфейса на Netflix. Но готовите езикови модели също не са подходящи за препоръки. Те отдават прекалено голямо значение на популярното съдържание, измислят заглавия, които не съществуват в каталога, и пренебрегват бизнес правилата.
GenRec е създаден, за да запълни тази празнина. Netflix обучава собствен модел на два етапа. Първо, неназован езиков модел с отворени тегла се дообучава с данни на Netflix, за да разбира каталога и поведението на потребителите. След това втори кръг от специализирано обучение превръща базовия модел в система за класиране на препоръки. Този втори етап се актуализира по-често, за да отчита новите заглавия и променящите се предпочитания.

Историята на гледане се превръща в обикновен текст
Вместо да кодира потребителските данни като плътни числови вектори, Netflix ги преобразува в обикновен текст. Пусканията, продължителността на гледане, оценките с палец нагоре или надолу, добавянията в списъка и прекратяванията се превръщат в своеобразен диалог между потребителя и системата за препоръки. Моделът сам открива модели като предпочитания към жанрове или променящи се интереси, вместо те да му бъдат задавани чрез ръчно конструирани характеристики.

Пълната текстова версия на всяко взаимодействие би надхвърлила контекстния прозорец на модела, затова Netflix филтрира агресивно. Събитията с висок сигнал, като дългите сесии на гледане, се запазват в пълен вид, докато кратките докосвания или бързото превъртане се премахват, а сесиите с поредно гледане се обобщават. За да не позволява на модела да предлага заглавия, които реално не съществуват, Netflix добавя отделен компонент, който оценява само реални записи от каталога.

GenRec работи върху vLLM в режим, при който моделът прочита входа веднъж и оценява всички кандидати с едно преминаване, без да генерира текст. Това поддържа разходите управляеми.
Малки, но статистически надеждни подобрения
В сравнение с производствената система, настройвана в продължение на много години, GenRec постигна около 1,6 процента по-добро качество на класирането офлайн. За целта му бяха необходими приблизително 40 пъти по-малко обозначени примери във втория етап на обучение. Това сравнение се отнася до тази конкретна фаза, а не до всички тренировъчни данни.

За онлайн теста Netflix проведе четириседмичен A/B експеримент върху около десет процента от трафика, ограничен до предварително изчисляваните повърхности за препоръки. Краткосрочен показател, проследяващ поведението на потребителите на началния екран, се повиши с 0,115 процента, а дългосрочен основен показател се подобри с 0,006 процента. Според Netflix и двете подобрения са твърде големи, за да бъдат обяснени със случайност.

Специализираното дообучаване за препоръки във фаза 2 добавя още 35 до 50 процента към производителността на базовия модел. Когато базовият модел вече е на две седмици, разликата нараства до около 80 процента, тъй като базовият модел вече не отразява новите заглавия и променените предпочитания. Моделите за препоръки остаряват бързо.
Проектирането на контекста заменя проектирането на характеристиките
Netflix разглежда GenRec като част от по-широк преход, който се проявява и в разработки като PLUM, GLIDE и OneRec-Think. Вместо да изгражда персонализирани архитектури за всяка задача за препоръки, един езиков модел обработва множество случаи на употреба. Работата се измества от създаването на все повече характеристики към решаването кои сигнали да бъдат включени във входа на модела и каква част от тях да се използва. Инфраструктурата също се насочва към GPU сървъри и инструменти за LLM.
Екипът на Netflix нарича GenRec „ранна, но обещаваща стъпка“ и описва системата като силна алтернатива на традиционните модели за препоръки. Пълната замяна на съществуващата система все още не е на дневен ред.
Netflix използва машинно обучение извън списъците си с препоръки от години. Още през 2020 г. компанията описа как графите на знанията и картите на сходството предвиждат към коя категория съдържание спада планираното заглавие и каква аудитория може да достигне във всяка държава. По това време езиковият модел BERT на Google обработваше само написани от хора резюмета на заглавия и подаваше машинно разбираеми представяния към последващи модели. Netflix също започна да създава собствени модели за производствени работни процеси и понякога ги публикува, например рамката VOID за премахване на обекти от видео.
AI новини без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за AI, ексклузивния шест пъти годишно доклад за новостите „AI Radar“, достъп до целия архив и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.