Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← Към новините

Netflix тества езиков модел като алтернатива на ръчно изградена логика за препоръки

Netflix тества езиков модел като алтернатива на ръчно изградена логика за препоръки
Jonathan Kemper
22 август 2026 г.
Nano Banana Pro, подканен от THE DECODER

Основни акценти

  • Netflix създаде GenRec — система за препоръки, базирана на езиков модел, която превъзхожда съществуващите му методи, като същевременно се нуждае от много по-малко тренировъчни данни.
  • Системата преобразува поведението на потребителите в обикновен текст, вместо да разчита на сложни ръчно създадени характеристики. Модел с отворени тегла, дообучен за целта, анализира тази история и оценява всички съвпадащи заглавия с едно преминаване.
  • Както офлайн тестовете, така и живият A/B експеримент с реални потребители показаха измерими подобрения в качеството на препоръките. Netflix вижда това като част от по-широк преход към езикови модели с общо предназначение и отказ от специално изградени архитектури.

Netflix изправи своята препоръчваща система на години срещу езиков модел и твърди, че е получил по-добри резултати. Системата, наречена GenRec, се нуждаеше от малка част от обозначените тренировъчни данни, необходими на старата система.

Настоящата система за препоръки на Netflix разчита на хиляди ръчно създадени характеристики за потребителите, заглавията и взаимодействията, според публикация в блога на технологичния екип на Netflix. Тази сложност прави скъпо добавянето на нови типове съдържание като игри, формати на живо или подкасти, както и разширяването към нови области в интерфейса на Netflix. Но готовите езикови модели също не са подходящи за препоръки. Те отдават прекалено голямо значение на популярното съдържание, измислят заглавия, които не съществуват в каталога, и пренебрегват бизнес правилата.

GenRec е създаден, за да запълни тази празнина. Netflix обучава собствен модел на два етапа. Първо, неназован езиков модел с отворени тегла се дообучава с данни на Netflix, за да разбира каталога и поведението на потребителите. След това втори кръг от специализирано обучение превръща базовия модел в система за класиране на препоръки. Този втори етап се актуализира по-често, за да отчита новите заглавия и променящите се предпочитания.

Schemazeichnung der GenRec-Pipeline von Netflix, in der Rohlogs mit Nutzerhistorie, Item-Informationen und Kontext über Verbalization und Context Engineering in Tokens umgewandelt, vom GenRec-LLM bewertet und als Recommendation Ranking mit Titeln wie Umbrella Academy, Dark und Breaking Bad ausgegeben werden.
GenRec преобразува историята на гледане и контекста на естествен език, вместо да ги моделира като ръчно създадени характеристики. | Изображение: Netflix

Историята на гледане се превръща в обикновен текст

Вместо да кодира потребителските данни като плътни числови вектори, Netflix ги преобразува в обикновен текст. Пусканията, продължителността на гледане, оценките с палец нагоре или надолу, добавянията в списъка и прекратяванията се превръщат в своеобразен диалог между потребителя и системата за препоръки. Моделът сам открива модели като предпочитания към жанрове или променящи се интереси, вместо те да му бъдат задавани чрез ръчно конструирани характеристики.

Ablaufdiagramm mit drei roten Kästen: OSS Models führt über Cadence Pre-Training zum Foundational LLM (Phase 1), das über häufiges, aufgabenspezifisches Post-Training zu GenRec wird (Phase 2).
Във фаза 1 Netflix адаптира модел с отворен код към собствените си данни. Във фаза 2 го дообучава специално за класиране. | Изображение: Netflix

Пълната текстова версия на всяко взаимодействие би надхвърлила контекстния прозорец на модела, затова Netflix филтрира агресивно. Събитията с висок сигнал, като дългите сесии на гледане, се запазват в пълен вид, докато кратките докосвания или бързото превъртане се премахват, а сесиите с поредно гледане се обобщават. За да не позволява на модела да предлага заглавия, които реално не съществуват, Netflix добавя отделен компонент, който оценява само реални записи от каталога.

Liniendiagramm der normalisierten Offline-Metrik über die Anzahl der Nutzerereignisse im Prompt, minus 7,9 Prozent bei N, Baseline und markierter Elbow-Punkt bei 2N, plus 1,7 Prozent bei 3N.
След избраната в момента дължина на контекста всяко допълнително събитие в подканата почти не подобрява качеството на класирането, но увеличава изчислителните разходи. | Изображение: Netflix

GenRec работи върху vLLM в режим, при който моделът прочита входа веднъж и оценява всички кандидати с едно преминаване, без да генерира текст. Това поддържа разходите управляеми.

Малки, но статистически надеждни подобрения

В сравнение с производствената система, настройвана в продължение на много години, GenRec постигна около 1,6 процента по-добро качество на класирането офлайн. За целта му бяха необходими приблизително 40 пъти по-малко обозначени примери във втория етап на обучение. Това сравнение се отнася до тази конкретна фаза, а не до всички тренировъчни данни.

Liniendiagramm der normalisierten Offline-Metrik über die Trainingsdatenmenge in logarithmischer Skala von 1x bis 20x, die Kurve steigt von 1,00 auf 1,16 und flacht dabei ab.
Повече тренировъчни данни във фаза 2 подобряват качеството на класирането за модела с приблизително десет милиарда параметъра, макар че ползите намаляват при по-големи обеми. | Изображение: Netflix

За онлайн теста Netflix проведе четириседмичен A/B експеримент върху около десет процента от трафика, ограничен до предварително изчисляваните повърхности за препоръки. Краткосрочен показател, проследяващ поведението на потребителите на началния екран, се повиши с 0,115 процента, а дългосрочен основен показател се подобри с 0,006 процента. Според Netflix и двете подобрения са твърде големи, за да бъдат обяснени със случайност.

Zwei Balkendiagramme vergleichen GenRec mit dem Produktionsmodell als Nullreferenz, plus 0,115 Prozent bei der kurzfristigen Homepage-Engagement-Metrik und plus 0,006 Prozent bei der langfristigen Kernmetrik, beide als signifikant markiert.
В A/B тест върху приблизително десет процента от трафика GenRec надмина производствения модел за класиране и по двата показателя. | Изображение: Netflix

Специализираното дообучаване за препоръки във фаза 2 добавя още 35 до 50 процента към производителността на базовия модел. Когато базовият модел вече е на две седмици, разликата нараства до около 80 процента, тъй като базовият модел вече не отразява новите заглавия и променените предпочитания. Моделите за препоръки остаряват бързо.

Проектирането на контекста заменя проектирането на характеристиките

Netflix разглежда GenRec като част от по-широк преход, който се проявява и в разработки като PLUM, GLIDE и OneRec-Think. Вместо да изгражда персонализирани архитектури за всяка задача за препоръки, един езиков модел обработва множество случаи на употреба. Работата се измества от създаването на все повече характеристики към решаването кои сигнали да бъдат включени във входа на модела и каква част от тях да се използва. Инфраструктурата също се насочва към GPU сървъри и инструменти за LLM.

Екипът на Netflix нарича GenRec „ранна, но обещаваща стъпка“ и описва системата като силна алтернатива на традиционните модели за препоръки. Пълната замяна на съществуващата система все още не е на дневен ред.

Netflix използва машинно обучение извън списъците си с препоръки от години. Още през 2020 г. компанията описа как графите на знанията и картите на сходството предвиждат към коя категория съдържание спада планираното заглавие и каква аудитория може да достигне във всяка държава. По това време езиковият модел BERT на Google обработваше само написани от хора резюмета на заглавия и подаваше машинно разбираеми представяния към последващи модели. Netflix също започна да създава собствени модели за производствени работни процеси и понякога ги публикува, например рамката VOID за премахване на обекти от видео.

AI новини без сензации – подбрани от хора

Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за AI, ексклузивния шест пъти годишно доклад за новостите „AI Radar“, достъп до целия архив и достъп до секцията за коментари.

Източник: Netflix Tech Blog

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини