پرش به محتوای اصلی
پرش به محتوای مقاله

مدل GenRec نتفلیکس منطق دستیِ توصیه‌گرها را شکست داد

·۳۱ مرداد ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
تولید ۳۰۰ اثر هوش مصنوعی در نتفلیکس: سرعت گسترش این فناوری در صنعت سرگرمی
تولید ۳۰۰ اثر هوش مصنوعی در نتفلیکس: سرعت گسترش این فناوری در صنعت سرگرمی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از LLM نه برای تولید متن، بلکه برای رتبه‌بندی محتوا با تبدیل رفتار کاربر به زبان طبیعی؛ در حالی که نیاز به داده‌های برچسب‌دار را ۴۰ برابر کاهش داده است.

اگر امروز در نتفلیکس فیلم تماشا می‌کنید، احتمالاً متوجه شده‌اید که پیشنهادات این سرویس هر روز دقیق‌تر می‌شوند. اما پشت این دقت، یک تغییر بنیادین در حال رخ دادن است: جایگزینی هزاران خط کد دستی با یک مدل زبانی که رفتار شما را مثل یک گفتگو می‌فهمد.

به گزارش وبلاگ فنی نتفلیکس در ۲۲ اوت ۲۰۲۶، سامانه جدیدی به نام GenRec توانسته است کیفیت رتبه‌بندی محتوا را نسبت به سیستم‌های قدیمی بهبود ببخشد. این مدل به‌جای استفاده از بردارهای عددی خشک، رفتار کاربر را به شکل یک مکالمه تحلیل می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، انتقال به مدل‌های زبانی در مقیاس صنعتی همواره با چالش‌هایی همراه است. نتفلیکس سال‌هاست که بر مهندسی ویژگی (Feature Engineering) — شبیه به نوشتن یک دفترچه دستورالعمل بسیار طولانی برای یک آشپز که دقیقاً بگوید چه زمانی نمک بزند — تکیه کرده است. در این روش، مهندسان باید هزاران قانون دستی برای عادت‌های کاربر و ویژگی‌های هر اثر تعریف کنند. این رویکرد بسیار صلب است و مقیاس‌بندی آن بسیار گران و سخت است.

برای مثال، وقتی نتفلیکس می‌خواست فرمت‌های جدیدی مثل ورزش‌های زنده، پادکست‌ها یا بازی‌ها را اضافه کند، سیستم قدیمی نیازمند به‌روزرسانی‌های دستی گسترده‌ای بود تا بتواند این انواع جدید محتوا را شناسایی کند. همچنین، این ساختار باعث می‌شد گسترش قابلیت‌ها به بخش‌های جدید از رابط کاربری نتفلیکس دشوار شود.

مدل‌های زبانی آماده (Off-the-shelf) هم راهکار آماده‌ای نبودند؛ چون این مدل‌ها تمایل داشتند بیش از حد روی محتواهای محبوب تمرکز کنند، قوانین تجاری شرکت را نادیده بگیرند و عناوینی را اختراع کنند (توهم بزنند) که اصلاً در کاتالوگ موجود نبودند. به همین دلیل GenRec طراحی شد تا این شکاف را پر کند.

سازوکار GenRec ساده اما هوشمندانه است: تاریخچه تماشا و بستر کاربر را به متن ساده تبدیل می‌کند. حالا تماشای یک فیلم، لایک کردن (thumbs-up)، مدت زمان تماشا، اضافه کردن به لیست و حتی لحظه قطع کردن ویدیو، به جای فرمول‌های ریاضی پیچیده، به شکل یک دیالوگ زبان طبیعی بین کاربر و هوش مصنوعی در می‌آید.

نتفلیکس مدل زبانی را جایگزین منطق دستی توصیه‌گرها آزمایش می‌کند

این مدل به‌طور خودکار الگوهایی مثل ترجیحات ژانری یا تغییر سلیقه کاربر در طول زمان را می‌شناسد و دیگر نیازی نیست مهندسان این موارد را از طریق ویژگی‌های مهندسی‌شده‌ی دستی تعریف کنند. عملیات در دو مرحله متمایز انجام می‌شود:

  • مرحله اول: یک مدل زبانی بزرگ (LLM) با وزن‌های باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر شده و نه فقط غذای آماده — روی داده‌های اختصاصی نتفلیکس تنظیم دقیق (Fine-tuning) می‌شود تا کاتالوگ و رفتار کاربران را به‌طور کامل یاد بگیرد.

نتفلیکس مدل زبانی را جایگزین منطق دست‌ساز توصیه‌گرها آزمایش می‌کند

  • مرحله دوم: مدل تحت یک آموزش تخصصی قرار می‌گیرد تا به یک رتبه‌بند (Recommendation Ranker) تبدیل شود. این مرحله به‌طور مکرر به‌روزرسانی می‌شود تا عناوینی که تازه اضافه شده‌اند و تغییرات سریع سلیقه کاربران را لحاظ کند.

برای جلوگیری از توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد، مثل دوستی که خاطره‌ای را اشتباه تعریف می‌کند — نتفلیکس یک بخش امتیازدهی جداگانه اضافه کرده که فقط عناوینی را تأیید می‌کند که واقعاً در کاتالوگ موجود هستند. همچنین برای مدیریت پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جای چند ورق دارد — از فیلترهای شدید استفاده می‌کنند.

در این سیستم، رویدادهای با سیگنال بالا مثل جلسات تماشای طولانی با جزئیات کامل حفظ می‌شوند، اما ضربه‌های کوتاه یا اسکرول‌های سریع حذف شده و جلسات تماشای متوالی (Binge sessions) فشرده می‌شوند.

نتفلیکس مدل زبانی را جایگزین منطک دستی پیشنهاد فیلم‌ها آزمایش می‌کند.

نتفلیکس دریافت که فراتر از یک طول متنی خاص، هر رویداد اضافی در ورودی (Prompt) به‌سختی کیفیت رتبه‌بندی را بهبود می‌بخشد اما هزینه محاسباتی را افزایش می‌دهد. بنابراین برای مدیریت هزینه‌ها، GenRec روی vLLM اجرا می‌شود. مدل ورودی را یک‌بار می‌خواند و تمام کاندیداها را در یک مسیر (Single Pass) رتبه‌بندی می‌کند، بدون اینکه نیاز باشد متنی تولید کند.

نتایج به‌دست‌آمده طبق مستندات فنی، از نظر آماری معتبر هستند. در تست‌های آفلاین، کیفیت رتبه‌بندی ۱.۶ درصد بهبود یافت. نکته کلیدی این است که GenRec برای رسیدن به این نتیجه، تقریباً ۴۰ برابر داده‌های برچسب‌دار کمتری در مرحله دوم آموزش نیاز داشت تا آنچه سیستم تولیدی فعلی نیاز دارد.

نتفلیکس مدل زبانی را جایگزین منطک دستی پیشنهاد فیلم‌ها آزمایش می‌کند.

در این مدل ۱۰ میلیارد پارامتری، افزایش داده‌های آموزشی در مرحله دوم باعث بهبود کیفیت می‌شود، هرچند که در حجم‌های بسیار بالا، میزان بازدهی کاهش می‌یابد. این مرحله دوم از تنظیم دقیق، بین ۳۵ تا ۵۰ درصد به عملکرد مدل پایه اضافه می‌کند. اگر مدل پایه دو هفته قدیمی باشد، این فاصله به ۸۰ درصد می‌رسد چون مدل پایه نمی‌تواند عناوینی که تازه منتشر شده‌اند را منعکس کند.

در یک تست A/B چهار هفته‌ای که روی ۱۰ درصد از ترافیک در سطوح توصیه‌ی پیش‌محاسبه‌شده انجام شد، نتایج زیر ثبت شد:

  • تعامل کوتاه‌مدت در صفحه اصلی: ۰.۱۱۵ درصد افزایش
  • معیارهای کلیدی بلندمدت: ۰.۰۰۶ درصد بهبود

نتفلیکس مدل زبانی را جایگزین منطک دستی پیشنهاد فیلم‌ها آزمایش می‌کند.

این تغییر، نشان‌دهنده گذار به «مهندسی بستر» (Context Engineering) است؛ رویکردی که در پروژه‌های دیگر مانند PLUM، GLIDE و OneRec-Think نیز دیده می‌شود. به‌جای ساخت معماری‌های سفارشی برای هر وظیفه، یک مدل زبانی واحد چندین مورد کاربرد را مدیریت می‌کند. حالا کار مهندسان از نوشتن کد برای ویژگی‌ها به تصمیم‌گیری درباره این تغییر می‌کند که کدام سیگنال‌ها باید در ورودی مدل قرار گیرند.

برای بیننده، این یعنی توصیه‌هایی که سریع‌تر با مود و حال‌وهوای او و آثار جدید منتشر شده تغییر می‌کنند. برای صنعت، این ثابت می‌کند که LLMها می‌توانند وظایف رتبه‌بندی در مقیاس بالا را بدون هزینه‌های سنگین خط لوله‌های سنتی یادگیری ماشین (ML Pipelines) مدیریت کنند.

نتفلیکس هنوز کل سیستم را جایگزین نکرده، اما GenRec گامی امیدوارکننده به سوی زیرساخت‌های متمرکز بر GPU است. این شرکت پیش از این از چارچوب VOID برای حذف اشیا از ویدیو استفاده کرده بود. همچنین در سال ۲۰۲۰، آن‌ها از گراف‌های دانش و نقشه‌های شباهت برای پیش‌بینی مخاطبان بهره می‌بردند، در حالی که مدل BERT گوگل برای پردازش خلاصه‌های متنی نوشته شده توسط انسان به کار می‌رفت.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، بررسی کنید چگونه می‌توانید داده‌های رفتاری کاربر را به توالی‌های متنی تبدیل کنید تا از قدرت LLMها برای رتبه‌بندی استفاده کنید.
  • روی کاهش حجم داده‌های آموزشی از طریق استفاده از مدل‌های پیش‌آموزش‌دیده (Pre-trained) تمرکز کنید.
  • مدل‌های رتبه‌بندی تک‌مرحله‌ای (Single-pass) را برای کاهش هزینه استنتاج در پروژه‌های خود تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تجربه عملی نتفلیکس، ثابت می‌کند که مدل‌های زبانی می‌توانند هزینه‌های آموزشی را به‌شدت کاهش دهند و در عین حال دقت را بالا ببرند. این موضوع اعتبار استفاده از LLMها را برای وظایف حساس رتبه‌بندی در مقیاس جهانی تأیید می‌کند.

تأثیر برای ایران

این خبر بیشتر برای مهندسان داده و پژوهشگران مدل‌های بنیادی در ایران اهمیت دارد تا کاربران نهایی؛ چرا که الگوی تبدیل رفتار به متن را برای سیستم‌های توصیه‌گر داخلی معرفی می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مهندسی ویژگی با مهندسی بستر، در واقع پایان عصر «قوانین سخت» در سیستم‌های توصیه‌گر است. این رویکرد ثابت می‌کند که مدل‌های زبانی می‌توانند در مقیاس میلیاردها کاربر، بدون نیاز به تولید متن و صرفاً برای رتبه‌بندی (Ranking) بهینه شوند. به نظر ما، این مدل تبدیل شدن LLMها به موتورهای تصمیم‌گیرنده در پس‌زمینه است، جایی که کاربر هرگز متوجه حضور یک مدل زبانی نمی‌شود اما اثر آن را در دقت نتایج می‌بیند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.