پرش به محتوای اصلی
پرش به محتوای مقاله

«همراستایی با رفتار انسانی»؛ هدف نهایی از بهینه‌سازی ترجیحات در LLMها

·۲۰ شهریور ۱۴۰۵۴ دقیقه مطالعه
راهنما
آموزش مدل هوش مصنوعی کافی بود؟ نه، پس‌آموزش هم هست.
آموزش مدل هوش مصنوعی کافی بود؟ نه، پس‌آموزش هم هست.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبیین تفاوت ساختاری میان SFT و DPO در تبدیل مدل‌های خام به دستیار؛ تأکید بر جایگزینی مدل‌های پاداش پیچیده با بهینه‌سازی مستقیم برای کاهش هزینه و افزایش سرعت.

تصور کنید مدلی دارید که تمام کتابخانه‌های جهان را خوانده اما نمی‌داند وقتی از او چیزی می‌خواهید، باید دقیقاً چه پاسخی بدهد. تفاوت میان یک مدل که صرفاً حقایق را می‌داند و مدلی که دستورات را اجرا می‌کند، در مرحله‌ای حیاتی به نام پست-تراینینگ (Post-training) نهفته است. در حالی که یک مدل پیش‌آموزش‌دیده خام، پیش‌بینی‌کننده متنی قدرتمند است، اما به‌ندرت می‌تواند یک دستیار مفید باشد. به نقل از ریجول (Rijul)، بنیان‌گذار LiveReview، این شکاف عمیق از طریق فاز پس‌آموزش پر می‌شود.

یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — در حالت خام تنها یک پیش‌بینی‌کننده متن است. این مدل می‌تواند کلمه بعدی یک جمله را به‌درستی حدس بزند، اما احتمالاً در پاسخ به یک سؤال مستقیم، یا جواب نمی‌دهد یا مسیر گفتگو را به سمتی پیش‌بینی‌ناپذیر می‌برد. این وضعیت اکثر مدل‌ها پیش از آن است که فرآیندهای همراستاسازی (Alignment) را طی کنند؛ همان فرآیندهایی که تجربه مدرن چت‌بات‌ها را تعریف می‌کنند.

زمینه و ضرورت پست-تراینینگ

آموزش یک مدل هوش مصنوعی صرفاً به داشتن یک مجموعه داده بزرگ و آموزش مدل روی آن محدود نمی‌شود. اگرچه پیش‌آموزش (Pre-training) مدلی آگاه و دانشمند ایجاد می‌کند، اما مفید بودن آن را تضمین نمی‌کند.

زمانی که قرار است یک مدل به عنوان «مغز» یک چت‌بات عمل کند، آموزش‌های تکمیلی مورد نیاز است تا بتواند به درستی به پرسش‌ها پاسخ دهد. بدون این مرحله، مدل اساساً یک پیش‌بینی‌کننده متن باقی می‌ماند و هرگز به یک دستیار کاربردی تبدیل نمی‌شود. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی همراستاسازی مدل‌های بازمتن اشاره کردیم، برای تبدیل یک پیش‌بینی‌کننده به یک دستیار، باید لایه‌ای از رفتارشناسی به مدل اضافه شود.

گام نخست: تنظیم نظارت‌شده (SFT)

پست-تراینینگ معمولاً با تنظیم نظارت‌شده (Supervised Fine-Tuning یا SFT) آغاز می‌شود. در این مرحله، توسعه‌دهندگان هزاران نمونه از مثال‌های حل‌شده را به مدل نشان می‌دهند. هر نمونه شامل یک پرسش مشخص و روش دقیقی است که یک دستیار مفید باید برای پاسخ به آن به کار ببرد.

این مثال‌ها توسط انسان‌ها یا مدل‌های موجود قدرتمندتر ساخته می‌شوند. SFT سه رفتار کلیدی و اولیه را به مدل می‌آموزد:

  • نحوه پیروی از دستورات پیچیده و چندمرحله‌ای
  • تولید خروجی در قالب‌های مشخص و ساختاریافته (مانند JSON، Markdown یا لیست)
  • حفظ لحنی مودبانه، حرفه‌ای و کمک‌کننده در طول گفتگو

با این حال، SFT دارای یک سقف رشد (Scaling Ceiling) است. مدل در این مرحله توسط کیفیت پاسخ‌هایی که دریافت می‌کند محدود می‌شود. ایجاد پاسخ‌های بی‌نقص و تأییدشده توسط انسان برای هر پرسش احتمالی کاربر، به‌شدت هزینه‌بر است و با تنوع بی‌کران پرامپت‌های دنیای واقعی سازگاری ندارد.

بهینه‌سازی بر اساس ترجیحات

برای عبور از محدودیت مثال‌های ایستا، توسعه‌دهندگان از داده‌های ترجیحی (Preference Data) استفاده می‌کنند. در این رویکرد، به‌جای ارائه یک پاسخ «درست» واحد، دو پاسخ مختلف (پاسخ الف و پاسخ ب) به یک پرامپت واحد به مدل نشان داده می‌شود و به مدل گفته می‌شود که کدام‌یک برتر است (مثلاً: پاسخ الف بهتر است و پاسخ ب ضعیف‌تر است).

طبق مستندات فنی، دو مکانیزم اصلی این بهینه‌سازی را هدایت می‌کنند:

  • بهینه‌سازی سیاست تقریبی (Proximal Policy Optimization یا PPO): این تکنیک یادگیری تقویت‌شده از یک مدل پاداش (Reward Model) مجزا استفاده می‌کند. فرآیند به این صورت است که ابتدا یک مدل پاداش با استفاده از مثال‌های ترجیحی انسانی آموزش می‌بیند تا بتواند کیفیت یک پاسخ را پیش‌بینی کند. سپس این مدل پاداش، در حین آموزش مدل زبانی، سیگنال‌هایی ارسال می‌کند و مدل زبانی به‌گونه‌ای بهینه می‌شود که پاسخ‌هایی تولید کند که پاداش‌های بالاتری دریافت کنند.
  • بهینه‌سازی مستقیم ترجیح (Direct Preference Optimization یا DPO): جایگزینی سبک‌تر و بهینه‌تر برای PPO است که نیاز به مدل پاداش مجزا را کاملاً حذف می‌کند. DPO مستقیماً مدل زبانی را با استفاده از داده‌های ترجیحی تنظیم می‌کند و به آن می‌آموزد که یک پاسخ را بر پاسخ دیگر ترجیح دهد. این امر باعث می‌شود DPO به‌طور کلی ساده‌تر پیاده‌سازی شود و هزینه کمتری داشته باشد، زیرا سربار نگهداری یک مدل پاداش مجزا در طول بهینه‌سازی را ندارد.

کاربرد در سیستم‌های حساس تجاری

برای توسعه‌دهندگانی که سیستم‌های حساس و حیاتی تجاری می‌سازند، این تفاوت‌های ظریف بسیار اهمیت دارند. ریجول اشاره می‌کند که سیل کدهای تولیدشده توسط هوش مصنوعی، حفظ امنیت و پایداری محیط‌های عملیاتی (Production) را دشوار کرده است، به‌ویژه اگر نخواهیم سرعت توسعه را کاهش دهیم. در واقع، تکیه کورکورانه به خروجی‌های مدل بدون بازبینی دقیق می‌تواند مخاطرات جدی داشته باشد، چرا که کپی-پیست کردن پاسخ‌های هوش مصنوعی می‌تواند اعتبار حرفه‌ای را تخریب کند. به همین دلیل او LiveReview را توسعه داده است؛ ابزاری برای بازبینی کد که نسبت به «شعاع تخریب» (Blast Radius) آگاه است.

LiveReview منطق مشابهی از اولویت‌بندی را در بازبینی کدها به کار می‌گیرد:

  • این ابزار هر بخش از تغییرات (Diff) را بر اساس «شعاع تخریب» امتیازدهی می‌کند؛ معیاری که اندازه‌گیری می‌کند یک تغییر تا چه حد در گراف فراخوانی (Call Graph) پیش می‌رود.
  • ابزار ارزیابی می‌کند که تغییرات چقدر با وضعیت‌های پایدار (Persistent State) در تماس هستند و کد تا چه حد تست شده است.
  • اولویت را به جای حجم کد، به ریسک می‌دهد؛ برای مثال، یک اصلاح ۳ خطی در تابعی که توسط ۴۰ فایل دیگر استفاده می‌شود و در پایگاه‌داده می‌نویسد، اولویت بسیار بالاتری نسبت به یک تغییر ۳۰۰ خطی در رابط کاربری (UI) در یک فایل واحد خواهد داشت.

این تغییر رویکرد — از دانش خام به سمت همراستاسازی رفتاری — همان چیزی است که یک مدل را از یک کنجکاوی پژوهشی به یک ابزار آماده برای تولید تبدیل می‌کند. بدون این گام‌ها، یک هوش مصنوعی تنها یک موتور دانشمند اما غیرقابل‌پیش‌بینی باقی می‌ماند.

برای مشاهده این اصول در عمل، می‌توانید بررسی کنید که چگونه بهینه‌سازی ترجیحات در دستیارهای کدنویسی تخصصی به کار گرفته شده تا نرخ توهمات (Hallucinations) در محیط‌های عملیاتی کاهش یابد.

گام بعدی شما

  • اگر از مدل‌های بازمتن استفاده می‌کنید، تفاوت خروجی مدل‌های Base و Instruct را بررسی کنید تا اثر SFT را ببینید.
  • در پروژه‌های خود به‌جای تکیه بر پرامپت‌های طولانی، امکان استفاده از DPO برای همراستاسازی مدل با ترجیحات خاص کسب‌وکار خود را بررسی کنید.
  • ابزارهای بازبینی کد مبتنی بر تحلیل گراف فراخوانی (Call Graph) را برای کاهش ریسک استقرار کدها مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فرآیند تخصصی است که تفاوت میان یک موتور متن و یک محصول تجاری را رقم می‌زند. بدون پست-تراینینگ، مدل‌های زبانی برای محیط‌های عملیاتی غیرقابل‌پیش‌بینی و خطرناک هستند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت GPU مواجه‌اند، استفاده از DPO به‌جای PPO مسیر بهینه‌تری برای شخصی‌سازی مدل‌های بازمتن (مانند Llama) فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از افزایش اندازه مدل‌ها به سمت بهینه‌سازی رفتاری (Alignment) تغییر کرده است. DPO نشان می‌دهد که می‌توان بدون پیچیدگی‌های محاسباتی PPO، مدل‌ها را با ترجیحات انسانی همراستا کرد. این یعنی در آینده، مدل‌های کوچک‌تر اما «بهتر تربیت‌شده»، جایگزین غول‌های ناکارآمد خواهند شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.