پرش به محتوای اصلی
پرش به محتوای مقاله

بهینه‌سازی DPO سوگیری‌های ترجیحی مدل‌های Qwen2.5 را برطرف کرد

·۲۹ مرداد ۱۴۰۵۱۲ دقیقه مطالعه
راهنما
بررسی سوگیری‌های ترجیحی و تنظیم دقیق مدل‌های زبانی با بهینه‌سازی مستقیم ترجیحات بر روی مجموعه داده Anthropic HH-RLHF با استفا
بررسی سوگیری‌های ترجیحی و تنظیم دقیق مدل‌های زبانی با بهینه‌سازی مستقیم ترجیحات بر روی مجموعه داده Anthropic HH-RLHF با استفا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک متد بازرسی کمی (Quantitative Audit) برای شناسایی میان‌برهای لغوی و سوگیری طول در فرآیند DPO، که مانع از یادگیری الگوهای سطحی توسط مدل‌های کوچک می‌شود.

تصور کنید مدل زبانی شما همیشه پاسخ‌های طولانی‌تر را به پاسخ‌های دقیق‌تر ترجیح می‌دهد؛ این همان «میان‌بر» کلاسیکی است که باعث شکست بسیاری از فرآیندهای همراستاسازی می‌شود. برای مقابله با این مشکل، یک پیاده‌سازی عملی با استفاده از بهینه‌سازی مستقیم ترجیح (DPO) روی مدل Qwen2.5-0.5B-Instruct، نقشه‌ای برای شناسایی و حذف این سوگیری‌های ساختاری در طول فرآیند همراستاسازی ارائه داده است.

بیشتر یادگیری‌های ترجیحی امروز بر پایه یادگیری تقویتی با بازخورد انسانی (RLHF) استوار است. این روش معمولاً به آموزش یک مدل پاداش (Reward Model) جداگانه نیاز دارد که مانند یک داور عمل کند. این فرآیند دو مرحله‌ای، هم از نظر محاسباتی گران است و هم پایداری کمی دارد. DPO این مسیر را ساده می‌کند؛ به این صورت که خودِ مدل زبانی را به عنوان مدل پاداش در نظر می‌گیرد و سیاست تولید متن را مستقیماً از روی جفت پاسخ‌های «انتخاب‌شده» (chosen) و «ردشده» (rejected) بهینه می‌کند.

به نقل از راهنمای فنی منتشر شده توسط Marktechpost، هدف این است که با اجرای یک مرحله بازرسی دقیق، از تنظیم دقیق (Fine-tuning) ساده فراتر برویم. این بازرسی تضمین می‌کند که مدل صرفاً در حال بازی با الگوهای سطحی مجموعه داده نیست. تنظیم دقیق — مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه خاص خبره شود — در اینجا باید طوری مدیریت شود که مدل الگوهای سطحی داده‌ها را بازی نکند. برای توسعه‌دهندگان، این یعنی تفاوت میان مدلی که فقط «مودب» به نظر می‌رسد و مدلی که واقعاً «مفید» است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت و پایداری مدل‌های بازمتن اشاره کردیم، حذف سوگیری‌های داده‌ای کلید رسیدن به مدل‌های قابل اعتماد است. در این راستا، استفاده از متدهای تکمیلی مانند اتصال به دانش خارجی از طریق خط لوله‌های RAG می‌تواند ریسک توهمات مدل و خطاهای ناشی از سوگیری‌های داخلی را به‌طور قابل‌توجهی کاهش دهد.

مدیریت محیط و وابستگی‌ها

برای تضمین پایداری محیط آموزش، این گردش‌کار با یک بررسی سخت‌گیرانه وابستگی‌ها آغاز می‌شود. خط لوله به نسخه‌های خاصی از کتابخانه‌های کلیدی نیاز دارد: trl>=0.12 ،transformers>=4.45 ،accelerate ،datasets و peft.

یک چالش فنی مهم که در این پیاده‌سازی به آن پرداخته شده، ناسازگاری torchao است. محیط‌های Colab معمولاً با نسخه ۰.۱۰۰ عرضه می‌شوند، اما کتابخانه peft به نسخه‌ای بالاتر از ۰.۱۶ نیاز دارد. از آنجایی که خط لوله DPO از torchao استفاده نمی‌کند، این ابزار صراحتاً حذف می‌شود تا از بروز خطا در هنگام وارد کردن (import) کتابخانه‌ها جلوگیری شود. این رویکرد «احتیاطی» شامل یک وصله (patch) است تا اگر حذف نصب با شکست مواجه شد، بررسی‌های داخلی peft برای torchao خنثی شود.

استخراج و تجزیه داده‌ها

این متد از مجموعه داده Anthropic HH-RLHF استفاده می‌کند و برای ایجاد یک سیگنال ترجیحی متوازن، از چهار زیرمجموعه متمایز بهره می‌برد:

  • helpful-base
  • helpful-rejection-sampled
  • helpful-online
  • harmless-base

برای مدیریت حافظه و حفظ ردپای قابل مدیریت در محیط‌های آزمایشی، ۱۲۰ نمونه آموزشی و ۳۰ نمونه آزمونی از هر زیرمجموعه استخراج می‌شود. متون خام با استفاده از عبارت‌های منظم (Regular Expressions) تجزیه می‌شوند تا نوبت‌های «انسان» (Human) و «دستیار» (Assistant) شناسایی شوند. یک فیلتر اعتبارسنجی سخت‌گیرانه اعمال می‌شود: یک جفت پاسخ تنها زمانی معتبر است که هر دو پاسخ (انتخاب‌شده و ردشده) دقیقاً پیش‌زمینه یا پرامپت یکسانی داشته باشند و از یک ساختار نقش‌های متناوب پیروی کنند. این کار مانع از آن می‌شود که مدل ترجیحات را بر اساس تفاوت در سؤال یاد بگیرد، نه کیفیت پاسخ.

بازرسی میان‌برهای لغوی

پیش از آموزش، تیمی از متخصصان یک «تشخیص لغوی» انجام می‌دهند تا بفهمند آیا الگوهای زبانی سطحی می‌توانند پاسخ‌های ترجیحی را از ردشده‌ها جدا کنند یا خیر. این کار با ساخت یک مجموعه داده لغوی انجام می‌شود که در آن متون انتخاب‌شده و ردشده برچسب‌گذاری شده و از یک بردارساز TF-IDF عبور داده می‌شوند (با استفاده از n-gramهای ۱ تا ۲، حداقل فرکانس سند ۲ و حداکثر ۲۰,۰۰۰ ویژگی).

سپس یک طبقه‌بند رگرسیون لجستیک (Logistic Regression) روی این داده‌ها آموزش می‌بیند. اگر مقدار ROC-AUC به‌طور قابل‌توجهی بالاتر از حد شانس باشد (که با اجرای همان تشخیص روی برچسب‌های تصادفی تعیین می‌شود)، نشان‌دهنده وجود یک «میان‌بر لغوی» است. این یعنی مجموعه داده حاوی انتخاب‌های کلامی خاصی است که مدل می‌تواند برای کاهش تابع زیان (loss) از آن‌ها بهره‌برداری کند، بدون اینکه واقعاً استدلال یا مفید بودن خود را بهبود بخشد. ۲۰ ضریب لغوی برتر تحلیل می‌شوند تا این الگوها شناسایی شوند، هرچند رشته‌های متنی خاص برای جلوگیری از نمایش محتوای توهین‌آمیز موجود در بدنه داده‌ها، حذف شده‌اند.

تله‌ی سوگیری طول

یکی از سرسخت‌ترین مشکلات در RLHF، سوگیری طول است؛ وضعیتی که در آن مدل‌ها یاد می‌گیرند پاسخ‌های بلندتر معمولاً توسط انسان‌ها امتیاز بالاتری می‌گیرند، فارغ از اینکه محتوا درست است یا خیر. این پیاده‌سازی «دلتای طول» — یعنی تفاوت تعداد کلمات بین پاسخ انتخاب‌شده و ردشده — را ردیابی می‌کند.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

با تحلیل این دلتا در زیرمجموعه‌های HH-RLHF، می‌توان تشخیص داد که آیا پاسخ‌های «انتخاب‌شده» به‌طور سیستماتیک بلندتر هستند یا خیر. برای مثال، این بازرسی میانگین دلتای طول و میانه نوبت‌های پرامپت را برای هر منبع محاسبه می‌کند. اگر دقت پاداش مدل همبستگی شدیدی با طول پاسخ داشته باشد (توافقی نزدیک به ۱.۰)، همراستاسازی شکست‌خورده تلقی می‌شود، زیرا مدل به جای سیگنال ترجیح، یک اکتشاف عددی (heuristic) برای طول یاد گرفته است.

خط لوله فنی آموزش

این سیستم از کتابخانه TRL و روش لورا (LoRA) — که مثل اضافه کردن چند لایه کوچک و منعطف به یک سازه سخت است تا بدون تغییر کل مدل، آن را شخصی‌سازی کند — برای افزایش کارایی استفاده می‌کند. خط لوله به‌گونه‌ای طراحی شده که در برابر تغییرات نسخه مقاوم باشد؛ به این صورت که به‌طور پویا بررسی می‌کند آیا DPOConfig از warmup_ratio پشتیبانی می‌کند یا باید برای جلوگیری از کرش در نسخه‌های مختلف TRL، به warmup_steps تبدیل شود.

مشخصات فنی کلیدی عبارتند از:

  • مدل پایه: Qwen2.5-0.5B-Instruct
  • بهینه‌سازی: DPO با مقدار بتا ۰.۱
  • دقت: bfloat16 (در صورت پشتیبانی) یا float32 برای کاهش فشار به حافظه
  • تنظیمات LoRA: رتبه (r) ۱۶، lora_alpha ۳۲ و lora_dropout ۰.۰۵
  • محدودیت توکن: حداکثر ۵۱۲ توکن برای کل توالی و ۲۵۶ توکن برای پرامپت‌ها
  • ابرپارامترها: نرخ یادگیری 5e-6، اندازه دسته ۱، تجمع گرادیان ۸ و مجموعاً ۳۰ گام برای تست اولیه (smoke testing)

برای مدیریت فرمت گفتگوها، یک قالب جایگزین ChatML پیاده شده است تا اگر توکنایزر فاقد قالب بود، مدل توکن‌های شروع و پایان (<|im_start|> و <|im_end|>) را به‌درستی تشخیص دهد.

ارزیابی صحت پاداش

پس از آموزش، مدل روی جفت‌های ترجیحی که در آموزش نبوده‌اند ارزیابی می‌شود. معیار اصلی «صحت پاداش» است؛ یعنی مدل هر چند وقت یک‌بار احتمال بالاتری را به پاسخ انتخاب‌شده نسبت به پاسخ ردشده اختصاص می‌دهد. این مقدار از طریق مقایسه احتمالات لگاریتمی (log probabilities) تکمیلی تحت سیاست تنظیم‌شده در برابر مدل مرجع محاسبه می‌شود.

به‌طور حیاتی، ارزیابی به‌صورت تفکیکی برای هر منبع و با استفاده از فرمول حاشیه پاداش انجام می‌شود: BETA * ((rc - refc) - (rr - refr)) که در آن rc احتمال لگاریتمی انتخاب‌شده و rr احتمال لگاریتمی ردشده است. اگر صحت در زیرمجموعه‌های «مفید» بالا برود اما در زیرمجموعه‌های «بی‌ضرر» افت کند، نشان‌دهنده بیش‌برازش (Overfitting) مدل روی سوگیری‌های خاص مجموعه داده است.

تست کیفی و استقرار

در مرحله نهایی، پاسخ‌های نمونه‌ای تولید می‌شود تا رفتار مدل سنجیده شود. مثال‌هایی مانند درخواست از مدل برای توضیح اینکه چرا DPO به مدل پاداش جداگانه نیاز ندارد یا عیب‌یابی صدای فن لپ‌تاپ، در این مرحله بررسی می‌شوند. این پاسخ‌ها با استفاده از رمزگشایی حریصانه (Greedy decoding) با تنظیم do_sample=False تولید می‌شوند تا ثبات پاسخ‌ها تضمین شود.

پس از اعتبارسنجی، سیاست (policy) و توکنایزر حاصل در یک دایرکتوری محلی برای آزمایش‌های بیشتر ذخیره می‌شوند. این رویکرد سخت‌گیرانه، DPO را از یک فرآیند «جعبه سیاه» به یک سیستم بازرسی شفاف تبدیل می‌کند. با اندازه‌گیری توافق بین «ترجیح مدل» و «طول پاسخ»، توسعه‌دهندگان می‌توانند به‌طور کمی ثابت کنند که مدل آن‌ها واقعاً همراستا شده است یا صرفاً در حال تقلید از یک الگوست.

این تغییر در رویکرد نشان می‌دهد که آینده همراستاسازی نه در داده‌های بیشتر، بلکه در تشخیص‌های دقیق‌تر است. با کوچک‌تر و تخصصی‌تر شدن مدل‌ها، توانایی حذف میان‌برها برای استقرار مدل‌های زبانی کوچک (SLM) قابل اعتماد در محیط عملیاتی حیاتی خواهد بود. این موضوع به‌ویژه در سناریوهای پیچیده عملیاتی اهمیت می‌یابد، چرا که حتی با مدل‌های پیشرفته نیز عامل‌های هوش مصنوعی در بسیاری از وظایف واقعی SRE با شکست مواجه می‌شوند و نیاز به همراستاسازی دقیق‌تر دارند.

گام بعدی شما

  • بررسی کتابخانه TRL برای پیاده‌سازی خط لوله بازرسی روی داده‌های ترجیحی اختصاصی خودتان.
  • تحلیل همبستگی بین طول پاسخ و امتیاز مدل در پروژه‌های فعلی برای شناسایی سوگیری‌های پنهان.
  • آزمایش مدل‌های کوچک‌تر (زیر ۱ میلیارد پارامتر) با متد DPO برای کاهش هزینه‌های استنتاج در محیط تولید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با حذف نیاز به مدل پاداش جداگانه، هزینه و پیچیدگی همراستاسازی را به‌شدت کاهش می‌دهد. تکیه بر متدهای بازرسی لغوی، اعتبار مدل‌های تولید شده را از نظر تخصص فنی افزایش داده و ریسک توهمات ساختاری را کم می‌کند.

تأثیر برای ایران

این متد برای توسعه‌دهندگان ایرانی که با محدودیت منابع پردازشی (GPU) روبرو هستند، راهکاری بهینه برای همراستاسازی مدل‌های کوچک و بازمتن بدون نیاز به زیرساخت‌های سنگین RLHF است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «سوگیری طول» نشان می‌دهد که ما از عصر جمع‌آوری انبوه داده به عصر تصفیه کیفی داده‌ها رسیده‌ایم. این متد ثابت می‌کند که در مدل‌های کوچک (SLM)، دقت در انتخاب سیگنال‌های ترجیحی بسیار مؤثرتر از افزایش حجم داده است. در واقع، شفافیت در فرآیند همراستاسازی اکنون به اندازه خودِ عملکرد مدل اهمیت یافته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.