پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه رکورد تنظیم دقیق مدل Qwen2.5-1.5B به ۶ دقیقه رسید؟

·۲۹ تیر ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
سرعت‌بخشی به تنظیم دقیق LoRA: وظیفه ثابت، سخت‌افزار ثابت، جدول رتبه‌بندی عمومی بر اساس زمان واقعی. modded-nanogpt برای تنظیم
سرعت‌بخشی به تنظیم دقیق LoRA: وظیفه ثابت، سخت‌افزار ثابت، جدول رتبه‌بندی عمومی بر اساس زمان واقعی. modded-nanogpt برای تنظیم
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ایجاد اولین تخته امتیاز (Leaderboard) سخت‌گیرانه برای PEFT که متغیرهای سخت‌افزاری را کاملاً ثابت کرده و «زمان واقعی» را جایگزین معیارهای انتزاعی محاسباتی می‌کند.

۶ دقیقه و ۵ ثانیه. این تمام زمانی است که برای رسیدن یک اجرای آموزشی مدل Qwen2.5-1.5B به صحت ۶۱.۱ درصدی در محک ریاضی GSM8K نیاز بود. این رکورد که در ۲۰ جولای ۲۰۲۶ ثبت شد، هسته اصلی lora-speedrun است؛ یک میدان رقابتی جدید که برای حذف نویزهای ناشی از گزارش‌های ناسازگار در پژوهش‌های هوش مصنوعی طراحی شده است.

تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه خاص خبره شود — اغلب شبیه به یک جعبه سیاه است؛ زیرا پژوهشگران از سخت‌افزارهای مختلف، مدل‌های گوناگون و مجموعه‌داده‌های متفاوتی استفاده می‌کنند. در حالی که تکنیک‌هایی مانند DoRA، rsLoRA و PiSSA به سرعت ظهور کردند، اما یک محیط «سیب با سیب» (مقایسه‌ای عادلانه) نداشتند تا ثابت کنند کدام‌یک واقعاً در زمان و محاسبات صرفه‌جویی می‌کند. lora-speedrun با ثابت کردن متغیرها (یک مدل، یک مجموعه‌داده و یک پردازنده گرافیکی خاص)، این مشکل را حل کرد.

بر اساس مستندات مخزن گیت‌هاب این پروژه، چالش از شرکت‌کنندگان می‌خواهد که از یک عدد NVIDIA L40S (با ۴۸ گیگابایت حافظه) در یک محیط ایزوله‌شده (Sandbox) در پلتفرم Modal استفاده کنند. هدف نهایی این است که مدل با کمترین زمان واقعی (Wall-clock time)، به حداقل ۵۷٪ تطابق دقیق (Exact Match) در مجموعه آزمون GSM8K برسد (با استفاده از روش 0-shot، استخراج سخت‌گیرانه و Greedy).

مشخصات فنی

جزئیات دقیق این چالش به شرح زیر است:

  • مدل پایه: Qwen2.5-1.5B (نسخه Base، نه نسخه Instruct).
  • مجموعه‌داده: تنها داده مجاز، بخش آموزشی GSM8K با ۷,۴۷۳ نمونه است.
  • محدودیت: وزن‌های پایه باید منجمد (Frozen) باشند؛ تنها استفاده از آداپتور PEFT مجاز است و حداکثر تعداد پارامترهای قابل آموزش باید ۳۰ میلیون باشد.
  • سخت‌افزار: یک عدد NVIDIA L40S (که دسترسی شبکه آن برای جلوگیری از تقلب مسدود شده است).
  • معیار سنجش: زمان واقعی اجرای آموزش (Wall-clock time)؛ هر چه کمتر باشد، نتیجه بهتر است.

جزئیات محدودیت‌ها و دامنه عملیاتی

شرکت‌کنندگان کنترل کاملی بر فرآیند تنظیم دارند. این کنترل شامل تعیین رتبه لورا (LoRA rank) و محل قرارگیری لایه‌ها، کوانتیزاسیون (Quantization) — که شبیه فشردن یک فایل حجیم برای اشغال فضای کمتر است — زمان‌بندی نرخ یادگیری (Learning-rate schedules) و انتخاب زیرمجموعه‌ای از داده‌ها است. آن‌ها حتی می‌توانند از کرنل‌های سفارشی استفاده کنند یا دقیقاً تعیین کنند که آموزش در چه لحظه‌ای متوقف شود. برای مثال، یک کاربر از نظر تئوری می‌تواند مدل را تنها روی ۱,۰۰۰ نمونه راستی‌آزمایی‌شده برای ۹۰ ثانیه آموزش دهد، به شرطی که بتواند سد ۵۷٪ صحت را رد کند.

قوانین سخت‌گیرانه‌ای از طریق فایل‌های TASK.md و spec.yaml اعمال می‌شوند. برای نمونه، استفاده از مدل‌های معلم (Teacher models)، داده‌های مصنوعی (Synthetic data) یا استفاده از چندین پردازنده گرافیکی اکیداً ممنوع است. انتخاب کارت L40S کاملاً عمدی است؛ زیرا این کارت یک SKU استاندارد دیتاسنتری ارائه می‌دهد تا تفاوت‌های سخت‌افزاری موجود در کارت‌های تجاری مصرف‌کننده حذف شود، در حالی که از نظر سیلیکونی مشابه معماری AD102 در کارت‌های RTX 4090 است.

برنده فعلی این رقابت، کاربر @Saivineeth147 است که با پیاده‌سازی «بسته‌بندی توالی» (Sequence Packing) و «ماسک‌گذاری زیان فقط برای تکمیل» (Completion-only loss masking) در دو اپوک (Epoch)، به زمان ۶ دقیقه و ۵ ثانیه دست یافت. این رویکرد تقریباً ۲ برابر سریع‌تر از رکورد اولیه (رکورد شماره ۰) بود. رکورد اولیه ۱۱ دقیقه و ۵۷ ثانیه زمان برد تا با استفاده از لورای ساده (r=16) روی تمام لایه‌های خطی در سه اپوک با نرخ یادگیری کسینوسی، به صحت ۵۹.۴٪ برسد.

تأییدیه و امنیت

برای تضمین مشروعیت، هر رکورد سه بار به‌طور مستقل با بذرهای (Seed) تصادفی جدید اجرا می‌شود و زمان رسمی، میانگین این اجراها خواهد بود. فرآیند با یک درخواست تغییر (PR) حاوی اسکریپت آموزش و فایل پیکربندی آغاز می‌شود. ابتدا سیستم CI کد را به‌طور استاتیک اعتبارسنجی می‌کند و سپس یک اسکن امنیتی خودکار توسط Claude بررسی می‌کند تا هرگونه تلاش برای خروج داده‌ها (Exfiltration)، استفاده از شبکه یا تماس با مجموعه آزمون شناسایی شود. این تمرکز بر امنیت و کنترل دسترسی، یادآور پروتکل‌های سخت‌گیرانه‌ای است که در عرضه GPT-5.6 برای نظارت دولت آمریکا پیاده‌سازی شده بود.

زمانی که یک نگهبان (Maintainer) عبارت /verify را کامنت کند، کد در محیط شبکه-بسته Modal اجرا می‌شود. سیستم نظارتی، تعداد پارامترهای آداپتور را حساب کرده و هش‌های (Hash) محتوای مدل و داده‌ها را بازبینی می‌کند تا از دستکاری آن‌ها جلوگیری شود. تمام نتایج به همراه دلیل پذیرش یا رد در مسیر records/verifications/ منتشر می‌گردد.

این تغییر رویکرد به سمت «اسپیدران»، مشابه موفقیت پروژه modded-nanogpt است که علم پیش-آموزش (Pretraining) را سرعت بخشید و منجر به کشف بهینه‌ساز Muon شد. وقتی زمان واقعی به جای FLOPs به عنوان ارز اصلی در نظر گرفته شود — چون زمان واقعی همان چیزی است که کاربران بابت آن هزینه پرداخت می‌کنند — توسعه‌دهندگان مجبور می‌شوند به جای گزارش‌های تئوری، روی بهینه‌سازی کرنل‌ها، بارگذاری داده‌ها و الگوریتم‌ها تمرکز کنند. این توجه به بهینه‌سازی هزینه و کارایی، در مقایسه‌های اخیر مدل‌های بزرگ نیز دیده می‌شود؛ برای مثال در تحلیل عملکرد GLM-5.2 در برابر Claude Opus، تفاوت در هزینه‌های عملیاتی علی‌رغم برابری در توانایی کدنویسی، عامل تعیین‌کننده‌ای بود.

برای متخصصان، این به معنای اندازه‌گیری واقعی فاصله بین تکنیک‌های نظری PEFT و بازدهی در محیط عملیاتی است. صنعت اکنون از ادعاهای مبهم «کارآمدی» به سمت معیارهای بازتولیدپذیر و سخت‌گیرانه «زمان-تا-صحت» (Time-to-Accuracy) حرکت می‌کند.

فرصت‌های آینده

اگر پردازنده گرافیکی با حافظه بیش از ۲۴ گیگابایت دارید، می‌توانید با استفاده از اسکریپت‌های آماده پروژه، به‌طور محلی آزمایش کنید، هرچند تنها اجراهای Modal L40S برای جدول رده‌بندی پذیرفته می‌شوند. این پروژه برای پذیرش تکنیک‌های جدید جهت شکستن رکورد ۶ دقیقه باز است. ایده‌هایی که هنوز برای ثبت رکورد استفاده نشده‌اند عبارتند از:

  • کرنل‌های پیشرفته: استفاده از کرنل‌های Unsloth، Liger یا Cross-entropy ادغام‌شده (Fused).
  • تغییرات معماری: استفاده از Attention با بسته‌بندی بلوک-قطری (Block-diagonal) یا روش‌های رتبه-تطبیقی (Rank-adaptive).
  • استراتژی‌های نرخ یادگیری: زمان‌بندی‌های تهاجمی در یک اپوک، LoRA+ (نرخ یادگیری نامتقارن برای A/B) یا Warmup هوشمندتر.
  • داده‌ها و نویز: آموزش روی سخت‌ترین ۲,۰۰۰ نمونه (هرس داده)، ترتیب‌بندی برنامه درسی (Curriculum ordering) یا نویز NEFTune.
  • کوانتیزاسیون: ارزیابی توازن بین QLoRA NF4 در مقابل bf16.
  • مقداردهی اولیه: بررسی روش‌های مقداردهی اولیه rsLoRA، DoRA یا PiSSA.

اما تأثیر این بهینه‌سازی‌ها بر هزینه استنتاج در مقیاس صنعتی حتی جذاب‌تر است — به تحلیل ما درباره‌ی کاهش هزینه‌های GPU مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص مهندسی سیستم، استانداردی برای سنجش واقعی کارایی مدل‌ها ایجاد می‌کند. نتیجه آن، کاهش مستقیم هزینه‌های عملیاتی برای شرکت‌هایی است که نیاز به به‌روزرسانی مداوم مدل‌های تخصصی دارند.

تأثیر برای ایران

به دلیل دسترسی محدود به GPUهای L40S، این پروژه برای توسعه‌دهندگان ایرانی بیشتر به عنوان یک مرجع برای بهینه‌سازی کد و کاهش زمان آموزش روی سخت‌افزارهای موجود (مانند سری RTX) کاربرد دارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «زمان واقعی» به جای «تعداد عملیات محاسباتی»، تغییر پارادایم از ریاضیات تئوریک به مهندسی عملی است. این رقابت نشان می‌دهد که گلوگاه‌های فعلی در تنظیم دقیق، بیش از آنکه مربوط به معماری مدل باشد، به نحوه مدیریت داده و اجرای کرنل‌ها بازمی‌گردد. احتمالاً در آینده نزدیک، شاهد ظهور کتابخانه‌هایی خواهیم بود که این ترفندهای «اسپیدران» را به صورت استاندارد در PEFT ادغام می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.