پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های پیش‌فرض در برابر مدل‌های محبوب؛ شکستِ رتبه‌بندی در پرامپت‌های خاص

·۱۳ مرداد ۱۴۰۵۵ دقیقه مطالعه
راهنما
پراستفاده‌ترین مدل، وابستگی اشتباه بود
پراستفاده‌ترین مدل، وابستگی اشتباه بود
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات تجربی اینکه مدل‌های پیش‌فرض (Base Models) در بازتولید جزئیات نادر، عملکرد بهتری نسبت به مدل‌های محبوب جامعه (Community Checkpoints) دارند و رتبه‌بندی‌های محبوبیت در این موارد گمراه‌کننده هستند.

تصور کنید می‌خواهید تصویری از یک شخصیت غیرمعمول بسازید؛ مثلاً یک صنعتگر ۴۰ ساله با جثه‌ای استخوانی و جزئیات دقیق لباس. یک آزمایش مفصل نشان می‌دهد که در چنین حالاتی، انتخاب پردانلودترین مدل از یک کتابخانه (Registry)، احتمالاً شما را به نتایجی می‌رساند که حتی از مدل‌های ابتدایی هم بدتر هستند و این ثابت می‌کند که چگونه اکتشافات مبتنی بر «محبوبیت» در مواجهه با نیازهای خاص، شکست می‌خورند.

بسیاری از کاربران با کتابخانه‌های مدل مانند مخازن نرم‌افزاری برخورد می‌کنند: جست‌وجو می‌کنند، بر اساس محبوبیت مرتب می‌کنند، تعداد ستاره‌ها را می‌خوانند و اولین نتیجه را برمی‌دارند. این استراتژی تقریباً در همه جا جواب می‌دهد، اما یک شکاف حیاتی بین «پذیرش گسترده (Adoption)» و «پوشش محتوایی (Coverage)» وجود دارد. مدلی با ۴۵۰ هزار دانلود، بر اساس درخواست‌های میانگین کاربران تنظیم دقیق (Fine-tuning) شده است؛ به این معنا که مشخصات نادر و خاص، خارج از توزیع آموزشی آن قرار می‌گیرند. این دقیقاً همان حالت شکستی است که وقتی یک کتابخانه کد را فقط بر اساس ستاره‌های گیت‌هاب برای موردی انتخاب می‌کنید که توسعه‌دهنده‌اش هرگز آن مورد خاص را هدف قرار نداده است. این چالش در مدیریت مدل‌ها، یادآور خطرات استفاده از لیست‌های ایستا است که در تحلیل ما درباره استعلام‌های پویا در مدیریت مدل‌های هوش مصنوعی به تفصیل بررسی شد.

به نقل از نویسنده این آزمایش، برای سنجش این موضوع دو محیط مختلف با یک مشخصات سخت هفت‌گانه برای شخصیتی به نام «برام»، قفل‌ساز ۴۰ ساله، مقایسه شدند. توصیفات دقیق به عنوان تنها منبع حقیقت (Source of Truth) در نظر گرفته شد و شامل ادعاهای زیر بود:

  • نقش: قفل‌ساز
  • سن: دهه ۴۰
  • جثه: کوتاه، چهارشانه، سینه بشکه‌ای
  • مو: کچل، با تاتوی هندسی روی پوست سر در سمت چپ
  • ریش: قرمز مسی، با دو گیس‌باف و حلقه برنجی در هر طرف
  • عینک: ذره‌بین جواهرسازی برنجی روی چشم راست
  • لباس: پیش‌بند چرمی با حلقه ابزار روی تونیک سبز خزه‌ای با گلدوزی آبی-سبز و کمربندی با حلقه‌ای از کلیدهای برنجی
  • دست‌ها: مچ‌بندهای چرمی میخ‌دوزی شده با جای زخم‌های سوختگی قدیمی

در محیط اول که «حل دستی وابستگی‌ها» (Manual Dependency Resolution) نام گرفت، کاربر باید خودش مدل را انتخاب می‌کرد. طبق گزارش نویسنده، این مسیر پر از اصطکاک است. جست‌وجوی کلمه «انیمه» ابتدا هیچ نتیجه‌ای نداد چون محدوده جست‌وجو (Scope) به اکوسیستم فعال محدود شده بود؛ کاربر مجبور شد ابتدا یک منوی کشویی خاص را پیدا کرده و محدوده را اصلاح کند تا جست‌وجو به ایندکس درست برسد.

پس از اصلاح، محبوب‌ترین چک‌پوینت انیمه با بیش از ۴۵۰ هزار دانلود و امتیاز «بسیار مثبت» (Overwhelmingly Positive) از سوی نزدیک به ۱۵۰۰ کاربر ظاهر شد. از نظر هر سیگنالی که یک کتابخانه ارائه می‌دهد، این بهترین انتخاب بود. اما تغییر مدل، کل پیکربندی زمان اجرا (Runtime Configuration) را عوض کرد. پیش‌فرض‌های جدیدی برای نمونه‌بردار (Sampler)، تعداد گام‌ها (Step Count) و مقیاس CFG ظاهر شد و یک فیلد برای پرامپت منفی (Negative Prompt) اضافه شد.

این مسیر مستلزم ۱۰ تصمیم مجزا بود که رابط کاربری در بسیاری از آن‌ها کمکی نمی‌کرد. برای مثال، انتخاب خانواده مدل (Model Family) مستلزم دانش قبلی بود. علاوه بر این، زبان پرامپت باید تغییر می‌کرد؛ زیرا چک‌پوینت‌های جامعه‌ای مشتق‌شده از SDXL به‌جای متن ادبی (Prose)، تگ‌های جدا شده با کاما می‌خواهند. بنابراین مشخصات به صورت زیر بازنویسی شد:

پرامپت مثبت: 1boy, solo, male dwarf, adult man, 40 years old, stocky build, broad shoulders, barrel chest, short stature, bald head, dark geometric head tattoo on left side, long copper red beard, braided beard, brass beard rings, brass jeweler's loupe over right eye, brown leather apron, tool loops on apron, moss green tunic, teal embroidered cuffs, ring of brass keys on belt, leather bracers.

پرامپت منفی: child, kid, young boy, teenager, youthful face, beardless, tall, slender, thin body, feminine, 1girl, bad hands, bad anatomy.

با وجود تمام این تلاش‌ها، نتایج ضعیف بود. ادعاهای مربوط به جثه در هر دو نسبت ابعاد شکست خورد، حتی با وجود سه تگ مثبت برای تأکید بر جثه و دو تگ منفی برای حذف حالت مخالف. پیش‌بند ابزار کاملاً نادیده گرفته شد و تونیک در بسیاری از موارد حذف شد و بالاتنه برهنه ماند.

در محیط دوم، از مدل پیش‌فرض سرویس PixAI استفاده شد. این تنظیمات تنها به سه تصمیم نیاز داشت که یکی از آن‌ها صرفاً انتخاب اندازه تصویر بود. کاربر مشخصات را به‌صورت متن ساده (Plain Prose) نوشت و تصویر را تولید کرد.

نتایج تکان‌دهنده بود: هر هفت ادعای شخصیتی در اولین اجرا پذیرفته شدند. مدل پیش‌فرضی که هیچ‌کس برای انتخابش تلاشی نکرده بود، از محبوب‌ترین مدل جامعه پیشی گرفت. در ادامه، سه مدل مختلف از صحنه روی بذرهای (Seeds) تصادفی اجرا شد — از یک پس‌زمینه استودیویی خاکستری گرم تا بازاری روی پل سنگی در شب با فانوس‌های روشن — در حالی که ثبات شخصیت بدون نیاز به تصویر مرجع یا بذر ثابت، حفظ شد.

همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تفاوت در معماری می‌تواند نتایج را به‌کلی تغییر دهد. شکست در محیط اول فقط مربوط به مدل نبود، بلکه به دلیل معماری بود:

  • معماری SDXL: توسط چک‌پوینت محبوب استفاده می‌شد؛ نیاز به پرامپت منفی و تگ‌های جداشده با کاما دارد. این معماری از سینتکس وزن‌دهی با کروشه مانند (tag:1.3) برای تأکید بر ویژگی‌ها استفاده می‌کند.
  • معماری DiT: توسط پیش‌فرض PixAI استفاده می‌شد؛ فیلد پرامپت منفی ندارد. موارد حذفی را به‌عنوان جملات ساده در پرامپت مثبت می‌پذیرد. اگر پرامپتی از SDXL بدون تغییر به اینجا منتقل شود، وزن‌های آن به‌طور بی‌صدا نادیده گرفته می‌شوند.

این آزمایش همچنین «کلاسی از باگ‌ها» در مورد لورا (LoRA) — لایه‌های کوچکی که برای تغییر سبک یا چهره به مدل اضافه می‌شوند — را آشکار کرد. اولین لورای انتخاب شده، تمام پالت رنگی تصویر را تغییر داد. دلیل این اتفاق در صفحه خودِ لورا نوشته شده بود: این لورا روی مدل بنیادی (Base Model) متفاوتی نسبت به مدلی که در حال حاضر در حال اجرا بود، آموزش دیده بود.

این موضوع ثابت می‌کند که مدل بنیادی، اصلی‌ترین فیلد سازگاری است و باید ابتدا بررسی شود. در حالی که مقدار قدرت (Strength) یک لورا می‌تواند اثر زیبایی‌شناختی آن را کم یا زیاد کند، اما نمی‌تواند یک عدم تطابق معماری بنیادی را اصلاح کند.

در نهایت، رتبه‌بندی کتابخانه‌ها به این سوال پاسخ می‌دهد که «اکثریت مردم چه چیزی استفاده می‌کنند»، نه اینکه «چه چیزی مشخصات من را برآورده می‌کند». وقتی ورودی شما غیرمعمول است، مدل پیش‌فرض ارسالی یک خط مبنای معتبر است. جایگزینی یک مدل پیش‌فرض هزینه شناختی بالایی دارد (حدود ۱۰ تصمیم). کارآمدترین آزمایش این است که ابتدا ابزار پیش‌فرض را امتحان کنید و سپس برای جایگزینی آن با مدلی که شاید توزیع خاص شما را پوشش ندهد، وقت صرف کنید.

گام بعدی شما

  • پیش از جایگزینی مدل‌های پیش‌فرض با نسخه‌های محبوب، ابتدا یک بار پرامپت خود را با مدل پایه تست کنید.
  • هنگام استفاده از LoRA، حتماً مدل بنیادی (Base Model) مورد استفاده در آموزش آن را با مدل فعلی خود چک کنید.
  • اگر از مدل‌های SDXL استفاده می‌کنید، از تگ‌های جدا شده با کاما بهره ببرید، اما برای مدل‌های جدیدتر مثل DiT به زبان طبیعی (Prose) اعتماد کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع نشان می‌دهد که معیارهای اجتماعی مانند تعداد دانلود، معیار دقیقی برای کیفیت فنی در تسک‌های خاص نیستند. متخصصان باید به جای دنبال کردن ترندهای جامعه، بر تطبیق معماری مدل با توصیفات متنی تمرکز کنند.

تأثیر برای ایران

برای طراحان و توسعه‌دهندگان ایرانی که با محدودیت سخت‌افزاری مواجه‌اند، این یافته یعنی صرف زمان و هزینه برای دانلود مدل‌های حجیم و محبوب همیشه به نتیجه بهتر نمی‌انجامد و مدل‌های پایه می‌توانند جایگزین بهینه‌تری باشند.

·نگاه ما
تحریریه دات‌هوش

اعتماد کورکورانه به متریک‌های محبوبیت در مدل‌های مولد، منجر به «تله میانگین» می‌شود. مدل‌های پردانلود با بهینه‌سازی برای ذائقه اکثریت، توانایی بازتولید موارد حاشیه‌ای (Edge Cases) را از دست می‌دهند. این یافته نشان می‌دهد که برای کاربردهای تخصصی، مدل‌های بنیادیِ عمومی به دلیل توزیع داده‌ای وسیع‌تر، پایدارتر از نسخه‌های تخصصی‌شده (Fine-tuned) هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.