پرش به محتوای اصلی
پرش به محتوای مقاله

دقت مدل‌های کوچک در برابر مدل‌های حجیم؛ برتری در محاسبات و کدنویسی

·۱۳ مرداد ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
آزمایش ۴ مدل محلی کوچک: شاید کوچک‌ترین مدل شما، بهترین انتخاب باشد
آزمایش ۴ مدل محلی کوچک: شاید کوچک‌ترین مدل شما، بهترین انتخاب باشد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات عددی برتری یک مدل ۱.۱ گیگابایتی بر مدل‌های بزرگ‌تر در وظایف منطقی؛ این یعنی پارامترهای بیشتر دیگر تضمینی برای صحت پاسخ‌ها در محیط‌های محلی نیستند.

اگر امروز از لپ‌تاپی با ۱۶ گیگابایت رم برای اجرای هوش مصنوعی استفاده می‌کنید، احتمالاً تصور می‌کنید مدل‌های حجیم‌تر جواب‌های دقیق‌تری می‌دهند؛ اما واقعیت این است که در بسیاری از کاربردهای عملی، مدل‌های کوچک‌تر بازدهی بالاتری دارند.

یک مدل استدلالی (Reasoning Model) — شبیه شطرنج‌بازی که قبل از هر حرکت چند گام جلوتر را می‌بیند — با حجم تنها ۱.۱ گیگابایت، توانست در مسائل ریاضی ۵ برابر بهتر از یک مدل عمومی ۲ گیگابایتی عمل کند. این موفقیت مدل‌های کوچک را می‌توان تا حدی به رویکردهای جدید در تقطیر دانش نسبت داد؛ موضوعی که در تحلیل ما درباره اثربخشی تقلید توالی‌ها در ارتقای مدل‌های کوچک به‌طور مفصل بررسی شده است. طبق گزارشی از تاریخ ۴ اوت ۲۰۲۶، کوچک‌ترین مدل این مجموعه بیشترین امتیاز کلی را کسب کرد، در حالی که حجیم‌ترین مدل در رتبه سوم قرار گرفت.

همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی مدل‌های لبه اشاره کردیم، استقرار محلی مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — معمولاً بر پایه این فرض است که «بزرگ‌تر، بهتر است». اما برای کاربرانی که روی سخت‌افزارهای مصرفی کار می‌کنند، موازنه میان تأخیر و منطق حیاتی است. نویسنده این مطالعه برای حذف سوگیری، از یک سیستم نمره‌دهی قطعی استفاده کرد و ۱۵۲ خروجی را در چهار مدل مختلف بررسی نمود.

بر اساس مستندات این پژوهش که با استفاده از اولاما (Ollama) اجرا شده، نتایج بین مدل‌های deepseek-r1:1.5b، llama3.2:3b، gemma:2b و codellama 7b تفاوت‌های شدیدی را نشان می‌دهد:

  • محاسبات ریاضی: مدل deepseek-r1:1.5b با ۱۰ پاسخ correct از ۱۲ مورد پیشتازی کرد؛ در حالی که llama3.2:3b و gemma:2b هر دو تنها ۲ امتیاز گرفتند.
  • استخراج داده: مدل llama3.2:3b با کسب ۹ امتیاز از ۹ مورد، برنده مطلق بود. این دقت در استخراج داده، تضاد جالبی با چالش‌های حافظه عامل‌ها در بنچمارک LOCOMO دارد که در آن توهم دقت در حافظه بررسی شده بود.
  • خروجی کد: مدل deepseek-r1:1.5b با امتیاز ۵ از ۶، مدل ۷ میلیارد پارامتری codellama (۴ از ۶) را شکست داد.
  • تأخیر: سریع‌ترین مدل llama3.2:3b با میانگین ۱.۶ ثانیه بود، در حالی که deepseek-r1:1.5b حدود ۱۴.۶ ثانیه زمان برد.

باید اشاره کرد که تله‌های فنی نزدیک بود این اعداد را تغییر دهد. مدل‌های استدلالی از بلوک‌های <think> استفاده می‌کنند که اگر سیستم نمره‌دهی آن‌ها را حذف نکند، پاسخ‌ها را به‌اشتباه «غلط» علامت می‌زند. همچنین مدل gemma عادت داشت پاسخ‌ها را با کلمه «Negative» شروع کند و این باعث می‌شد در بررسی خط آخر، پاسخ‌های درست او صفر امتیاز بگیرند.

این چرخش نشان می‌دهد که برای تکالیفی با پاسخ کوتاه و ساختاریافته، مدل‌های زبانی کوچک (SLM) بازگشت سرمایه بهتری نسبت به مدل‌های عمومی بزرگ دارند. اکنون کاربران می‌توانند به‌جای تعقیب کورکورانه تعداد پارامترها، معماری مدل را بر اساس نوع کار انتخاب کنند: مدل‌های استدلالی برای ریاضی و مدل‌های عمومی برای استخراج داده.

گام بعدی شما

  • اگر به دنبال اجرای محلی هستید، ابتدا مدل‌های زیر ۳ میلیارد پارامتر را برای کارهای ریاضیه‌محور تست کنید.
  • برای بررسی منطق نمره‌دهی و اجرای این تست‌ها روی سخت‌افزار خود، به مخزن RouteFoundry در گیت‌هاب مراجعه کنید.
  • تفاوت سرعت استنتاج در مدل‌های کوچک را با مدل‌های کوانتیزه شده مقایسه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره تأثیر حافظه VRAM روی سرعت مدل‌های کوچک مراجعه کنید.

چرا این موضوع مهم است؟

این یافته با تکیه بر تجربه عملی استقرار محلی، اثبات می‌کند که بهینه‌سازی معماری بر مقیاس‌پذیری غلبه کرده است. این موضوع هزینه سخت‌افزاری برای توسعه‌دهندگان را به‌شدت کاهش می‌دهد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت سخت‌افزاری و هزینه بالای GPU مواجه‌اند، استفاده از SLMها جایگزینی ایده‌آل برای کاهش هزینه‌های زیرساختی است.

·نگاه ما
تحریریه دات‌هوش

تکیه بر تعداد پارامترها به‌عنوان تنها معیار کیفیت در حال شکستن است. این داده‌ها ثابت می‌کنند که «تراکم هوش» در مدل‌های کوچک از طریق آموزش‌های استدلالی، جایگزین حجم خام داده شده است. در واقع، ما از عصر «مدل‌های همه-کاره» به سمت «ابزارهای تخصصی کوچک» حرکت می‌کنیم که در محیط‌های محدود (Edge) بسیار کارآمدترند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.