اگر امروز از لپتاپی با ۱۶ گیگابایت رم برای اجرای هوش مصنوعی استفاده میکنید، احتمالاً تصور میکنید مدلهای حجیمتر جوابهای دقیقتری میدهند؛ اما واقعیت این است که در بسیاری از کاربردهای عملی، مدلهای کوچکتر بازدهی بالاتری دارند.
یک مدل استدلالی (Reasoning Model) — شبیه شطرنجبازی که قبل از هر حرکت چند گام جلوتر را میبیند — با حجم تنها ۱.۱ گیگابایت، توانست در مسائل ریاضی ۵ برابر بهتر از یک مدل عمومی ۲ گیگابایتی عمل کند. این موفقیت مدلهای کوچک را میتوان تا حدی به رویکردهای جدید در تقطیر دانش نسبت داد؛ موضوعی که در تحلیل ما درباره اثربخشی تقلید توالیها در ارتقای مدلهای کوچک بهطور مفصل بررسی شده است. طبق گزارشی از تاریخ ۴ اوت ۲۰۲۶، کوچکترین مدل این مجموعه بیشترین امتیاز کلی را کسب کرد، در حالی که حجیمترین مدل در رتبه سوم قرار گرفت.
همانطور که در تحلیل قبلی ما دربارهی بهینهسازی مدلهای لبه اشاره کردیم، استقرار محلی مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — معمولاً بر پایه این فرض است که «بزرگتر، بهتر است». اما برای کاربرانی که روی سختافزارهای مصرفی کار میکنند، موازنه میان تأخیر و منطق حیاتی است. نویسنده این مطالعه برای حذف سوگیری، از یک سیستم نمرهدهی قطعی استفاده کرد و ۱۵۲ خروجی را در چهار مدل مختلف بررسی نمود.
بر اساس مستندات این پژوهش که با استفاده از اولاما (Ollama) اجرا شده، نتایج بین مدلهای deepseek-r1:1.5b، llama3.2:3b، gemma:2b و codellama 7b تفاوتهای شدیدی را نشان میدهد:
- محاسبات ریاضی: مدل deepseek-r1:1.5b با ۱۰ پاسخ correct از ۱۲ مورد پیشتازی کرد؛ در حالی که llama3.2:3b و gemma:2b هر دو تنها ۲ امتیاز گرفتند.
- استخراج داده: مدل llama3.2:3b با کسب ۹ امتیاز از ۹ مورد، برنده مطلق بود. این دقت در استخراج داده، تضاد جالبی با چالشهای حافظه عاملها در بنچمارک LOCOMO دارد که در آن توهم دقت در حافظه بررسی شده بود.
- خروجی کد: مدل deepseek-r1:1.5b با امتیاز ۵ از ۶، مدل ۷ میلیارد پارامتری codellama (۴ از ۶) را شکست داد.
- تأخیر: سریعترین مدل llama3.2:3b با میانگین ۱.۶ ثانیه بود، در حالی که deepseek-r1:1.5b حدود ۱۴.۶ ثانیه زمان برد.
باید اشاره کرد که تلههای فنی نزدیک بود این اعداد را تغییر دهد. مدلهای استدلالی از بلوکهای <think> استفاده میکنند که اگر سیستم نمرهدهی آنها را حذف نکند، پاسخها را بهاشتباه «غلط» علامت میزند. همچنین مدل gemma عادت داشت پاسخها را با کلمه «Negative» شروع کند و این باعث میشد در بررسی خط آخر، پاسخهای درست او صفر امتیاز بگیرند.
این چرخش نشان میدهد که برای تکالیفی با پاسخ کوتاه و ساختاریافته، مدلهای زبانی کوچک (SLM) بازگشت سرمایه بهتری نسبت به مدلهای عمومی بزرگ دارند. اکنون کاربران میتوانند بهجای تعقیب کورکورانه تعداد پارامترها، معماری مدل را بر اساس نوع کار انتخاب کنند: مدلهای استدلالی برای ریاضی و مدلهای عمومی برای استخراج داده.
گام بعدی شما
- اگر به دنبال اجرای محلی هستید، ابتدا مدلهای زیر ۳ میلیارد پارامتر را برای کارهای ریاضیهمحور تست کنید.
- برای بررسی منطق نمرهدهی و اجرای این تستها روی سختافزار خود، به مخزن RouteFoundry در گیتهاب مراجعه کنید.
- تفاوت سرعت استنتاج در مدلهای کوچک را با مدلهای کوانتیزه شده مقایسه کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ به تحلیل ما درباره تأثیر حافظه VRAM روی سرعت مدلهای کوچک مراجعه کنید.




گفتگو