پیشفرض صنعت هوش مصنوعی که «مقیاس بزرگتر برابر با عملکرد بهتر است»، همین امروز فروپاشید. یک مدل با ۱۱۸ میلیارد پارامتر توانست رقبایی با معماری تریلیونی را با اختلاف زیاد شکست دهد.
به نقل از گزارش ۲۹ جولای ۲۰۲۶ در وبسایت thesequence.substack.com، مدل Laguna S 2.1 توانسته است در بسیاری از معیارهای ارزیابی، مدلهای بسیار حجیمتر را کنار بزند. برای سالها، دنیای AI از یک خط روند ساده پیروی میکرد: افزایش تعداد پارامترها (Parameters) مستقیماً منجر به رشد نمرات در محکهای ارزیابی میشد. همانطور که در تحلیلهای پیشین ما دربارهی مدلهای زبانی کوچک اشاره کردیم، این دگم «بزرگتر، بهتر است» استاندارد اصلی سنجش مدلهای وزنهای باز (Open Weights) بود.

اما Laguna S 2.1 بهطور کامل از این خط روند فاصله گرفته است. طبق تحلیلهای فنی، این مدل در محک Terminal-Bench 2.1 نمره ۷۰.۲٪ را کسب کرد؛ در حالی که مدل ۱.۶ تریلیون پارامتری DeepSeek-V4-Pro-Max نمره ۶۴.۰٪ و مدل ۹۷۵ میلیارد پارامتری Inkling به ۶۳. l۸٪ رسید. این موضوع در حالی است که مدل Inkling تلاش کرده بود با استفاده از معماری فعالسازی بخشی از پارامترها، چالشهای مدیریت ظرفیت در مقیاس تریلیونی را حل کند. این شکاف در آزمون دشوارتر DeepSWE خیرهکنندهتر است: Laguna S 2.1 با کسب ۴۰.۴٪، مدل DeepSeek-V4-Pro-Max را با ۹.۰٪ به شدت پشت سر گذاشت.

برای مقابله با ادعاهای احتمالی درباره «نشت داده» (Data Leakage) یا نقص در ارزیابیها، شرکت Poolside گام متفاوتی برداشت و تمام مسیرهای استدلالی (Trial Trajectories) مجموعه ارزیابی نهایی را منتشر کرد. این شفافیت به توسعهدهندگان اجازه میدهد دقیقاً بررسی کنند مدل برای رسیدن به پاسخ، از چه مسیرهای منطقی عبور کرده است.
این تغییر رویکرد، نشاندهنده چرخش از «مقیاسدهی خام» به سمت کیفیت بالاتر دادهها یا آموزشهای معماری کارآمدتر است. اگر یک مدل ۱۱۸ میلیارد پارامتری بتواند در تسکهای خاص ۴ برابر عملکرد یک مدل ۱.۶ تریلیونی را داشته باشد، توجیه هزینههای اقتصادی و محاسباتی نگهداری مدلهای غولپیکر دشوار میشود.
گام بعدی شما
- بررسی مسیرهای استدلالی منتشرشده توسط Poolside برای تحلیل الگوهای منطقی مدلهای کوچک.
- ارزیابی مجدد هزینههای استنتاج (Inference) در پروژههای خود؛ شاید نیازی به مدلهای تریلیونی نباشد.
- رصد این موضوع که آیا این کارایی در استدلالهای عمومی نیز تکرار میشود یا محدود به بنچمارکهای فنی است.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو