پرش به محتوای اصلی
پرش به محتوای مقاله

Laguna S 2.1 در برابر مدل‌های ۱۰ برابر بزرگ‌تر در DeepSWE

·۷ مرداد ۱۴۰۵۱ دقیقه مطالعه۲ بازدید
هوش مصنوعی هفته #۹۰۳: لاگونا، ۱۱۸ میلیارد پارامتر که وارد بار ۱ تریلیون پارامتری می‌شود
هوش مصنوعی هفته #۹۰۳: لاگونا، ۱۱۸ میلیارد پارامتر که وارد بار ۱ تریلیون پارامتری می‌شود
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شکستن رابطه مستقیم میان تعداد پارامتر و عملکرد؛ مدل Laguna S 2.1 ثابت کرد که مدل‌های کوچک‌تر می‌توانند در تسک‌های پیچیده فنی، مدل‌های تریلیونی را با اختلاف فاحش شکست دهند.

پیش‌فرض صنعت هوش مصنوعی که «مقیاس بزرگ‌تر برابر با عملکرد بهتر است»، همین امروز فروپاشید. یک مدل با ۱۱۸ میلیارد پارامتر توانست رقبایی با معماری تریلیونی را با اختلاف زیاد شکست دهد.

به نقل از گزارش ۲۹ جولای ۲۰۲۶ در وب‌سایت thesequence.substack.com، مدل Laguna S 2.1 توانسته است در بسیاری از معیارهای ارزیابی، مدل‌های بسیار حجیم‌تر را کنار بزند. برای سال‌ها، دنیای AI از یک خط روند ساده پیروی می‌کرد: افزایش تعداد پارامترها (Parameters) مستقیماً منجر به رشد نمرات در محک‌های ارزیابی می‌شد. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های زبانی کوچک اشاره کردیم، این دگم «بزرگ‌تر، بهتر است» استاندارد اصلی سنجش مدل‌های وزن‌های باز (Open Weights) بود.

هوش مصنوعی هفته #۹۰۳: لاگونا، ۱۱۸ میلیارد پارامتر که وارد بار ۱ تریلیون پارامتری می‌شود

اما Laguna S 2.1 به‌طور کامل از این خط روند فاصله گرفته است. طبق تحلیل‌های فنی، این مدل در محک Terminal-Bench 2.1 نمره ۷۰.۲٪ را کسب کرد؛ در حالی که مدل ۱.۶ تریلیون پارامتری DeepSeek-V4-Pro-Max نمره ۶۴.۰٪ و مدل ۹۷۵ میلیارد پارامتری Inkling به ۶۳. l۸٪ رسید. این موضوع در حالی است که مدل Inkling تلاش کرده بود با استفاده از معماری فعال‌سازی بخشی از پارامترها، چالش‌های مدیریت ظرفیت در مقیاس تریلیونی را حل کند. این شکاف در آزمون دشوارتر DeepSWE خیره‌کننده‌تر است: Laguna S 2.1 با کسب ۴۰.۴٪، مدل DeepSeek-V4-Pro-Max را با ۹.۰٪ به شدت پشت سر گذاشت.

هوش مصنوعی هفته #۹۰۳: لاگونا، ۱۱۸ میلیارد پارامتر که وارد بار ۱ تریلیون پارامتری می‌شود

برای مقابله با ادعاهای احتمالی درباره «نشت داده» (Data Leakage) یا نقص در ارزیابی‌ها، شرکت Poolside گام متفاوتی برداشت و تمام مسیرهای استدلالی (Trial Trajectories) مجموعه ارزیابی نهایی را منتشر کرد. این شفافیت به توسعه‌دهندگان اجازه می‌دهد دقیقاً بررسی کنند مدل برای رسیدن به پاسخ، از چه مسیرهای منطقی عبور کرده است.

این تغییر رویکرد، نشان‌دهنده چرخش از «مقیاس‌دهی خام» به سمت کیفیت بالاتر داده‌ها یا آموزش‌های معماری کارآمدتر است. اگر یک مدل ۱۱۸ میلیارد پارامتری بتواند در تسک‌های خاص ۴ برابر عملکرد یک مدل ۱.۶ تریلیونی را داشته باشد، توجیه هزینه‌های اقتصادی و محاسباتی نگهداری مدل‌های غول‌پیکر دشوار می‌شود.

گام بعدی شما

  • بررسی مسیرهای استدلالی منتشرشده توسط Poolside برای تحلیل الگوهای منطقی مدل‌های کوچک.
  • ارزیابی مجدد هزینه‌های استنتاج (Inference) در پروژه‌های خود؛ شاید نیازی به مدل‌های تریلیونی نباشد.
  • رصد این موضوع که آیا این کارایی در استدلال‌های عمومی نیز تکرار می‌شود یا محدود به بنچمارک‌های فنی است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد بر اعتبار فرضیه scaling laws اثر می‌گذارد و ثابت می‌کند کارایی معماری می‌تواند جایگزین حجم عظیم محاسبات شود. این امر هزینه‌های عملیاتی برای شرکت‌های AI را به‌طور چشم‌گیری کاهش می‌دهد.

تأثیر برای ایران

این خبر برای توسعه‌دهندگان ایرانی که با محدودیت منابع GPU مواجه‌اند حیاتی است؛ زیرا نشان می‌دهد مدل‌های کوچک‌تر و بهینه، جایگزینی واقعی برای مدل‌های غول‌پیکر در کاربردهای تخصصی هستند.

·نگاه ما
تحریریه دات‌هوش

دستیابی به این نتایج نشان می‌دهد که ما از عصر «بیشتر داشتن داده و پارامتر» به عصر «بهینه کردن مسیر استدلال» وارد شده‌ایم. این موفقیت احتمالاً نتیجه استفاده از داده‌های مصنوعی (Synthetic Data) با کیفیت بسیار بالا در مرحله پیش‌آموزش است که اجازه می‌دهد مدل‌های کوچک‌تر، مفاهیم پیچیده را با تعداد گره‌های کمتر رمزگشایی کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.