پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Inkling: فعال‌سازی ۴٪ پارامترها برای مدیریت ظرفیت یک تریلیون

·۳۱ تیر ۱۴۰۵۱ دقیقه مطالعه
نمای درون مدل اینکلینگ: هوش مصنوعی تریلیون‌پارامتری که فقط ۴۱ میلیارد پارامتر را بیدار نگه می‌دارد
نمای درون مدل اینکلینگ: هوش مصنوعی تریلیون‌پارامتری که فقط ۴۱ میلیارد پارامتر را بیدار نگه می‌دارد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییری بنیادین در نسبت پارامتر کل به فعال (حدود ۴٪) که اجازه می‌دهد مدل تریلیونی با هزینه استنتاج مدل‌های بسیار کوچک‌تر عمل کند.

تنها ۴۱ میلیارد پارامتر؛ این است مقدار دقیقی از ظرفیتی که مدل Inkling در هر توکن (Token) فعال می‌کند. طبق تحلیل فنی منتشر شده در ۲۲ ژوئیه ۲۰۲۶ توسط رسانه thesequence.substack.com، این رویکرد پراکنده اجازه می‌دهد Inkling به‌جای یک مغز یکپارچه، مانند انبار تخصص‌های مجزا عمل کند تا از فروپاشی محاسباتی ناشی از فعال شدن هم‌زمان یک تریلیون پارامتر جلوگیری شود.

در فضای فعلی هوش مصنوعی، افزایش پارامترها معمولاً منجر به رشد خطی هزینه‌های استنتاج (Inference) می‌شود. همان‌طور که در تحلیل قبلی ما درباره‌ی قوانین مقیاس‌پذیری مدل‌های بنیادی اشاره کردیم، مدیریت این هزینه‌ها چالشی حیاتی است. Inkling این مشکل را با سازماندهی معماری خود شبیه به یک دانشگاه با ۲۵۶ دپارتمان تخصصی حل کرده است؛ به‌طوری که به‌جای فراخوانی تمام اساتید برای هر پرسش، یک مسیریاب (Router) تنها زیرمجموعه کوچکی از متخصصان مرتبط را انتخاب می‌کند.

مشخصات فنی Inkling بر اساس مستندات منتشر شده عبارت است از:

  • ظرفیت کل: ۹۷۵ میلیارد پارامتر
  • پارامترهای فعال: ۴۱ میلیارد در هر توکن
  • نرخ فعال‌سازی: تقریباً ۴.۲٪ از کل شبکه
  • منطق مسیریابی: ۶ «دپارتمان» تخصصی به‌علاوه‌ی دو واحد همه‌منظوره

نمای درون مدل اینکلینگ: هوش مصنوعی تریلیونی که هر بار فقط ۴۱ میلیارد پارامتر را بیدار می‌کند

به گزارش منابع فنی، این سازوکار به مدل اجازه می‌دهد به‌طور پویا بین حوزه‌های کاملاً متفاوت تغییر وضعیت دهد. برای مثال، یک خط کد پایتون مجموعه‌ای از متخصصان کدنویسی را فعال می‌کند، در حالی که یک عبارت یونانی یا یک برچسب صوتی، کلاستر متفاوتی از پارامترها را فرا می‌خواند. این مکانیسم خروجی‌هایی با دقت بالا در حالت‌های چندوجهی (Multimodal) را تضمین می‌کند، بدون اینکه منابع محاسباتی روی نورون‌های نامرتبط تلف شوند.

برای متخصصان، این رویکرد معیار «اندازه مدل» را از تعداد کل پارامترها به «بهره‌وری فعال در هر توکن» تغییر می‌دهد. این موضوع ثابت می‌کند که ظرفیت ذخیره‌سازی عظیم می‌تواند با استنتاج سبک هم‌زیستی داشته باشد، مشروط بر اینکه مکانیسم مسیریابی به‌اندازه کافی دقیق باشد. در این حالت، گلوگاه از توان محاسباتی به چالش‌های حافظه و شبکه منتقل می‌شود، زیرا ۹۷۵ میلیارد پارامتر همچنان باید ذخیره و در دسترس باشند.

بزرگ‌ترین پرسش پیش‌رو این است که آیا این مسیریابی پراکنده در مقیاس‌های حتی بزرگ‌تر نیز پایدار می‌ماند یا خیر. توسعه‌دهندگان باید اثر این معماری بر تأخیر (Latency) در کاربردهای چندوجهیِ آنی را در مقایسه با مدل‌های متراکم سنتی رصد کنند.

گام بعدی شما

  • بررسی متدهای Routing در معماری‌های MoE برای بهینه‌سازی هزینه استنتاج.
  • تحلیل اثر حجم VRAM بر سرعت بارگذاری مدل‌های با ظرفیت تریلیونی.
  • تست مدل‌های مشابه در سناریوهای چندزبانه برای سنجش دقت سوئیچ بین متخصصان.

اما تأثیر این معماری بر دسترسی به سخت‌افزارهای لبه حتی پیچیده‌تر است. این چالش‌های زیرساختی در حالی رخ می‌دهد که غول‌های فناوری بر تصاحب لایه‌ی استقرار مدل‌ها متمرکز شده‌اند تا برتری عملیاتی خود را تثبیت کنند — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با تکیه بر تجربه عملی در مدل‌های MoE، اثبات می‌کند که می‌توان تخصص‌های وسیع را بدون انفجار هزینه‌های عملیاتی مدیریت کرد. اعتبار این رویکرد در کاهش چشمگیر نرخ مصرف انرژی در دیتاسنترهای مقیاس‌پذیر است.

تأثیر برای ایران

به‌دلیل نیاز به حافظه VRAM بسیار بالا برای ذخیره ۹۷۵ میلیارد پارامتر، اجرای محلی این مدل برای اکثر زیرساخت‌های فعلی ایران غیرممکن است و تنها از طریق APIهای ابری قابل بهره‌برداری خواهد بود.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «حجم کل مدل» با «نرخ فعال‌سازی» به عنوان معیار برتری، پارادایم مقیاس‌پذیری را تغییر می‌دهد. این رویکرد نشان می‌دهد که مسیر رسیدن به AGI لزوماً از افزایش قدرت پردازش لحظه‌ای نمی‌گذرد، بلکه از سازماندهی هوشمندانه دانش در حافظه‌های عظیم می‌گذرد تا استنتاج در سطح هزینه مدل‌های کوچک باقی بماند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.