پرش به محتوای اصلی
پرش به محتوای مقاله

روش PAW حافظهٔ استنتاج را ۵۰ برابر کاهش داد

·۱۲ تیر ۱۴۰۵۱ دقیقه مطالعه
برنامه به‌عنوان وزن: پارادایم برنامه‌نویسی برای توابع فازی
برنامه به‌عنوان وزن: پارادایم برنامه‌نویسی برای توابع فازی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «استفاده از مدل برای حل مسئله» به «استفاده از مدل برای ساخت یک ابزار عصبی مستقل» که حافظه مورد نیاز را ۵۰ برابر کاهش می‌دهد.

تصور کنید بتوانید قدرت یک مدل غول‌پیکر را در ابعادی بسیار کوچک‌تر جای دهید، بدون اینکه دقت پاسخ‌ها را فدا کنید. این دیگر یک رویای مهندسی نیست، بلکه دستاورد جدیدی است که مرز بین «پرامپت‌نویسی» و «وزن‌های مدل» را از بین می‌برد.

بر اساس مستندات منتشر شده در ۳ جولای ۲۰۲۶، رویکرد Program-as-Weights (PAW) به جای تکیه بر پرامپت‌های طولانی، توصیفات زبان طبیعی را به یک آرتیفکت عصبی (Neural Artifact) تبدیل می‌کند که به‌صورت محلی قابل اجراست. این یعنی مدل دیگر هر بار نباید کل مسئله را از طریق متن بفهمد، بلکه سازوکار حل مسئله در وزن‌های مدل حک شده است.

بسیاری از کارهای برنامه‌نویسی، مثل اصلاح JSONهای ناقص یا رتبه‌بندی نتایج جست‌وجو، برای کدنویسی سخت‌گیرانه (Rule-based) بیش از حد «مبهم» هستند. هم‌اکنون توسعه‌دهندگان این وظایف را به APIهای عظیم مدل‌های زبانی بزرگ می‌سپارند و هزینه سنگینی می‌پردازند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های لبه (Edge AI) اشاره کردیم، انتقال محاسبات از مرحله اجرا به مرحله کامپایل، کلید دستیابی به سرعت‌های بالاتر است. این رویکرد بهینه‌سازی ساختاری، یادآور تلاش‌های اخیر برای عبور از گلوگاه‌های غیردیفرانسیل در معماری‌های عصبی است که هدف آن افزایش کارایی در لایه‌های عملیاتی مدل‌ها بود.

به نقل از تحلیل فنی سایت arxiv.org، این سامانه از یک کامپایلر ۴ میلیارد پارامتری استفاده می‌کند که روی مجموعه داده FuzzyBench (شامل ۱۰ میلیون نمونه) آموزش دیده است. این کامپایلر آداپتورهای (Adapters) بهینه‌ای تولید می‌کند که به یک مفسر سبک و منجمد متصل می‌شوند.

جزئیات فنی این معماری عبارتند از:

  • اندازه مفسر: مدل Qwen3 با ۰.۶ میلیارد پارامتر
  • بهره‌وری: مصرف حافظه استنتاج تقریباً ۱/۵۰ هشتم مقدار مورد نیاز در پرامپت‌نویسی مستقیم Qwen3-32B
  • سرعت: دستیابی به سرعت ۳۰ توکن در ثانیه بر روی MacBook M3
  • مجموعه داده: بهره‌گیری از ۱۰ میلیون مثال FuzzyBench برای آموزش کامپایلر

این تحول، نقش مدل بنیادی را از یک «حل‌کننده مسئله برای هر ورودی» به یک «ابزارساز» تغییر می‌دهد. به جای اینکه برای هر خط لگ یا اصلاح JSON به یک مدل ۳۲ میلیارد پارامتری رجوع کنید، کامپایلر یک بار اجرا شده و یک ابزار آفلاین و قابل استفاده مجدد می‌سازد. برای متخصصان فنی، این موضوع مهر تأییدی بر حرکت به سمت آداپتورهای تخصصی و کوچک در مقابل پرامپت‌های حجیم و تک‌سنگی (Monolithic) است.

گام بعدی شما

  • بررسی مجموعه داده FuzzyBench برای شناسایی کارهای «مبهم» که بیشترین پتانسیل را برای تبدیل به آداپتور دارند.
  • تحلیل موازنه‌ی زمان کامپایل (Compilation Time) در برابر تأخیر استنتاج (Inference Latency) در محیط‌های محلی.
  • آزمایش جایگزینی فراخوانی‌های API گران‌قیمت با مدل‌های ۰.۶ میلیارد پارامتری در گردش‌های کاری تکراری.

اما چالش اصلی اکنون این است که آیا این فشرده‌سازی روی کارهای استدلالی پیچیده نیز اثر می‌گذارد یا خیر؛ ما در گزارش بعدی اثر این رویکرد بر مدل‌های استدلالی را بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این متدولوژی با تکیه بر تخصص در معماری‌های فشرده، هزینه استنتاج را به شدت کاهش داده و استقرار مدل‌های سطح بالا را روی سخت‌افزارهای مصرفی ممکن می‌سازد. اعتبار این یافته‌ها از طریق بنچمارک‌های سخت‌افزار MacBook M3 تأیید شده است.

تأثیر برای ایران

به دلیل کاهش شدید نیاز به VRAM و حافظه، این روش امکان اجرای مدل‌های با کیفیت بالا را برای توسعه‌دهندگان ایرانی روی سخت‌افزارهای محدود و بدون نیاز به APIهای گران‌قیمت فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی استنتاج لحظه‌ای با کامپایل یک‌باره، مدل‌های زبانی را از حالت «چت‌بات» به «تولیدکننده نرم‌افزار عصبی» تبدیل می‌کند. این رویکرد فرضیه نیاز به مدل‌های غول‌پیکر برای کارهای تخصصی را می‌شکند و ثابت می‌کند که دانش مدل‌های بزرگ را می‌توان در قالب وزن‌های بهینه در مدل‌های کوچک تزریق کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.