پرش به محتوای اصلی
پرش به محتوای مقاله

معماری PSSA سرعت استنتاج مدل‌های زبانی کوچک را ۱۲ برابر کرد

·۸ مهر ۱۴۰۵۱۴ دقیقه مطالعه
معماری سفارشی هوش مصنوعی در حال توسعه با Rust
معماری سفارشی هوش مصنوعی در حال توسعه با Rust
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ترکیب لایه فضای حالت بازگشتی با حافظه اپیزودیک و پیاده‌سازی بومی در Rust، که منجر به کاهش ۱۲ برابری تأخیر استنتاج روی CPU نسبت به ترنسفورمرها شد.

اگر به دنبال اجرای مدل‌های زبانی روی سخت‌افزارهای محدود هستید، باید بدانید که وابستگی مطلق به معماری ترنسفورمر دیگر تنها راه پیش‌رو نیست. معماری PSSA (Plastic State-Space Architecture) ثابت کرد که می‌توان بدون استفاده از مکانیزم‌های سنگین توجه، به نتایجی سریع‌تر و دقیق‌تر دست یافت.

در دنیای امروز، چشم‌انداز هوش مصنوعی مدرن به‌طور گسترده‌ای تحت سلطه معماری ترنسفورمر است. از مقیاس عظیم GPT-4 گرفته تا مدل‌های کوچک‌تر و تقطیر شده (Distilled)، مکانیزم توجه (Attention)—به‌ویژه توانایی امتیازدهی به هر جفت از توکن‌ها در یک پنجره زمینه—به استاندارد صنعت تبدیل شده است. اما این سلطه با یک هزینه محاسباتی سنگین همراه است: مقیاس‌پذیری درجه‌دوم (Quadratic Scaling). همان‌طور که طول توالی افزایش می‌یابد، هزینه هر گام به‌صورت مجذور طول آن رشد می‌کند و کل زمینه باید در هر گام به‌طور کامل بازخوانی شود. این ناکارآمدی ذاتی، پژوهشگران را به جستجوی جایگزین‌ها سوق داده است و توسعه PSSA نشان‌دهنده یک گسست جسورانه از وضعیت موجود است.

در هسته خود، PSSA یک مدل زبانی کوچک است که پارادایم ترنسفورمر را به‌طور کامل رد می‌کند. به‌جای مکانیزم توجه جهانی، PSSA از یک لایه فضای حالت بازگشتی (Recurrent State-Space Layer) استفاده می‌کند. این ساختار به مدل اجازه می‌دهد متن را توکن به توکن پردازش کرده و یک حالت با اندازه ثابت را در طول توالی در یک گذر واحد از چپ به راست حمل کند. برای جبران فقدان پنجره توجه جهانی، PSSA یک بانک از حافظه‌های اپیزودیک (Episodic Memories) را ادغام می‌کند. به‌جای بازخوانی کل زمینه قبلی برای یافتن یک قطعه اطلاعات مرتبط، مدل عملیات جستجو (Lookup) را در این بانک حافظه انجام می‌دهد. این تغییر، پیچیدگی محاسباتی را از درجه‌دوم به خطی تبدیل می‌کند؛ به این معنا که هزینه پردازش متن به‌جای رشد نمایی، به‌طور متناسب با طول توالی رشد می‌کند.

یکی از خیره‌کننده‌ترین جنبه‌های PSSA، نحوه پیاده‌سازی آن است. در عصری که تقریباً هر پروژه هوش مصنوعی بر روی پشته‌ای بلند از فریم‌ورک‌ها—معمولاً PyTorch یا TensorFlow—بنا شده است، PSSA به‌طور کامل و از صفر با زبان Rust نوشته شده است. در این پروژه هیچ فریم‌ورک یادگیری ماشین زیربنایی وجود ندارد. توسعه‌دهنده با دور زدن سربارهای این کتابخانه‌های کلی‌منظوره، سیستمی ایجاد کرده است که بسیار سبک و برای سخت‌افزاری که روی آن اجرا می‌شود، به‌شدت بهینه شده است. انتخاب Rust، امنیت حافظه و عملکردی را فراهم می‌کند که با C++ رقابت می‌کند و تضمین می‌کند که عملیات‌های فضای حالت بازگشتی با حداکثر بازدهی اجرا شوند.

نتایج عملی این معماری در مقایسه با ترنسفورمرهای استاندارد صرفاً تئوریک نیستند، بلکه در مقایسه‌های سخت‌گیرانه و رودررو اثبات شده‌اند. در یک آزمایش کنترل‌شده، PSSA در مقابل یک مدل ترنسفورمر استاندارد قرار گرفت. برای تضمین عدالت در رقابت، هر دو مدل تعداد پارامترها، مجموعه داده (Corpus)، توکن‌ساز (Tokenizer)، برنامه بهینه‌ساز (Optimizer Schedule) و بذر تصادفی (Random Seed) یکسانی دریافت کردند. داده‌های آموزشی شامل ۱۲.۷ میلیون توکن از مجموعه داده پاک‌سازی شده WikiText-103 بود. نتایج بسیار واضح بود: PSSA آموزش خود را با تابع زیان (Cross-Entropy Loss) ۳.۹۸ به پایان رساند، در حالی که ترنسفورمر با عدد ۴.۴۳ عقب ماند. این شکاف ۰.۴۵ ناتی (nats) به معنای perplexity (پرپلکسیتی) ۵۳.۷ برای PSSA در مقابل ۸۳.۷ برای ترنسفورمر است.

شاید حتی چشم‌گیرکننده‌تر از زیان نهایی، سرعت همگرایی (Convergence) باشد. ترنسفورمر تمام بودجه ۱۲.۷ میلیون توکنی خود را صرف کرد تا تنها به سطحی از زیان برسد که PSSA در حدود نقطه ۲ میلیون توکنی از آن عبور کرده بود. این موضوع نشان می‌دهد که معماری فضای حالت پلاستیک نه تنها در زمان استنتاج (Inference) بهینه‌تر است، بلکه در طول آموزش نیز به‌طور قابل‌توجهی در استفاده از نمونه‌ها (Sample-efficient) موفق‌تر عمل می‌کند. علاوه بر این، روی یک CPU یکسان، PSSA متن را تقریباً ۱۲ برابر سریع‌تر از ترنسفورمر تولید می‌کند که نتیجه مستقیم مقیاس‌پذیری خطی و نبود سربار فریم‌ورک‌هاست. این رویکرد بهینه‌سازی در لایه‌های زیرین، یادآور تلاشاتی است که در مدل‌های دیگر برای کاهش هزینه‌های عملیاتی صورت گرفته است؛ برای مثال، مدل‌های Smaug توانستند هزینه‌های عملیاتی عامل‌های هوش مصنوعی را تا ۱۰۰ برابر کاهش دهند.

برای اطمینان از اینکه این نتایج صرفاً نتیجه بیش‌برازش (Overfitting) روی جریان آموزشی نبوده‌اند، مدل‌ها روی یک برش جدا شده شامل ۱۹۸,۹۳۹ توکن دیده نشده آزمایش شدند. هر نقطه بازرسی (Checkpoint) از هر دو اجرا—۶۴ مورد برای PSSA و ۴۳ مورد برای ترنسفورمر—روی یک پنجره محدود ۹,۹۳۴ توکنی از این داده‌های دیده نشده امتیازدهی شد. نتایج ثابت ماند: منحنی‌های عملکرد هرگز یکدیگر را قطع نکردند. PSSA برتری خود را از اولین نقطه بازرسی حفظ کرد و در نهایت ۰.۵۱ نات پایین‌تر از ترنسفورمر به پایان رسید. این امر ثابت می‌کند که مزایای معماری PSSA به‌خوبی به داده‌های دیده نشده تعمیم می‌یابد و نمایش مقاوم‌تری از الگوهای زبانی آموخته شده ارائه می‌دهد.

اصطلاح «پلاستیک» در PSSA به قابلیت مدل در بازنویسی بخشی از وزن‌ها (Weights) در حین اجرا اشاره دارد. این تنظیم پویای وزن‌ها به مدل اجازه می‌دهد تا به‌صورت لحظه‌ای با جریان اطلاعات سازگار شود و برخی جنبه‌های یادگیری بیولوژیکی را بسیار نزدیک‌تر از وزن‌های استاتیک یک ترنسفورمر در مرحله استنتاج، شبیه‌سازی کند. وقتی این ویژگی با بانک حافظه اپیزودیک ترکیب می‌شود، مدل یک سیستم هیبریدی ایجاد می‌کند که می‌تواند هم حالت‌های بازگشتی کوتاه‌مدت و هم بازیابی حافظه بلندمدت را بدون هزینه درجه‌دوم مکانیزم توجه مدیریت کند.

این پروژه به عنوان یک اثبات مفهوم (Proof of Concept) حیاتی برای چندین ایده عمل می‌کند. نخست، ثابت می‌کند که مدل‌سازی زبانی با کارایی بالا بدون نیاز به پشته فریم‌ورک‌های «شرکت‌های بزرگ فناوری» امکان‌پذیر است. با بازگشت به اصول اولیه و پیاده‌سازی مستقیم ریاضیات در یک زبان سیستمی مانند Rust، توسعه‌دهندگان می‌توانند سطوحی از عملکرد را آزاد کنند که اغلب توسط انتزاع‌های PyTorch پنهان می‌مانند. دوم، پتانسیل مدل‌های فضای حالت (SSMs) را به عنوان جایگزین‌هایی viable و شاید برتر نسبت به ترنسفورمرها برای مقیاس‌های خاصی از مدل‌سازی زبانی تایید می‌کند. در حالی که ترنسفورمرها در موازی‌سازی عظیم در طول آموزش روی GPUها می‌درخشند، PSSA نشان می‌دهد که برای مدل‌های زبانی کوچک (SLM) و محیط‌های وابسته به CPU، رویکرد بازگشتی به‌مراتب بهینه‌تر است. این جستجو برای جایگزینی ساختارهای سنتی با معماری‌های بهینه‌تر، در سایر حوزه‌ها نیز دیده می‌شود، جایی که برای مثال meclaw حلقه‌های تکرار عامل‌های هوش مصنوعی را با توپولوژی فایل جایگزین کرد تا کارایی سیستم را افزایش دهد.

با حرکت صنعت هوش مصنوعی به سمت «هوش مصنوعی لبه» (Edge AI)—جایی که مدل‌ها باید روی دستگاه‌های محلی با توان و حافظه محدود اجرا شوند—مقیاس‌پذیری خطی PSSA به یک ویژگی ضروری تبدیل می‌شود. مدلی که می‌تواند متن را ۱۲ برابر سریع‌تر روی CPU تولید کند و در عین حال پرپلکسیتی پایین‌تری را حفظ کند، کاندیدای اصلی برای ادغام در دستگاه‌هاست. توانایی حفظ یک حالت با اندازه ثابت، صرف‌نظر از طول توالی، مشکل «پنجره زمینه» را حل می‌کند؛ مشکلی که ترنسفورمرها را رنج می‌دهد، زیرا با طولانی‌تر شدن گفتگو، مصرف حافظه به‌شدت افزایش می‌یابد. در همین راستا، رقابت برای دستیابی به سریع‌ترین ابزارهای استدلالی در سطح سازمانی شدت یافته است، همان‌طور که مدل Quasar 438B به سریع‌ترین ابزار استدلالی اروپا تبدیل شد.

در نتیجه، PSSA فراتر از یک تمرین کدنویسی در Rust است؛ این یک به چالش کشیدن هژمونی معماری فعلی ترنسفورمر است. با ترکیب یک لایه فضای حالت بازگشتی، حافظه اپیزودیک و پلاستیسیته پویای وزن‌ها، این مدل به آموزش سریع‌تر، استنتاج سریع‌تر و دقت پیش‌بینی بهتر روی مجموعه داده WikiText-103 دست یافته است. این پروژه به ما یادآوری می‌کند که مسیر رسیدن به هوش مصنوعی بهینه همیشه از طریق مجموعه‌داده‌های بزرگ‌تر و GPUهای بیشتر نیست، بلکه از طریق نوآوری‌های بنیادی در معماری و به‌کارگیری بهینه برنامه‌نویسی سیستمی می‌گذرد. شکاف در پرپلکسیتی و تفاوت عظیم در توان عملیاتی (Throughput) روی CPU نشان می‌دهد که رویکرد «پلاستیک» به مدل‌سازی فضای حالت می‌تواند درهای جدیدی را برای توسعه مدل‌های زبانی کوچک، چابک، بهینه و قدرتمند باز کند.

گام بعدی شما

  • بررسی پیاده‌سازی‌های مدل‌های فضای حالت (SSM) مانند Mamba برای درک عمیق‌تر جایگزین‌های ترنسفورمر.
  • مطالعه مستندات زبان Rust برای پیاده‌سازی لایه‌های عصبی بدون وابستگی به فریم‌ورک‌های سنگین.
  • ارزیابی مدل‌های زبانی کوچک (SLM) برای جایگزینی مدل‌های ابری در کاربردهای محلی و حساس به تأخیر.

اما این تنها بخشی از مسیر است؛ تأثیر این معماری بر کاهش مصرف انرژی در مراکز داده را در تحلیل‌های آینده بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این معماری با شکستن انحصار ترنسفورمرها، راه را برای مدل‌های زبانی باز می‌کند که بدون نیاز به GPUهای گران‌قیمت، سرعت و دقت بالایی داشته باشند. تخصص در پیاده‌سازی سیستم‌های Low-level مانند Rust اکنون به اندازه دانش ریاضیات مدل‌ها در توسعه AI اهمیت یافته است.

تأثیر برای ایران

این رویکرد برای توسعه‌دهندگان ایرانی که با محدودیت دسترسی به GPUهای قدرتمند و هزینه‌های بالای ابر مواجه‌اند، فرصتی برای ساخت مدل‌های بهینه روی سخت‌افزارهای معمولی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

PSSA نشان می‌دهد که بازگشت به اصول اولیه برنامه‌نویسی سیستم‌ها می‌تواند محدودیت‌های سخت‌افزاری را دور بزند. در حالی که اکثر رقابت‌های فعلی بر سر افزایش تعداد پارامترهاست، این مدل ثابت می‌کند که نوآوری در ساختار لایه‌ها و حذف لایه‌های انتزاعی نرم‌افزاری (مانند PyTorch) می‌تواند جهشی در توان عملیاتی ایجاد کند. این رویکرد احتمالاً مسیر توسعه مدل‌های محلی را از «کوانتایز کردن مدل‌های بزرگ» به سمت «طراحی مدل‌های بومی کوچک» تغییر می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.