اگر به دنبال اجرای مدلهای زبانی روی سختافزارهای محدود هستید، باید بدانید که وابستگی مطلق به معماری ترنسفورمر دیگر تنها راه پیشرو نیست. معماری PSSA (Plastic State-Space Architecture) ثابت کرد که میتوان بدون استفاده از مکانیزمهای سنگین توجه، به نتایجی سریعتر و دقیقتر دست یافت.
در دنیای امروز، چشمانداز هوش مصنوعی مدرن بهطور گستردهای تحت سلطه معماری ترنسفورمر است. از مقیاس عظیم GPT-4 گرفته تا مدلهای کوچکتر و تقطیر شده (Distilled)، مکانیزم توجه (Attention)—بهویژه توانایی امتیازدهی به هر جفت از توکنها در یک پنجره زمینه—به استاندارد صنعت تبدیل شده است. اما این سلطه با یک هزینه محاسباتی سنگین همراه است: مقیاسپذیری درجهدوم (Quadratic Scaling). همانطور که طول توالی افزایش مییابد، هزینه هر گام بهصورت مجذور طول آن رشد میکند و کل زمینه باید در هر گام بهطور کامل بازخوانی شود. این ناکارآمدی ذاتی، پژوهشگران را به جستجوی جایگزینها سوق داده است و توسعه PSSA نشاندهنده یک گسست جسورانه از وضعیت موجود است.
در هسته خود، PSSA یک مدل زبانی کوچک است که پارادایم ترنسفورمر را بهطور کامل رد میکند. بهجای مکانیزم توجه جهانی، PSSA از یک لایه فضای حالت بازگشتی (Recurrent State-Space Layer) استفاده میکند. این ساختار به مدل اجازه میدهد متن را توکن به توکن پردازش کرده و یک حالت با اندازه ثابت را در طول توالی در یک گذر واحد از چپ به راست حمل کند. برای جبران فقدان پنجره توجه جهانی، PSSA یک بانک از حافظههای اپیزودیک (Episodic Memories) را ادغام میکند. بهجای بازخوانی کل زمینه قبلی برای یافتن یک قطعه اطلاعات مرتبط، مدل عملیات جستجو (Lookup) را در این بانک حافظه انجام میدهد. این تغییر، پیچیدگی محاسباتی را از درجهدوم به خطی تبدیل میکند؛ به این معنا که هزینه پردازش متن بهجای رشد نمایی، بهطور متناسب با طول توالی رشد میکند.
یکی از خیرهکنندهترین جنبههای PSSA، نحوه پیادهسازی آن است. در عصری که تقریباً هر پروژه هوش مصنوعی بر روی پشتهای بلند از فریمورکها—معمولاً PyTorch یا TensorFlow—بنا شده است، PSSA بهطور کامل و از صفر با زبان Rust نوشته شده است. در این پروژه هیچ فریمورک یادگیری ماشین زیربنایی وجود ندارد. توسعهدهنده با دور زدن سربارهای این کتابخانههای کلیمنظوره، سیستمی ایجاد کرده است که بسیار سبک و برای سختافزاری که روی آن اجرا میشود، بهشدت بهینه شده است. انتخاب Rust، امنیت حافظه و عملکردی را فراهم میکند که با C++ رقابت میکند و تضمین میکند که عملیاتهای فضای حالت بازگشتی با حداکثر بازدهی اجرا شوند.
نتایج عملی این معماری در مقایسه با ترنسفورمرهای استاندارد صرفاً تئوریک نیستند، بلکه در مقایسههای سختگیرانه و رودررو اثبات شدهاند. در یک آزمایش کنترلشده، PSSA در مقابل یک مدل ترنسفورمر استاندارد قرار گرفت. برای تضمین عدالت در رقابت، هر دو مدل تعداد پارامترها، مجموعه داده (Corpus)، توکنساز (Tokenizer)، برنامه بهینهساز (Optimizer Schedule) و بذر تصادفی (Random Seed) یکسانی دریافت کردند. دادههای آموزشی شامل ۱۲.۷ میلیون توکن از مجموعه داده پاکسازی شده WikiText-103 بود. نتایج بسیار واضح بود: PSSA آموزش خود را با تابع زیان (Cross-Entropy Loss) ۳.۹۸ به پایان رساند، در حالی که ترنسفورمر با عدد ۴.۴۳ عقب ماند. این شکاف ۰.۴۵ ناتی (nats) به معنای perplexity (پرپلکسیتی) ۵۳.۷ برای PSSA در مقابل ۸۳.۷ برای ترنسفورمر است.
شاید حتی چشمگیرکنندهتر از زیان نهایی، سرعت همگرایی (Convergence) باشد. ترنسفورمر تمام بودجه ۱۲.۷ میلیون توکنی خود را صرف کرد تا تنها به سطحی از زیان برسد که PSSA در حدود نقطه ۲ میلیون توکنی از آن عبور کرده بود. این موضوع نشان میدهد که معماری فضای حالت پلاستیک نه تنها در زمان استنتاج (Inference) بهینهتر است، بلکه در طول آموزش نیز بهطور قابلتوجهی در استفاده از نمونهها (Sample-efficient) موفقتر عمل میکند. علاوه بر این، روی یک CPU یکسان، PSSA متن را تقریباً ۱۲ برابر سریعتر از ترنسفورمر تولید میکند که نتیجه مستقیم مقیاسپذیری خطی و نبود سربار فریمورکهاست. این رویکرد بهینهسازی در لایههای زیرین، یادآور تلاشاتی است که در مدلهای دیگر برای کاهش هزینههای عملیاتی صورت گرفته است؛ برای مثال، مدلهای Smaug توانستند هزینههای عملیاتی عاملهای هوش مصنوعی را تا ۱۰۰ برابر کاهش دهند.
برای اطمینان از اینکه این نتایج صرفاً نتیجه بیشبرازش (Overfitting) روی جریان آموزشی نبودهاند، مدلها روی یک برش جدا شده شامل ۱۹۸,۹۳۹ توکن دیده نشده آزمایش شدند. هر نقطه بازرسی (Checkpoint) از هر دو اجرا—۶۴ مورد برای PSSA و ۴۳ مورد برای ترنسفورمر—روی یک پنجره محدود ۹,۹۳۴ توکنی از این دادههای دیده نشده امتیازدهی شد. نتایج ثابت ماند: منحنیهای عملکرد هرگز یکدیگر را قطع نکردند. PSSA برتری خود را از اولین نقطه بازرسی حفظ کرد و در نهایت ۰.۵۱ نات پایینتر از ترنسفورمر به پایان رسید. این امر ثابت میکند که مزایای معماری PSSA بهخوبی به دادههای دیده نشده تعمیم مییابد و نمایش مقاومتری از الگوهای زبانی آموخته شده ارائه میدهد.
اصطلاح «پلاستیک» در PSSA به قابلیت مدل در بازنویسی بخشی از وزنها (Weights) در حین اجرا اشاره دارد. این تنظیم پویای وزنها به مدل اجازه میدهد تا بهصورت لحظهای با جریان اطلاعات سازگار شود و برخی جنبههای یادگیری بیولوژیکی را بسیار نزدیکتر از وزنهای استاتیک یک ترنسفورمر در مرحله استنتاج، شبیهسازی کند. وقتی این ویژگی با بانک حافظه اپیزودیک ترکیب میشود، مدل یک سیستم هیبریدی ایجاد میکند که میتواند هم حالتهای بازگشتی کوتاهمدت و هم بازیابی حافظه بلندمدت را بدون هزینه درجهدوم مکانیزم توجه مدیریت کند.
این پروژه به عنوان یک اثبات مفهوم (Proof of Concept) حیاتی برای چندین ایده عمل میکند. نخست، ثابت میکند که مدلسازی زبانی با کارایی بالا بدون نیاز به پشته فریمورکهای «شرکتهای بزرگ فناوری» امکانپذیر است. با بازگشت به اصول اولیه و پیادهسازی مستقیم ریاضیات در یک زبان سیستمی مانند Rust، توسعهدهندگان میتوانند سطوحی از عملکرد را آزاد کنند که اغلب توسط انتزاعهای PyTorch پنهان میمانند. دوم، پتانسیل مدلهای فضای حالت (SSMs) را به عنوان جایگزینهایی viable و شاید برتر نسبت به ترنسفورمرها برای مقیاسهای خاصی از مدلسازی زبانی تایید میکند. در حالی که ترنسفورمرها در موازیسازی عظیم در طول آموزش روی GPUها میدرخشند، PSSA نشان میدهد که برای مدلهای زبانی کوچک (SLM) و محیطهای وابسته به CPU، رویکرد بازگشتی بهمراتب بهینهتر است. این جستجو برای جایگزینی ساختارهای سنتی با معماریهای بهینهتر، در سایر حوزهها نیز دیده میشود، جایی که برای مثال meclaw حلقههای تکرار عاملهای هوش مصنوعی را با توپولوژی فایل جایگزین کرد تا کارایی سیستم را افزایش دهد.
با حرکت صنعت هوش مصنوعی به سمت «هوش مصنوعی لبه» (Edge AI)—جایی که مدلها باید روی دستگاههای محلی با توان و حافظه محدود اجرا شوند—مقیاسپذیری خطی PSSA به یک ویژگی ضروری تبدیل میشود. مدلی که میتواند متن را ۱۲ برابر سریعتر روی CPU تولید کند و در عین حال پرپلکسیتی پایینتری را حفظ کند، کاندیدای اصلی برای ادغام در دستگاههاست. توانایی حفظ یک حالت با اندازه ثابت، صرفنظر از طول توالی، مشکل «پنجره زمینه» را حل میکند؛ مشکلی که ترنسفورمرها را رنج میدهد، زیرا با طولانیتر شدن گفتگو، مصرف حافظه بهشدت افزایش مییابد. در همین راستا، رقابت برای دستیابی به سریعترین ابزارهای استدلالی در سطح سازمانی شدت یافته است، همانطور که مدل Quasar 438B به سریعترین ابزار استدلالی اروپا تبدیل شد.
در نتیجه، PSSA فراتر از یک تمرین کدنویسی در Rust است؛ این یک به چالش کشیدن هژمونی معماری فعلی ترنسفورمر است. با ترکیب یک لایه فضای حالت بازگشتی، حافظه اپیزودیک و پلاستیسیته پویای وزنها، این مدل به آموزش سریعتر، استنتاج سریعتر و دقت پیشبینی بهتر روی مجموعه داده WikiText-103 دست یافته است. این پروژه به ما یادآوری میکند که مسیر رسیدن به هوش مصنوعی بهینه همیشه از طریق مجموعهدادههای بزرگتر و GPUهای بیشتر نیست، بلکه از طریق نوآوریهای بنیادی در معماری و بهکارگیری بهینه برنامهنویسی سیستمی میگذرد. شکاف در پرپلکسیتی و تفاوت عظیم در توان عملیاتی (Throughput) روی CPU نشان میدهد که رویکرد «پلاستیک» به مدلسازی فضای حالت میتواند درهای جدیدی را برای توسعه مدلهای زبانی کوچک، چابک، بهینه و قدرتمند باز کند.
گام بعدی شما
- بررسی پیادهسازیهای مدلهای فضای حالت (SSM) مانند Mamba برای درک عمیقتر جایگزینهای ترنسفورمر.
- مطالعه مستندات زبان Rust برای پیادهسازی لایههای عصبی بدون وابستگی به فریمورکهای سنگین.
- ارزیابی مدلهای زبانی کوچک (SLM) برای جایگزینی مدلهای ابری در کاربردهای محلی و حساس به تأخیر.
اما این تنها بخشی از مسیر است؛ تأثیر این معماری بر کاهش مصرف انرژی در مراکز داده را در تحلیلهای آینده بررسی خواهیم کرد.




گفتگو