پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه معماری PHA مصرف حافظه در متون طولانی را ۴۰٪ کاهش داد؟

·۲۷ خرداد ۱۴۰۵۱ دقیقه مطالعه۲ بازدید
چگونه معماری PHA مصرف حافظه در متون طولانی را ۴۰٪ کاهش داد؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معماری PHA نخستین بار از ساختار «موازی» برای ترکیب SSM و Attention استفاده کرده است، در حالی که مدل‌های قبلی این دو را به‌صورت متوالی (Sereialized) پشت سر هم قرار می‌دادند.

اگر روی پردازش اسناد طولانی کار می‌کنید، می‌دانید که گلوگاه اصلی همواره توازن میان دقت بازیابی اطلاعات و مصرف حافظه است. تصور کنید مجبور باشید برای خواندن یک کتاب، هر صفحه را هزار بار مرور کنید تا جزئیات را فراموش نکنید؛ این دقیقاً همان هزینه‌ای است که مدل‌های فعلی می‌پردازند.

طبق گزارش ۱۶ ژوئن ۲۰۲۶ در وب‌سایت arxiv.org، معماری Parallel Hybrid Architecture (PHA) این مشکل را با یک رویکرد جسورانه حل کرده است. این مدل به‌جای استفاده از یک زنجیره متوالی، از شاخه‌های تخصصی موازی استفاده می‌کند تا مصرف حافظه را در توالی‌های طولانی تا ۴۰٪ نسبت به مدل‌های مبتنی بر توجه (Attention) کاهش دهد.

همان‌طور که در تحلیل قبلی ما درباره‌ی مدل‌های استدلالی اشاره کردیم، چالش اصلی همواره مقیاس‌پذیری بوده است. PHA با ترکیب سه مسیر مستقل، این چالش را مدیریت می‌کند:

  • فضاهای حالت درگاه‌دار (Gated State Spaces - GSS): برای درک بافت کلی و جهانی متن.
  • توجه پرس‌وجوی گروهی (Grouped Query Attention - GQA): برای بازیابی دقیق و انتخابی اطلاعات.
  • شبکه‌های پیش‌خور (Feed-Forward Networks - FFNs): برای پردازش‌های تکمیلی.

داده‌های این گزارش نشان می‌دهد که نسخه ۱۲۵ میلیون پارامتری PHA در مجموعه‌داده WikiText-103 به عدد ۱۶.۵۱ در معیار پرپلکسیتی (Perplexity) رسیده است. این عدد از مدل Hedgehog (۱۶.۷۰) و H3-125M (۲۳.۷۰) بهتر است. همچنین، افزایش مقیاس مدل به ۱۸۰ میلیون پارامتر، سرعت پردازش (Throughput) را ۲۴٪ افزایش داد، بدون آنکه دقت مدل افت کند.

به نقل از مستندات این پژوهش، این تغییر پارادایم ثابت می‌کند که آینده‌ی مدل‌های زبانی بزرگ (LLM) نه در انتخاب بین مدل‌های حالت-فضا (SSM) و ترانسفورمرها، بلکه در ارکستراسیون آن‌ها به صورت یک مجموعه متنوع است.

گام بعدی شما

  • بررسی نحوه ادغام استراتژی میکس موازی PHA در چارچوب‌های موجود Mixture-of-Experts (MoE).
  • آزمایش مدل‌های SSM-Hybrid برای کاهش هزینه‌ی استنتاج در پروژه‌های با پنجره متنی بالا.
  • رصد مقیاس‌پذیری این معماری در مدل‌هایی با میلیاردها پارامتر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ اثر این معماری بر نیاز به GPUها را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در معمارهای هیبریدی، هزینه‌ی سخت‌افزاری پردازش متون حجیم را به‌طور واقعی کاهش می‌دهد. نتیجه این است که مدل‌های با دقت بالا، روی سخت‌افزارهای ارزان‌تر و با سرعت بیشتر اجرا خواهند شد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران؛ چرا که پیاده‌سازی عملی آن نیازمند دسترسی به کدهای منبع و زیرساخت‌های آموزشی سنگین است.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که PHA در واقع «پایان عصر تک‌معماری» در LLMها است. به جای تلاش برای یافتن یک فرمول جامع، این مدل پذیرفته است که برای مدیریت متون طولانی، نیاز به دو متخصص متفاوت (یکی برای کلیات و یکی برای جزئیات) داریم که به‌صورت موازی کار کنند، نه یکی پس از دیگری.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.