پرش به محتوای اصلی
پرش به محتوای مقاله

۴ استارتاپ با بازطراحی معماری ترنسفورمر هزینه مدل‌های زبانی را کاهش می‌دهند

·۱۹ مرداد ۱۴۰۵۱۱ دقیقه مطالعه۳ بازدید
استارتاپ‌هایی که به دنبال نسل بعدی مدل‌های زبانی بزرگ هستند
استارتاپ‌هایی که به دنبال نسل بعدی مدل‌های زبانی بزرگ هستند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل یا ترکیبی مکانیزم Attention با روش‌هایی مثل State Space و Liquid Networks برای حذف رشد تصاعدی هزینه‌ها در متون طولانی.

اگر امروز برای اجرای مدل‌های زبانی هزینه می‌پردازید، احتمالاً متوجه شده‌اید که هرچه متن ورودی طولانی‌تر می‌شود، صورت‌حساب شما به‌صورت تصاعدی رشد می‌کند. این مشکل ریشه در ریاضیاتِ بنیادین مدل‌های فعلی دارد که باعث شده OpenAI تنها در سال جاری میلادی ۵۰ میلیارد دلار برای محاسبات هزینه کند.

برای درک ابعاد این بحران، کافی است به اعداد نگاه کنید: پردازش یک سند ۱۰ هزار کلمه‌ای برای یک مدل ترنسفورمر، نیازمند ۵۰ میلیون عملیات ضرب است. این ناکارآمدی شدید دلیل آن است که آژانس بین‌المللی انرژی پیش‌بینی می‌کند مصرف برق مراکز داده تا سال ۲۰۳۰ دو برابر خواهد شد.

صنعت هوش مصنوعی تقریباً یک دهه است که به معماری ترنسفورمر (Transformer) — ساختاری که در تابستان ۲۰۱۷ با مقاله «Attention Is All You Need» گوگل معرفی شد — تکیه کرده است. جاستین دانگل، هم‌بنیان‌گذار و مدیرعامل Subquadratic، معتقد است کل صنعت فعلی بر پایه ترنسفورمرها بنا شده و آن‌ها را یکی از مهم‌ترین نوآوری‌ها در تاریخ علوم کامپیوتر می‌نامد. اما همان‌طور که در تحلیل‌های قبلی ما درباره‌ی نحوه استفاده WebGrader از نمره‌دهی برنامه‌ریزی‌شده برای بهبود عملکرد مدل‌ها اشاره کردیم، وقتی به سمت عامل‌های هوش مصنوعی پیچیده و مدل‌های استدلالی می‌رویم، این معماری قدیمی شروع به لرزیدن می‌کند.

بسیاری از پیشرفت‌های اخیر در استدلال، در واقع «راهکارهای موقت» برای پوشاندن نقص‌های بنیادین در نحوه مدیریت حافظه و توان در ترنسفورمرها هستند. برای مثال، مدل‌های استدلالی فعلی از زنجیره تفکر (Chain-of-Thought) استفاده می‌کنند؛ این فرآیند اساساً شبیه این است که مدل یادداشت‌هایی را برای خودش روی یک کاغذ پیش‌نویس بنویسد و سپس آن‌ها را دوباره بخواند. این کار تنها باعث افزایش حجم داده‌ای می‌شود که مدل باید ردیابی کند و مشکل اصلی را حل نمی‌کند.

هدف اکنون رسیدن به نسل «LLMs+» است؛ اصطلاحی که MIT Technology Review برای توصیف نسل جدیدی از مدل‌ها به کار می‌برد که هوشمندتر، سریع‌تر و به‌مراتب ارزان‌تر از مدل‌های فعلی باشند.

گلوگاه ترنسفورمر

ترنسفورمرها متن را کلمه به کلمه پردازش می‌کنند که این موضوع پنجره متنی (Context Window) — یعنی میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — را محدود می‌کند. برای اینکه مدل‌های زبانی بزرگ (LLMs) بتوانند وظایف دشوارتر را انجام دهند، باید بتوانند مجموعه‌داده‌های بزرگ‌تری مانند کل یک پایگاه کد یا کتابخانه‌های کاملی از اسناد را ببلعند. همچنین برای عامل‌های هوش مصنوعی، پردازش خروجی‌های مدل‌های زبانی دیگر ضروری است.

به دلیل این نیازها، نقطه قوت ترنسفورمر یعنی «توجه متراکم» (Dense Attention)، حالا به بزرگ‌ترین نقطه ضعف آن تبدیل شده است. این فرآیند شامل مقایسه هر کلمه (یا بخشی از کلمه که توکن نامیده می‌شود) در یک متن با تمام کلمات دیگر از طریق نوعی عملیات ضرب است. اگرچه این روش معنا را با دقتی خیره‌کننده استخراج می‌کند، اما هزینه محاسباتی آن با رشد طول متن به‌سرعت افزایش می‌یابد.

اکنون شاهد موجی از استارتاپ‌ها هستیم که تلاش می‌کنند مرزهای این فناوری پرطرفدار را جابه‌جا کنند. این بازیگران جدید اغلب ریسک‌های کمتری نسبت به غول‌های فعلی صنعت دارند و می‌توانند جسورانه‌تر عمل کنند.

بازنگری در مکانیزم توجه

استارتاپ Subquadratic مستقر در میامی، با جایگزینی توجه متراکم با «توجه پراکنده» (Sparse Attention) به جنگ این مشکل رفته است. مدل آن‌ها، SubQ، به‌جای مقایسه هر کلمه یا توکن در یک بلوک متنی با تمام کلمات دیگر، در لحظه تشخیص می‌دهد کدام کلمات واقعاً اهمیت دارند. این رویکرد تعداد ضرب‌های ریاضی مورد نیاز برای اسناد طولانی را به‌شدت کاهش می‌دهد.

در حالی که بسیاری از مکانیزم‌های توجه پراکنده سال‌هاست وجود دارند، آن‌ها معمولاً در استخراج معنا به دقت توجه متراکم نمی‌رسیدند. اما Subquadratic ادعا می‌کند که SubQ اولین مدلی است که در وظایف خاصی مانند کدنویسی و جستجو، توان رقابت با LLMهای جریان اصلی را دارد. این شرکت گزارش داده است که هزاران کاربر در لیست انتظار آن ثبت‌نام کرده‌اند و قصد دارد به‌زودی مدل را به‌طور گسترده در دسترس قرار دهد.

در مقابل، شرکت Manifest AI در سان‌فرانسیسکو، کلاً مفهوم توجه را کنار گذاشته و از مکانیزمی به نام «حفظ توان» (Power Retention) استفاده می‌کند. این مدل به‌جای نگه داشتن تمام توکن‌ها در پنجره متنی، یک خلاصه جاری از داده‌ها را حفظ می‌کند. با ورود اطلاعات جدید، داده‌های کم‌اهمیت حذف می‌شوند تا حافظه مدل در کارهای طولانی «منفجر» نشود.

جزئیات فنی حفظ توان

  • سازوکار: برخلاف توجه پراکنده که تصویری کلی و تقریبی از همه چیز نگه می‌دارد، حفظ توان یک خلاصه متحرک از پنجره متنی ارائه می‌دهد. این امر تضمین می‌کند که حجم داده‌های ردیابی‌شده توسط مدل زبانی بزرگ (LLM) به‌صورت انفجاری رشد نکند.
  • انعطاف‌پذیری: طبق ادعای Manifest AI، مدل‌های ترنسفورمر را می‌توان با کمترین میزان آموزش مجدد (Retraining) به مدل‌های حفظ توان تبدیل کرد.
  • نمونه عملی: این شرکت برای اثبات این فناوری، مدل متن‌باز StarCoder را به PowerCoder تبدیل کرد.
  • محک‌های رقابتی: آن‌ها مدل Brumby را منتشر کردند که ادعا می‌شود با نسخه‌های مدل محبوب و متن‌باز Qwen از شرکت علی‌بابا رقابت می‌کند.
  • کاربردها: کارلس گلادا، مدیر فنی شرکت، پیشنهاد می‌کند که این فناوری می‌تواند به عامل‌های هوش مصنوعی اجازه دهد هفته‌ها روی یک وظیفه متمرکز بمانند یا ویدیوهای چندساعته را بدون کرش کردن تحلیل کنند.
  • زمینه تاریخی: اصل اساسی «حفظ» (Retention) یک دهه است که وجود دارد، اما Manifest AI ادعا می‌کند این تکنیک‌ها را به‌روزرسانی کرده تا در نهایت بتوانند در برابر LLMهای مبتنی بر ترنسفورمر قد راست کنند.

شبکه‌های مایع و مدل‌های ترکیبی

شرکت Liquid AI که یک اسپین‌آف از MIT در کمبریج ماساچوست است، رویکردی بیولوژیکی الهام‌گرفته از مغز کرم‌ها در پیش گرفته است. آن‌ها از «شبکه‌های عصبی مایع» — که در واقع توسعه‌ای از شبکه‌های کانولوشنال (Convolutional Networks) پیش از ظهور ترنسفورمرها هستند — برای ساخت مدل‌های بنیادی مایع (LFMs) استفاده می‌کنند.

برخلاف ترنسفورمرها که رفتارشان پس از اتمام آموزش ثابت است، شبکه‌های مایع می‌توانند رفتار خود را در لحظه با اطلاعات جدید تطبیق دهند. این قابلیت به مدل اجازه می‌دهد در حین پیشروی یاد بگیرد؛ قابلیتی که ترنسفورمرها فاقد آن هستند. اولین مدل‌های Liquid AI ابتدایی بودند اما قادر به پرواز دادن پهپادها یا راندن وسایل نقلیه بودند.

استارتاپ‌هایی که به‌دنبال نسل بعدی مدل‌های زبانی بزرگ هستند

این مدل‌ها به‌شدت سبک هستند. LFMs شرکت Liquid AI می‌توانند روی یک رزبری‌پای ۵۰ دلاری اجرا شوند که آن‌ها را برای رایانش لبه (Edge Computing) ایده‌آل می‌کند. آن‌ها پیش از این با خودروسازانی مانند مرسدس برای اجرای هوش مصنوعی روی تراشه‌های کوچک داخلی خودروها همکاری کرده‌اند. تا به امروز، مدل‌های آن‌ها نزدیک به ۳۴ میلیون بار دانلود شده است و برای سازمان‌هایی با درآمد سالانه زیر ۱۰ میلیون دلار به‌صورت رایگان ارائه می‌شوند.

معماری ترکیبی

  • نسبت ترکیب: مدل‌های LFM فعلی، مدل‌های ترکیبی هستند که از ۲۰٪ ترنسفورمر و ۸۰٪ شبکه عصبی مایع تشکیل شده‌اند.
  • هوش مصنوعی طراح: این نسبت خاص توسط یک سیستم AI مجزا که توسط Liquid AI ساخته شده، کشف شده است. این «AI طراح» ترکیبات مختلف شبکه‌های مایع، کانولوشنال و ترنسفورمر را غربال می‌کند تا نقطه بهینه بازدهی را بیابد.
  • عملکرد: این مدل‌ها عملکردی برابر با رقبایی دارند که چهار برابر بزرگ‌تر از آن‌ها هستند، از جمله مدل متن‌باز Gemma گوگل و Qwen علی‌بابا.
  • الهام بیولوژیک: رامین حسنی، مدیرعامل شرکت، به مغز انسان اشاره می‌کند که تنها با ۲۰ وات برق کار می‌کند؛ این برای او دلیلی است بر اینکه صنعت می‌تواند بسیار نوآورانه‌تر از روش‌های فعلی مبتنی بر ترنسفورمر عمل کند.

انتشار و استدلال غیرزبانی

استارتاپ Inception در پالو آلتو، تکنولوژی مدل انتشار (Diffusion Model) — همان فناوری پشت تولیدکننده‌های تصویر — را روی متن پیاده کرده است. اکثر LLMها متن را کلمه به کلمه تولید می‌کنند که از نظر محاسباتی کند است، اما مدل‌های Inception بلوک‌های متنی را به‌طور هم‌زمان تولید می‌کنند.

مدل‌های انتشار معمولاً یک شبکه تصادفی از پیکسل‌ها (شبیه برفک تلویزیون) را می‌گیرند و با کار روی تمام پیکسل‌ها به‌طور هم‌زمان، آن‌ها را به یک تصویر تبدیل می‌کنند. Inception این روش را به متن منتقل کرده است؛ به‌گونه‌ای که یک رشته تصادفی از کلمات را گرفته و آن‌ها را به جملاتی منسجم تبدیل می‌کند. اگرچه آن‌ها هنوز از ترنسفورمرها برای کدگذاری معنا استفاده می‌کنند، اما بسیاری از توکن‌ها را به‌طور هم‌زمان پیش‌بینی می‌کنند.

استفانو ارمون، مدیرعامل شرکت و پژوهشگر استنفورد، با یک چالش ریاضی بزرگ روبرو بود: برخلاف پیکسل‌ها که می‌توان بین رنگ‌ها انتقال تدریجی داشت، هیچ حالت «میانی» بین کلماتی مثل «گربه» و «سگ» وجود ندارد. در سال ۲۰۲۴، ارمون و همکارانش این مسئله ریاضی را حل کردند و ابتدا مدلی ساختند که با GPT-2 (محصول ۲۰۱۹) برابری می‌کرد اما ۱۰ برابر سریع‌تر بود.

امروز، Inception ادعا می‌کند مدل Mercury 2 آن‌ها عملکرد GPT-4 (منتشر شده در ۲۰۲۳) را دارد اما همچنان ۱۰ برابر سریع‌تر است. ارمون هوش را به عنوان واحد «هوش در هر دلار» می‌بیند و بر سرعت و هزینه به عنوان معیارهای اصلی مقیاس‌بندی تمرکز دارد. این رویکرد توسط گوگل نیز از طریق نمونه اولیه‌ای به نام Diffusion Gemma در حال بررسی است.

فراتر از زبان

استارتاپ Pathway در پالو آلتو، تلاش می‌کند کلاً از زبان فاصله بگیرد. مدل آن‌ها، Dragon Hatchling (نام‌گذاری شده بر اساس کتاب Color of Magic اثر تری پراتچت)، به‌جای توجه، از ریاضیات «فضای حالت» (State Space) استفاده می‌کند.

به‌جای کدگذاری اطلاعات کلمه به کلمه، فضاهای حالت داده‌ها را به یک نمایش انتزاعی فشرده می‌کنند. این امر به مدل اجازه می‌دهد اشکالی از استدلال را تقلید کند که لزوماً شامل توالی کلمات نیست؛ موضوعی که برای وظایفی مانند ریاضیات یا شطرنج حیاتی است. زوزانا استامیروفسکا استدلال می‌کند که لحظات «یافتم!» (Eureka) در مغز لزوماً زبانی نیستند و استدلال در قالب زبان، یک محدودیت است.

عملکرد Dragon Hatchling

  • محک سودوکو: در آزمونی با ۲۵۰ هزار پازل سخت سودوکو، Dragon Hatchling بیش از ۹۷٪ آن‌ها را حل کرد.
  • مقایسه: چندین مدل پیشرو از آزمایشگاه‌های برتر، در حل حتی یکی از پازل‌های همان مجموعه شکست خوردند.
  • منطق: زوزانا استامیروفسکا می‌گوید نمایش یک صفحه سودوکو به‌صورت کلمه به کلمه، ذاتاً دشوار و ناکارآمد است.
  • استدلال انتزاعی: با جایگزینی توجه با ساختارهای فضای حالت، مدل می‌تواند پازل‌هایی را مدیریت کند که در ذهن به‌عنوان یک جمله طولانی جای نمی‌گیرند.

استامیروفسکا معتقد است تکیه بر زبان برای استدلال یک محدودیت است. اگرچه یک مدل می‌تواند کتابی درباره سودوکو بخواند و کدی برای حل آن بنویسد، اما او باور دارد پیشرفت‌های واقعی — مانند درمان سرطان — نیازمند مدل‌هایی است که بتوانند فراتر از محدودیت‌های یک کتاب درسی یا یک جمله استدلال کنند. او ترنسفورمرها را یک «سهولت مهندسی» می‌نامد که باعث ایجاد یک «دین» شده است، اما تأکید می‌کند که یک گسست و پیشرفت جدید اجتناب‌ناپذیر است.

چرخش در اقتصاد هوش مصنوعی

این جنبش نشان‌دهنده تغییر استراتژی از «مقیاس‌بندی با زور بازو» (Brute Force Scaling) به «بهینگی معماری» است. برای رهبران کسب‌وکار، این یعنی «خندقی» که با بودجه‌های میلیاردی محاسباتی ایجاد شده بود، در حال کوچک شدن است. اگر استارتاپی بتواند عملکرد GPT-4 را با یک‌دهم هزینه ارائه دهد، مزیت رقابتی از کسی که بیشترین GPU را دارد به کسی منتقل می‌شود که ریاضیات بهتری می‌نویسد.

ما در حال گذاری هستیم که در آن «سهولت مهندسی» ترنسفورمرها جای خود را به معماری‌های تخصصی می‌دهد. برندگان احتمالا کسانی خواهند بود که بتوانند هوش «به اندازه کافی خوب» را روی لبه — در خودروها، گوشی‌ها و سرورهای محلی — بدون نیاز به بودجه‌های ۵۰ میلیارد دلاری برای مراکز داده مستقر کنند. این رویکرد بهینه‌سازی کنترل سیستم‌های پیچیده، مشابه تلاشی است که شرکت Enigma برای ساده‌سازی کنترل ربات‌ها به کار گرفته تا پیچیدگی‌های عملیاتی را به یک مدل قابل مدیریت تبدیل کند.

منتظر انتشار عمومی SubQ و ادغام احتمالی تولید متن مبتنی بر انتشار در نمونه اولیه Diffusion Gemma گوگل باشید. نبرد بعدی در هوش مصنوعی بر سر این نیست که چه کسی داده‌های بیشتری دارد، بلکه بر سر این است که چه کسی می‌تواند آن داده‌ها را با کمترین مقدار برق پردازش کند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل‌های Open Weights (وزن‌های باز) را که از معماری‌های غیرترنسفورمر استفاده می‌کنند، در پروژه‌های کوچک تست کنید تا تفاوت در تأخیر (Latency) را بسنجید.
  • انتشار عمومی مدل SubQ را دنبال کنید تا ببینید آیا توجه پراکنده واقعاً دقت را فدای سرعت می‌کند یا خیر.
  • در استراتژی محصول خود، به‌جای تکیه بر افزایش پنجره متنی، به دنبال مدل‌هایی با قابلیت «خلاصه جاری» (مانند رویکرد Manifest AI) باشید.

اما نبرد واقعی در لایه سخت‌افزار است؛ برای درک اینکه تراشه‌های جدید چگونه این معماری‌ها را پشتیبانی می‌کنند، به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییرات معماری، قدرت انحصاری غول‌های دارای بودجه‌های عظیم محاسباتی را می‌شکند و اجازه می‌دهد هوش مصنوعی سطح بالا روی سخت‌افزارهای ارزان‌قیمت اجرا شود. این موضوع بر اساس تخصص مهندسی معماری مدل‌ها، هزینه استنتاج را به‌شدت کاهش می‌دهد.

تأثیر برای ایران

کاهش نیاز به GPUهای گران‌قیمت و مراکز داده عظیم، فرصتی برای استارتاپ‌های ایرانی است تا مدل‌های بهینه را روی سخت‌افزارهای در دسترس‌تر اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از افزایش تعداد پارامترها به سمت بهینه‌سازی نحوه دسترسی به داده‌ها تغییر کرده است. این یعنی دوران «بیشتر یعنی بهتر» به پایان رسیده و حالا «هوشمندتر یعنی ارزان‌تر» اولویت دارد. احتمالاً در آینده نزدیک، مدل‌های ترکیبی (Hybrid) که بخش کوچکی برای درک کلی و بخش بزرگی برای پردازش بهینه دارند، جایگزین مدل‌های یکپارچه و سنگین فعلی شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.