پرش به محتوای اصلی
پرش به محتوای مقاله

Soofi S 30B-A3B: پیشتازی مدل‌های باز در بنچمارک‌های انگلیسی و آلمانی

·۲۵ تیر ۱۴۰۵۵ دقیقه مطالعه
مدل بنیادین ترکیبی مامبا-ترنسفورمر موئی سوفی S 30B-A3B برای آلمانی و انگلیسی
مدل بنیادین ترکیبی مامبا-ترنسفورمر موئی سوفی S 30B-A3B برای آلمانی و انگلیسی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

پیاده‌سازی موفق معماری ترکیبی Mamba-MoE که منجر به افزایش ۹ برابری سرعت رمزگشایی در بافت‌های طولانی و پیشتازی در بنچمارک‌های دوزبانه آلمانی-انگلیسی شده است.

اگر به‌دنبال مدل‌های بنیادی با وزن‌های باز هستید که در زبان‌های غیرانگلیسی دچار افت شدید کیفیت نشوند، Soofi S استانداردی جدید تعریف کرده است. این مدل در حال حاضر بالاترین امتیاز تجمیعی را در بین مدل‌های کاملاً باز برای زبان‌های انگلیسی و آلمانی به ثبت رسانده است. مدل Soofi S 30B-A3B توسط یک کنسرسیوم تحقیقاتی در آلمان توسعه یافته است تا یک جایگزین با وزن‌های باز برای وظایف دوزبانه با عملکرد بالا فراهم کند، بدون آنکه محدودیت‌های مربوط به تنظیم دستوری (Instruction Tuning)، همراستاسازی (Alignment) یا تنظیمات ایمنی (Safety Tuning) را داشته باشد.

این عرضه در زمانی صورت می‌گیرد که یک موج جهانی برای دستیابی به «حاکمیت محاسباتی» شکل گرفته است تا وابستگی کامل به مدل‌های بسته‌سورس متمرکز بر ایالات متحده کاهش یابد. این پروژه که توسط KI Bundesverband هماهنگ و توسط وزارت اقتصاد و انرژی فدرال آلمان تأمین مالی شده، نشان‌دهنده یک تلاش استراتژیک برای ساخت زیرساخت‌های محلی هوش مصنوعی است. شرکت‌کنندگان در این کنسرسیوم شامل Fraunhofer IAIS، DFKI، دانشگاه TU Darmstadt، شرکت ellamind و Merantix Momentum است. در حالی که ما پیش‌تر کاربرد ابزارهای تخصصی مانند غربال‌گر رزومه‌های مبتنی بر هوش مصنوعی را بررسی کرده بودیم، Soofi S در سطحی بنیادی‌تر عمل می‌کند و بستر خام لازم برای چنین کاربردهای پایین‌دستی را فراهم می‌آورد.

زمینه زیرساختی

طبق گزارش marktechpost.com، این مدل به‌صورت کامل (end-to-end) در ابر هوش مصنوعی صنعتی Deutsche Telekom در مونیخ آموزش دیده است. فرآیند آموزش از ۲۴ مارس تا ۱۳ مه ۲۰۲۶ به طول انجامید. زیرساخت مورد استفاده شامل ۵۱۲ عدد GPU NVIDIA B200 بود که در مجموع حدود ۲۵۳,۰۰۰ ساعت پردازشی B200 مصرف کردند.

معماری فنی

از نظر معماری، این مدل از یک ساختار ترکیبی Mamba-Transformer با مکانیزم ترکیب خبره‌ها (Mixture of Experts یا MoE) استفاده می‌کند. برای تضمین سازگاری باK پشته‌هایی مانند vLLM، بهره‌وری در سرویس‌دهی و کنترل علمی، تیم سازنده از طراحی مرجع Nemotron 3 Nano بدون هیچ‌گونه تغییری استفاده کرده است. با استفاده از این ستون فقرات ثابت، تیم توانست «دستور پخت داده‌ها» را به عنوان تنها متغیر تغییرپذیر ایزوله کند.

ساختار این مدل شامل ۵۲ لایه است:

  • ۲۳ لایه ترکیب سکانس Mamba-2
  • ۲۳ لایه MoE دانه‌بندی شده (شامل ۱۲۸ خبره مسیری که ۶ مورد در هر توکن فعال هستند، به‌علاوه ۲ خبره مشترک)
  • ۶ لایه توجه پرس‌وجوی گروهی (GQA) که تنها لایه‌هایی هستند که حافظه KV (KV cache) را حفظ می‌کنند

سایر مشخصات معماری شامل ابعاد مدل ۲۶۸۸، استفاده از squared ReLU و RMSNorm و حذف جاسازی‌های موقعیتی (Positional Embeddings) است. این مدل با مجموع حدود ۳۱.۶ میلیارد پارامتر، در هر توکن تنها ۳.۲ میلیارد پارامتر را فعال می‌کند که هزینه محاسباتی در زمان استنتاج (Inference) را به‌شدت کاهش می‌دهد.

دستور پخت آموزش

تمرکز اصلی تیم تحقیقاتی روی دستور پخت داده‌ها به عنوان متغیر اصلی بوده است. آموزش در سه فاز و با استفاده از یک زمان‌بندی Warmup–Stable–Decay (WSD) با یک بخش کاهش minus_sqrt انجام شد که در مجموع حدود ۲۶.۶۸ تریلیون توکن را مصرف کرد:

  • فاز ۱: مصرف حدود ۲۰ تریلیون توکن روی یک ترکیب متنوع و لایه‌بندی شده از نظر کیفیت در یک plateau ۱e-۳.
  • فاز ۲: مصرف حدود ۶.۵۸ تریلیون توکن از داده‌های پالایش‌شده (annealing) با کیفیت بالا. در این مرحله نرخ یادگیری از 1e-3 به 1e-5 کاهش یافت و سپس در سطح 1e-5 ثابت ماند.
  • فاز ۳: مصرف حدود ۰.۱۰ تریلیون توکن با طول توالی ۱,۰۴۸,۵۷۶ توکن، که پنجره زمینه (Context Window) کاربردی را تا ۱ میلیون توکن گسترش داد.

به‌طور قابل توجهی، سهم داده‌های آلمانی از ۷.۲٪ از توکن‌های مؤثر در فاز اول، به ۱۵.۳۲٪ در فاز دوم افزایش یافت. این یک جهش بزرگ در مقایسه با ترکیب مرجع Nemotron 3 Nano است که تنها حدود ۵٪ را به مجموع تمام زبان‌های غیرانگلیسی اختصاص می‌دهد. منابع آلمانی شامل HPLT v3 و v4، German Commons، German FinePDFs و FineWiki است. علاوه بر این، Genios تعداد ۱۹۳ میلیون مقاله با لایسنس تجاری از ۹۱۶ آرشیو روزنامه‌ای و مطبوعات تخصصی را فراهم کرد.

بنچمارک‌های عملکرد

در تست‌های رودررو با استفاده از خط لوله lm-evaluation-harness با پرومپت‌های یکسان و تنظیمات few-shot، مدل Soofi S 30B-A3B از ۱۶ مدل بنیادی باز دیگر پیشی گرفت. در مقایسه با مدل مرجع خود که معماری یکسانی دارد، Soofi S امتیاز خود را ۱.۸ امتیاز در مجموع انگلیسی، ۴.۲ امتیاز در مجموع آلمانی و ۶.۷ امتیاز در داده‌های انگلیسی خارج از مجموعه آموزش (held-out) افزایش داد.

نتایج کلیدی بنچمارک‌ها به شرح زیر است:

  • تجمیعی انگلیسی: ۷۰.۱٪ (برتر از Olmo 3 32B با ۶۷.۳٪ و EuroLLM 22B با ۶۱.۲٪)
  • تجمیعی آلمانی: ۷۹.۱٪ (برتر از Olmo 3 32B با ۶۹.۲٪ و EuroLLM 22B با ۷۰.۶٪)
  • آزمون HumanEval (pass@1): ۷۳.۸٪ (در مقابل ۶۳.۰٪ Olmo 3)
  • آزمون GSM8K: ۸۶.۱٪ (در مقابل ۸۰.۷٪ Olmo 3)
  • آزمون MBPP-DE (pass@1): ۸۴.۲٪
  • آزمون GLP-DE: ۸۸.۸٪
  • آزمون INCLUDE-DE: ۶۱.۲٪
  • آزمون GPQA-Diamond: ۴۳.۴٪

در حالی که Soofi S در بین مدل‌های بنیادی کاملاً باز پیشتازی می‌کند، اما در برابر وزن‌های بزرگ‌تری مانند Qwen3.5 35B-A3B عقب می‌ماند. با این حال، در وظایف آلمانی از Gemma 3 27B (۷۰.۳ انگلیسی) و Ministral 3 14B پیشی گرفته و امتیاز ۷۹.۱ را در مقابل ۷۸.۴ و ۷۸.۳ ثبت کرده است.

پیاده‌سازی و استقرار

برای کسانی که قصد پیاده‌سازی این مدل را دارند، وزن‌ها از طریق یک پیش‌نمایش محدود (gated preview) در Hugging Face در دسترس است. مدل همراه با کدهای مدل‌سازی سفارشی عرضه شده و برای سرویس‌دهی با تراکم بالا با vLLM سازگار است. کاربران باید پیش از استفاده از AutoModelForCausalLM در کتابخانه transformers شرایط را در صفحه مدل بپذیرند.

این تغییر به سمت معماری‌های ترکیبی Mamba-Transformer نشان می‌دهد که این حوزه در حال فاصله گرفتن از ترنسفورمرهای خالص برای حل مشکل گلوگاه حافظه KV است. با محدود کردن حافظه کش تنها به ۶ لایه از ۵۲ لایه، Soofi S به سرعت رمزگشایی (decode speed) دست یافته که ۸ تا ۹ برابر سریع‌تر از مدل‌های متراکم ۱۴ تا ۲۴ میلیارد پارامتری در هنگام مدیریت زمینه ۴۰ هزار توکنی است. این سرعت از ۴ هزار تا ۲۵۶ هزار توکن ثابت می‌ماند، که به‌طور مؤثری مانع استقرار ابزارهای تحلیل اسناد عمیق، مانند تنظیم دقیق PDF بیمه‌نامه‌ها یا دستیارهای برنامه‌نویسی پایتون به زبان آلمانی (با امتیاز ۸۴.۲ در MBPP-DE) را کاهش می‌دهد.

توسعه‌دهندگان اکنون باید نهایی شدن لایسنس مدل و بسته شدن پیش‌نمایش محدود را رصد کنند و در عین حال تست‌های بازیابی (retrieval) را در برابر شکاف‌های RULER و NaturalQuestions انجام دهند تا این وزن‌ها را به‌طور کامل در خطوط تولید خود ادغام نمایند.

گام بعدی شما

  • بررسی وزن‌های مدل در Hugging Face و تست قابلیت‌های استخراج داده از اسناد طولانی (PDF)
  • مقایسه سرعت استنتاج Soofi S با مدل‌های ترنسفورمر خالص در محیط vLLM
  • آزمایش دقت مدل در ترجمه تخصصی آلمانی-انگلیسی برای کاربردهای صنعتی

این بهینه‌سازی در سرعت رمزگشایی، مسیر را برای تحلیل اسناد حجیم هموار می‌کند؛ اما تأثیر این معماری ترکیبی بر مصرف حافظه در مقیاس‌های میلیونی را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص کنسرسیوم‌های آلمانی، اثبات می‌کند که تمرکز بر کیفیت داده‌های زبانی محلی (Sovereign AI) می‌تواند شکاف عملکردی با مدل‌های آمریکایی را پر کند. دسترسی باز به این وزن‌ها، استقلال محاسباتی اروپا را در حوزه هوش مصنوعی تقویت می‌کند.

تأثیر برای ایران

این مدل برای پژوهشگران ایرانی که روی مدل‌های چندزبانه یا بهینه‌سازی استنتاج (Inference) کار می‌کنند، یک منبع مطالعاتی ارزشمند است. دسترسی به وزن‌های آن در Hugging Face برای توسعه‌دهندگان داخلی آزاد است.

·نگاه ما
تحریریه دات‌هوش

استفاده از معماری ترکیبی Mamba-Transformer در Soofi S نشان می‌دهد که عصر مدل‌های متراکم خالص برای پردازش متون طولانی به پایان رسیده است. حذف بخش بزرگی از KV Cache و تبدیل آن به لایه‌های Mamba، گلوگاه حافظه را می‌شکند و استنتاج را در پنجره‌های یک میلیون توکنی اقتصادی می‌کند. این رویکرد، مدل‌های کوچک‌تر را قادر می‌سازد تا در تخصص‌های زبانی خاص، مدل‌های بسیار بزرگ‌تر اما عمومی را شکست دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.