پرش به محتوای اصلی
پرش به محتوای مقاله

۷۲ معماری مدرن LLM در مخزن متن‌باز OpenArch

·۲۳ شهریور ۱۴۰۵۴ دقیقه مطالعه
پیاده‌سازی PyTorch معماری‌های LLM متن‌باز (Llama، Qwen، DeepSeek و غیره) از صفر برای یادگیری.
پیاده‌سازی PyTorch معماری‌های LLM متن‌باز (Llama، Qwen، DeepSeek و غیره) از صفر برای یادگیری.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه ۷۲ معماری مدرن در قالب کدهای پایتورچِ ساده و تک‌فایلی، به‌جای استفاده از کتابخانه‌های پیچیده و بهینه‌شده برای تولید.

اگر می‌خواهید بدانید درون پیچیده‌ترین مدل‌های هوش مصنوعی دنیا چه می‌گذرد، دیگر نیازی نیست در هزاران خط کد بهینه‌شده و نامفهوم غرق شوید. مخزن OpenArch در گیت‌هاب، لایه‌های پنهان مدل‌های پیشرو را با زبانی ساده و شفاف پیش روی شما می‌گذارد. این پروژه با پیاده‌سازی معماری‌ها از ابتدا در PyTorch، به توسعه‌دهندگان اجازه می‌دهد تا انتخاب‌های ساختاری دقیقی که مدل‌های زبانی بزرگ (LLM) مدرن را تعریف می‌کنند، بدون شلوغی‌های معمول کدهای صنعتی بررسی کنند.

بسیاری از توسعه‌دهندگان برای درک تفاوت‌های ظریف بین مدل‌ها دچار مشکل می‌شوند؛ زیرا کدهای رسمی شرکت‌ها برای سرعت، توزیع داده (Sharding) و بهینه‌سازی سخت‌افزاری طراحی شده‌اند، نه برای شفافیت و یادگیری. این پروژه در واقع مکمل بصری و عملی گالری معماری سباستین راشکا است که نمودارهای تئوری را به کدهای قابل اجرا تبدیل می‌کند. همان‌طور که پیش‌تر در پوشش خود درباره اینکه چرا سایت‌های مبتنی بر ChatGPT باعث نابودی Wix نمی‌شوند به بازسازی توسعه وب پرداختیم، OpenArch بر لایه‌ای عمیق‌تر تمرکز دارد: اینکه مدل‌ها در واقعیت چگونه ساخته شده‌اند.

زمینه معماری

مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیارد‌ها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — از یک اسکلت مشترک پیروی می‌کند، اما در ده‌ها انتخاب کوچک و حیاتی با یکدیگر متفاوت است. OpenArch این تفاوت‌ها را صریح می‌کند تا یادگیری را تسهیل کند. این پروژه از مقالات اصلی، گزارش‌های فنی، فایل‌های مرجع config.json و نوشته‌های سباستین راشکا و Machine Learning Mastery بهره گرفته است.

هدف این مخزن رقابت با کتابخانه‌های تولیدی مانند transformers نیست، بلکه اولویت آن «شفافیت» است. این مخزن برای خوانایی بهینه شده و برای هر معماری تنها یک فایل متنی ساده و خوانا ارائه می‌دهد. این رویکرد به کاربران اجازه می‌دهد تا انتخاب‌های ساختاری را به‌صورت موازی مقایسه کنند؛ برای مثال، تفاوت بین رمزگذارهای متراکم (Dense Decoders) و مدل‌های ترکیب خبره‌ها (Mixture of Experts) را بررسی کنند و ببینند که آیا این مدل‌ها دارای خبره‌های مشترک (Shared Experts) هستند یا خیر. در همین راستا، برخی شرکت‌ها برای بهینه‌سازی این ساختارها از رویکردهای نوآورانه استفاده می‌کنند؛ چنان‌که معماری Scatter-Gather در Oxlo.ai تلاش می‌کند گلوگاه پنجره متنی مدل‌های زبانی را بشکند.

طبق مستندات منتشر شده در ۱۴ سپتامبر ۲۰۲۶، پروژه OpenArch قصد دارد معماری ۷۲ مدل مختلف را پوشش دهد. این پروژه به‌جای رقابت با کتابخانه‌های صنعتی بر خوانایی تمرکز کرده است. بر اساس بررسی مستندات این مخزن، برخی از مدل‌های برجسته پیاده‌سازی شده عبارت‌اند از:

  • Llama 3 (8B): بهره‌گیری از RMS Norm، RoPE و توجه پرس‌وجوی گروه‌بندی شده (GQA).
  • DeepSeek R1 (671B): دارای RMS Norm، QK-Norm و توجه نهان چندسر (MLA) همراه با MoE.
  • Gemma 3 (27B): پیاده‌سازی GQA با پنجره لغزان (Sliding Window).
  • Kimi K2 (1T): پیاده‌سازی عظیم با استفاده از MLA و MoE.
  • GLM 4.5 (355B): ترکیبی از GQA، پیش‌بینی چند-توکنی و MoE.

جزئیات فنی

در بخش جزئیات فنی، مدل‌ها بر اساس نوع ورودی یا مودالیته دسته‌بندی شده‌اند. این دسته‌بندی شامل گزینه‌های متنی و چندوجهی (Multimodal) است؛ برای مثال، مدل PaliGemma (3B) که از RMS Norm، RoPE و توجه چندسر (Multihead Attention) استفاده می‌کند، در این لیست جای دارد. همچنین مدل‌هایی مثل Grok-2.5 (270B) و Qwen3 (3B) در حال حاضر در وضعیت «در دست ساخت» (🚧) قرار دارند.

مکانیزم‌های کلیدی پیاده‌سازی شده در این گالری شامل موارد زیر است:

  • انواع توجه: MHA، GQA، MQA، MLA، پنجره لغزان (Sliding-window) و ترکیبات خطی یا DeltaNet.
  • تکنیک‌های نرمال‌سازی: Pre-norm، Post-norm، QK-Norm، Sandwich norm و RMSNorm.
  • رمزگذاری‌های موقعیت: RoPE، NoPE، RoPE جزئی (Partial RoPE) و YaRN.
  • ترفندهای زمان آموزش: خبره‌های نهان (Latent experts)، توجه گیت‌دار (Gated attention) و پیش‌بینی چند-توکنی.

ساختار پوشه‌بندی پروژه به‌گونه‌ای است که هر معماری در پوشه مجزای خود (مثلاً OpenArch/text/llama3/) دارای یک فایل model.py اختصاصی و یک راهنمای کوتاه README.md است. این سازماندهی اجازه می‌دهد تا اجزای حیاتی مانند انواع نرمال‌سازی (Pre-norm در مقابل QK-Norm) و رمزگذاری‌های موقعیت (RoPE در مقابل YaRN) به‌طور مستقیم با هم مقایسه شوند.

برای یک توسعه‌دهنده عملی، این تغییر تمرکز از «عملکرد» به «خوانایی» بسیار قابل توجه است. این رویکرد مانع ورود برای کسانی که می‌خواهند با مسیریابی در MoE یا لایه‌های ترکیبی Mamba/Attention آزمایش کنند را از بین می‌برد. به‌جای کلنجار رفتن با هزاران خط کد بهینه‌شده در C++ یا هسته‌های پیچیده CUDA، کاربر می‌تواند یک فایل پایتون واحد را بخواند تا ببیند یک «گذر پیشرو» (Forward Pass) واقعاً چگونه عمل می‌کند. این شفافیت در معماری می‌تواند منجر به مدل‌های بهینه‌تری شود که هزینه استنتاج آن‌ها را از تعداد توکن‌ها جدا می‌کند، تا بهره‌وری اقتصادی در کنار دقت فنی افزایش یابد.

این منبع در واقع «شهود معماری» را که پیش‌تر مختص پژوهشگران آزمایشگاه‌های بزرگ بود، دموکراتیزه می‌کند. با شفاف کردن انتخاب‌های ساختاری، توسعه‌دهندگان مستقل می‌توانند مدل‌های کوچک‌تر و تخصصی را بر اساس الگوهای اثبات‌شده بسازند، به‌جای آنکه بر اساس حدس و گمان پیش بروند.

شما می‌توانید لیست فعلی مدل‌های پیاده‌سازی شده را بررسی کنید یا با افزودن یک فایل model.py برای یکی از معماری‌های باقی‌مانده در گالری، در این پروژه مشارکت کنید. از مشارکت‌کنندگان خواسته شده است تا تست‌های گذر پیشرو را اضافه کنند که وزن‌های رسمی را بارگذاری کرده و خروجی‌ها را روی چند توکن تطبیق دهد.

گام بعدی شما

  • مخزن OpenArch را در گیت‌هاب بررسی کنید و فایل model.py مدل مورد علاقه خود را با مدل‌های دیگر مقایسه کنید.
  • سعی کنید یک تست گذر پیشرو (Forward-pass test) بنویسید و خروجی آن را با وزن‌های رسمی مدل‌ها تطبیق دهید.
  • اگر با معماری خاصی آشنا هستید، با ارسال یک Pull Request در پیاده‌سازی مدل‌های باقی‌مانده مشارکت کنید.

اما درک معماری تنها نیمی از مسیر است؛ برای اینکه بدانید این ساختارها چگونه روی سخت‌افزار اجرا می‌شوند، به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه با تکیه بر اعتبار مستندات فنی مدل‌های پیشرو، دسترسی به دانش ساختاری LLMها را برای توسعه‌دهندگان مستقل فراهم می‌کند. این شفافیت باعث می‌شود طراحی مدل‌های کوچک‌تر و بهینه‌تر بر اساس الگوهای موفق، سریع‌تر صورت گیرد.

تأثیر برای ایران

این مخزن برای دانشجویان و پژوهشگران هوش مصنوعی در ایران که دسترسی محدودی به سخت‌افزارهای عظیم دارند، منبعی عالی برای یادگیری معماری مدل‌ها بدون نیاز به اجرای آن‌هاست.

·نگاه ما
تحریریه دات‌هوش

جایگزینی بهینه‌سازی‌های صنعتی با خوانایی کد، یک چرخش آموزشی است که شکاف بین مقالات پژوهشی و پیاده‌سازی واقعی را پر می‌کند. این پروژه نشان می‌دهد که پیچیدگی مدل‌های جدید نه در مفاهیم کلی، بلکه در ترکیب‌های خاص از نرمال‌سازی و رمزگذاری موقعیت نهفته است. در واقع، OpenArch ابزاری برای تبدیل «جادوی سیاه» مدل‌های بسته به «مهندسی قابل مشاهده» تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.