پرش به محتوای اصلی
پرش به محتوای مقاله

Strata: اجرای مدل‌های ۱۲۵ میلیارد پارامتری روی کارت گرافیک‌های خانگی

·۱۲ مهر ۱۴۰۵۸ دقیقه مطالعه
موتور استنتاج Strata: اجرای Qwen3.8-Flash-Next روی سخت‌افزار معمولی با نصب یک‌کلیکی ویندوز/لینوکس، API محلی OpenAI/Anthropic
موتور استنتاج Strata: اجرای Qwen3.8-Flash-Next روی سخت‌افزار معمولی با نصب یک‌کلیکی ویندوز/لینوکس، API محلی OpenAI/Anthropic
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از معماری حافظه ترکیبی (Hybrid RAM) برای اجرای مدل‌های ۱۲۵ میلیارد پارامتری روی ۱۲ گیگابایت VRAM؛ در حالی که پیش از این چنین مدل‌هایی تنها روی سرورهای H100 یا A100 قابل اجرا بودند.

تصور کنید یک سیستم گیمینگ معمولی با کارت گرافیک RTX 5070 بتواند مدل‌های هوش مصنوعی با ۱۲۵ میلیارد پارامتر را به‌صورت کاملاً محلی اجرا کند. این رویایی که تا پیش از این به سرورهای صنعتی محدود بود، اکنون با معرفی Strata به واقعیت تبدیل شده است.

Strata یک موتور استنتاج (Inference) — شبیه به لحظه آشپزی واقعی بعد از یادگیری دستور پخت — است که در ۴ اکتبر ۲۰۲۶ منتشر شد. این ابزار متن‌باز به مدل Qwen3.8-Flash-Next اجازه می‌دهد تا با دور زدن محدودیت‌های سنتی حافظه ویدیویی (VRAM)، روی سخت‌افزارهای مصرف‌کننده اجرا شود. این مدل در واقع تکامل‌یافته‌ی خانواده مدل‌های Qwen است که علی‌بابا پیش‌تر با کاهش شدید هزینه‌های API مدل‌های چندوجهی خود، دسترسی به این فناوری را تسهیل کرده بود.

بیشتر مدل‌های مقیاس‌بزرگ برای اجرا به سرورهای سازمانی با صدها گیگابایت حافظه گرافیکی نیاز دارند و این موضوع برای کاربران عادی یک سقف سخت ایجاد کرده بود. همان‌طور که در تحلیل قبلی ما درباره‌ی حملات زنجیره تأمین و توقف GPT-6.1 Astra اشاره کردیم، روند صنعت اکنون به سمت آوردن هوش مصنوعی عظیم به لبه (Edge) در حال حرکت است تا دسترسی به هوش سطح بالا برای همه فراهم شود.

طبق مستندات Strata، این موتور شکاف حافظه را با یک معماری ترکیبی حل می‌کند. در این سیستم، PC مانند یک آشپزخانه مدیریت می‌شود: داده‌های پرکاربرد روی «میز کار» (VRAM) می‌مانند و بقیه در «انباری» (RAM و SSD) منتظر می‌مانند. این مدل از ۲۴,۵۷۶ متخصص کوچک یا «خبره» تشکیل شده است، اما برای تولید هر کلمه تنها به حدود ۱۰ مورد از آن‌ها نیاز است و نیازی نیست کل مدل همزمان در حافظه گرافیکی باشد.

الزامات سخت‌افزاری و عملکرد

برای اجرای Strata، کاربر به کارت گرافیکی با حداقل ۱۲ گیگابایت VRAM نیاز دارد. سخت‌افزارهای پشتیبانی‌شده عبارت‌اند از:

  • NVIDIA: سری‌های GeForce RTX 20, 30, 40 یا 50.
  • AMD: مدل‌های Radeon RX 7900 XT / XTX، سری RX 7800 XT / 7700 XT، مدل‌های جدید RX 9060 XT و RX 9070 / 9070 XT، Radeon AI PRO R9700 و سری RX 6800 / 6900.
  • رم سیستم: حداقل ۳۲ گیگابایت. برای اجرای تمامی اندازه‌های موجود مدل، ۶۴ گیگابایت رم توصیه می‌شود.
  • فضای ذخیره‌سازی: حدود ۸۰ گیگابایت فضای خالی. استفاده از SSD به‌شدت توصیه می‌شود زیرا سرعت اولین اجرا را به‌طور قابل‌توجهی افزایش می‌دهد.
  • سیستم‌عامل: ویندوز ۱۰ / ۱۱ یا لینوکس با درایورهای گرافیکی به‌روز.

بر اساس گزارش‌های عملکردی، سرعت خروجی به سطح کوانتیزاسیون (Quantization) بستگی دارد. روی یک سیستم با RTX 5070 (۱۲ گیگابایت VRAM) و پردازنده Ryzen 5 7600 با ۶۴ گیگابایت رم، مدل Q2_0 با سرعت ۹۴ توکن (Token) — تکه‌های کوچک متن شبیه برش‌های کیک — در ثانیه می‌نویسد و پرامپت‌ها را با سرعت ۲,۶۵۰ توکن در ثانیه می‌خواند. سایر پیکربندی‌ها روی همین سخت‌افزار عبارت‌اند از: مدل IQ2_XS (۷۹ توکن/ثانیه نوشتن، ۲,۰۹۰ توکن/ثانیه خواندن)، مدل IQ3_XXS (۶۲ توکن/ثانیه نوشتن، ۱,۷۵۰ توکن/ثانیه خواندن) و مدل IQ3_S (۵۳ توکن/ثانیه نوشتن، ۱,۶۲۰ توکن/ثانیه خواندن). نسخه Coder در این سیستم به سرعت ۵۵ توکن/ثانیه در نوشتن و ۲,۱۸۰ توکن/ثانیه در خواندن می‌رسد.

در سخت‌افزار AMD RX 9070 XT با ۱۶ گیگابایت VRAM، پردازنده Ryzen 9 3900X و ۴۷ گیگابایت رم، مدل Q2_0 با سرعت ۶۰ توکن/ثانیه می‌نویسد و ۱,۱۶۰ توکن/ثانیه می‌خواند. مدل IQ2_XS سرعت ۵۲ توکن/ثانیه در نوشتن و ۱,۱۱۰ توکن/ثانیه در خواندن دارد، در حالی که نسخه Coder به ۴۴ توکن/ثانیه در نوشتن و ۱,۴۲۰ توکن/ثانیه در خواندن می‌رسد.

برای کاربران دارای RTX 3090 با ۲۴ گیگابایت حافظه، این سرعت می‌تواند به ۱۰۰ تا ۱۴۰ توکن در ثانیه افزایش یابد. لازم به ذکر است که اندازه‌گیری‌های NVIDIA با استفاده از موتور نسخه 0.1.36 برای Q2_0 و نسخه 0.1.26 برای سایر مدل‌ها، بر اساس پاسخ‌های 4K و پرامپت‌های 32K انجام شده است.

موتور استنتاج Strata: اجرای Qwen3.8-Flash-Next روی سخت‌افزار معمولی، نصب یک‌کلیکی ویندوز/لینوکس، API محلی OpenAI/Anthropic با

انتخاب مدل و بهینه‌سازی

Strata نسخه‌های مختلفی از Qwen3.8-Flash-Next را بر اساس رم سیستم پیشنهاد می‌دهد. نصب‌کننده بر اساس سخت‌افزار شما اندازه مناسب را توصیه می‌کند:

  • ۳۲ گیگابایت رم: نسخه Coder توصیه می‌شود. این نسخه در ۳۲ گیگابایت جا می‌شود و برای کدنویسی بهینه شده است. (اگر کارت گرافیک ۲۴ گیگابایتی دارید، مدل‌های Q2_0 و IQ2_XS نیز اجرا می‌شوند).
  • ۴۸ گیگابایت رم: نسخه IQ2_XS (یا Q2_0 برای حداکثر سرعت) توصیه می‌شود، زیرا اندازه‌های بزرگ‌تر در این مقدار رم جا نمی‌شوند.
  • ۶۴ گیگابایت رم: نسخه IQ2_XS توصیه می‌شود، هرچند IQ3_XXS و IQ3_S نیز قابل اجرا هستند. مدل IQ3_S هوشمندترین اما کندترین گزینه است. این رویکرد بهینه‌سازی حافظه با استراتژی‌های انویدیا برای عرضه سخت‌افزارهای تخصصی جهت اجرای عامل‌های محلی همسو است تا پردازش‌های سنگین از سرورهای ابری به دسکتاپ منتقل شوند.
  • ۹۶ گیگابایت رم و بیشتر: نسخه IQ3_S یا مدل ۴ بیتی Unsloth UD-IQ4_XS توصیه می‌شود تا فضای کافی برای اجرای سایر برنامه‌ها در کنار مدل وجود داشته باشد.

برخی نسخه‌های خاص شامل موارد زیر است:

  • Coder: یک نسخه مخصوص کدنویسی که نیمی از خبره‌ها را حذف کرده است. این مدل به ۹۱٪ امتیاز SWE-bench Verified مدل کامل می‌رسد اما در وظایف غیربرنامه‌نویسی، از جمله متون چینی و CJK، ضعیف‌تر است.
  • Swift 1.5: یک مدل با تنظیم دقیق (Fine-tuning) — شبیه دادن تخصص پوست به یک پزشک عمومی — که زمان تفکر قبل از پاسخ را کاهش داده تا پاسخ‌ها با کیفیتی مشابه اما سریع‌تر برسند.
  • Unsloth UD-IQ4_XS: یک نسخه تقریباً ۴ بیتی با حجم دانلود ۹۴ گیگابایت. اگر کمتر از ۸۰ گیگابایت رم داشته باشید، Strata بخشی از آن را از SSD می‌خواند که مگر در صورت استفاده از NVMe SSD، سرعت کمتری دارد.
  • Unsloth UD-Q4_K_XL: یک نسخه آزمایشی که نزدیک‌ترین حالت به مدل کامل است. چون بیشتر داده‌ها از SSD خوانده می‌شوند، روی یک PC با ۶۴ گیگابایت رم تنها ۷ تا ۸.۵ توکن در ثانیه می‌نویسد.
  • OrcaRouter's Uncensored IQ3_XXS: یک گزینه برای نصب دستی که در منوی نصب‌کننده وجود ندارد.

نصب و یکپارچه‌سازی

نصب Strata از طریق فایل‌های START-HERE.bat در ویندوز یا setup.sh در لینوکس به‌صورت تک‌کلیکی انجام می‌شود. نصب‌کننده به‌طور خودکار سخت‌افزار را شناسایی کرده و بهینه ترین اندازه مدل را پیشنهاد می‌دهد. کاربران حتی می‌توانند از دستیارهای کدنویسی مانند Claude Code، Cursor، Codex یا GitHub Copilot برای مدیریت نصب استفاده کنند؛ کافی است پرامپتی را که آن‌ها را به مخزن گیت‌هاب Strata و فایل docs/AI_SETUP.md ارجاع می‌دهد، برای آن‌ها ارسال کنید.

در طول نصب، سیستم مدل را دانلود می‌کند (حدود ۷۰ گیگابایت). اگر دانلود متوقف شود، اجرای مجدد نصب‌کننده باعث ادامه دانلود از همان نقطه می‌شود. به نقل از توسعه‌دهندگان، در اولین اجرا ممکن است سیستم برای ۱ تا ۳ دقیقه کند یا غیرپاسخگو شود، زیرا Strata حدود ۳۵ تا ۵۵ گیگابایت داده را در رم بارگذاری کرده و بخشی از آن را برای GPU قفل می‌کند.

Strata با ارائه یک API سازگار با OpenAI در آدرس http://127.0.0.1:8080/v1 با جریان‌های کاری موجود یکپارچه می‌شود. این قابلیت اجازه می‌دهد تا ایجنت‌های کدنویسی مانند Claude Code، Cursor و GitHub Copilot به‌صورت محلی از آن تغذیه شوند. برای برنامه‌های مبتنی بر Anthropic، نقطه اتصال (Endpoint) http://127.0.0.1:8080/v1/messages است و برای Codex CLI و سایر برنامه‌های OpenAI Responses API از /v1/responses استفاده می‌شود.

همچنین یک سرور MCP در آن گنجانده شده است که به ابزارهای هوش مصنوعی اجازه می‌دهد موتور را به‌طور خودکار استارت یا استاپ کنند. برای دسترسی از راه دور از طریق گوشی یا یک PC دیگر، کاربران می‌توانند دستور START-HERE.bat --setup --host 0.0.0.0 --api-key <secret> را اجرا کنند.

موتور استنتاج Strata: اجرای Qwen3.8-Flash-Next روی سخت‌افزار معمولی، نصب یک‌کلیکی ویندوز/لینوکس، API محلی OpenAI/Anthropic با

سازوکارهای فنی

Strata برای حفظ سرعت از دو ترفند اصلی استفاده می‌کند. اول، سیستم «حدس بزن و چک کن» (guess-then-check) که در آن یک مدل کمکی کوچک کلمات بعدی را پیش‌بینی می‌کند و مدل بزرگ آن‌ها را به‌صورت دسته‌ای تایید می‌کند؛ این کار سرعت را ۱.۶ تا ۱.۸ برابر افزایش می‌دهد. دوم، پردازش متون طولانی در دسته‌های (Chunks) حداکثر ۸,۱۹۲ توکنی با سرعت بیش از ۱,۰۰۰ توکن در ثانیه است. اولین پیام یک چت به‌طور کامل در حدود ۱ دقیقه به ازای هر ۳۰,۰۰۰ توکن خوانده می‌شود، در حالی که پیام‌های بعدی در عرض چند ثانیه شروع می‌شوند.

این موتور از ورودی‌های تصویری (Multimodal) نیز پشتیبانی می‌کند. کاربران باید در هنگام نصب به سوال «?Images» پاسخ «Yes» بدهند. اگرچه این قابلیت به‌طور کلی پشتیبانی می‌شود، اما کارت‌های AMD در ویندوز هنوز قادر به خواندن تصاویر نیستند؛ در لینوکس، این کار از طریق پردازنده انجام می‌شود. این توانایی پردازش بصری در مدل‌های بزرگ، یادآور کارایی مدل‌های بینایی ۸ میلیاردی در استخراج اسناد است که نشان می‌دهد حتی مدل‌های کوچک‌تر نیز در تحلیل تصاویر پیشرفت‌های چشمگیری داشته‌اند.

سایر ویژگی‌های پیشرفته عبارت‌اند از:

  • تلاش برای استدلال (Reasoning Effort): کاربران می‌توانند بین سطوح تفکر «خاموش»، «کم»، «متوسط» یا «بالا» انتخاب کنند. حالت «خاموش» سریع‌ترین و حالت «بالا» برای سوالات پیچیده بهترین است.
  • چند GPU (Multi-GPU): دو یا سه کارت گرافیک می‌توانند بار مدل را به اشتراک بگذارند تا عملکرد افزایش یابد.
  • موازی‌سازی (Parallelism): به‌طور پیش‌فرض، Strata در هر لحظه به یک درخواست پاسخ می‌دهد. تنظیم مقدار parallel: 2 اجازه پاسخ‌های همزمان را می‌دهد، هرچند این کار سرعت هر پاسخ را در کارت‌های ۱۲ گیگابایتی کاهش می‌دهد.
  • سازگاری: پشتیبانی آزمایشی برای GPUهای قدیمی‌تر (Tesla P40/V100, GTX 10, Radeon VII/MI50, RX 6700 XT, RX 5500 XT) و Intel Arc (ساخت از سورس در لینوکس) وجود دارد. CPUهای قدیمی بدون AVX2 نیز کار می‌کنند اما سرعت بسیار کمی دارند.

عیب‌یابی و نگهداری

مشکلات رایج در فایل docs/TROUBLESHOOTING.md بررسی شده‌اند. اگر سیستم در اولین اجرا هنگ کرد، توصیه می‌شود ۱۰ دقیقه صبر کنید و سپس ری‌استارت کنید. کندی شدید یا توقف غیرمنتظره موتور معمولاً نشانه کمبود رم آزاد است؛ بستن مرورگرها یا انتخاب مدل‌های کوچک‌تر (مانند Q2_0 یا IQ2_XS) معمولاً این مشکل را حل می‌کند. اگر پورت ۸۰۸۰ در حال استفاده است، به این معناست که Strata در حال حاضر در حال اجراست.

به‌روزرسانی‌ها را می‌توان بدون استارت کردن مدل و از طریق فایل UPDATE.bat یا ./update.sh انجام داد. برای مشکلات پایدار، کاربران می‌توانند فایل strata-<model>.log را به یک Issue در گیت‌هاب پیوست کنند.

این چرخش به سمت استنتاج ترکیبی به این معناست که «دیوار VRAM» دیگر مانعی مطلق برای اجرای مدل‌های پیشرو نیست. با تبدیل رم سیستم و SSDهای NVMe به لایه‌های حافظه کمکی، یک سیستم گیمینگ معمولی به یک ایستگاه کاری هوش مصنوعی تبدیل می‌شود.

برای کاربر نهایی، این یعنی حریم خصوصی کامل و حذف هزینه‌های اشتراکی برای مدلی که می‌تواند کدهای پیچیده بنویسد و تصاویر را تحلیل کند. توانایی اجرای یک مدل ۱۲۵ میلیارد پارامتری به‌صورت محلی، تحلیل هزینه-فایده را برای توسعه‌دهندگانی که پیش از این برای کارهای استدلالی پیچیده به APIهای ابری گران‌قیمت وابسته بودند، به‌کلی تغییر می‌دهد.

کاربران اکنون می‌توانند با دانلود مخزن از گیت‌هاب و انتخاب اندازه مدل متناسب با ظرفیت رم خود، محدودیت‌های سخت‌افزاری‌شان را به چالش بکشند.

گام بعدی شما

  • مخزن Strata را از گیت‌هاب دانلود کرده و بر اساس میزان رم سیستم خود، مدل مناسب را انتخاب کنید.
  • اگر توسعه‌دهنده هستید، API محلی آن را به Cursor یا Claude Code متصل کنید تا هزینه‌های توکن ابری را حذف کنید.
  • برای حداکثر سرعت، مدل را روی یک درایو NVMe SSD نصب کنید تا زمان بارگذاری اولیه کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر تخصص در مدیریت حافظه ترکیبی، دسترسی به مدل‌های ۱۲۵ میلیارد پارامتری را دموکراتیزه می‌کند. در نتیجه، وابستگی توسعه‌دهندگان به زیرساخت‌های ابری کاهش یافته و حریم خصوصی داده‌ها در سطح محلی تضمین می‌شود.

تأثیر برای ایران

این ابزار برای توسعه‌دهندگان ایرانی که با محدودیت‌های پرداخت ارزی و تحریم APIهای ابری مواجه‌اند، راهکاری حیاتی برای اجرای مدل‌های سطح اول به‌صورت رایگان و محلی است.

·نگاه ما
تحریریه دات‌هوش

Strata با جابه‌جایی مرکز ثقل حافظه از VRAM به RAM و SSD، عملاً مفهوم «سخت‌افزار مورد نیاز» را بازتعریف می‌کند. این رویکرد نشان می‌دهد که بهینه‌سازی نرم‌افزاری در مدیریت حافظه می‌تواند اثر سخت‌افزارهای گران‌قیمت سازمانی را خنثی کند. به نظر ما، این اولین قدم جدی برای تبدیل PCهای خانگی به گره‌های پردازشی مدل‌های عظیم است، به شرطی که پهنای باند SSDها در آینده بیشتر شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.