تصور کنید یک سیستم گیمینگ معمولی با کارت گرافیک RTX 5070 بتواند مدلهای هوش مصنوعی با ۱۲۵ میلیارد پارامتر را بهصورت کاملاً محلی اجرا کند. این رویایی که تا پیش از این به سرورهای صنعتی محدود بود، اکنون با معرفی Strata به واقعیت تبدیل شده است.
Strata یک موتور استنتاج (Inference) — شبیه به لحظه آشپزی واقعی بعد از یادگیری دستور پخت — است که در ۴ اکتبر ۲۰۲۶ منتشر شد. این ابزار متنباز به مدل Qwen3.8-Flash-Next اجازه میدهد تا با دور زدن محدودیتهای سنتی حافظه ویدیویی (VRAM)، روی سختافزارهای مصرفکننده اجرا شود. این مدل در واقع تکاملیافتهی خانواده مدلهای Qwen است که علیبابا پیشتر با کاهش شدید هزینههای API مدلهای چندوجهی خود، دسترسی به این فناوری را تسهیل کرده بود.
بیشتر مدلهای مقیاسبزرگ برای اجرا به سرورهای سازمانی با صدها گیگابایت حافظه گرافیکی نیاز دارند و این موضوع برای کاربران عادی یک سقف سخت ایجاد کرده بود. همانطور که در تحلیل قبلی ما دربارهی حملات زنجیره تأمین و توقف GPT-6.1 Astra اشاره کردیم، روند صنعت اکنون به سمت آوردن هوش مصنوعی عظیم به لبه (Edge) در حال حرکت است تا دسترسی به هوش سطح بالا برای همه فراهم شود.
طبق مستندات Strata، این موتور شکاف حافظه را با یک معماری ترکیبی حل میکند. در این سیستم، PC مانند یک آشپزخانه مدیریت میشود: دادههای پرکاربرد روی «میز کار» (VRAM) میمانند و بقیه در «انباری» (RAM و SSD) منتظر میمانند. این مدل از ۲۴,۵۷۶ متخصص کوچک یا «خبره» تشکیل شده است، اما برای تولید هر کلمه تنها به حدود ۱۰ مورد از آنها نیاز است و نیازی نیست کل مدل همزمان در حافظه گرافیکی باشد.
الزامات سختافزاری و عملکرد
برای اجرای Strata، کاربر به کارت گرافیکی با حداقل ۱۲ گیگابایت VRAM نیاز دارد. سختافزارهای پشتیبانیشده عبارتاند از:
- NVIDIA: سریهای GeForce RTX 20, 30, 40 یا 50.
- AMD: مدلهای Radeon RX 7900 XT / XTX، سری RX 7800 XT / 7700 XT، مدلهای جدید RX 9060 XT و RX 9070 / 9070 XT، Radeon AI PRO R9700 و سری RX 6800 / 6900.
- رم سیستم: حداقل ۳۲ گیگابایت. برای اجرای تمامی اندازههای موجود مدل، ۶۴ گیگابایت رم توصیه میشود.
- فضای ذخیرهسازی: حدود ۸۰ گیگابایت فضای خالی. استفاده از SSD بهشدت توصیه میشود زیرا سرعت اولین اجرا را بهطور قابلتوجهی افزایش میدهد.
- سیستمعامل: ویندوز ۱۰ / ۱۱ یا لینوکس با درایورهای گرافیکی بهروز.
بر اساس گزارشهای عملکردی، سرعت خروجی به سطح کوانتیزاسیون (Quantization) بستگی دارد. روی یک سیستم با RTX 5070 (۱۲ گیگابایت VRAM) و پردازنده Ryzen 5 7600 با ۶۴ گیگابایت رم، مدل Q2_0 با سرعت ۹۴ توکن (Token) — تکههای کوچک متن شبیه برشهای کیک — در ثانیه مینویسد و پرامپتها را با سرعت ۲,۶۵۰ توکن در ثانیه میخواند. سایر پیکربندیها روی همین سختافزار عبارتاند از: مدل IQ2_XS (۷۹ توکن/ثانیه نوشتن، ۲,۰۹۰ توکن/ثانیه خواندن)، مدل IQ3_XXS (۶۲ توکن/ثانیه نوشتن، ۱,۷۵۰ توکن/ثانیه خواندن) و مدل IQ3_S (۵۳ توکن/ثانیه نوشتن، ۱,۶۲۰ توکن/ثانیه خواندن). نسخه Coder در این سیستم به سرعت ۵۵ توکن/ثانیه در نوشتن و ۲,۱۸۰ توکن/ثانیه در خواندن میرسد.
در سختافزار AMD RX 9070 XT با ۱۶ گیگابایت VRAM، پردازنده Ryzen 9 3900X و ۴۷ گیگابایت رم، مدل Q2_0 با سرعت ۶۰ توکن/ثانیه مینویسد و ۱,۱۶۰ توکن/ثانیه میخواند. مدل IQ2_XS سرعت ۵۲ توکن/ثانیه در نوشتن و ۱,۱۱۰ توکن/ثانیه در خواندن دارد، در حالی که نسخه Coder به ۴۴ توکن/ثانیه در نوشتن و ۱,۴۲۰ توکن/ثانیه در خواندن میرسد.
برای کاربران دارای RTX 3090 با ۲۴ گیگابایت حافظه، این سرعت میتواند به ۱۰۰ تا ۱۴۰ توکن در ثانیه افزایش یابد. لازم به ذکر است که اندازهگیریهای NVIDIA با استفاده از موتور نسخه 0.1.36 برای Q2_0 و نسخه 0.1.26 برای سایر مدلها، بر اساس پاسخهای 4K و پرامپتهای 32K انجام شده است.

انتخاب مدل و بهینهسازی
Strata نسخههای مختلفی از Qwen3.8-Flash-Next را بر اساس رم سیستم پیشنهاد میدهد. نصبکننده بر اساس سختافزار شما اندازه مناسب را توصیه میکند:
- ۳۲ گیگابایت رم: نسخه Coder توصیه میشود. این نسخه در ۳۲ گیگابایت جا میشود و برای کدنویسی بهینه شده است. (اگر کارت گرافیک ۲۴ گیگابایتی دارید، مدلهای Q2_0 و IQ2_XS نیز اجرا میشوند).
- ۴۸ گیگابایت رم: نسخه IQ2_XS (یا Q2_0 برای حداکثر سرعت) توصیه میشود، زیرا اندازههای بزرگتر در این مقدار رم جا نمیشوند.
- ۶۴ گیگابایت رم: نسخه IQ2_XS توصیه میشود، هرچند IQ3_XXS و IQ3_S نیز قابل اجرا هستند. مدل IQ3_S هوشمندترین اما کندترین گزینه است. این رویکرد بهینهسازی حافظه با استراتژیهای انویدیا برای عرضه سختافزارهای تخصصی جهت اجرای عاملهای محلی همسو است تا پردازشهای سنگین از سرورهای ابری به دسکتاپ منتقل شوند.
- ۹۶ گیگابایت رم و بیشتر: نسخه IQ3_S یا مدل ۴ بیتی Unsloth UD-IQ4_XS توصیه میشود تا فضای کافی برای اجرای سایر برنامهها در کنار مدل وجود داشته باشد.
برخی نسخههای خاص شامل موارد زیر است:
- Coder: یک نسخه مخصوص کدنویسی که نیمی از خبرهها را حذف کرده است. این مدل به ۹۱٪ امتیاز SWE-bench Verified مدل کامل میرسد اما در وظایف غیربرنامهنویسی، از جمله متون چینی و CJK، ضعیفتر است.
- Swift 1.5: یک مدل با تنظیم دقیق (Fine-tuning) — شبیه دادن تخصص پوست به یک پزشک عمومی — که زمان تفکر قبل از پاسخ را کاهش داده تا پاسخها با کیفیتی مشابه اما سریعتر برسند.
- Unsloth UD-IQ4_XS: یک نسخه تقریباً ۴ بیتی با حجم دانلود ۹۴ گیگابایت. اگر کمتر از ۸۰ گیگابایت رم داشته باشید، Strata بخشی از آن را از SSD میخواند که مگر در صورت استفاده از NVMe SSD، سرعت کمتری دارد.
- Unsloth UD-Q4_K_XL: یک نسخه آزمایشی که نزدیکترین حالت به مدل کامل است. چون بیشتر دادهها از SSD خوانده میشوند، روی یک PC با ۶۴ گیگابایت رم تنها ۷ تا ۸.۵ توکن در ثانیه مینویسد.
- OrcaRouter's Uncensored IQ3_XXS: یک گزینه برای نصب دستی که در منوی نصبکننده وجود ندارد.
نصب و یکپارچهسازی
نصب Strata از طریق فایلهای START-HERE.bat در ویندوز یا setup.sh در لینوکس بهصورت تککلیکی انجام میشود. نصبکننده بهطور خودکار سختافزار را شناسایی کرده و بهینه ترین اندازه مدل را پیشنهاد میدهد. کاربران حتی میتوانند از دستیارهای کدنویسی مانند Claude Code، Cursor، Codex یا GitHub Copilot برای مدیریت نصب استفاده کنند؛ کافی است پرامپتی را که آنها را به مخزن گیتهاب Strata و فایل docs/AI_SETUP.md ارجاع میدهد، برای آنها ارسال کنید.
در طول نصب، سیستم مدل را دانلود میکند (حدود ۷۰ گیگابایت). اگر دانلود متوقف شود، اجرای مجدد نصبکننده باعث ادامه دانلود از همان نقطه میشود. به نقل از توسعهدهندگان، در اولین اجرا ممکن است سیستم برای ۱ تا ۳ دقیقه کند یا غیرپاسخگو شود، زیرا Strata حدود ۳۵ تا ۵۵ گیگابایت داده را در رم بارگذاری کرده و بخشی از آن را برای GPU قفل میکند.
Strata با ارائه یک API سازگار با OpenAI در آدرس http://127.0.0.1:8080/v1 با جریانهای کاری موجود یکپارچه میشود. این قابلیت اجازه میدهد تا ایجنتهای کدنویسی مانند Claude Code، Cursor و GitHub Copilot بهصورت محلی از آن تغذیه شوند. برای برنامههای مبتنی بر Anthropic، نقطه اتصال (Endpoint) http://127.0.0.1:8080/v1/messages است و برای Codex CLI و سایر برنامههای OpenAI Responses API از /v1/responses استفاده میشود.
همچنین یک سرور MCP در آن گنجانده شده است که به ابزارهای هوش مصنوعی اجازه میدهد موتور را بهطور خودکار استارت یا استاپ کنند. برای دسترسی از راه دور از طریق گوشی یا یک PC دیگر، کاربران میتوانند دستور START-HERE.bat --setup --host 0.0.0.0 --api-key <secret> را اجرا کنند.

سازوکارهای فنی
Strata برای حفظ سرعت از دو ترفند اصلی استفاده میکند. اول، سیستم «حدس بزن و چک کن» (guess-then-check) که در آن یک مدل کمکی کوچک کلمات بعدی را پیشبینی میکند و مدل بزرگ آنها را بهصورت دستهای تایید میکند؛ این کار سرعت را ۱.۶ تا ۱.۸ برابر افزایش میدهد. دوم، پردازش متون طولانی در دستههای (Chunks) حداکثر ۸,۱۹۲ توکنی با سرعت بیش از ۱,۰۰۰ توکن در ثانیه است. اولین پیام یک چت بهطور کامل در حدود ۱ دقیقه به ازای هر ۳۰,۰۰۰ توکن خوانده میشود، در حالی که پیامهای بعدی در عرض چند ثانیه شروع میشوند.
این موتور از ورودیهای تصویری (Multimodal) نیز پشتیبانی میکند. کاربران باید در هنگام نصب به سوال «?Images» پاسخ «Yes» بدهند. اگرچه این قابلیت بهطور کلی پشتیبانی میشود، اما کارتهای AMD در ویندوز هنوز قادر به خواندن تصاویر نیستند؛ در لینوکس، این کار از طریق پردازنده انجام میشود. این توانایی پردازش بصری در مدلهای بزرگ، یادآور کارایی مدلهای بینایی ۸ میلیاردی در استخراج اسناد است که نشان میدهد حتی مدلهای کوچکتر نیز در تحلیل تصاویر پیشرفتهای چشمگیری داشتهاند.
سایر ویژگیهای پیشرفته عبارتاند از:
- تلاش برای استدلال (Reasoning Effort): کاربران میتوانند بین سطوح تفکر «خاموش»، «کم»، «متوسط» یا «بالا» انتخاب کنند. حالت «خاموش» سریعترین و حالت «بالا» برای سوالات پیچیده بهترین است.
- چند GPU (Multi-GPU): دو یا سه کارت گرافیک میتوانند بار مدل را به اشتراک بگذارند تا عملکرد افزایش یابد.
- موازیسازی (Parallelism): بهطور پیشفرض، Strata در هر لحظه به یک درخواست پاسخ میدهد. تنظیم مقدار
parallel: 2اجازه پاسخهای همزمان را میدهد، هرچند این کار سرعت هر پاسخ را در کارتهای ۱۲ گیگابایتی کاهش میدهد. - سازگاری: پشتیبانی آزمایشی برای GPUهای قدیمیتر (Tesla P40/V100, GTX 10, Radeon VII/MI50, RX 6700 XT, RX 5500 XT) و Intel Arc (ساخت از سورس در لینوکس) وجود دارد. CPUهای قدیمی بدون AVX2 نیز کار میکنند اما سرعت بسیار کمی دارند.
عیبیابی و نگهداری
مشکلات رایج در فایل docs/TROUBLESHOOTING.md بررسی شدهاند. اگر سیستم در اولین اجرا هنگ کرد، توصیه میشود ۱۰ دقیقه صبر کنید و سپس ریاستارت کنید. کندی شدید یا توقف غیرمنتظره موتور معمولاً نشانه کمبود رم آزاد است؛ بستن مرورگرها یا انتخاب مدلهای کوچکتر (مانند Q2_0 یا IQ2_XS) معمولاً این مشکل را حل میکند. اگر پورت ۸۰۸۰ در حال استفاده است، به این معناست که Strata در حال حاضر در حال اجراست.
بهروزرسانیها را میتوان بدون استارت کردن مدل و از طریق فایل UPDATE.bat یا ./update.sh انجام داد. برای مشکلات پایدار، کاربران میتوانند فایل strata-<model>.log را به یک Issue در گیتهاب پیوست کنند.
این چرخش به سمت استنتاج ترکیبی به این معناست که «دیوار VRAM» دیگر مانعی مطلق برای اجرای مدلهای پیشرو نیست. با تبدیل رم سیستم و SSDهای NVMe به لایههای حافظه کمکی، یک سیستم گیمینگ معمولی به یک ایستگاه کاری هوش مصنوعی تبدیل میشود.
برای کاربر نهایی، این یعنی حریم خصوصی کامل و حذف هزینههای اشتراکی برای مدلی که میتواند کدهای پیچیده بنویسد و تصاویر را تحلیل کند. توانایی اجرای یک مدل ۱۲۵ میلیارد پارامتری بهصورت محلی، تحلیل هزینه-فایده را برای توسعهدهندگانی که پیش از این برای کارهای استدلالی پیچیده به APIهای ابری گرانقیمت وابسته بودند، بهکلی تغییر میدهد.
کاربران اکنون میتوانند با دانلود مخزن از گیتهاب و انتخاب اندازه مدل متناسب با ظرفیت رم خود، محدودیتهای سختافزاریشان را به چالش بکشند.
گام بعدی شما
- مخزن Strata را از گیتهاب دانلود کرده و بر اساس میزان رم سیستم خود، مدل مناسب را انتخاب کنید.
- اگر توسعهدهنده هستید، API محلی آن را به Cursor یا Claude Code متصل کنید تا هزینههای توکن ابری را حذف کنید.
- برای حداکثر سرعت، مدل را روی یک درایو NVMe SSD نصب کنید تا زمان بارگذاری اولیه کاهش یابد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو