پرش به محتوای اصلی
پرش به محتوای مقاله

موتور FreeToken مدل ۷۵۳ میلیارد پارامتری GLM-5.2 را روی یک GPU اجرا کرد

·۱ شهریور ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
موتور سرویس‌دهی MoE بومی لبه که مدل ۷۵۳B GLM-5.2 را روی یک GPU ایستگاه کاری اجرا می‌کند
موتور سرویس‌دهی MoE بومی لبه که مدل ۷۵۳B GLM-5.2 را روی یک GPU ایستگاه کاری اجرا می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم q* برای توزیع پویا و تطبیقی محاسبات بین CPU و GPU بر اساس پهنای‌باند لحظه‌ای، که گلوگاه‌های قدیمی PCIe را در مدل‌های MoE دور می‌زند.

تصور کنید یک توسعه‌دهنده مستقل بتواند مدل‌های غول‌پیکری را که پیش‌تر فقط در دیتاسنترهای میلیاردی جای داشتند، روی یک ایستگاه کاری شخصی اجرا کند. این رویایی که تا پیش از این غیرممکن به نظر می‌رسید، اکنون با سرعت ۱۴.۹ توکن در ثانیه برای مدل ۷۵۳ میلیارد پارامتری GLM-5.2 به واقعیت تبدیل شده است.

به نقل از وب‌سایت Marktechpost در ۲۳ اوت ۲۰۲۶، این دستاورد فرضیه قدیمی را که مدل‌های پیشرو (Frontier-scale) حتماً به خوشه‌های عظیم پردازشی دیتاسنتر نیاز دارند تا کاربردی باشند، به چالش می‌کشد. واقعیت این است که بسیاری از مدل‌های وزن‌های باز (Open Weights) — یعنی مدل‌هایی که پارامترهای آن‌ها علناً منتشر شده تا هر کسی بتواند از آن‌ها استفاده کند — با مقیاسی عرضه می‌شوند که تعداد کمی از افراد توان مالی اجرای آن‌ها را دارند. مدل‌هایی مثل Kimi-K3، GLM-5.2 و DeepSeek-V4-Flash هرچند فاصله توانمندی با سیستم‌های انحصاری و تجاری را کم کرده‌اند، اما انتشار پارامترها تنها تعیین می‌کند که چه کسی می‌تواند مدل را «به دست آورد»، نه اینکه چه کسی توان «اجرای» آن را دارد. سرویس‌دهی به این مدل‌ها همچنان بر پایه فرض وجود خوشه‌های GPU در سطح دیتاسنتر است. با افزایش تقاضا برای استنتاج در بارهای کاری عامل‌محور (Agentic workloads)، این هزینه سنگین‌ترین فشار را بر توسعه‌دهندگان مستقل و تیم‌های کوچک وارد می‌کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی رایانش لبه و استفاده از Actorهای حالت‌دار توسط Telnyx برای APIهای لبه اشاره کردیم، صنعت به سمتی می‌رود که محاسبات سنگین را به کاربر نزدیک‌تر کند. در حال حاضر بیش از صد میلیون ماشین مصرف‌کننده دارای GPUهای مجزا هستند. تیم پژوهشی دانشگاه برکلی و تگزاس با معرفی FreeToken استدلال می‌کنند که قطعه گم‌شده، سخت‌افزار نیست، بلکه یک سیستم سرویس‌دهی (Serving System) است. هدف آن‌ها این است که یک سیستم شخصی را نه به عنوان یک GPU کوچک با حافظه VRAM محدود، بلکه به عنوان یک پلتفرم یکپارچه و منعطف ببینند که به طور مداوم محاسبات و وضعیت مدل را روی هر آنچه ماشین در اختیار دارد — اعم از GPU، CPU، حافظه RAM و پهنای‌باند interconnect — نگاشت می‌کند.

معماری FreeToken و حل معمای پراکندگی

FreeToken روی نقطه ضعف «پراکندگی» (Sparsity) ذاتی در مدل‌های ترکیب خبره‌ها (Mixture of Experts یا MoE) دست گذاشته است. در این مدل‌ها — که شبیه تیمی از متخصصان هستند که هر سوال را فقط به فرد خبره می‌سپارند — در هر لایه تنها بخش کوچکی از پارامترها فعال می‌شوند. برای مثال در DeepSeek-V4-Flash، از ۲۵۶ خبره مسیریابی شده، تنها ۶ مورد در هر یک از ۴۳ لایه فعال می‌شوند. این یعنی از ۲۸۴ میلیارد پارامتر، فقط ۱۳ میلیارد در تولید هر توکن نقش دارند و همین موضوع استنتاج محلی مدل‌های پیشرو را از نظر ریاضی ممکن می‌کند.

اما مشکل اینجاست که پراکندگی باعث کوچک شدن کل مجموعه خبره‌ها نمی‌شود. در دقت FP4، حجم کل مدل تقریباً ۱۴۰ گیگابایت است. خبره‌های غیرفعال باید در حافظه میزبان (Host Memory) قرار گیرند و در صورت نیاز وارد مسیر اجرا شوند. موتورهای فعلی مثل llama.cpp، Ollama و KTransformers اغلب شکست می‌خورند زیرا جایگذاری حافظه را به صورت ایستا (Static) مدیریت می‌کنند. تیم تحقیق سه نقطه شکست اصلی را در این موتورها شناسایی کردند:

  • تخریب پراکندگی در پیش‌پُرکردن: در مرحله پیش‌پُرکردن (Prefill) — یعنی لحظه‌ای که مدل متن ورودی را می‌خواند — هزاران توکن در هر لایه به تقریباً تمام مجموعه خبره‌ها مسیریابی می‌شوند. این امر باعث می‌شود یک پاس پیش‌پُرکردن مجبور شود کل مجموعه خبره‌ها را از طریق لینک PCIe استریم کند. این فرآیند روی یک RTX 5090 حدود دو ثانیه، روی دسکتاپ‌های PCIe 4.0 حدود پنج ثانیه و روی لینک‌های x8 رایج در لپ‌تاپ‌ها ده ثانیه یا بیشتر زمان می‌برد.

  • توزیع ایستای حافظه و ترافیک رمزگشایی: ابزارهایی مثل llama.cpp تانسورهای MoE را در زمان بارگذاری تخصیص می‌دهند، در حالی که KTransformers یک زیرمجموعه «داغ» (Hot) را پین می‌کند. چون مسیریابی در هر توکن تغییر می‌کند، اکثر ارزیابی‌های خبره به CPU می‌افتد در حالی که GPU و لینک PCIe بیکار می‌مانند.

  • گلوگاه CPU: پردازنده‌های مصرف‌کننده نمی‌توانند باقی‌مانده بار را تحمل کنند. حافظه DDR5 دوکاناله تنها ۸۰ تا ۹۰ گیگابایت بر ثانیه پهنای‌باند ارائه می‌دهد، در حالی که یک RTX 4090 یا 5090 از حافظه داخلی خود ۱ تا ۱.۸ ترابایت بر ثانیه سرعت می‌گیرد.

FreeToken برای حل این مشکلات سه مکانیزم اصلی معرفی کرده است:

۱. اجرای تطبیقی با پهنای‌باند (سیاست q):* به جای یک قانون آف‌لود ثابت، این سیستم پهنای‌باند واقعی PCIe و حافظه میزبان را با استفاده از دستور ft bench bw پروفایل می‌کند. چون انتقال‌های DMA و اجرای خبره‌ها در CPU از یک زیرسیستم حافظه میزبان استفاده می‌کنند، یک لینک PCIe اشباع شده، پهنای‌باند باقی‌مانده $B_H − B_P$ را بر جای می‌گذارد. FreeToken هر مرحله از $m$ خطای حافظه (Cache Miss) را بر این اساس تقسیم می‌کند: تعداد $q^* \approx m \times B_P / B_H$ خبره در کش GPU پر می‌شوند و بقیه در جای خود روی CPU محاسبه می‌گردند. این دو مجموع جزئی دقیقاً با هم ادغام می‌شوند بدون اینکه تخمینی زده شود یا مسیریاب تغییر کند. این موضوع حیاتی است زیرا نسبت‌های اندازه‌گیری شده $B_P:B_H$ به شدت متفاوت است؛ از ۵۲.۷:۷۷.۳ در یک سرور RTX 5090 تا ۱۱.۸:۴۷.۵ در یک لپ‌تاپ 4060.

۲. کشینگ معنایی (Semantic-Aware Caching): در مرحله پیش‌پُرکردن، از بافرینگ دوگانه لایه کامل استفاده می‌کند تا لایه $l+1$ را استریم کند در حالی که GPU لایه $l$ را محاسبه می‌کند. نقاط بازرسی وضعیت بازگشتی (Recurrent-state checkpoints) در مرز توکن‌های خاص — مانند بلوک‌های تفکر (Thinking blocks)، فراخوانی ابزارها و خروجی ابزارها — لنگر می‌اندازند. این دقیقاً همان جایی است که چارچوب‌های عامل‌محور متن را قطع می‌کنند و اجازه می‌دهد یک ویرایش تنها بخش جدید (Suffix) را مجدداً پیش‌پُر کند. در مرحله رمزگشایی (Decode)، یک کش خبره LRU مشترک که تمام لایه‌های MoE را در بر می‌گیرد، به جای جایگذاری ثابت در زمان بارگذاری، از مسیریاب پیروی می‌کند.

۳. مدیریت حافظه منعطف: در نقاط امن زمان‌بندی (Scheduler safe points)، کش خبره GPU تحت یک بودجه VRAM بازنگری شده، بدون نیاز به ری‌استارت موتور یا بارگذاری مجدد مجموعه میزبان، بازسازی می‌شود. خبره‌ها مستقیماً از دیسک به چیدمان نهایی میزبان خوانده شده و پین می‌شوند. هیچ گرم‌کردن (Warmup) برای GPU لازم نیست زیرا اولین درخواست با یک کش سرد (Cold cache) سرویس داده می‌شود.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

بنچمارک‌ها و عملکرد واقعی

روی یک کارت RTX 5090، FreeToken سرعت ۷۷ تا ۸۳ توکن در ثانیه را برای مدل Qwen3.6-35B-A3B (با دقت BF16) و ۲۲ تا ۲۵ توکن در ثانیه را برای DeepSeek-V4-Flash (با دقت MXFP4) حفظ می‌کند. این نشان‌دهنده افزایش سرعت ۱.۵ تا ۲.۳ برابری نسبت به قوی‌ترین خط‌های پایه (Baselines) است. علاوه بر این، سرعت رمزگشایی در سه بار کاری مختلف عامل‌محور، در محدوده ۱۲٪ نرخ تک-نوبتی (Single-turn) باقی می‌ماند.

تفاوت اصلی در زمان تا نخستین توکن (TTFT) است. FreeToken بدترین حالت TTFT را در تمام سلول‌های تست شده زیر ۴۴ ثانیه نگه می‌دارد. در مقابل، llama.cpp به ۲۳۲ ثانیه، Ollama به ۱۷۹ ثانیه و KTransformers در برخی تست‌های ماتریسی به ۹۴۶ ثانیه رسید؛ زمانی که بسیار فراتر از نقطه‌ای است که کلاینت‌های عامل‌محور معمولاً دچار Timeout می‌شوند.

بهره‌وری در مدیریت کش نیز مشهود است. در ظرفیت کش برابر (۳۷٪ از مجموعه Qwen3.6)، خطاهای LRU جهانی تنها ۱۶٪ از خواندن‌های خبره در زمان رمزگشایی را از دست می‌دهند، در حالی که این رقم برای KTransformers حدود ۴۱٪ و برای llama.cpp حدود ۶۲٪ است.

برای کسانی که سخت‌افزار ضعیف‌تری دارند، یک لپ‌تاپ با RTX 4060 و ۸ گیگابایت حافظه می‌تواند یک مدل ۳۵ میلیارد پارامتری را با سرعت ۳۹.۳ توکن در ثانیه سرویس دهد. روی یک تک کارت RTX PRO 6000، مدل ۷۵۳ میلیاردی GLM-5.2 (با ۴۰ میلیارد پارامتر فعال) با سرعت ۱۴.۹ توکن در ثانیه اجرا می‌شود که دو برابر سرعت ۷.۳ توکن در ثانیه در llama.cpp است.

استقرار و دسترسی

این پروژه تحت لایسنس Apache-2.0 منتشر شده و در گیت‌هاب و PyPI با نام freetoken v0.1.2 در دسترس است. کاربران می‌توانند آن را از طریق دستور uv pip install "freetoken[accel]" نصب کنند یا از اپلیکیشن دسکتاپ تک-کلیکی برای ویندوز و لینوکس در سایت flashml.ai استفاده کنند.

رابط خط فرمان (CLI) برای لینوکس x86_64 با GPUهای انویدیا و درایور r580+ (CUDA 13) طراحی شده است. این ابزار نقاط انتهایی (Endpoints) سازگار با OpenAI و Anthropic را روی پورت ۱۹۱۹ ارائه می‌دهد. دستور ft launch claude به کاربران اجازه می‌دهد تا ابزارهایی مثل Claude Code، Codex، OpenCode یا OpenClaw را به جای APIهای ابری، به ماشین محلی خود متصل کنند.

تحلیل تحریریه

این تغییر، مفهوم «مرز» (Frontier) را از ابر به ایستگاه کاری منتقل می‌کند. برای صنایعی مانند بهداشت و درمان، حقوق، دفاع و امور مالی، توانایی اجرای یک مدل ۷۰۰+ میلیارد پارامتری به صورت ایزوله (Air-gapped)، یک پیروزی بزرگ برای حریم خصوصی داده‌ها و تحقیق و توسعه‌های حساس به مالکیت معنوی (IP) است. این امر ریسک خروج داده‌های حساس یا قراردادها از ماشین برای یک API شخص ثالث را از بین می‌برد. کاربردهای رایج شامل عامل‌های کدنویسی محلی، بازبینی خصوصی کد، تحلیل آفلاین قراردادها، تولید داده‌های مصنوعی و ارزیابی‌های دسته‌ای (Batch evals) است.

با این حال، ادعای «تک GPU» نیاز به بررسی واقع‌بینانه دارد. در حالی که تنها از یک GPU برای محاسبات استفاده می‌شود، مدل ۷۵۳ میلیاردی به حافظه میزبان عظیمی نیاز دارد — تا ۵۱۲ گیگابایت DDR5 روی یک Xeon Platinum 8559C. پیکربندی «دسکتاپ گیمینگ» برای مدل ۲۸۴ میلیاردی به ۱۹۲ گیگابایت RAM نیاز دارد. این بدان معناست که اگرچه به خوشه GPU نیاز ندارید، اما همچنان به یک ایستگاه کاری رده‌بالا نیاز دارید، نه یک PC معمولی مصرف‌کننده.

همچنین نکاتی در مورد ادعاهای عملکرد وجود دارد. در حالی که سرعت ۳۹.۳ توکن در ثانیه روی لپ‌تاپ تحسین‌برانگیز است، این عدد از بیلد NVFP4 استفاده می‌کند. وقتی با میانگین رمزگشایی خالص Codex (۵۷.۱ توکن در ثانیه) مقایسه شود، تقریباً دو-سوم آن سرعت است، نه اینکه از آن پیشی بگیرد. علاوه بر این، تست‌های خط پایه برای KTransformers روی ۶ رشته CPU محدود شده بود تا میزبان‌های لبه شبیه‌سازی شوند، که کمتر از پیکربندی‌های چند-هسته‌ای AMX است که آن ابزار معمولاً هدف قرار می‌دهد.

برای توسعه‌دهنده تک‌نفره، استارتاپ‌ها یا تیم‌های مهندسی SMB که صورت‌حساب توکن‌های عامل‌محورشان از هزینه خرید یک GPU بیشتر شده است، این فناوری عملاً «صورت‌حساب توکن» را می‌کشد. اگر در حال حاضر یک GPU رده‌بالا دارید، هزینه استنتاج تقریباً به صفر می‌رسد و مزیت اقتصادی از ارائه‌دهندگان API به سمت اپراتور محلی تغییر می‌کند.

گام بعدی شما

  • اگر کارت گرافیک سری ۴۰ یا ۵۰ انویدیا دارید، کتابخانه freetoken را نصب کنید تا مدل‌های MoE را با سرعت واقعی تجربه کنید.
  • برای کاهش هزینه‌های API، گردش‌کارهای عامل‌محور خود را روی مدل‌های محلی ۳۵ میلیاردی تست کنید.
  • بررسی کنید که آیا سیستم شما حافظه RAM کافی (حداقل ۱۹۲ گیگابایت برای مدل‌های متوسط) برای جایگزینی دیتاسنتر را دارد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در مدیریت حافظه، حریم خصوصی داده‌ها را در حوزه‌های حساس مثل پزشکی و دفاعی تضمین می‌کند. اکنون اجرای مدل‌های ۷۰۰ میلیاردی بدون خروج داده از محیط محلی، یک امکان عملی است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های پرداخت ارزی و تحریم APIهای پیشرو دست‌وپنجه نرم می‌کنند، این ابزار راهکاری برای اجرای مدل‌های سطح جهانی روی سخت‌افزارهای موجود در بازار داخلی است.

·نگاه ما
تحریریه دات‌هوش

انتقال مرز مدل‌های پیشرو از ابر به ایستگاه کاری، مدل اقتصادی APIهای تجاری را به شدت تهدید می‌کند. وقتی هزینه استنتاج برای تیم‌های مهندسی به نزدیک صفر برسد، مزیت رقابتی از ارائه‌دهندگان مدل به اپراتورهای محلی منتقل می‌شود. البته باید مراقب بود که «تک GPU» به معنای «PC معمولی» نیست و نیاز به RAMهای حجیم همچنان یک سد ورود است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.