پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه TensorSharp سرعت استنتاج DeepSeek را در محیط‌های توزیع‌شده بالا برد؟

·۱۰ مرداد ۱۴۰۵۱ دقیقه مطالعه۲ بازدید
مقایسه عملکرد TensorSharp و llama.cpp در اجرای مدل Deepseek v4 Flash 0731 GGUF
مقایسه عملکرد TensorSharp و llama.cpp در اجرای مدل Deepseek v4 Flash 0731 GGUF
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به سرعت ۸۳۶ توکن در ثانیه در محیط .NET برای مدل‌های GGUF؛ این اولین بار است که یک موتور بومی دات‌نت در مقیاس چند-GPU به‌طور ملموس از استاندارد صنعتی (llama.cpp) پیشی می‌گیرد.

اگر توسعه‌دهنده‌ای هستید که برای اجرای مدل‌های زبانی روی سخت‌افزارهای محلی از اکوسیستم .NET استفاده می‌کنید، احتمالاً با گلوگاه‌های شدید سرعت در کتابخانه‌های موجود دست‌وپنجه نرم کرده‌اید. حالا TensorSharp با ارائه داده‌های جدید، ادعا می‌کند که می‌تواند این معادله را به‌نفع سرعت تغییر دهد.

طبق اعلام تیم توسعه، TensorSharp — یک موتور استنتاج (Inference) بومی در دات‌نت که شبیه به یک آشپزخانه صنعتی است و هرچه دستور پخت سنگین‌تر باشد، کرایه هر وعده را با بهینه‌سازی کم می‌کند — در مقایسه با لاماسی‌پلاس‌پلاس (llama.cpp) برتری چشمگیری دارد. این موتور از بک‌اندهای متنوعی مثل CUDA، Vulkan و Metal پشتیبانی می‌کند و قابلیت‌هایی نظیر دسته‌بندی پیوسته (Continuous Batching) و رمزگشایی گمانه‌زنانه (Speculative Decoding) را در اختیار کاربر قرار می‌دهد.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، مدیریت حافظه در محیط‌های چند-GPU همواره یک چالش بوده است. در همین راستا، ابزارهایی مانند TileLang با هدف حذف مدیریت دستی حافظه تلاش می‌کنند تا پیچیدگی‌های کامپایل کرنل‌های GPU را کاهش دهند. بر اساس مستندات منتشر شده، در آزمونی با مدل DeepSeek-V4-Flash-0731 روی چهار پردازنده Nvidia A40 و نسخه CUDA 12.8، نتایج خیره‌کننده‌ای به دست آمد:

  • در تست‌های پیش‌پُرکردن (Prefill) برای ۱۶ هزار توکن، بک‌اند CUDA در TensorSharp به سرعت ۸۳۶ توکن (Token) در ثانیه رسید.
  • در مقابل، سرعت در llama.cpp تنها ۵۵۸ توکن در ثانیه بود.
  • سرعت رمزگشایی نیز در توالی‌های کوتاه و بلند، در TensorSharp به‌طور مداوم بالاتر بود.

به گزارش توسعه‌دهندگان، ادغام ابزار DSpark برای رمزگشایی گمانه‌زنانه — که شبیه به پیش‌بینی جملات توسط یک دستیار سریع است تا مدل اصلی فقط آن‌ها را تایید کند — سرعت تولید متن را تا ۲.۰۳ برابر در پردازش اسناد ۱۰ هزار توکنی افزایش داده است. این رویکرد بهینه‌سازی یادآور دستاورد‌های اخیر در DGX Spark است که سرعت استنتاج مدل Qwen3.5 را به طور قابل توجهی ارتقا داد. نرخ پذیرش در این حالت تا ۸۵٪ می‌رسد و برای متون کوتاه‌تر، افزایش سرعت حدود ۱.۷۴ برابر است.

این نتایج نشان می‌دهد که TensorSharp در حال تبدیل شدن به جایگزینی جدی برای کسانی است که به دنبال استقرار مدل‌های زبانی بزرگ در محیط‌های سازمانی .NET هستند. این پروژه اکنون به‌صورت متن‌باز در گیت‌هاب در دسترس است و تیم سازنده به‌دنبال بازخوردهای جامعه برای پایداری بیشتر در محیط‌های توزیع‌شده است.

گام بعدی شما

  • اگر از مدل‌های GGUF در محیط دات‌نت استفاده می‌کنید، TensorSharp را با llama.cpp در سناریوهای واقعی خود مقایسه کنید.
  • برای افزایش سرعت تولید متن در اسناد طولانی، مکانیزم DSpark را فعال کنید.
  • مستندات توزیع مدل روی چندین GPU را در گیت‌هاب پروژه بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ اثر بهینه‌سازی‌های نرم‌افزاری بر مصرف VRAM را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این پیشرفت بر اساس تخصص در معماری سیستم‌های توزیع‌شده، هزینه و زمان استنتاج را برای سازمان‌هایی که زیرساخت .NET دارند به‌شدت کاهش می‌دهد. در نتیجه، استقرار مدل‌های غول‌پیکر مثل DeepSeek در محیط‌های محلی (On-premises) اقتصادی‌تر می‌شود.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در محیط‌های سازمانی از دات‌نت استفاده می‌کنند، این ابزار امکان اجرای مدل‌های قدرتمند را بدون نیاز به APIهای گران‌قیمت و تحریم‌شده فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی llama.cpp با موتورهای بومی مثل TensorSharp نشان می‌دهد که عصر «یک ابزار برای همه» در استنتاج محلی به پایان رسیده است. تمرکز بر بهینه‌سازی‌های خاصِ هر زبان برنامه‌نویسی (در اینجا .NET) می‌تواند شکاف عملکردی را که پیش‌تر فقط با سخت‌افزارهای گران‌تر پر می‌شد، با کدنویسی بهینه پر کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.