اگر توسعهدهندهای هستید که برای اجرای مدلهای زبانی روی سختافزارهای محلی از اکوسیستم .NET استفاده میکنید، احتمالاً با گلوگاههای شدید سرعت در کتابخانههای موجود دستوپنجه نرم کردهاید. حالا TensorSharp با ارائه دادههای جدید، ادعا میکند که میتواند این معادله را بهنفع سرعت تغییر دهد.
طبق اعلام تیم توسعه، TensorSharp — یک موتور استنتاج (Inference) بومی در داتنت که شبیه به یک آشپزخانه صنعتی است و هرچه دستور پخت سنگینتر باشد، کرایه هر وعده را با بهینهسازی کم میکند — در مقایسه با لاماسیپلاسپلاس (llama.cpp) برتری چشمگیری دارد. این موتور از بکاندهای متنوعی مثل CUDA، Vulkan و Metal پشتیبانی میکند و قابلیتهایی نظیر دستهبندی پیوسته (Continuous Batching) و رمزگشایی گمانهزنانه (Speculative Decoding) را در اختیار کاربر قرار میدهد.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای بازمتن اشاره کردیم، مدیریت حافظه در محیطهای چند-GPU همواره یک چالش بوده است. در همین راستا، ابزارهایی مانند TileLang با هدف حذف مدیریت دستی حافظه تلاش میکنند تا پیچیدگیهای کامپایل کرنلهای GPU را کاهش دهند. بر اساس مستندات منتشر شده، در آزمونی با مدل DeepSeek-V4-Flash-0731 روی چهار پردازنده Nvidia A40 و نسخه CUDA 12.8، نتایج خیرهکنندهای به دست آمد:
- در تستهای پیشپُرکردن (Prefill) برای ۱۶ هزار توکن، بکاند CUDA در TensorSharp به سرعت ۸۳۶ توکن (Token) در ثانیه رسید.
- در مقابل، سرعت در llama.cpp تنها ۵۵۸ توکن در ثانیه بود.
- سرعت رمزگشایی نیز در توالیهای کوتاه و بلند، در TensorSharp بهطور مداوم بالاتر بود.
به گزارش توسعهدهندگان، ادغام ابزار DSpark برای رمزگشایی گمانهزنانه — که شبیه به پیشبینی جملات توسط یک دستیار سریع است تا مدل اصلی فقط آنها را تایید کند — سرعت تولید متن را تا ۲.۰۳ برابر در پردازش اسناد ۱۰ هزار توکنی افزایش داده است. این رویکرد بهینهسازی یادآور دستاوردهای اخیر در DGX Spark است که سرعت استنتاج مدل Qwen3.5 را به طور قابل توجهی ارتقا داد. نرخ پذیرش در این حالت تا ۸۵٪ میرسد و برای متون کوتاهتر، افزایش سرعت حدود ۱.۷۴ برابر است.
این نتایج نشان میدهد که TensorSharp در حال تبدیل شدن به جایگزینی جدی برای کسانی است که به دنبال استقرار مدلهای زبانی بزرگ در محیطهای سازمانی .NET هستند. این پروژه اکنون بهصورت متنباز در گیتهاب در دسترس است و تیم سازنده بهدنبال بازخوردهای جامعه برای پایداری بیشتر در محیطهای توزیعشده است.
گام بعدی شما
- اگر از مدلهای GGUF در محیط داتنت استفاده میکنید، TensorSharp را با llama.cpp در سناریوهای واقعی خود مقایسه کنید.
- برای افزایش سرعت تولید متن در اسناد طولانی، مکانیزم DSpark را فعال کنید.
- مستندات توزیع مدل روی چندین GPU را در گیتهاب پروژه بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ اثر بهینهسازیهای نرمافزاری بر مصرف VRAM را در گزارش بعدی بررسی خواهیم کرد.




گفتگو