پرش به محتوای اصلی
پرش به محتوای مقاله

Neutrino-1 8B: کاهش ۸ برابری حجم وزن‌ها با فرمت ترنری اختصاصی

·۶ مرداد ۱۴۰۵۷ دقیقه مطالعه۱ بازدید
لوگوی مدل زبانی Neutrino-1 8B با نماد نوترینو و اعداد ۸B
لوگوی مدل زبانی Neutrino-1 8B با نماد نوترینو و اعداد ۸B
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کوانتش‌های متداول با یک فرمت وزنی ترنری اختصاصی که در لایه کرنل رمزگشایی می‌شود و نیاز به تبدیل فایل برای سخت‌افزارهای مختلف (Mac/Nvidia/CPU) را حذف می‌کند.

۳.۸۸ گیگابایت؛ این عدد اکنون معیار جدیدی برای مدل‌های محلی با پارامترهای بالا است. مدل Neutrino-1 8B که در ۲۷ جولای ۲۰۲۶ توسط شرکت Fermion Research منتشر شد، ثابت می‌کند که یک مدل با این ابعاد می‌تواند بدون نیاز به چرخه‌های سنتی کوانتش، در حافظه یک لپ‌تاپ معمولی جای بگیرد. این مدل با بهره‌گیری از یک فرمت وزنی اختصاصی از خانواده ترنری (Ternary)، به‌عنوان یک مصنوع واحد عرضه شده است که قادر است هم در دسکتاپ‌ها و هم در مراکز داده سرویس‌دهی کند و به‌طور موثری «دیوار حافظه» را جابه‌جا نماید.

این دستاورد در زمانی رخ می‌دهد که صنعت برای ایجاد تعادل بین هوشمندی مدل‌های بزرگ و محدودیت‌های سخت‌گیرانه حافظه تصویری (VRAM) در دستگاه‌های لبه در کلنجار است. در حال حاضر بیشتر توسعه‌دهندگان به کوانتش‌های GGUF یا EXL2 متکی هستند که معمولاً پس از آموزش مدل انجام می‌شوند. Neutrino-1 با ادغام فرمت وزنی در هسته اصلی مصنوع مدل، این روند را تغییر می‌دهد تا اطمینان حاصل شود که یک فایل واحد و دقیق (Bit-exact) روی سخت‌افزارهای مختلف و بک‌اندهای متنوع اجرا شود.

همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، گلوگاه اصلی همیشه جابه‌جایی داده‌ها در حافظه بوده است، نه لزوماً قدرت محاسباتی.

مکانیزم رمزگذاری ترنری

به نقل از گزارش فنی منتشر شده در وب‌سایت fermionresearch.com، مدل Neutrino-1 8B یک ترنسفورمر (Transformer) تنها-رمزگشای با ۸,۱۹۰,۷۳۵,۳۶۰ پارامتر است. هسته این معماری، یک کانتینر خانواده-ترنری رمزگذاری شده است. فایل دانلودی در واقع یک انتقال رمزگذاری شده از کانتینر (۲,۵۵۹,۸۲۲,۵۹۴ بایت) است که هنگام اجرا به فایلی با حجم دقیق ۳,۸۷۵,۴۰۴,۸۱۲ بایت تبدیل می‌شود که توسط محیط زمان اجرا (Runtime) اجرا می‌گردد.

در این مدل، به‌جای ذخیره وزن‌ها (Weights) در فرمت fp16، ۲۵۲ لایه‌ی خطی ترنسفورمر در فرمتی ذخیره شده‌اند که ۸ برابر کوچک‌تر است. این وزن‌ها در حالت سکون به‌صورت بیت-پک (Bit-packed) باقی می‌مانند و مستقیماً درون کرنل‌های ماتریسی رمزگشایی می‌شوند. این یعنی در مسیر رمزگشایی، هیچ بخشی از داده‌ها هرگز به‌صورت مواد وزنی fp16 یا fp32 ذخیره نمی‌شود و حجم بایت‌هایی که باید برای هر توکن (Token) جابه‌جا شوند، به‌شدت کاهش می‌یابد. این طراحی اجازه می‌دهد مدل از یک مصنوع واحد در یک GPU مرکز داده، یک مک‌بوک و یک CPU دسکتاپ بدون نیاز به تبدیل (Conversion) سرویس‌دهی شود.

جزئیات معماری

مدل Neutrino-1 یک ترنسفورمر متراکم است که بر پایه Qwen3-8B توسعه یافته است. مشخصات هندسی آن به شرح زیر است:

  • عمق لایه‌ها: ۳۶ لایه رمزگشا.
  • عرض: عرض پنهان ۴,۰۹۶ و عرض لایه پیش‌خور gated SwiGLU برابر با ۱۲,۲۸۸ (که در هر لایه از سه لایه خطی استفاده می‌کند).
  • مکانیزم توجه: استفاده از توجه پرس‌وجوی گروهی (GQA) با نسبت ۴:۱، شامل ۳۲ سر پرس‌وجو و ۸ سر کلید-مقدار. عرض هر سر (Head width) برابر با ۱۲۸ است.
  • رمزگذاری موقعیت: رمزگذاری دورانی (Rotary encoding) با پایه ۱,۰۰۰,۰۰۰ که در تمام عرض ۱۲۸ سر اعمال می‌شود.
  • نرمال‌سازی: استفاده از RMSNorm با اپسیلون 1e-6، شامل RMSNormهای مجزا برای پرس‌وجو و کلید در داخل بلوک‌های توجه.
  • پنجره زمینه و واژگان: حداکثر طول پنجره زمینه (Context Window) برابر با ۴۰,۹۶۰ توکن و اندازه واژگان ۱۵۱,۹۳۶ است. تنسورهای جاسازی ورودی (Input embedding) و سر خروجی (Output head) دو تنسور جداگانه و غیرمتصل هستند.

توزیع وزن‌ها و پراکندگی

طبق بررسی مستندات، این مدل سطح شگفت‌آوری از پراکندگی خودبه‌خودی را نشان می‌دهد. از میان ۶.۹۵ میلیارد وزن رمزگذاری شده، ۶۲.۶۳٪ آن‌ها صفر هستند. باقی‌مانده وزن‌ها به‌طور تقریباً متقارنی بین مقادیر مثبت (۱۸.۶۸٪) و منفی (۱۸.۶۹٪) تقسیم شده‌اند؛ این تعادل علامت تا صدم یک واحد است، بدون اینکه محدودیت خاصی برای اجبار به این حالت اعمال شده باشد.

این تراکم در سراسر مدل یکسان نیست:

  • در لایه‌های ۱ تا ۳ بخش پیش‌خور (Gate and down feed-forward projections)، میزان صفرها به ۷۰-۷۲٪ جهش می‌کند.
  • در تمام چهار تصویر پیش‌بینی توجه (Attention projections)، تراکم از لایه ۰ تا ۳۵ به‌صورت ثابت در حدود ۶۲٪ باقی می‌ماند.
  • این موضوع نشان می‌دهد که بلوک‌های پیش‌خور اولیه، وزن‌های غیرضروری را حذف می‌کنند در حالی که مکانیزم توجه ثابت می‌ماند.

ترکیب کانتینر

کانتینر ۳.۸۸ گیگابایتی به کلاس‌های مختلف تنسور تقسیم شده است:

  • مسیر رمزگذاری (۶۷.۲٪): شامل ۲,۶۰۵ مگابایت. این بخش شامل هفت لایه خطی در هر لایه است (پرس‌وجو، کلید، مقدار، تصویر خروجی و لایه‌های خطی gate، up و down پیش‌خور). هر لایه ۷۲,۳۵۱,۷۴۴ بایت را به خود اختصاص می‌دهد.
  • بردار معنایی توکن‌ها (۳۲.۱٪): شامل ۱,۲۴۵ مگابایت. این بخش شامل دو تنسور int8 غیرمتصل (۱۵۱,۹۳۶ × ۴,۰۹۶) برای جاسازی ورودی و سر خروجی است که هرکدام در هر سطر یک مقیاس (Scale) دارند. این‌ها به دلیل اینکه توکن به توکن خوانده می‌شوند و در برابر کل جریان فعال‌ساز ضرب نمی‌شوند، در حالت int8 باقی می‌مانند.
  • متا‌دیتا (۰.۶٪): ۲۵ مگابایت برای ذخیره ابعاد سطرها، مقیاس‌ها و مجموع سطرها.
  • وزن‌های نرمال‌سازی: ۱۴۵ تنسور در فرمت float32 (چهار مورد در هر لایه به علاوه نرمال‌ساز نهایی) با مجموع ۱.۲ مگابایت.
  • هدر (Header): یک هدر کانتینر حداقلی با اندازه ۶۰ بایت.

عملکرد در سخت‌افزارهای مختلف

به دلیل کوچک بودن مجموعه کاری، اقتصاد سرویس‌دهی مدل تغییر کرده است. رمزگشایی تک-جریانی (Single-stream decode) محدود به این است که چه مقدار بایت در هر توکن جابه‌جا شود. توجه پرس‌وجوی گروهی باعث می‌شود کش KV در یک‌چهارم عرض پرس‌وجو باقی بماند (۱۴۴ کیلوبایت برای هر توکن در fp16). در نتیجه، یک نشست ۴ هزار توکنی ۰.۶۰ گیگابایت کش هزینه دارد، در حالی که برای زمینه ۳۲ هزار توکنی، این مقدار به ۴.۸۳ گیگابایت می‌رسد.

چون مجموع وزن‌ها (۳.۸۸ گیگابایت) و کش آن می‌توانند در ۸ گیگابایت VRAM جای بگیرند، به سرعت‌هایی دست می‌یابد که مدل‌های fp16 با ۱۶ گیگابایت حافظه در همان سیستم نمی‌توانند. بنچمارک‌های عملکرد سطوح مختلف استقرار را نشان می‌دهند:

  • H100 80GB (Plain single-stream greedy): سرعت ۳۹۶ توکن در ثانیه.
  • NVIDIA L4 (CUDA fork): سرعت ۳۰.۷ توکن در ثانیه با مصرف ۴.۶۸ گیگابایت VRAM در زمینه ۴ هزار توکنی.
  • Apple M5 MacBook (MLX optimized): سرعت ۳۳.۷ توکن در ثانیه.
  • Apple M5 (CPU only, 9 threads): سرعت ۲۴.۹ توکن در ثانیه از طریق باینری بومی.

رمزگشایی گمانه‌زنانه با Neutrino-1 0.6B

شرکت Fermion Research استراتژی جفت‌سازی را با مدل کوچک‌تر Neutrino-1 0.6B (حجم ۳۲۸ مگابایت) معرفی کرد. در این ساختار، مدل ۰.۶B توکن‌ها را پیش‌بینی (Draft) می‌کند و مدل 8B کل این رشته را در یک پاس پیش‌رو (Forward pass) تأیید می‌کند. یک توکن تنها زمانی پذیرفته می‌شود که با Argmax مدل 8B برابر باشد، تا تضمین شود خروجی یک جریان ساده حریصانه (Greedy stream) باقی می‌ماند. در آزمایش‌ها، ۲۷,۶۴۸ توکن متوالی بدون هیچ واگرایی تطبیق یافتند.

روی یک H100، این روش بسته به نوع پرامپت، سرعت را به‌طور قابل توجهی افزایش می‌دهد (مدل 8B به‌عنوان تأییدکننده برای پیش‌بینی‌های مدل 0.6B عمل می‌کند):

  • شمارش و لیست‌ها: ۷۶۳ توکن در ثانیه (۱.۹۳ برابر سریع‌تر).
  • پاسخ‌های کوتاه واقع‌گرایانه: ۶۱۳ توکن در ثانیه (۱.۵۵ برابر سریع‌تر).
  • ادامه متن (Prose): ۵۳۲ توکن در ثانیه (۱.۳۴ برابر سریع‌تر).
  • توضیحات محاوره‌ای: ۴۴۷ توکن در ثانیه (۱.۱۳ برابر سریع‌تر).
  • کدنویسی: ۴۲۶ توکن در ثانیه (۱.۰۷ برابر سریع‌تر).

این جفت‌سازی تنها ۸.۴۶٪ به کل حجم بایت‌های وزن‌ها اضافه می‌کند. روی یک Apple M5، هر دو مدل در یک پروسه MLX زیر سقف ۶ گیگابایت بارگذاری شده و در مجموع به پیک ۴.۳ گیگابایت می‌رسند. در پرامپت‌های واقع‌گرایانه، نرخ پیش‌بینی شده ۲۵.۷۱ توکن در ثانیه در مقابل ۲۲.۰- توکن ساده است، با نرخ پذیرش ۰.۷۴۴.

محک‌ها و مجوزها

مدل Neutrino-1 8B که مشتقی از Qwen3-8B است، در محک‌های استاندارد عمومی اندازه‌گیری شده در جولای ۲۰۲۶ نتایج رقابتی داشته است:

  • MMLU (5-shot, 57 subjects): امتیاز ۷۲.۱
  • MMLU-Redux (Generative): امتیاز ۶۷.۸
  • IFEval (Prompt-strict): امتیاز ۷۷.۲
  • IFEval (Instruction-strict): امتیاز ۸۰.۲
  • IFEval (Prompt-loose): امتیاز ۷۶.۳
  • BFCL v3 (Macro over 13 subsets): امتیاز ۶۸.۹
  • GSM8K (0-shot generative, flexible): امتیاز ۵۳.۴
  • GSM8K (Stated format): امتیاز ۵۱.۷۳

این مدل تحت مجوز Apache-2.0 منتشر شده که اجازه استفاده تجاری، تغییر و توزیع مجدد را می‌دهد. بسته pip تحت Apache-2.0 است و فورک llama.cpp تحت مجوز MIT عرضه شده است. استقرار مدل تنها با دو دستور pip install fermion-research و سپس fermion chat انجام می‌شود.

تحلیل فنی

برای جامعه یادگیری ماشین، Neutrino-1 نشان‌دهنده تغییری به سمت وزن‌های «بومی-انتقالی» (Transport-native) است. با تبدیل کانتینر به مصنوع اصلی به جای اینکه آن را نسخه‌ای فشرده از یک مدل float بدانیم، Fermion Research بحث‌های مربوط به از دست دادن دقت (Precision loss) را که معمولاً با کوانتش‌های پس از آموزش همراه است، حذف کرده است. این حقیقت که وزن‌ها درون کرنل‌ها رمزگشایی می‌شوند، نشان می‌دهد که گلوگاه دیگر محاسبات نیست، بلکه جابه‌جایی وزن‌ها از حافظه به واحد اجرا است.

این معماری به‌طور موثری سد ورود برای میزبانی مدل‌های ۸ میلیاردی با کیفیت بالا روی دستگاه‌هایی با حافظه یکپارچه محدود را کاهش می‌دهد. این مدل ثابت می‌کند که پراکندگی تهاجمی (Sparsity) — به‌ویژه در لایه‌های اولیه شبکه پیش‌خور — می‌تواند بدون تخریب توانایی‌های استدلالی general مدل حفظ شود. ارائه سه مسیر دسترسی (بومی pip، فورک CUDA GGUF و کرنل‌های MLX Metal) تضمین می‌کند که رویکرد تک-کانتینری در تمام طیف سخت‌افزاری کاربردی است.

برای بررسی این افزایش عملکرد، توسعه‌دهندگان باید دستور fermion serve را برای راه‌اندازی یک سرور محلی سازگار با OpenAI تست کنند و نرخ توکن در ثانیه را با پیاده‌سازی‌های استاندارد GGUF مقایسه کنند.

گام بعدی شما

  • توسعه‌دهندگان باید دستور fermion serve را برای راه‌اندازی سرور سازگار با OpenAI تست کنند تا نرخ توکن در ثانیه را با پیاده‌سازی‌های GGUF مقایسه کنند.
  • بررسی کنید که آیا مدل ۰.۶B در سناریوهای خاص شما نرخ پذیرش (Acceptance rate) بالایی دارد یا خیر.
  • برای کاهش هزینه‌های عملیاتی، مدل‌های 8B را با فرمت ترنری جایگزین نسخه‌های کوانتیده سنتی کنید.

اما تأثیر این متراکم‌سازی بر کیفیت استدلال در زبان‌های غیرانگلیسی هنوز ناشناخته است — به تحلیل ما درباره‌ی مدل‌های چندزبانه مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با کاهش ۸ برابری حجم وزن‌ها، دسترسی به مدل‌های ۸ میلیارد پارامتری را برای سخت‌افزارهای ارزان‌قیمت ممکن می‌کند. این تغییر از نظر اعتبار فنی، استقرار مدل‌های باکیفیت در لبه (Edge) را بدون افت شدید دقت میسر می‌سازد.

تأثیر برای ایران

به‌دلیل انتشار تحت مجوز Apache-2.0 و وزن‌های باز، توسعه‌دهندگان ایرانی می‌توانند این مدل را به‌صورت کاملاً محلی و بدون نیاز به APIهای محدودشده روی سخت‌افزارهای ضعیف‌تر اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

تغییر رویکرد از «کوانتش پس از آموزش» به «وزن‌های بومیِ انتقال» (Transport-native weights) نشان می‌دهد که گلوگاه مدل‌های محلی دیگر قدرت پردازش نیست، بلکه پهنای باند حافظه است. این معماری ثابت می‌کند که می‌توان با پذیرش پراکندگی شدید در لایه‌های ابتدایی شبکه، حجم مدل را بدون تخریب توانایی استدلال کاهش داد. در واقع، Neutrino-1 مرز بین مدل‌های SLM و LLM را کم‌رنگ‌تر می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.