پرش به محتوای اصلی
پرش به محتوای مقاله

تنسنت: چارچوب AngelSpec سرعت رمزگشایی را ۲.۴ برابر کرد

·۸ مرداد ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
چارچوب آموزش یکپارچه تایسن برای نمونه‌برداری سوداگرانه در مدل‌های زبانی بزرگ
چارچوب آموزش یکپارچه تایسن برای نمونه‌برداری سوداگرانه در مدل‌های زبانی بزرگ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی یک مدل پیش‌بین واحد با دو معماری متضاد (MTP برای چت و DFly برای کد) برای حل تناقض در نرخ پذیرش توکن‌ها در زبان‌های مختلف.

اگر هزینه و تأخیر در پاسخ‌دهی مدل‌های زبانی بزرگ برای شما یک گلوگاه است، باید بدانید که تنسنت راهی برای حذف محاسبات زائد یافته است. این شرکت با معرفی AngelSpec، سرعت پردازش را در مدل‌های HY3-295B-A21B تا ۲.۴ برابر (دقیقاً بین ۱.۹۸ تا ۲.۴۰ برابر) نسبت به رمزگشایی خودبازگشتی استاندارد افزایش داده است. طبق گزارش marktechpost.com، این پیشرفت از طریق بهینه‌سازی رمزگشایی گمانه‌زنانه (Speculative Decoding) — که شبیه به پیش‌بینی جملات توسط یک دستیار سریع است تا مدل اصلی فقط آن‌ها را تأیید کند — رخ داده است. در این فرآیند، یک مدل سبک (Drafter) چندین توکن آینده را پیشنهاد می‌دهد و مدل هدف (Target Model) آن‌ها را در یک مرحله پیش‌رو (Forward Pass) با استفاده از روش «نمونه‌برداری رد» (Rejection Sampling) تأیید می‌کند. سرعت این سیستم به دو عامل حیاتی بستگی دارد: تعداد توکن‌های پیشنهاد شده که پذیرفته می‌شوند و زمانی که هر چرخه کامل «پیش‌نویس-تأیید» زمان می‌برد. نکته کلیدی این است که این دو مقدار اغلب در دامنه‌های مختلف، در جهت مخالف یکدیگر حرکت می‌کنند.

همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی‌های لایه استنتاج اشاره کردیم، اکثر پژوهش‌ها در زمینه رمزگشایی گمانه‌زنانه به دنبال یافتن یک مدل پیش‌بین (Drafter) هستند که در یک میانگین کلی از بنچ‌مارک‌های ترکیبی امتیاز خوبی بگیرد. اما ترافیک واقعی سرویس‌دهی این‌گونه نیست. گفتگوهای آزاد و باز (Open-ended) «آنتروپی» بالایی دارند؛ یعنی ادامه های معنایی معتبری بسیار زیاد هستند و در نتیجه نرخ پذیرش با افزایش عمق پیشنهادها به سرعت کاهش می‌یابد. در چنین رژیم‌هایی، تولید و تأیید بلوک‌های طولانی باعث اتلاف منابع محاسباتی می‌شود. در مقابل، کدنویسی و استدلال‌های ریاضی با نحو برنامه‌نویسی، شناسه‌های تکراری و عبارات رسمی سر و کار دارند که توکن‌های آینده را به شدت محدود می‌کنند. این حجم از کاری، بازه‌های پیش‌بینی‌پذیر طولانی‌تری ایجاد می‌کند که مدل‌های پیش‌بین بلوکی می‌توانند هزینه‌ آن‌ها را به خوبی توزیع و مستهلک کنند.

AngelSpec این ناهمگونی در حجم کاری را به عنوان یک محدودیت طراحی درجه اول پذیرفته است. بر اساس مستندات این پروژه، تنسنت به‌جای یک مدل جامع و جهانی، دو معماری مکمل ارائه داده است: یک مدل پیش‌بینی چندتوکنی (MTP) برای گفتگوهای متنوع و یک مدل انتشار بلوکی به نام DFly برای کد و ریاضیات.

مسیر MTP و آزمون زمان آموزش

مدل MTP روی داده‌های گفتگویی تمرکز دارد، جایی که نرخ پذیرش معمولاً با افزایش عمق توالی به سرعت افت می‌کند. در مدل Hy3 اصلی، تنها از یک لایه MTP بدون «بازگشایی خود-شرطی تکراری» (Recurrent Self-conditioned Unrolling) استفاده شده بود. اگرچه این بلوک می‌توانست در زمان استنتاج به‌صورت تکراری استفاده شود، اما هدف آموزشی مدل هرگز آن را برای زنجیره‌های طولانی خود-تولید شده آماده نکرده بود. این امر باعث می‌شد خطاها با افزایش عمق انباشته شوند و نرخ پذیرش برای جایگاه‌های دوم و سوم پیش‌نویس به شدت کاهش یابد.

برای حل این عدم تطابق بین زمان آموزش و استنتاج، AngelSpec یک طرح «عمق چندگانه با پارامتر مشترک» را پیاده‌سازی می‌کند. در این روش، D عمق پیش‌بینی منطقی حفظ می‌شود اما تنها از یک بلوک فیزیکی MTP استفاده می‌گردد. در طول آموزش، این بلوک به‌صورت خودبازگشتی برای D مرحله باز می‌شود و هر پیش‌بینی به فراخوانی بعدی تغذیه می‌گردد.

  • اصل آزمون زمان آموزش (TTT): مطابق با رویکرد EAGLE-3، عمق k+1 به‌جای دریافت توکن واقعی (Ground-truth)، پیش‌بینی arg max را از عمق k دریافت می‌کند.
  • نظارت اختصاصی: پارامترها بین لایه‌ها مشترک‌اند، اما نظارت بر هر عمق به‌صورت مجزا انجام می‌شود و هدف معلم (Teacher Target) در هر عمق یک موقعیت آینده را به جلو می‌برد.
  • توزیع منجمد: ستون فقرات مدل هدف و سر مدل زبانی هدف منجمد شده‌اند و ورودی‌های MTP از ستون فقرات جدا (Detach) می‌شوند. این کار باعث بهبود توزیع پیشنهادی می‌شود بدون اینکه توزیعی که باید توسط تأییدکننده حفظ شود، تغییر کند.
  • بهره‌برداری مدل هدف: آموزش به‌جای استفاده از یک مجموعه داده مرجع استاتیک، روی پاسخ‌های تولید شده توسط مدل هدفِ منجمد صورت می‌گیرد. این کار باعث می‌شود انتخاب‌های دقیق توکن‌ها، مسیرهای حالت پنهان و الگوهای عدم قطعیت محلی که MTP باید در زمان سرویس‌دهی تقریب بزند، دقیقاً ثبت شوند.

این تغییرات باعث شد نرخ پذیرش میانگین در لحظه صفر از ۵۲.۸٪ به ۶۶.۴٪ برسد و میانگین طول پذیرفته شده از ۲.۵۸ به ۲.۹۹ افزایش یابد. به‌طور خاص، نرخ جایگاه اول (از ۰.۷۹۹ به ۰.۸۱۴) تقریباً ثابت ماند، اما جایگاه‌های عمیق‌تر جهش‌های عظیمی داشتند: نرخ پذیرش جایگاه سوم (p3) در آزمون GSM8K از ۰.۲۹۰ به ۰.۷۰۶ و در HumanEval از ۰.۳۸۷ به ۰.۷۵۷ رسید.

DFly: دقت جراحی برای کد و ریاضی

مدل DFly تکامل یافته‌ی معماری قدیمی‌تر DFlash است تا داده‌های ساختاریافته را بهتر مدیریت کند. این مدل دو تغییر ساختاری اصلی در معماری انتشار بلوکی ایجاد کرده است.

نخست، DFly از یک ستون فقرات ترکیبی برای شرطی‌سازی هدف استفاده می‌کند. در DFlash قبلی، حالت‌های پنهان از چندین لایه هدف از طریق یک لایه کاملاً متصل (FC) به صورت یک ویژگی بستر مشترک تجمیع می‌شدند که این کار تخصص هر لایه را محدود می‌کرد. مدل DFlare بعداً وزن‌های ادغام هر لایه را یاد گرفت اما تبدیل FC را حذف کرد. DFly هر دو را ترکیب می‌کند: شاخه FC یک اساس معنایی مشترک ایجاد می‌کند، در حالی که ادغام هر لایه، پالایش‌های باقی‌مانده (Residual Refinement) را فراهم می‌کند. این تغییر تنها D × T وزن اسکالر اضافه می‌کند و ضرایب softmax را می‌توان پس از آموزش پیش‌محاسبه کرد.

دوم، DFly مشکل «افت پذیرش پسوند» (Suffix Acceptance Decay) را حل کرده است. در یک ستون فقرات موازی استاندارد، هر جایگاه بلوکی را فقط بر اساس بستر پذیرفته شده پیش‌بینی می‌کند و نمی‌بیند که در جایگاه‌های پیش‌نویس قبلی کدام ادامه انتخاب شده است. DFly یک «سر متوالی» (Sequential Head) کوچک بعد از ستون فقرات موازی قرار داده است تا پیش‌بینی‌های حاشیه‌ایِ موقعیتی را به توزیع‌های شرطی‌شده به پیشوند تبدیل کند. بدین ترتیب، ستون فقرات گران‌قیمت کاملاً موازی می‌ماند و تنها سر کوچک به‌صورت چپ-به-راست اجرا می‌شود.

نتایج روی مدل Qwen3-8B خیره‌کننده است: DFly به میانگین طول پذیرش ۵.۴۱ رسید و از DSpark (۵.۳۲)، DFlash (۴.۵۷) و MTP (۳.۲۴) پیشی گرفت. این مدل در هر پنج بنچ‌مارک ریاضی و کد، بهترین نتیجه را کسب کرد. در مدل Hy3-A21B نیز فاصله بیشتر بود: DFly به ۴.۷۹ رسید، در حالی که DFlash امتیاز ۳.۶۹ و MTP امتیاز ۳.۰۰ داشتند (به ترتیب ۲۹.۸٪ و ۵۹.۷٪ افزایش نسبی). این تمرکز بر بهبود استدلال ریاضی یادآور پیشرفت‌های اخیر در مدل‌های تخصصی‌تر است، مانند مدل Leanstral 1.5 که با مقیاس‌بندی زمان استنتاج توانست ۵۸۷ مسئله پیچیده ریاضی PutnamBench را حل کند.

یک مطالعه حذف (Ablation Study) روی Hy3-A21B تحت رمزگشایی حریصانه (Greedy Decoding) این پیشرفت‌ها را ردیابی کرد: ستون فقرات DFlash (۳.۷۷) $ \rightarrow $ ستون فقرات DFly (۴.۴۰) $ \rightarrow $ سر مارکوف (۴.۵۶) $ \rightarrow $ اصلاح پنهان (۴.۶۰) $ \rightarrow $ داده‌های کد/ریاضی (۴.۷۵). گسترش داده‌ها شامل افزودن ۷۰۰ هزار پرامپت بود: ۵۰۰ هزار مورد از OpenCodeInstruct و OpenCodeReasoning و ۲۰۰ هزار مورد از Big-Math. برای تضمین یکپارچگی، هر پرامپتی که یک بازه متوالی ۱۶ توکنی با نمونه‌های ارزیابی مشترک داشت، حذف شد.

مهندسی چارچوب اجرایی

این ابزار بر پایه TorchSpec ساخته شده و از طریق APIهای عمومی با موتور vLLM یکپارچه می‌شود تا بدون نیاز به تغییر در کد اصلی (Forking)، حالت‌های پنهان را استخراج کند. این سیستم از یک ذخیره‌ساز RDMA مبتنی بر Mooncake برای انتقال این حالت‌ها به کارکنان توزیع‌شده آموزش استفاده می‌کند.

ویژگی‌های فنی کلیدی عبارت‌اند از:

  • FlexAttention: برای بازسازی ساختارهای توجه پیشوندی-عامدانه-به‌علاوه-قطری به‌صورت ضمنی از طریق FlexAttention کامپایل‌شده و ادغام logsumexp، که حافظه را نزدیک به یک پاس ساده‌ی علّی نگه می‌دارد.
  • موازات توالی Ulysses: پشتیبانی از آموزش بستر متنی طولانی تا ۱۲۸ هزار توکن. هر تکه محلی یک «هاله» (Halo) توکن D را حمل می‌کند تا نظارت تغییر-عمق در سطح محلی باقی بماند.
  • بسته‌بندی آگاه از سند: استفاده از سه مکانیزم ایزولاسیون — گیت سند توجه، گیت سند تغییر-عمق (برای MTP) و رمزگذاری موقعیتی محلی سند — که توسط تست‌های واحد برای عدم نشت توجه تایید شده است.
  • سرور ارزیابی: اجرای دوره‌ای رمزگشایی گمانه‌زنانه واقعی روی GPUهای اختصاصی برای گزارش طول پذیرش میانگین در دنیای واقعی از آخرین چک‌پوینت‌ها.
  • رابط‌های قابل تعویض: پشتیبانی از نقاط ورود پلاگین vLLM در زمان اجرا (Targets)، اهداف ترکیبی و بهینه‌سازهایی مانند Muon به عنوان جایگزین AdamW.

برای کاربرانی که توان عملیاتی (Throughput) را به دقت مطلق ترجیح می‌دهند، پیاده‌سازی D-cut توان پردازش را در ۶۴ هم‌روندی (Concurrency) به ۹۸۱ توکن بر ثانیه رساند که ۱۵.۷٪ افزایش نسبت به DFly پایه است، اگرچه ۲.۸٪ از نرخ پذیرش قربانی شد.

این حرکت به سمت پیش‌بین‌های تخصصی نشان می‌دهد که دوران بهینه‌سازهای استنتاج «یک-اندازه-برای-همه» به پایان رسیده است. تنسنت با تطبیق معماری با آنتروپی تکلیف (پایین برای کد، بالا برای چت)، گلوگاه را از اندازه مدل به هم‌ترازی معماری با حجم کاری منتقل کرده است.

توسعه‌دهندگان اکنون می‌توانند به هفت چک‌پوینت در Hugging Face و ModelScope دسترسی داشته باشند، از جمله نسخه‌های high-think DFly. AngelSpec شش معماری (DFly, DFlash, DFlare, Eagle3, DSpark, MTP) را در قالب یک خط لوله مبتنی بر پیکربندی آموزش می‌دهد. معیار حیاتی بعدی این خواهد بود که این پیش‌بین‌های تخصصی روی مجموعه‌داده‌های اختصاصی و دامنه-محور، فراتر از بنچ‌مارک‌های استاندارد GSM8K و HumanEval، چگونه عمل می‌کنند.

گام بعدی شما

  • اگر روی استقرار مدل‌های باز-وزن در مقیاس صنعتی کار می‌کنید، چک‌پوینت‌های DFly را در Hugging Face تست کنید.
  • برای محیط‌های تولیدی که ترافیک ترکیبی (چت و کد) دارند، استراتژی «پیش‌بین تخصصی» را جایگزین مدل‌های عمومی کنید.
  • بررسی کنید آیا مدل‌های شما در پاسخ‌های طولانی دچار افت پذیرش توکن‌ها می‌شوند تا از تکنیک TTT استفاده کنید.

اما تأثیر این بهینه‌سازی‌ها بر کاهش هزینه‌های سخت‌افزاری در مراکز داده حتی حیاتی‌تر است — به تحلیل ما درباره معماری‌های جدید GPU مراجعه کنید.

چرا این موضوع مهم است؟

این چارچوب با تکیه بر تخصص تنسنت در مدیریت ترافیک عظیم، استانداردی جدید برای کاهش تأخیر در مدل‌های Hybrid ایجاد می‌کند. اعتبار این روش با انتشار نتایج روی بنچمارک‌های سخت‌گیرانه مثل HumanEval تأیید شده است.

تأثیر برای ایران

به‌دلیل متن‌باز بودن AngelSpec و سازگاری با vLLM، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای پولی، سرعت استقرار مدل‌های محلی خود را افزایش دهند.

·نگاه ما
تحریریه دات‌هوش

تنسنت با این اقدام، مفهوم «بهینه‌ساز جامع» را به چالش کشیده و اعلام می‌کند که استنتاج باید بر اساس آنتروپی داده‌ها شخصی‌سازی شود. این رویکرد نشان می‌دهد که گلوگاه آینده، دیگر صرفاً اندازه مدل نیست، بلکه همراستاسازی معماری پیش‌بین با نوع پردازش (کد در مقابل گفتگو) است. در واقع، ما به سمت سیستمی می‌رویم که مدل‌های لایه-کمک، بسته به نوع سوال کاربر، به‌صورت پویا جابه‌جا می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.