پرش به محتوای اصلی
پرش به محتوای مقاله

چرا معماری دو-نمایی Orthrus سرعت استنتاج Qwen3 را ۷.۸ برابر کرد؟

·۲۶ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه
چرا معماری دو-نمایی Orthrus سرعت استنتاج Qwen3 را ۷.۸ برابر کرد؟
اشتراک‌گذاری

اگر امروز از مدل‌های Qwen3 استفاده می‌کنید، احتمالاً سرعت تولید پاسخ‌ها برایتان گلوگاه است؛ اما تصور کنید همین پاسخ‌ها ۷.۸ برابر سریع‌تر برسند، بدون اینکه حتی یک کلمه از دقت مدل کم شود.

این ادعای اصلی Orthrus است؛ چارچوبی که در ۱۵ مه ۲۰۲۶ معرفی شد تا یکی از سخت‌ترین چالش‌های هوش مصنوعی زاینده (Generative AI) را حل کند. توسعه‌دهندگان معمولاً بین دو راه گیر می‌کنند: یا از رمزگشایی‌های کند اما دقیق استفاده کنند یا به مدل‌های انتشار سریع بروند که احتمال خطا در آن‌ها زیاد است.

مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — برای تولید هر کلمه نیاز به پردازش سنگینی دارد. همان‌طور که در تحلیل قبلی ما درباره‌ی کاهش هزینه‌های استنتاج در vLLM اشاره کردیم، صنعت اکنون از مرحله‌ی صرفه‌جویی در هزینه به مرحله‌ی بهینه‌سازی حداکثری نرخ انتقال داده رسیده است.

Orthrus برای رسیدن به این سرعت، استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند؛ شبیه خودِ آشپزی، نه دوره‌ی آموزش آشپز — را بازتعریف می‌کند. طبق گزارش توسعه‌دهندگان، این سیستم تنها ۱۶٪ از پارامترهای مدل را تنظیم می‌کند تا قابلیت تولید موازی را به آن اضافه کند.

جزئیات فنی این معماری عبارت است از:

  • تولید کاملاً بدون خطا از طریق یک سازوکار اجماع داخلی.
  • حذف حافظه‌ی اضافی با اشتراک‌گذاری یک KV cache (حافظه کلید-مقدار) واحد بین دو نما.
  • افزایش سرعت به‌طور میانگین ۴.۲۵ برابر برای مدل ۱.۷ میلیارد پارامتری و ۵.۳۶ برابر برای مدل ۸ میلیارد پارامتری.

به نقل از مستندات گیت‌هاب این پروژه، Orthrus در آزمون‌های رودررو، ابزارهای رمزگشایی گمانه‌زن مانند EAGLE-3 و DFlash را شکست داد. این یعنی «مالیات دقت» که همیشه برای سرعت بخشیدن به مدل‌ها پرداخت می‌شد، حالا حذف شده است. برای شما که اپلیکیشن‌های استدلالی می‌سازید، دیگر لازم نیست بین «دقت بالا» و «پاسخ سریع» یکی را انتخاب کنید.

گام بعدی شما

  • اگر از مدل‌های Qwen استفاده می‌کنید، پیاده‌سازی این چارچوب را از طریق مخزن رسمی گیت‌هاب تست کنید.
  • منتظر ادغام بومی این فناوری در vLLM و SGLang باشید تا مدیریت حافظه بهینه‌تر شود.
  • نرخ پذیرش توکن‌ها را در متون طولانی‌تر بسنجید تا اثر مقیاس‌پذیری را ببینید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت «مالیات دقت» را در تولیدات موازی حذف می‌کند. با تکیه بر اعتبار معماری‌های انتشار، توسعه‌دهندگان اکنون می‌توانند مدل‌های استدلالی سریع را بدون نیاز به سخت‌افزارهای عظیم مستقر کنند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.