پرش به محتوای اصلی
پرش به محتوای مقاله

«هدف‌گذاری برای مهندسی نرم‌افزار»؛ رویکرد Meituan در توسعه LongCat-2.0

·۱۵ تیر ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
معرفی LongCat-2.0 توسط میتوان: مدل باز ۱.۶ تریلیون پارامتری MoE با کانتکست ۱ میلیونی و توجه پراکنده LongCat
معرفی LongCat-2.0 توسط میتوان: مدل باز ۱.۶ تریلیون پارامتری MoE با کانتکست ۱ میلیونی و توجه پراکنده LongCat
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به پنجرهٔ زمینه ۱ میلیون توکنی بومی در یک مدل ۱.۶ تریلیون پارامتری که کاملاً بدون GPUهای انویدیا و تنها با ASICهای بومی آموزش دیده و بدون هیچ Loss Spike متوقف نشده است.

اگر امروز یک مخزن کد بزرگ دارید، دیگر نیازی نیست برای تحلیل آن، فایل‌ها را تکه‌تکه به مدل بدهید. مدل LongCat-2.0 با پنجرهٔ زمینه ۱ میلیون توکنی، اجازه می‌دهد کل یک پروژه نرم‌افزاری به‌صورت یک‌جا وارد حافظه مدل شود. در حالی که اکثر عوامل کدنویسی پیشرو به سخت‌افزارهای Nvidia متکی هستند، یک مدل با ۱.۶ تریلیون پارامتر که بدون استفاده از حتی یک GPU آموزش دیده است، اکنون در حال به چالش کشیدن وضعیت موجود است. LongCat-2.0 محصول شرکت Meituan است که یک پنجره زمینه بومی ۱ میلیون توکنی را به‌طور خاص برای مهندسی نرم‌افزار در سطح مخزن (Repository-level) ارائه می‌دهد. این امر نشان‌دهنده یک جهش عظیم در مقیاس و قابلیت‌ها نسبت به نسخه پیشین است.

این عرضه در زمانی رخ می‌دهد که صنعت به سمت «کدنویسی عامل‌محور» (Agentic Coding) تغییر مسیر داده است؛ جایی که مدل‌ها دیگر تنها به پیشنهاد تکه‌های کد (Snippets) اکتفا نمی‌کنند، بلکه می‌توانند کل چرخه‌های حیات یک پروژه را مدیریت کنند. این رویکرد یادآور پیشرفت‌های متا در تبدیل تولید داده‌های مصنوعی به یک حلقه عامل‌محور با چارچوب Autodata است که استقلال مدل‌ها در مدیریت وظایف پیچیده را افزایش می‌دهد. همان‌طور که در تحلیل قبلی ما درباره‌ی نحوه استفاده مدل SubQ 1.1 از «توجه پراکنده» (Sparse Attention) برای کاهش هزینه‌های محاسباتی اشاره کردیم، LongCat-2.0 این منطق را بیشتر پیش می‌برد تا از «دیوار حافظه» سنتی که با پنجره‌های زمینه عظیم همراه است، عبور کند.

زمینه و تکامل مدل

مدل LongCat-2.0 به عنوان نسل بعدی مدل‌های باز با مقیاس تریلیون-پارامتری Meituan معرفی شده است. این مدل جایگزین LongCat-Flash می‌شود که یک مدل ۵۶۰ میلیارد پارامتری بود و در سپتامبر ۲۰۲۵ عرضه شده بود. جهش در مقیاس بسیار چشمگیر است: تعداد کل پارامترها از ۵۶۰ میلیارد به ۱.۶ تریلیون افزایش یافته و پنجره زمینه از ۱۲۸ هزار توکن به ۱ میلیون توکن بومی گسترش یافته است.

طبق گزارش فنی منتشر شده در ۳۰ ژوئن ۲۰۲۶، LongCat-2.0 از معماری ترکیب خبره‌ها (Mixture-of-Experts یا MoE) بهره می‌برد. با وجود حجم عظیم ۱.۶ تریلیون پارامتری، مدل در هر توکن تنها بین ۳۳ تا ۵۶ میلیارد پارامتر را فعال می‌کند. برای رسیدن به این بهره‌وری، Meituan «خبره‌های با محاسبات صفر» (Zero-computation experts) را پیاده‌سازی کرده است تا توکن‌های ساده، مانند علائم نگارشی، بدون هدر دادن چرخه‌های محاسباتی سنگین، مسیریابی شوند. یک کنترل‌کننده PID نیز وظیفه مدیریت این فرآیند را بر عهده دارد و با تنظیم بایاس خبره‌ها، فعال‌سازی میانگین را در بازه دینامیک ۳۳ تا ۵۶ میلیارد پارامتر نگه می‌دارد.

معرفی LongCat-2.0 توسط میتوان: مدل متن‌باز ۱.۶ تریلیون پارامتری MoE با زمینه یک میلیونی و توجه پراکنده LongCat

جزئیات معماری

برای حفظ توان عملیاتی (Throughput) بالا و کاهش هزینه‌ها، این مدل از یک طراحی با اتصالات میان‌بر (Shortcut-connected) به نام ScMoE استفاده می‌کند. این معماری بر چهار استراتژی اصلی کاهش هزینه تمرکز دارد:

  • توجه پراکنده LongCat (LSA): این قابلیت تکاملی از DeepSeek Sparse Attention (DSA) است. LSA از سه روش نمایه‌سازی متعامد استفاده می‌کند: نمایه‌سازی آگاه از استریم (Streaming-aware Indexing) که خواندن‌های تکه‌تکه را به بلوک‌های پیوسته تبدیل می‌کند، نمایه‌سازی بین-لایه‌ای (Cross-Layer Indexing) که برجستگی‌ها (Saliency) را در لایه‌های مجاور بازاستفاده می‌کند، و نمایه‌سازی سلسله‌مراتبی (Hierarchical Indexing) که فیلترینگ را از حالت درشت به ریز انجام می‌دهد. این سازوکار مقیاس‌بندی توجه را از حالت درجه‌دو (Quadratic) به خطی (Linear) کاهش می‌دهد.
  • بردار معنایی N-gram: یک ماژول اختصاصی با ۱۳۵ میلیارد پارامتر است که به‌طور متعامد نسبت به خبره‌های MoE قرار می‌گیرد. این بخش روابط محلی متراکم توکن‌ها را ثبت کرده و ورودی/خروجی حافظه (Memory I/O) را در حین رمزگشایی با دسته‌های بزرگ (Large-batch decoding) کاهش می‌دهد.
  • خط لوله MOPD: یک خط لوله پس از آموزش (Post-training) است که سه گروه مختلف از خبرگان استاد (Teacher expert groups) را با هم ادغام می‌کند تا قابلیت‌های استدلالی (Reasoning)، عاملی (Agent) و تعاملی (Interaction) در یک مدل واحد و یکپارچه ترکیب شوند.
  • زیرساخت سرویس‌دهی: Meituan از یک طرح موازی‌سازی ۶ بعدی (6D parallelism) و یک معماری تفکیک‌شده‌ی پیش‌پُرکردن-رمزگشایی (Prefill-decode disaggregated architecture) استفاده می‌کند. برای پنهان کردن تأخیرهای I/O، آن‌ها از «سوپر کرنل‌ها» (Super kernels) و پیش‌خوانی وزن‌ها در حافظه کش L2 (L2-cache weight prefetching) بهره می‌برند.

سخت‌افزار و پایداری آموزش

یکی از تکان‌دهنده‌ترین سیگنال‌های فنی، پشته سخت‌افزاری مورد استفاده است. آموزش و سرویس‌دهی این مدل به‌طور کامل روی یک خوشه سوپرپاد (Superpod) متشکل از ۵۰,۰۰۰ کارت ASIC بومی (ساخت داخل کشور چین) انجام شده است. پیش‌آموزش این مدل بر روی بیش از ۳۵ تریلیون توکن در طول میلیون‌ها ساعت محاسباتی شتاب‌دهنده صورت گرفته است.

نکته حائز اهمیت این است که Meituan هیچ مورد بازگشت (Rollback) یا جهش ناگهانی و غیرقابل بازیابی در تابع زیان (Loss spike) را در کل طول این فرآیند گزارش نکرده است. این ادعای پایداری بسیار مهم است زیرا ابزارهای نرم‌افزاری برای سخت‌افزارهای غیر-Nvidia معمولاً کمتر بالغ هستند؛ نبود جهش‌های ناگهانی نشان می‌دهد که ابزارهای ASIC بومی به اندازه کافی بالغ شده‌اند تا مقیاس‌های تریلیون-پارامتری را به‌طور قابل‌اعتمادی مدیریت کنند.

بنچمارک‌ها و عملکرد

بنچمارک‌های گزارش شده توسط Meituan، این مدل را در صدر وظایف مهندسی نرم‌افزار قرار می‌دهد، هرچند همچنان یک ابزار تخصصی است و نه یک مدل همه‌منظوره:

  • SWE-bench Pro: امتیاز ۵۹.۵ کسب کرد که کمی بالاتر از امتیاز ۵۸.۶ مدل GPT-5.5 است.
  • Terminal-Bench 2.1: امتیاز ۷۰.۸ را ثبت کرد که معیاری برای سنجش اجرا و بازیابی خطا در محیط‌های شل (Shell) است.
  • SWE-bench Multilingual: امتیاز ۷۷.۳ را برای وظایف مخزنی در زبان‌های مختلف به دست آورد.

اگرچه این مدل در مهندسی نرم‌افزار بر Gemini 3.1 Pro برتری دارد، اما در بنچمارک‌های گسترده‌تر عوامل عمومی مانند FORTE و BrowseComp عقب‌تر از سیستم‌های پیشرو است. همچنین هنوز تأییدیه مستقلی از لیدربوردهای بیرونی منتشر نشده است.

کاربردهای عملی

برای توسعه‌دهندگان، این تغییر به معنای گذار از «تکه‌بندی» (Chunking) کد به «بلعیدن» (Ingesting) کل مخازن است. با پنجرهٔ زمینه ۱ میلیون توکنی، مدل برای کارهای سبک عاملی تنظیم شده است:

  • استدلال در سطح مخزن: کاربران می‌توانند کل کد یک پروژه متوسط را وارد پنجره کنند تا باگ‌ها را در میان چندین فایل ردیابی کنند، بدون اینکه نیاز به ترفندهای خلاصه‌سازی (Summarization hacks) داشته باشند.
  • وظایف ترمینالی چندمرحله‌ای: مدل می‌تواند در یک حلقه عاملی با دسترسی به شل اجرا شود تا دستورات را صادر کند، خطاها را بخواند و تا زمان موفقیت در انجام وظیفه، تلاش مجدد کند.
  • ویرایش‌های سطح مخزن: مدل می‌تواند بازسازی‌های (Refactors) هماهنگی را پیشنهاد دهد که چندین ماژول و تست را به‌طور هم‌زمان و یکپارچه تغییر می‌دهد.
  • مهاجرت بین‌زبانی: بهره‌گیری از نقاط قوت در SWE-bench Multilingual برای انتقال منطق کد بین زبان‌های مختلف در حالی که رفتار برنامه حفظ شود.

در حال حاضر این مدل از طریق پلتفرم LongCat API با نقاط انتهایی سازگار با OpenAI و Anthropic در دسترس است. همچنین از طریق OpenRouter و ابزارهایی مانند Claude Code، OpenClaw، OpenCode و Codex قابل استفاده است. قیمت‌گذاری روی ۰.۷۵ دلار برای هر میلیون توکن ورودی و ۲.۹۵ دلار برای هر میلیون توکن خروجی تنظیم شده است، اما در طرح تخفیفی زمان عرضه، این قیمت‌ها به ترتیب به ۰.۳۰ و ۱.۲۰ دلار کاهش یافته‌اند (در حالی که خواندن‌های کش‌شده رایگان است). وزن‌های مدل نیز قرار است تحت لایسنس MIT منتشر شوند.

گام بعدی شما

  • اگر با پروژه‌های بزرگ سر و کار دارید، از طریق OpenRouter مدل LongCat-2.0 را برای تحلیل ساختاری کل مخزن کد خود تست کنید.
  • بررسی کنید که آیا مدل‌های تخصصی مهندسی نرم‌افزار می‌توانند جایگزین مدل‌های General-purpose در گردش‌کارهای CI/CD شما شوند یا خیر.
  • منتظر انتشار وزن‌های باز (Open Weights) تحت لایسنس MIT باشید تا امکان استقرار محلی مدل را بررسی کنید.

اما چالش اصلی در این مسیر، مدیریت حافظه برای چنین پنجره‌های عظیم است — به بررسی ما درباره‌ی ترکیب استراتژی‌های کوانتش و مدیریت اپیزودیک برای کاهش ۸ برابری حافظه KV Cache مراجعه کنید تا با روش‌های بهینه‌سازی حافظه در مدل‌های مدرن آشنا شوید.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص در معماری MoE، مرز بین «پیشنهاد کد» و «مدیریت پروژه» را جابه‌جا می‌کند. موفقیت آن در آموزش روی ASICهای بومی، اعتبار سخت‌افزارهای جایگزین انویدیا را در مقیاس تریلیونی به رسمیت می‌شناساند.

تأثیر برای ایران

به دلیل هزینه پایین استنتاج و دسترسی از طریق OpenRouter، برنامه‌نویسان ایرانی می‌توانند بدون نیاز به زیرساخت‌های سنگین، تحلیل کل مخازن کد خود را با هزینه‌ای بسیار کمتر از مدل‌های OpenAI انجام دهند.

·نگاه ما
تحریریه دات‌هوش

دستیابی به ثبات در آموزش یک مدل ۱.۶ تریلیون پارامتری روی سخت‌افزارهای ASIC بومی، بیش از خودِ مدل اهمیت دارد. این موضوع نشان می‌دهد که انحصار انویدیا در لایه‌ی ابزارهای آموزش (Training Tooling) در حال شکستن است. LongCat-2.0 ثابت می‌کند که برای رسیدن به توانمندی‌های استدلالی در کدنویسی، لزوماً نیاز به مدل‌های General-purpose نیست و تخصص در معماری (مانند ScMoE) می‌تواند نتایج بهتری بدهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.