پرش به محتوای اصلی
پرش به محتوای مقاله

موتورهای استنتاجی INT21 در برابر کامپایلرهای سنتی؛ سرعت بیشتر، تأخیر کمتر

·۱۲ شهریور ۱۴۰۵۱۰ دقیقه مطالعه۴ بازدید
بینگ ژو، بنیان‌گذار و مدیرعامل INT21 – مجموعه مصاحبه
بینگ ژو، بنیان‌گذار و مدیرعامل INT21 – مجموعه مصاحبه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامپایلرهای سنتی با دسته‌های عامل‌محور برای تولید مستقیم کدهای هسته GPU؛ این یعنی AI دیگر فقط کد نمی‌نویسد، بلکه معماری اجرای سخت‌افزاری را از صفر و بدون پیش‌فرض‌های انسانی بازطراحی می‌کند.

اگر امروز برای بهینه‌سازی سخت‌افزاری مدل‌های خود هزینه می‌کنید، باید بدانید که دسته‌های عامل‌محور اکنون می‌توانند کدهای بهینه‌سازی را ۵۹٪ سریع‌تر از خبرگان انسانی بنویسند. این یعنی گلوگاه هوش مصنوعی از خودِ مدل‌ها به زیرساختی منتقل شده است که آن‌ها را اجرا می‌کند. شرکت INT21 که توسط بینگ شو، مهندس برجسته سابق انویدیا تأسیس شده است، در حال تغییر نقطه تمرکز صنعت از خودِ مدل‌ها به زیرساختی است که این مدل‌ها را می‌چرخاند.

بسیاری از شرکت‌ها تمام سرمایه و تحقیقات خود را روی هوشمندتر کردن مدل‌ها می‌ریزند. اما لایه نرم‌افزاری یا همان «هارنس» (Harness) — شبیه به بدنه و شاسی یک ماشین که قدرت موتور را به چرخ‌ها می‌رساند — اغلب مانع از رسیدن مدل به حداکثر توانش در محیط عملیاتی می‌شود. طبق گزارش‌های فنی، هر بار که نسل جدیدی از GPUها یا معماری‌های مدل معرفی می‌شود، مهندسان باید کدهای بهینه‌سازی را دستی بازنویسی کنند؛ فرآیندی که هرگز نمی‌تواند با سرعت به‌روزرسانی‌های هفتگی مدل‌ها پیش برود.

بینگ شو (Bing Xu)، مهندس سابق انویدیا (NVIDIA)، متا (Meta) و اپل (Apple)، سال‌ها را صرف حل این شکاف‌های بهره‌وری کرد. مسیر شغلی او همواره بر بهبود نرم‌افزار و زیرساخت‌های زیربنایی سیستم‌های مدرن AI متمرکز بوده است. او پیش از تأسیس INT21 در سال ۲۰۲۶، به عنوان مهندس ارشد نرم‌افزار در متا فعالیت می‌کرد و در آنجا ابزار AITemplate را خلق کرد تا استنتاج در مقیاس تولید را در تمامی بارهای کاری بهینه کند. او همچنین نقش‌های مهندسی و پژوهشی متعددی در OctoML, Facebook AI، اپل و Turi بر عهده داشت.

شو پیش از این، بنیان‌گذار HippoML بود؛ استارتاپی در زمینه استنتاج GPU که تخصصش استنتاج سریع برای هوش مصنوعی زاینده (Generative AI) بود. HippoML ابزارهای بهینه‌سازی نرم‌افزاری ساخت تا مدل‌های زبانی بزرگ را سریع‌تر و بهینه‌تر اجرا کند. انویدیا این شرکت را تنها ۱۴ ماه پس از لانچ خریداری کرد. شو در انویدیا به مقام مهندس برجسته (Distinguished Engineer) رسید و روی توسعه نرم‌افزارهای عامل‌محور کار کرد و چندین نسل از عامل‌های کدنویسی، از جمله پروژه‌های VibeTensor و AVO را خلق نمود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی لایه‌های سخت‌افزاری اشاره کردیم، تفاوت بین یک مدل کند و یک مدل سریع، اغلب در لایه زیرساختی نهفته است. تحقیقات شو در انویدیا ثابت کرد که عملکرد عامل‌ها در وظایف پیچیده، بیش از آنکه به خودِ مدل وابسته باشد، به لایه زیرساختی اطراف آن (هارنس) بستگی دارد. این شواهد نشان داد که گلوگاه واقعی در زیرساخت AI، یافتن مدل‌های بهتر نیست، بلکه بهینه‌سازی سیستم‌هایی است که این مدل‌ها را اجرا می‌کنند.

شکاف استعدادی و گلوگاه زیرساخت

شو شرکت INT21 را زمانی تأسیس کرد که متوجه کمبود شدید و بحرانی متخصصان زیرساخت AI در تخصص‌های مختلف شد؛ تقاضا برای این استعدادها بسیار بیشتر از عرضه بود. او این چالش را شخصاً در HippoML تجربه کرد، جایی که شرکت نمی‌توانست بدون تکیه بر پیمانکاران بااستعداد از شرق اروپا و مناطق دیگر، با تقاضای بهینه‌سازی استنتاج AI پیش برود و مقیاس‌پذیر شود.

او دریافت که ابزارهای توسعه سنتی اساساً توسط تعداد ساعاتی که یک انسان می‌تواند کار کند و مسائل خاصی که یک انسان می‌تواند فیزیکی حل کند، محدود شده‌اند. در مقابل، فلسفه اصلی INT21 این است که عامل‌ها، درست مانند انسان‌ها، از طریق انباشت دانش هوشمندتر می‌شوند.

این دسته‌های عامل‌محور چون محدود به چارچوب‌های (Frameworks) قدیمی و موجود نیستند، برای هر بار کاری (Workload) خاص، راهکاری را از صفر می‌سازند. این رویکرد با دیدگاه‌های مدرن در مورد اتوماسیون سازگار است که در آن اولویت با طراحی جریان‌های کاری بهینه است تا ابزارهای تک‌منظوره. این یعنی با هر چرخه تولید، سیستم سریع‌تر، دقیق‌تر و بهینه‌تر می‌شود. تکنولوژی با چنان سرعتی پیش رفته است که این سیستم‌ها اکنون واقعاً برای ساخت، اجرا و بهینه‌سازی زیرساخت‌ها به‌صورت خودمختار (Autonomous) کفایت می‌کنند.

کارخانه موتور استنتاج

شرکت INT21 اکنون از «کارخانه موتور استنتاج» (Inference Engine Factory) استفاده می‌کند. این سامانه از دسته‌های عامل‌محور خودمختار برای ساخت کل پشته (Stack) زیرساختی استفاده می‌کند، شامل:

  • هسته‌های CUDA و PTX
  • درایورهای سخت‌افزاری
  • زیرساخت‌های سرویس‌دهی (Serving Infrastructure)

یک موتور استنتاج (Inference) — نرم‌افزاری که مدل را روی سخت‌افزار اجرا می‌کند — نیاز به ده‌ها تصمیم طراحی هم‌زمان دارد؛ مثلاً اینکه زمان‌بندی کارها بین هسته‌ها چگونه باشد یا کدام عملیات‌ها در یک هسته واحد با هم اجرا شوند. چون این تصمیمات به هم پیوسته‌اند، تغییر یکی مستلزم تست مجدد همه موارد دیگر است. به‌طور سنتی، مهندسان انسانی این موارد را برای هر مدل به‌صورت دستی تنظیم می‌کردند.

این موضوع به‌ویژه برای تولید ویدیو، موسیقی و گفتار که از معماری‌های چندمرحله‌ای و چندمقیاسی (Multiscale) استفاده می‌کنند و هیچ چارچوب آماده‌ای ندارند، بسیار دشوار است. عامل‌های INT21 هزاران تغییر بهینه‌سازی را به‌صورت موازی بررسی می‌کنند. آن‌ها عملکرد را مستقیماً روی سخت‌افزارهای هدف، مانند NVIDIA Hopper و Blackwell اعتبارسنجی می‌کنند.

این رویکرد به سیستم اجازه می‌دهد بهره‌وری‌هایی را پیدا کند که مهندسان انسانی به دلیل دشواری و طاقت‌فرسا بودن فرآیند دستی، از آن‌ها غافل می‌شوند. در حال حاضر، پشته‌های تولید ویدیو و صدا در INT21 بدون نیاز به بازبینی کد توسط انسان، از پیشرفته‌ترین راهکارهای استنتاج موجود در تنظیمات هم‌زمانی (Concurrency) یکسان، عملکرد بهتری دارند.

عبور از کامپایلرها

بهینه‌سازی‌های سنتی GPU بر پایه زبان‌های تخصصی (DSL) و کامپایلرهای پیش‌ساخته هستند. در حالی که این ابزارها برای الگوهای رایج جواب می‌دهند، در برابر بارهای کاری جدید مثل KDA (Kimi Linear Attention) شکست می‌خورند.

عامل‌های INT21 این انتزاع‌ها را به‌طور کامل دور می‌زنند. آن‌ها با نادیده گرفتن پیش‌فرض‌های کامپایلر و قالب‌های DSL، فضای طراحی را از پایه جست‌وجو می‌کنند. به نقل از مصاحبه unite.ai، همین آزادی عمل منجر به جهش ۵۹ درصدی عملکرد در بارهای کاری KDA نسبت به خط‌مبناهای موجود شد.

این قابلیت ابتدا از طریق «کارخانه هسته PTX» شرکت نمایش داده شد که هسته‌های GPU را روی سخت‌افزارهای Hopper و Blackwell تولید و بنچ‌مارک می‌کرد. از آن زمان، شرکت منابع محاسباتی خود را به سمت بهینه‌سازی کامل موتورهای استنتاج تغییر داده است.

حل اثر فرانکنشتاین

در تلاش‌های قبلی برای کدنویسی با AI، پدیده‌ای رخ می‌داد که شو آن را «اثر فرانکنشتاین» می‌نامد. این درسی بود که از پروژه VibeTensor در انویدیا آموختند. در آن مورد، AI در هر سطح به‌تنهایی کد درستی تولید می‌کرد، اما وقتی قطعات در قالب یک سیستم جمع می‌شدند، نتیجه ضعیف‌تر از چیزی بود که خبرگان انسانی می‌ساختند.

در مقابل، کار روی «عملگرهای تغییر عامل‌محور» (AVO) نشان داد که AI می‌تواند در مسائل با محدوده بسته (Tightly Scoped)، مانند تولید هسته (Kernel Generation)، از انسان پیشی بگیرد؛ زیرا هدف در اینجا محدود، قابل اندازه‌گیری و تک‌بعدی است.

برای حل اثر فرانکنشتاین، INT21 پلتفرم SwarmOS را ساخت؛ یک پلتفرم Cloud-native که عامل‌های متخصص را هماهنگ می‌کند. به جای استفاده از یک مدل غول‌پیکر با پنجره متنی (Context Window) بزرگ — که شو اشاره می‌کند فقط به نگه داشتن اطلاعات کمک می‌کند و نه حل مسائل چندبعدی متصل به هم — سامانه SwarmOS از چندین عامل با محدودیت‌های روشن و اهداف اندازه‌پذیر استفاده می‌کند.

این ساختار شبیه به یک تیم مهندسی است که در آن هر متخصص روی حوزه خود تسلط دارد اما برای تصمیماتی که بر دیگران اثر می‌گذارد، هماهنگ می‌شود. این ارکستراسیون به عامل‌ها اجازه می‌دهد به‌صورت موازی کاوش کنند و بدون تکرار یا تداخل، روی راهکارهای قوی‌تر هم‌گرا شوند. با استفاده از عامل‌های متخصص، فرآیند بهینه‌تر می‌شود چون از هیچ عاملی خواسته نمی‌شود که هم‌زمان درباره تمام متغیرها استدلال کند.

چرخه بازخورد سخت‌گیرانه

برای جلوگیری از تولید کدهای «ظاهراً درست اما غلط»، یک چرخه تأیید شدید اجرا می‌شود. یک بهینه‌سازی اگر فقط تحت فرض‌های خاص یا توزیع ورودی خاصی درست باشد، بی‌ارزش است.

این فرآیند مسیر سخت‌گیرانه‌ای را دنبال می‌کند:

  • نقطه شروع: سیستم با مدل، محدودیت‌های استقرار و معیار سرویس‌دهی (Serving Metric) مورد نظر شروع می‌کند.
  • کاوش: دسته‌های عامل به‌طور هم‌زمان مسیرهای پیکربندی و بهینه‌سازی را جست‌وجو می‌کنند.
  • ارزیابی: هر کاندید در برابر اهداف سخت‌گیرانه صحت (Correctness) و عملکرد تست می‌شود.
  • حفظ: فقط پیاده‌سازی‌هایی که در عمل ثابت شده‌اند، نگه داشته می‌شوند.

این فرآیند باعث می‌شود سیستم به‌جای تولید سریع کد، یک ابزار زیرساختی خودبهبودبخش باشد. داده‌های اعتبارسنجی خودشان بهبود یافته و به دسته‌های عامل بازمی‌گردند تا درک آن‌ها از آنچه «کار می‌کند» دقیق‌تر شود. این کار از انباشت بدهی فنی (Technical Debt) که معمولاً نرم‌افزارهای تولید شده توسط AI را دچار می‌کند، جلوگیری می‌کند. بدون این سخت‌گیری، سیستم فقط کد را سریع‌تر ارسال می‌کرد در حالی که اعتماد به ساختار سیستم به‌طور نامرئی تخریب می‌شد.

بهبود خودکار در برابر بهبود بازگشتی

INT21 رویکرد خود را با «بهبود بازگشتی» (Recursive Self-Improvement) متفاوت می‌داند. بهبود بازگشتی بر آموزش مدل‌های اختصاصی تمرکز دارد تا بتوانند درباره فرآیند آموزش خود استدلال کنند؛ سفری ۱۰ ساله که نیازمند سرمایه‌های کلان، تیم‌های پژوهشی و میلیاردها دلار هزینه است.

اما رویکرد INT21 متفاوت است. آن‌ها سعی نمی‌کنند خودِ مدل‌های پیشرو (Frontier Models) را بهبود ببخشند، بلکه دسته‌های عاملی می‌سازند تا «هارنس» را بهینه کنند. شو این تفاوت را این‌گونه توصیف می‌کند: یک روش سعی دارد نیروگاه بسازد، اما INT21 با برقی که همین حالا وجود دارد، ابزار می‌سازد.

یک عامل نیازی ندارد سازوکار داخلی یک مدل پیشرو را بفهمد تا ۱۰٪ بهره‌وری ایجاد کند؛ او فقط باید فضای طراحی را کاوش کند، اندازه‌گیری کند، اعتبارسنجی کند و آنچه کار می‌کند را نگه دارد. با تمرکز بر لایه زیرساخت، INT21 می‌تواند سریع‌تر حرکت کند و بدون نیاز به میلیاردها دلار سرمایه، به تقاضای فوری بازار پاسخ دهد. این تمرکز بر هارنس بر اساس تحقیقاتی است که ثابت کرد لایه زیرساخت، و نه مدل، تعیین‌کننده عملکرد عامل در وظایف پیچیده است.

آینده مهندسی زیرساخت

این تحول، نقش مهندس زیرساخت را به‌طور بنیادی تغییر می‌دهد. شغل مهندسی از کلنجار رفتن با کدهای هسته و تنظیمات حافظه فاصله می‌گیرد. در عوض، مهندسان آینده فضای طراحی را تعریف می‌کنند، اهداف را تعیین می‌کنند، محدودیت‌ها را وضع می‌کنند و نتایج تولید شده توسط دسته‌های عامل را تفسیر می‌کنند.

شو معتقد است در حالی که برای نگه داشتن سیستم‌ها به مهندسان زیرساخت کمتری نیاز خواهد بود، اما کارهای استراتژیک باقی‌مانده ارزشمندتر می‌شوند. سازمان‌ها قادر خواهند بود زیرساخت‌های پیچیده AI را با تعداد بسیار کمتری از مهندسان متخصص نسبت به امروز اداره کنند و بدین ترتیب مشکل کمبود استعدادی که شو در HippoML با آن مواجه بود، حل شود. این تغییر در ساختار نیروی انسانی، مشابه آن است که چگونه عامل‌های هوشمند در سازمان‌ها جایگزین سیستم‌های سنتی تیکتینگ شده و نقش کارکنان را از اجرا به نظارت تغییر می‌دهند.

خبرگان انسانی همچنان ضروری هستند، اما نقش آن‌ها به ارائه جهت‌دهی و تفسیر نتایج تغییر می‌کند، در حالی که AI با اجرای سیستماتیک‌تر از هر انسانی، تأثیر آن‌ها را تقویت می‌کند. AI کارهای طاقت‌فرسای جست‌وجوی هزاران تغییر را بر عهده می‌گیرد و انسان جهت‌دهی استراتژیک سطح بالا را فراهم می‌کند.

شو آینده‌ای را متصور است که در آن کل پشته AI — از هسته‌های سطح پایین تا چارچوب‌های بنیادین و رابط‌های سطح بالا — به‌صورت خودمختار هماهنگ شوند. در حال حاضر، این لایه‌ها به‌طور مستقل بهینه می‌شوند، به این معنی که بهینه‌سازی در یک لایه ممکن است به‌طور تصادفی چیزی را در لایه‌های پایین‌دست خراب کند.

در بلندمدت، دسته‌های عامل در تمام لایه‌ها هماهنگ خواهند شد. وقتی مدل جدیدی معرفی شود، کل پشته به‌طور خودکار و در لحظه بازنویسی و بهینه می‌شود تا هیچ ذره‌ای از توان سخت‌افزار هدر نرود. این یک دسته جدید از محاسبات را خلق می‌کند: «زیرساخت خودبهبودبخش». زیرساختی که بتواند به سرعت سخت‌افزارها و مدل‌ها سازگار شود، برتری رقابتی را خواهد داشت، در حالی که سیستم‌های ایستا به یک نقطه ضعف تبدیل می‌شوند.

گام بعدی شما

  • اگر از مدل‌های Open-source استفاده می‌کنید، بررسی کنید که آیا لایه استنتاج شما (مانند vLLM) با سخت‌افزارتان کاملاً همراستا است یا خیر.
  • روی یادگیری ابزارهای مدیریت عامل‌های تخصصی (Multi-agent systems) تمرکز کنید، زیرا مدیریت این دسته‌ها جایگزین کدنویسی دستی زیرساخت می‌شود.
  • تحولات تراشه‌های Blackwell انویدیا را دنبال کنید، زیرا این سخت‌افزارها بستر اصلی آزمایش‌های INT21 هستند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با حذف نیاز به ارتش‌های بزرگ از مهندسان سطح پایین GPU، هزینه استقرار مدل‌های پیچیده را به‌شدت کاهش می‌دهد. اعتبار این ادعا از سوابق بینگ شو در انویدیا و متا می‌آید که مستقیماً با گلوگاه‌های سخت‌افزاری در مقیاس جهانی دست‌وپنجه نرم کرده است.

تأثیر برای ایران

به‌دلیل محدودیت دسترسی به سخت‌افزارهای نسل جدید انویدیا در ایران، اثر مستقیم این ابزار برای توسعه‌دهندگان داخلی کم است، اما برای کسانی که از سرویس‌های ابری بین‌المللی استفاده می‌کنند، کاهش هزینه استنتاج یک مزیت است.

·نگاه ما
تحریریه دات‌هوش

تمرکز INT21 بر لایه زیرساخت به‌جای مدل، یک چرخش استراتژیک است؛ چرا که در دنیایی که مدل‌های بنیادی به سقف اشباع نزدیک می‌شوند، برنده کسی است که بتواند مدل‌های موجود را با کمترین هزینه و بیشترین سرعت اجرا کند. این رویکرد نشان می‌دهد که «بهینه‌سازی» دیگر یک مرحله تکمیلی نیست، بلکه خودِ محصول است. در واقع، ما از عصر «ساخت مدل» به عصر «مهندسی اجرای مدل» وارد می‌شویم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.