پرش به محتوای اصلی
پرش به محتوای مقاله

«بهینه‌سازی لایه‌های پایین»؛ راهکار Kog برای شتاب‌دهی به استنتاج مدل‌ها

·۲۳ مرداد ۱۴۰۵۵ دقیقه مطالعه
کاگ برای استخراج بیشترین قدرت استنتاج از پردازنده‌های گرافیکی عمیق‌تر می‌رود | تک‌کرانچ
کاگ برای استخراج بیشترین قدرت استنتاج از پردازنده‌های گرافیکی عمیق‌تر می‌رود | تک‌کرانچ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

به‌جای طراحی تراشه جدید، Kog با استفاده از متدهای امنیت سایبری و مهندسی معکوس، سرعت استنتاج را روی سخت‌افزارهای موجود ۳۰ برابر می‌کند.

اگر امروز برای اجرای مدل‌های زبانی در مقیاس صنعتی هزینه می‌کنید، احتمالاً بخش بزرگی از قدرت سخت‌افزارتان هرگز فعال نمی‌شود. استارتاپ فرانسوی Kog ادعا می‌کند که با یک «هک» نرم‌افزاری، می‌تواند سرعت تولید پاسخ‌های هوش مصنوعی را در همان پردازنده‌هایی که اکنون دارید، تا ۳۰ برابر افزایش دهد.

در حالی که غول‌های فناوری روی تراشه‌های اختصاصی تمرکز کرده‌اند — مانند استقبال گرمی که بازار از عرضه اولیه سهام Cerebras در مه ۲۰۲۴ داشت — تیم Kog معتقد است سخت‌افزارهای فعلی مانند NVIDIA H200 و AMD MI300X دارای پهنای باند حافظه عظیمی هستند که تا حد زیادی بلااستفاده باقی مانده است. این تمرکز بر سخت‌افزارهای AMD در حالی است که این شرکت اخیراً سرمایه‌گذاری کلانی برای تامین زیرساخت‌های برق کلود Anthropic انجام داده تا ظرفیت‌های پردازشی خود را گسترش دهد. آن‌ها می‌خواهند با بهینه‌سازی لایه‌های زیرین نرم‌افزاری، گلوگاه‌های رمزگشایی (Decoding) — که شبیه به ترافیک سنگین در خروجی یک اتوبان است و سرعت رسیدن به جواب نهایی را می‌گیرد — از بین ببرند.

این تلاش برای افزایش سرعت در زمانی رخ می‌دهد که هزینه و تأخیر در استنتاج (Inference) — یعنی همان لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره‌ی آموزش آشپز — به بزرگ‌ترین مانع برای پذیرش هوش مصنوعی در محیط‌های حرفه‌ای تبدیل شده است. به عنوان مثال، کاربران Claude Code گاهی برای نتایج پیچیده ساعت‌ها منتظر می‌مانند و همین موضوع باعث شد Anthropic برای حالت «سریع» (Fast Mode) هزینه بیشتری دریافت کند. هدف Kog این است که سرعت بالای رمزگشایی را از یک کالای لوکس و پولی برای کاربران حرفه‌ای، به یک استاندارد تبدیل کند.

زمینه و تقاضای بازار

Kog نخستین بار در مه ۲۰۲۴ با انتشار یک پیش‌نمایش فنی در صفحه اول Hacker News توجهات را جلب کرد. هدف این پیش‌نمایش اثبات این نکته بود که «رمزگشایی بسیار سریع برای تک‌درخواست‌ها روی GPUهای استاندارد مراکز داده که شرکت‌ها در حال حاضر مالک آن‌ها هستند، امکان‌پذیر است». اگرچه برخی کاربران از اینکه این قابلیت به GPUهای لپ‌تاپ تعمیم نمی‌یافت ناامید شدند، اما پتانسیل تجاری آن برای سازمان‌های بزرگ کاملاً روشن بود.

گائل دلالو (Gaël Delalleau)، مدیرعامل Kog، اعلام کرد که پس از این پیش‌نمایش، ۲۰۰ سرنخ تجاری واقعی دریافت کرده است. بر اساس بازخوردهای اولیه، دلالو انتظار دارد که مهندسی نرم‌افزار نخستین حوزه کاربردی و اصلی باشد. علاوه بر این، این استارتاپ شرکای طراحی دارد که در حال ساخت اپلیکیشن‌ها و بازی‌هایی از طریق پرامپت‌ها هستند؛ جایی که موتور استنتاج Kog (KIE) می‌تواند با تسریع نتایج، مستقیماً باعث افزایش درآمد آن‌ها شود.

رویکرد «هکری» به مهندسی

رویکرد دلالو به مهندسی GPU غیرمتعارف است. او به‌جای تکیه بر روش‌های رایج پژوهشی، از ذهنیتی برگرفته از فیزیک حالت جامد — که در مدرسه پلی‌تکنیک فرانسه (École Polytechnique) مطالعه کرده است — و امنیت سایبری تهاجمی استفاده می‌کند. دلالو که چهار بار فینالیست مسابقات CTF در DEF CON بوده، بهینه‌سازی GPU را شبیه به «هک کلاه سفید» می‌بیند.

این فرآیند شامل مهندسی معکوس سخت‌افزار تا سطح زبان اسمبلی و کدهای باینری است تا بفهمد سخت‌افزار دقیقاً چگونه کار می‌کند و سپس GPU را مجبور کند به اهدافی دست یابد که لزوماً برای آن‌ها طراحی نشده است. دلالو این کار را درک «قوانین GPU» برای به حداکثر رساندن عملکرد توصیف می‌کند.

جزئیات فنی و استراتژی

بر اساس مستندات فنی Kog، دستاوردهای فعلی آن‌ها شامل موارد زیر است:

  • دموی اولیه: دستیابی به ۳,۰۰۰ توکن (Token) در ثانیه (TPS) برای هر درخواست با استفاده از مدل Laneformer 2B — یک مدل کوچک بازمتن با ۲ میلیارد پارامتر. توکن‌ها تکه‌های کوچکی از متن هستند، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد. این دستاورد در کنار تلاش‌های دیگر در صنعت است؛ برای مثال بهینه‌سازی‌های جدید در DGX Spark توانسته سرعت استنتاج مدل Qwen3.5 را به ۷۸ توکن بر ثانیه برساند.
  • تمرکز سخت‌افزاری: موتور KIE برای GPUهای رده‌بالای مراکز داده طراحی شده و برای لپ‌تاپ‌های معمولی نیست.
  • جهش به مدل‌های بزرگ: پس از موفقیت در مدل‌های کوچک، تیم اکنون روی مدل‌های بزرگ‌تر تمرکز کرده است. این تغییر جهت به این دلیل رخ داد که مشتریان احتمالی آمادگی نداشتند مدل‌های کوچک را تنظیم دقیق (Fine-tuning) کنند — فرآیندی که شبیه دادن تخصص پوست به یک پزشک عمومی است.
  • مهندسی دستی: این فرآیند بسیار متمرکز بر نیروی انسانی و زمان‌بر است. تیم ۱۱ نفره‌ی آن‌ها هفته‌ها یا حتی ماه‌ها را صرف تحقیق مهندسی GPU روی هر تراشه‌ی جدیدی می‌کند که قصد پشتیبانی از آن را دارند.
  • مقیاس‌پذیری آینده: برای غلبه بر محدودیت‌های یک تیم کوچک، Kog قصد دارد متدولوژی خود را به خط‌لوله‌های عامل‌محور (Agent-based) منتقل کند تا در طول زمان از تراشه‌ها و مدل‌های بیشتری پشتیبانی کند.

این استراتژی، Kog را در دسته‌ای متفاوت از شرکت‌های فرانسوی مانند ZML قرار می‌دهد که روی نرم‌افزارهای مستقل از سخت‌افزار برای دور زدن CUDA انویدیا تمرکز دارند. دلالو می‌گوید رویکرد آن‌ها بیشتر شبیه آزمایشگاه Hazy Research در دانشگاه استنفورد است که تمرکز عمیق‌تری بر شتاب‌دهی GPU دارد.

برای کاربر حرفه‌ای، این یعنی «بازی انتظار» در کدنویسی با AI یا گردش‌های کاری عامل‌محور ممکن است به‌کلی حذف شود. اگر Kog بتواند تا سپتامبر ۲۰۲۴ سرعت یک مدل بزرگ را ۱۰ برابر کند، احتمالاً باعث تغییر در نحوه بودجه‌بندی محاسباتی شرکت‌ها خواهد شد؛ به گونه‌ای که به‌جای خرید تراشه‌های بیشتر، روی بهینه‌سازی تراشه‌های موجود سرمایه‌گذاری کنند.

اثر مرتبه دوم این تحول، تقویت حاکمیت محاسباتی اروپا است. Kog با حمایت Scaleway، Bpifrance و برنامه French Tech 2030، تلاش می‌کند وابستگی کلی اروپا به نقشه‌راه سخت‌افزاری که توسط غول‌های تراشه‌ساز آمریکایی دیکته می‌شود را کاهش دهد.

منتظر نمایش Kog در سپتامبر برای پیاده‌سازی روی یک مدل بزرگ باشید؛ اگر آن‌ها به هدف ۱۰ برابری برسند، دلالو معتقد است که قادر خواهند بود جذب مشتریان را اثبات کرده و دور سرمایه‌گذاری Series A خود را جذب کنند.

گام بعدی شما

  • اگر از مدل‌های کوچک (SLM) برای کارهای تخصصی استفاده می‌کنید، منتظر دموهای سپتامبر Kog برای مدل‌های بزرگ‌تر باشید.
  • بررسی کنید که آیا گلوگاه سیستم شما در تعداد GPUهاست یا سرعت رمزگشایی (Decoding)؛ دومی جایی است که Kog تغییر ایجاد می‌کند.
  • متدهای مهندسی معکوس در لایه‌های پایین سخت‌افزار را به عنوان جایگزینی برای خرید سخت‌افزار گران‌قیمت دنبال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با کاهش شدید تأخیر در استنتاج، امکان اجرای عامل‌های هوش مصنوعی در زمان واقعی را فراهم می‌کند. تخصص Kog در مهندسی معکوس سخت‌افزار، وابستگی صنعت را به ابزارهای بسته انویدیا کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت دسترسی به GPUهای رده‌بالا، این بهینه‌سازی برای مراکز داده داخلی که با محدودیت سخت‌افزاری روبرو هستند، بسیار حیاتی است تا از منابع موجود بیشترین بهره را ببرند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Kog بر مهندسی معکوس لایه‌های پایین، این فرض را می‌شکند که برای افزایش سرعت استنتاج حتماً باید به سراغ معماری‌های جدید ASIC رفت. این رویکرد نشان می‌دهد که مقدار زیادی از توان پردازشی در GPUهای فعلی به‌دلیل لایه‌های نرم‌افزاری ناکارآمد هدر می‌رود. اگر این متدولوژی مقیاس‌پذیر شود، مدل اقتصادی مراکز داده از خرید سخت‌افزار به سمت خرید «بهینه‌سازهای نرم‌افزاری» تغییر می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.