اگر امروز برای اجرای مدلهای زبانی در مقیاس صنعتی هزینه میکنید، احتمالاً بخش بزرگی از قدرت سختافزارتان هرگز فعال نمیشود. استارتاپ فرانسوی Kog ادعا میکند که با یک «هک» نرمافزاری، میتواند سرعت تولید پاسخهای هوش مصنوعی را در همان پردازندههایی که اکنون دارید، تا ۳۰ برابر افزایش دهد.
در حالی که غولهای فناوری روی تراشههای اختصاصی تمرکز کردهاند — مانند استقبال گرمی که بازار از عرضه اولیه سهام Cerebras در مه ۲۰۲۴ داشت — تیم Kog معتقد است سختافزارهای فعلی مانند NVIDIA H200 و AMD MI300X دارای پهنای باند حافظه عظیمی هستند که تا حد زیادی بلااستفاده باقی مانده است. این تمرکز بر سختافزارهای AMD در حالی است که این شرکت اخیراً سرمایهگذاری کلانی برای تامین زیرساختهای برق کلود Anthropic انجام داده تا ظرفیتهای پردازشی خود را گسترش دهد. آنها میخواهند با بهینهسازی لایههای زیرین نرمافزاری، گلوگاههای رمزگشایی (Decoding) — که شبیه به ترافیک سنگین در خروجی یک اتوبان است و سرعت رسیدن به جواب نهایی را میگیرد — از بین ببرند.
این تلاش برای افزایش سرعت در زمانی رخ میدهد که هزینه و تأخیر در استنتاج (Inference) — یعنی همان لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — به بزرگترین مانع برای پذیرش هوش مصنوعی در محیطهای حرفهای تبدیل شده است. به عنوان مثال، کاربران Claude Code گاهی برای نتایج پیچیده ساعتها منتظر میمانند و همین موضوع باعث شد Anthropic برای حالت «سریع» (Fast Mode) هزینه بیشتری دریافت کند. هدف Kog این است که سرعت بالای رمزگشایی را از یک کالای لوکس و پولی برای کاربران حرفهای، به یک استاندارد تبدیل کند.
زمینه و تقاضای بازار
Kog نخستین بار در مه ۲۰۲۴ با انتشار یک پیشنمایش فنی در صفحه اول Hacker News توجهات را جلب کرد. هدف این پیشنمایش اثبات این نکته بود که «رمزگشایی بسیار سریع برای تکدرخواستها روی GPUهای استاندارد مراکز داده که شرکتها در حال حاضر مالک آنها هستند، امکانپذیر است». اگرچه برخی کاربران از اینکه این قابلیت به GPUهای لپتاپ تعمیم نمییافت ناامید شدند، اما پتانسیل تجاری آن برای سازمانهای بزرگ کاملاً روشن بود.
گائل دلالو (Gaël Delalleau)، مدیرعامل Kog، اعلام کرد که پس از این پیشنمایش، ۲۰۰ سرنخ تجاری واقعی دریافت کرده است. بر اساس بازخوردهای اولیه، دلالو انتظار دارد که مهندسی نرمافزار نخستین حوزه کاربردی و اصلی باشد. علاوه بر این، این استارتاپ شرکای طراحی دارد که در حال ساخت اپلیکیشنها و بازیهایی از طریق پرامپتها هستند؛ جایی که موتور استنتاج Kog (KIE) میتواند با تسریع نتایج، مستقیماً باعث افزایش درآمد آنها شود.
رویکرد «هکری» به مهندسی
رویکرد دلالو به مهندسی GPU غیرمتعارف است. او بهجای تکیه بر روشهای رایج پژوهشی، از ذهنیتی برگرفته از فیزیک حالت جامد — که در مدرسه پلیتکنیک فرانسه (École Polytechnique) مطالعه کرده است — و امنیت سایبری تهاجمی استفاده میکند. دلالو که چهار بار فینالیست مسابقات CTF در DEF CON بوده، بهینهسازی GPU را شبیه به «هک کلاه سفید» میبیند.
این فرآیند شامل مهندسی معکوس سختافزار تا سطح زبان اسمبلی و کدهای باینری است تا بفهمد سختافزار دقیقاً چگونه کار میکند و سپس GPU را مجبور کند به اهدافی دست یابد که لزوماً برای آنها طراحی نشده است. دلالو این کار را درک «قوانین GPU» برای به حداکثر رساندن عملکرد توصیف میکند.
جزئیات فنی و استراتژی
بر اساس مستندات فنی Kog، دستاوردهای فعلی آنها شامل موارد زیر است:
- دموی اولیه: دستیابی به ۳,۰۰۰ توکن (Token) در ثانیه (TPS) برای هر درخواست با استفاده از مدل Laneformer 2B — یک مدل کوچک بازمتن با ۲ میلیارد پارامتر. توکنها تکههای کوچکی از متن هستند، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد. این دستاورد در کنار تلاشهای دیگر در صنعت است؛ برای مثال بهینهسازیهای جدید در DGX Spark توانسته سرعت استنتاج مدل Qwen3.5 را به ۷۸ توکن بر ثانیه برساند.
- تمرکز سختافزاری: موتور KIE برای GPUهای ردهبالای مراکز داده طراحی شده و برای لپتاپهای معمولی نیست.
- جهش به مدلهای بزرگ: پس از موفقیت در مدلهای کوچک، تیم اکنون روی مدلهای بزرگتر تمرکز کرده است. این تغییر جهت به این دلیل رخ داد که مشتریان احتمالی آمادگی نداشتند مدلهای کوچک را تنظیم دقیق (Fine-tuning) کنند — فرآیندی که شبیه دادن تخصص پوست به یک پزشک عمومی است.
- مهندسی دستی: این فرآیند بسیار متمرکز بر نیروی انسانی و زمانبر است. تیم ۱۱ نفرهی آنها هفتهها یا حتی ماهها را صرف تحقیق مهندسی GPU روی هر تراشهی جدیدی میکند که قصد پشتیبانی از آن را دارند.
- مقیاسپذیری آینده: برای غلبه بر محدودیتهای یک تیم کوچک، Kog قصد دارد متدولوژی خود را به خطلولههای عاملمحور (Agent-based) منتقل کند تا در طول زمان از تراشهها و مدلهای بیشتری پشتیبانی کند.
این استراتژی، Kog را در دستهای متفاوت از شرکتهای فرانسوی مانند ZML قرار میدهد که روی نرمافزارهای مستقل از سختافزار برای دور زدن CUDA انویدیا تمرکز دارند. دلالو میگوید رویکرد آنها بیشتر شبیه آزمایشگاه Hazy Research در دانشگاه استنفورد است که تمرکز عمیقتری بر شتابدهی GPU دارد.
برای کاربر حرفهای، این یعنی «بازی انتظار» در کدنویسی با AI یا گردشهای کاری عاملمحور ممکن است بهکلی حذف شود. اگر Kog بتواند تا سپتامبر ۲۰۲۴ سرعت یک مدل بزرگ را ۱۰ برابر کند، احتمالاً باعث تغییر در نحوه بودجهبندی محاسباتی شرکتها خواهد شد؛ به گونهای که بهجای خرید تراشههای بیشتر، روی بهینهسازی تراشههای موجود سرمایهگذاری کنند.
اثر مرتبه دوم این تحول، تقویت حاکمیت محاسباتی اروپا است. Kog با حمایت Scaleway، Bpifrance و برنامه French Tech 2030، تلاش میکند وابستگی کلی اروپا به نقشهراه سختافزاری که توسط غولهای تراشهساز آمریکایی دیکته میشود را کاهش دهد.
منتظر نمایش Kog در سپتامبر برای پیادهسازی روی یک مدل بزرگ باشید؛ اگر آنها به هدف ۱۰ برابری برسند، دلالو معتقد است که قادر خواهند بود جذب مشتریان را اثبات کرده و دور سرمایهگذاری Series A خود را جذب کنند.
گام بعدی شما
- اگر از مدلهای کوچک (SLM) برای کارهای تخصصی استفاده میکنید، منتظر دموهای سپتامبر Kog برای مدلهای بزرگتر باشید.
- بررسی کنید که آیا گلوگاه سیستم شما در تعداد GPUهاست یا سرعت رمزگشایی (Decoding)؛ دومی جایی است که Kog تغییر ایجاد میکند.
- متدهای مهندسی معکوس در لایههای پایین سختافزار را به عنوان جایگزینی برای خرید سختافزار گرانقیمت دنبال کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو