اگر امروز به دنبال جایگاه شغلی در زیرساختهای هوش مصنوعی هستید، یک پورتفولیوی شامل کدهای تأییدشده بسیار ارزشمندتر از یک گواهینامه کاغذی است. InferQuest که در ۲۴ اوت ۲۰۲۶ راهاندازی شد، دو نقشه راه رایگان را معرفی کرده است تا مهندسان نرمافزار را از طریق سیستمی از «کویستهای تأییدشده»، به متخصصان استنتاج یا آموزش تبدیل کند.
به نقل از مستندات این پلتفرم، با انتقال مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — از آزمایشگاهها به مقیاس تولید، صنعت با کمبود شدید مهندسانی مواجه شده که بتوانند مدلها را سریعتر و ارزانتر اجرا کنند. اکثر دورههای آنلاین بر آزمونهای چهارگزینهای تکیه دارند که بهراحتی قابل تقلب هستند؛ اما InferQuest تمرکز را به اثبات تجربی تغییر داده و کاربر را برای پیشرفت، ملزم به استقرار نقاط انتهایی (endpoints) زنده و نوشتن کرنلهای کاربردی GPU میکند.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی سختافزاری مدلها اشاره کردیم، تسلط بر لایههای پایینتر محاسبات، مرز بین یک توسعهدهنده معمولی و یک مهندس زیرساخت است. در InferQuest، همه کاربران از ماژول Foundations شروع میکنند که مفاهیم داخلی ترنسفورمر (Transformer)، معماری GPU و کرنلها را پوشش میدهد. سپس یادگیرندگان به مسیرهای تخصصی میروند و پیشرفت آنها در یک جدول XP مشترک، از سطح «توکن» تا «مدل بنیادی» (Foundation Model) ردیابی میشود.
طبق گزارش این پلتفرم، برای تضمین تسلط کاربر از سه مکانیزم استفاده میشود:
- تمرینهای نمرهدار: آزمونهای سمت سرور درباره ریاضیات KV Cache، تحلیل Roofline، پذیرش در رمزگشایی گمانهزن (speculative-decoding acceptance) و موازنه بین موازیسازی.
- تکرار با فاصله: مرورهای دورهای و تمرینهای تکرارشونده برای تثبیت یادگیری بلندمدت.
- ردیابی حساب: ثبتنام رایگان از طریق گوگل یا ایمیل برای پیگیری توالی یادگیری، استریکها (streaks) و سطح XP.
مسیر مهندسی استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دورهی آموزش آشپز — بر کاهش تأخیر و هزینه تمرکز دارد. بر اساس برنامه درسی inferquest.org، دانشجویان باید در موارد زیر تسلط یابند:
- داخلیات ترنسفورمر: بررسی عمیق مکانیزمهای توجه (Attention)، نمونهگیری و مدیریت حافظه KV Cache.
- نوشتن کرنل: توسعه کرنلهای GPU با استفاده از CUDA یا Triton، بهویژه برای توابع سافتمکس، توجه برقآسا (flash attention) و کوانتیزهکنندهها.
- موتورهای سرویسدهی: کار با ابزارهای صنعتی مثل vLLM، SGLang و TensorRT-LLM با اهداف سختگیرانه برای تأخیر.
- بهینهسازی: پیادهسازی کوانتیزاسیون (Quantization)، دستهبندی پیوسته (continuous batching)، توجه صفحهبندی شده (paged attention) و سرویسدهی توزیعشده از طریق موازیسازی تنسور و خط لوله (pipeline parallelism).
- پروفایلینگ: استفاده از ابزارهای حرفهای مثل Nsight برای شناسایی گلوگاهها.
در مقابل، مسیر آموزش مدل برای کسانی است که نقشهای آزمایشگاهی را هدف قرار دادهاند. این مسیر از پیادهسازی پسانتشار (backpropagation) و بهینهسازها از صفر شروع شده و به مدیریت داده با خط لولههای Common Crawl و ریاضیات قوانین مقیاسپذیری (scaling laws) میرسد. این رویکرد در راستای تغییرات اخیر صنعت است که در آن ساخت مدلهای متخصص جایگزین پیشآموزشهای چندمیلیون دلاری شده است تا بهرهوری در کاربردهای خاص افزایش یابد.
این مسیر از ابزار NanoGPT-speedrun برای افزایش بهرهوری استفاده میکند و مفاهیمی چون Muon، FP8 و کرنلهای ادغامشده (fused kernels) را در بر میگیرد. پروژه نهایی (Capstone) این بخش، پیشآموزش یک مدل کلاس GPT-2 است که میتواند روی یک GPU مصرفکننده یا با حدود ۵۰ دلار هزینه اجاره فضای محاسباتی تکمیل شود.
برای تأیید مهارتهای پس از آموزش (Post-training) مانند SFT، لورا (LoRA)، DPO و GRPO روی یک GPU واحد، پلتفرم از یک سیستم ارزیابی محلی (local harness) استفاده میکند. این سیستم ابتدا همگرایی (convergence) مدل را نمرهگذاری کرده و سپس مستلزم مشاهده افزایش سرعت حداقل ۱.۵ برابری در اجراهای آموزشی تحت بودجه توکن ثابت است.
تفاوت اصلی InferQuest در ادغام مستقیم با API گیتهاب است. برای کسب برخی دستاوردها، کاربران باید Pull Requestهای خود را به کتابخانههای بزرگی مثل vLLM، SGLang، FlashInfer، TRL، torchtitan و nanochat ارسال کنند. سیستم بهطور خودکار تأیید میکند که این تغییرات واقعاً ادغام (merge) شدهاند و صرفاً اصلاحات نوشتاری ساده یا تغییرات جزئی نبودهاند.
علاوه بر این، سیستم از طریق Probeهای زنده، نقاط انتهایی استقرار یافته توسط کاربر را برای بررسی استریمینگ، محاسبه مصرف (usage accounting)، قطعشدنهای max_tokens، ساختار خطاها و اهداف تأخیر آزمایش میکند.
این رویکرد، فرآیند یادگیری را به یک پورتفولیوی عمومی تبدیل میکند که هر نقطه بازرسی آن — از یک Probe زنده تا یک PR ادغام شده — یک رسید دائمی از صلاحیت فنی برای تیمهای استخدام است.
برای یک مهندس نرمافزار باتجربه، تکمیل یک مسیر معمولاً ۶ ماه تا یک سال مطالعه پارهوقت زمان میبرد. کل برنامه درسی شامل ۱۸۲ تسک در ۳۸ کویست است که در مجموع ۲۱,۷۴۰ XP میشود. در حالی که مبانی اولیه و پروژه نهایی موتور استنتاج روی CPU یا نوتبوکهای رایگان ابری اجرا میشوند، مراحل مهندسی کرنل برای اجرای سیستم نمرهدهی به یک GPU مدرن انویدیا نیاز دارند.
این چرخش به سمت آموزش «اثبات کار» (proof-of-work) نشان میدهد که بازار شغلی AI در حال فاصله گرفتن از مدرکگرایی است. InferQuest با مجبور کردن یادگیرندگان به مشارکت در کتابخانههایی که قدرتبخش این صنعت هستند، موفقیت آموزشی را با کاربرد حرفهای فوری گره میزند.
یادگیرندگان علاقهمند میتوانند برنامه درسی کامل را بهصورت رایگان در inferquest.org مرور کنند یا برای شروع ردیابی XP و استریکهای خود وارد حساب کاربری شوند.
گام بعدی شما
- اگر مهندس نرمافزار هستید، برنامه درسی رایگان را در inferquest.org بررسی کنید تا شکافهای فنی خود را در لایه زیرساخت شناسایی کنید.
- برای شروع، روی مفاهیم KV Cache و مدیریت حافظه در GPU تمرکز کنید، زیرا اینها پیشنیاز اکثر کویستهای استنتاج هستند.
- مشارکت در پروژههای متنباز ذکر شده در پلتفرم را به عنوان بخشی از رزومه فنی خود آغاز کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو