تفاوت میان نوشتن یک پرامپت ساده و طراحی یک سامانه هوش مصنوعی در مقیاس صنعتی، داشتن یک مدل ذهنی عمیق از لایههای زیرین سختافزار و نرمافزار است. کتاب مهندسی مدلهای بنیادی (Foundation Model Engineering) که آخرین بهروزرسانی آن در ۱۶ اوت ۲۰۲۶ انجام شده، دقیقاً برای پر کردن این شکاف طراحی شده است تا مهندسان بتوانند موازنه میان حافظه، توان عملیاتی و تأخیر را مدیریت کنند.
بسیاری از توسعهدهندگان امروز با هوش مصنوعی تنها از طریق APIها تعامل دارند و مدل را مانند یک جعبه سیاه میبینند. این منبع در زمانی عرضه شده که صنعت از رابطهای سادهی چت به سمت گردشهای کاری عاملمحور (Agentic) — شبیه به داشتن کارمندانی که میتوانند بهطور مستقل مراحل یک پروژه را پیش ببرند — و سرویسدهی به متون بسیار طولانی حرکت میکند. در این فضای جدید، درک «چرایی» معماریها دیگر یک انتخاب نیست، بلکه یک ضرورت رقابتی است.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی استنتاج اشاره کردیم، درک لایههای پاییندستی برای کاهش هزینهها حیاتی است. به نقل از مستندات پروژه در sungeuns.github.io، این محتوا بر جریان تاریخی و ریاضی این حوزه تمرکز دارد. محورهای اصلی این منبع عبارتاند از:
- معماریها: بررسی گذار از RNNها به ترنسفورمر (Transformer) و بهکارگیری ترکیب خبرهها (MoE).
- سیستمهای استنتاج: نقش حیاتی KV Cache و دستهبندی (Batching) در عملکرد سیستم.
- آموزش و همراستاسازی: مهندسی RLHF و حلقههای ارزیابی بهعنوان مسائل مربوط به محصول.
- بازیابی: مکانیسمهای تولید بازیابیافزا (RAG) — مثل دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — و قابلیتهای چندوجهی (Multimodal).
این کتاب از ارائه نکات پراکنده پرهیز کرده و بهجای آن، از مثالهای PyTorch و بصریسازهای تعاملی برای آموزش استدلال استفاده میکند. بر اساس مستندات، این اثر بهطور صریح برای خوانندگان پژوهشمحور طراحی شده و یک راهنمای مقدماتی برای مبتدیان نیست.
این تغییر در رویکرد آموزشی نشان میدهد که «عصر API» در توسعه هوش مصنوعی در حال بلوغ است. اکنون مهندسیِ قضاوت — یعنی دانستن اینکه چه زمانی از یک مدل پراکنده (Sparse) بهجای مدل متراکم (Dense) استفاده کنیم — بسیار ارزشمندتر از دانستن یک قالب پرامپت است.
گام بعدی شما
- بررسی فهرست مطالب و ماژولهای تعاملی در سایت GitHub Pages پروژه.
- تمرین با مثالهای PyTorch برای درک موازنه میان حافظه و تأخیر.
- مشارکت در بهروزرسانی محتوا از طریق Pull Requestها برای همگام شدن با مقالات جدید.
اما درک این تئوریها تنها نیمی از مسیر است؛ برای دیدن اثر این مفاهیم در سختافزار، تحلیل ما دربارهی تراشههای Blackwell را بخوانید.




گفتگو