اگر میخواهید بدانید زیر پوست مدلهای زبانی چه میگذرد، دیگر نیازی به پذیرش در سختگیرانهترین دانشگاه جهان ندارید. دوره CME 295: Transformers & Large Language Models اکنون بهصورت رایگان در یوتیوب در دسترس است تا مسیر دقیقی برای درک ریاضیات و مهندسی پشت پرده مدلهای زبانی بزرگ فراهم کند. این دوره فراتر از روایتهای سادهای چون «پیشبینی توکن بعدی» میرود تا مهندسی ریاضیاتی را توضیح دهد که عاملهای هوش مصنوعی مدرن را ممکن ساخته است.
این انتشار در حالی رخ میدهد که صنعت از چتباتهای ساده به سمت عاملهای خودمختار حرکت میکند. همانطور که در تحلیل قبلی ما دربارهی مدلهای زبانی کوچک (SLM) مانند SmolLM2-135M و چالش توهمات در بنچمارکهای خاص اشاره کردیم، این دوره مبانی تئوریک لازم برای درک علت وقوع این شکستها را فراهم میکند. این دوره توسط افشین عمیدی و شروین عمیدی، مهندسان سابق گوگل و نتفلیکس، تدریس شده و از سال ۲۰۲۱ بهطور مداوم بهروزرسانی و صیقل داده شده است.
ساختار و بستر آموزشی
این دوره بخشی از مسیر مهندسی محاسباتی و ریاضیاتی (CME) در دانشگاه استنفورد است. مدرسان دوره، افشین و شروین عمیدی که برادران دوقلو هستند، پیشینه آکادمیک عمیقی دارند؛ هر دو از Ecole Centrale Paris فارغالتحصیل شدهاند و سپس در مقاطع تکمیلی، افشین در MIT و شروین در استنفورد تحصیل کردهاند.
نسخه پاییز ۲۰۲۶ این دوره، سومین ویرایش آن است و تنها جلسه اول آن تاکنون بیش از ۳۷۲,۰۰۰ بازدید داشته است. برخلاف دورههای معمول دانشگاهی، در CME 295 هیچ تکلیفی وجود ندارد. نمرات صرفاً بر اساس دو آزمون تعیین میشوند: یک آزمون میانترم در ۲۳ اکتبر ۲۰۲۶ که چهار جلسه اول را پوشش میدهد، و یک آزمون پایانترم در ۹ دسامبر ۲۰۲۶ که شامل پنج جلسه باقیمانده است.
جلسات هر جمعه از ساعت ۱۵:۳۰ تا ۱۷:۲۰ برگزار میشوند. برای حمایت از دانشجویان، اسلایدهای آموزشی یک روز زودتر منتشر میشوند تا یادگیرندگان بتوانند یادداشتهای خود را مستقیماً روی متریال بنویسند؛ قابلیتی که بر اساس درخواستهای دانشجویان دورههای قبلی اضافه شده است.
تکامل فنی: از RNN تا ترنسفورمر
بر اساس مستندات منتشر شده در ۱۱ اکتبر ۲۰۲۶، برنامه درسی با بررسی گذار از شبکههای عصبی بازگشتی (RNN) — شبیه به نوار ضبطشوندهای که اطلاعات را به ترتیب میخواند و زود فراموش میکند — به معماری ترنسفورمر (Transformer) آغاز میشود. مدرسان توضیح میدهند که یک دهه پیش، صنعت برای هر وظیفه مجزا از مدلهای متفاوتی استفاده میکرد؛ برای مثال، مدلهای جداگانهای برای تحلیل احساسات، ترجمه یا شناسایی موجودات نامدار (NER) به کار میرفت.
به نقل از متریال دوره، مقاله «Attention Is All You Need» در سال ۲۰۱۷ نقطه عطف این مسیر بود. این مقاله ترنسفورمر را معرفی کرد که نه تنها نتایج را بهبود بخشید، بلکه مقیاسپذیری (Scalability) را ممکن کرد. این به این معناست که افزایش حجم دادهها، قدرت محاسباتی و اندازه مدل، منجر به پیشرفتی با نرخ بسیار بالاتر از هر معماری قبلی میشود. این تکامل در نهایت به عرضه ChatGPT در نوامبر ۲۰۲۲ و ظهور عصر عاملهای کدنویسی در سال ۲۰۲۶ ختم شد.
کالبدشکافی مکانیزمهای اصلی
جلسه اول چهار مفهوم حیاتی را بهطور مفصل باز میکند:
- توکنسازی (Tokenization) — فرآیند تبدیل متن به عدد. دوره توضیح میدهد چرا Byte Pair Encoding (BPE) استاندارد فعلی صنعت است و چرا روشهای مبتنی بر کلمه (که باعث تورم واژگان میشوند) یا روشهای مبتنی بر کاراکتر (که کند هستند و تفسیر آنها دشوار است) کنار گذاشته شدهاند. واژگان مدرن بسیار حجیم هستند و اغلب حدود ۲۰۰,۰۰۰ توکن دارند. برای مثال، جمله "a cute teddy bear is reading" ممکن است به شش توکن تقسیم شود، در حالی که "teddy bear" احتمالاً به عنوان یک واحد عمل میکند.
- بردارهای معنایی (Word Embeddings) — گذار از رمزگذاری one-hot (که در آن بردارها متعامد هستند و فاقد معنای معناییاند) به word2vec. این روش از وظایف جایگزینی مانند CBOW (پیشبینی کلمه مرکزی از روی متن اطراف) و skip-gram (پیشبینی متن اطراف از روی کلمه مرکزی) برای ثبت روابط استفاده میکند؛ مانند این رابطه که «پاریس نسبت به فرانسه، همان برلین نسبت به آلمان است».
- خودتوجهی (Self-Attention) — قلب تپنده ترنسفورمر است. مدرسان بر استفاده از بردارهای Query (پرسش)، Key (کلید) و Value (مقدار) تأکید میکنند. یک Query میپرسد «من باید به چه کسی توجه کنم؟»، Key به عنوان برچسبی برای مقایسه عمل میکند و Value محتوای واقعی است. فرمول شامل ضرب داخلی Q و K است که بر ریشه دوم بُعد کلید تقسیم میشود تا از مشکلات واریانس جلوگیری شود و سپس با یک تابع softmax، وزنهای نهایی برای بردارهای Value ایجاد میگردند.
- رمزگذاری موقعیت (Positional Embedding) — استفاده از توابع سینوسی و کسینوسی در فرکانسهای مختلف برای دادن حس ترتیب کلمات به مدل. این رویکرد «عقربههای ساعت» تضمین میکند که موقعیتهای نزدیک مقادیر مشابهی داشته باشند و از محدودیتهای طولی موجود در رمزگذاریهای یادگیریشده (learned embeddings) جلوگیری میکند.
نقشه راه سال ۲۰۲۶
سیلابس پاییز ۲۰۲۶ تمرکز شدیدی بر هوش مصنوعی در سطح تولید (Production-grade) دارد. این سری ۹ جلسهای فراتر از تئوری، موارد زیر را پوشش میدهد:
- جلسه ۲ (مدلهای زبانی): ترکیب خبرهها (MoE)، مقایسه MHA در مقابل MQA و GQA، رمزگذاریهای RoPE، طول زمینه (Context Length) و استراتژیهای نمونهگیری مانند Temperature.
- جلسه ۳ (آموزش): پیشآموزش (Pretraining)، تنظیم نظارتشده (SFT)، لورا (LoRA)، همراستاسازی با ترجیحات انسانی و تقطیر On-policy.
- جلسه ۴ (یادگیری تقویتی): طراحی پاداش، گرادیانهای سیاست، PPO و GRPO.
- جلسه ۵ (سیستمهای LLM): آموزش توزیعشده، KV Caching، رمزگشایی گمانهزنانه (Speculative Decoding)، توجه برقآسا (Flash Attention) و توازنهای سختافزاری.
- جلسه ۶ (عاملهای AI): استفاده از ابزار، پروتکل زمینه مدل (MCP)، حافظه، بازیابی (Retrieval)، فشردهسازی زمینه (Context Compaction) و بهینهسازی هارنس. در این مسیر، انتخاب ابزار مناسب حیاتی است، چرا که حتی برخی از محبوبترین ابزارهای ساخت عاملها به دلیل تغییرات سریع تکنولوژی متوقف شدهاند.
- جلسه ۷ (ارزیابی): مدل زبانی بهمثابه داور (AI-as-a-judge)، سوگیریها، تلههای بنچمارک و ارزیابی عاملها. برای بهبود این ارزیابیها، رویکردهایی مانند استفاده از گزارشهای HTML برای کاهش بار شناختی توسعهدهندگان در تحلیل رفتار عاملها پیشنهاد شده است.
- جلسه ۸ (مدلهای انتشار): انتشار پیوسته، گسسته و ماسکشده (Masked Diffusion).
- جلسه ۹ (مباحث داغ): دیدگاههای چندوجهی (Multimodal).
برای کسانی که نمیتوانند در جلسات زنده جمعهها شرکت کنند، مدرسان یک «راهنمای مطالعه جامع» و یک برگه تقلب (Cheat Sheet) چندزبانه فراهم کردهاند که به حدود ۱۵ زبان مختلف ترجمه شده است؛ از جمله نسخه تایلندی که در مخزن گیتهاب دوره در پوشه /th یافت میشود.
این برنامه درسی نشاندهنده تغییری بنیادین در آموزش AI است. با گنجاندن مفاهیمی مثل «فشردهسازی زمینه» و «بهینهسازی هارنس» در ماژول عاملهای هوشمند، استنفورد پذیرفته است که گلوگاه اصلی هوش مصنوعی امروز دیگر صرفاً اندازه مدل نیست، بلکه کارایی حلقه عملیاتی عامل (Operational Loop) است.
درک این جزئیات داخلی در حال تبدیل شدن به یک پیشنیاز پایه برای هر توسعهدهندهای است که از عاملهای کدنویسی استفاده میکند. کسانی که مدلهای زبانی را به عنوان جعبه سیاه میبینند، در عیبیابی خطاهای ظریفی که هنگام اشباع پنجره زمینه یا انحراف مکانیزم توجه رخ میدهد، با دشواری زیادی روبرو خواهند شد.
گام بعدی شما
- سری ویدیوهای کامل دوره را در کانال یوتیوب Stanford Online دنبال کنید.
- برگه تقلب (Cheat Sheet) بهروزرسانی شده را از وبسایت رسمی دوره دانلود کنید.
- مفاهیم جلسه ۶ درباره پروتکل MCP را برای بهینهسازی عاملهای شخصی خود بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو