پرش به محتوای اصلی
پرش به محتوای مقاله

«پر کردن شکاف مفاهیم پایه»؛ هدف از انتشار رایگان دورهٔ CME 295

·۱۹ مهر ۱۴۰۵۴ دقیقه مطالعه
آیا واقعاً می‌خواهید بدانید LLM چگونه کار می‌کند؟ دوره رایگان استنفورد بهترین نقطه شروع است.
آیا واقعاً می‌خواهید بدانید LLM چگونه کار می‌کند؟ دوره رایگان استنفورد بهترین نقطه شروع است.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر محوریت آموزش از تئوری‌های پایه به مفاهیم عملیاتی سال ۲۰۲۶ مانند پروتکل MCP و بهینه‌سازی حلقه‌های عامل‌محور در یک محیط دانشگاهی.

اگر می‌خواهید بدانید زیر پوست مدل‌های زبانی چه می‌گذرد، دیگر نیازی به پذیرش در سخت‌گیرانه‌ترین دانشگاه جهان ندارید. دوره CME 295: Transformers & Large Language Models اکنون به‌صورت رایگان در یوتیوب در دسترس است تا مسیر دقیقی برای درک ریاضیات و مهندسی پشت پرده مدل‌های زبانی بزرگ فراهم کند. این دوره فراتر از روایت‌های ساده‌ای چون «پیش‌بینی توکن بعدی» می‌رود تا مهندسی ریاضیاتی را توضیح دهد که عامل‌های هوش مصنوعی مدرن را ممکن ساخته است.

این انتشار در حالی رخ می‌دهد که صنعت از چت‌بات‌های ساده به سمت عامل‌های خودمختار حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی مدل‌های زبانی کوچک (SLM) مانند SmolLM2-135M و چالش توهمات در بنچمارک‌های خاص اشاره کردیم، این دوره مبانی تئوریک لازم برای درک علت وقوع این شکست‌ها را فراهم می‌کند. این دوره توسط افشین عمی‌دی و شروین عمی‌دی، مهندسان سابق گوگل و نتفلیکس، تدریس شده و از سال ۲۰۲۱ به‌طور مداوم به‌روزرسانی و صیقل داده شده است.

ساختار و بستر آموزشی

این دوره بخشی از مسیر مهندسی محاسباتی و ریاضیاتی (CME) در دانشگاه استنفورد است. مدرسان دوره، افشین و شروین عمی‌دی که برادران دوقلو هستند، پیشینه آکادمیک عمیقی دارند؛ هر دو از Ecole Centrale Paris فارغ‌التحصیل شده‌اند و سپس در مقاطع تکمیلی، افشین در MIT و شروین در استنفورد تحصیل کرده‌اند.

نسخه پاییز ۲۰۲۶ این دوره، سومین ویرایش آن است و تنها جلسه اول آن تاکنون بیش از ۳۷۲,۰۰۰ بازدید داشته است. برخلاف دوره‌های معمول دانشگاهی، در CME 295 هیچ تکلیفی وجود ندارد. نمرات صرفاً بر اساس دو آزمون تعیین می‌شوند: یک آزمون میان‌ترم در ۲۳ اکتبر ۲۰۲۶ که چهار جلسه اول را پوشش می‌دهد، و یک آزمون پایان‌ترم در ۹ دسامبر ۲۰۲۶ که شامل پنج جلسه باقی‌مانده است.

جلسات هر جمعه از ساعت ۱۵:۳۰ تا ۱۷:۲۰ برگزار می‌شوند. برای حمایت از دانشجویان، اسلایدهای آموزشی یک روز زودتر منتشر می‌شوند تا یادگیرندگان بتوانند یادداشت‌های خود را مستقیماً روی متریال بنویسند؛ قابلیتی که بر اساس درخواست‌های دانشجویان دوره‌های قبلی اضافه شده است.

تکامل فنی: از RNN تا ترنسفورمر

بر اساس مستندات منتشر شده در ۱۱ اکتبر ۲۰۲۶، برنامه درسی با بررسی گذار از شبکه‌های عصبی بازگشتی (RNN) — شبیه به نوار ضبط‌شونده‌ای که اطلاعات را به ترتیب می‌خواند و زود فراموش می‌کند — به معماری ترنسفورمر (Transformer) آغاز می‌شود. مدرسان توضیح می‌دهند که یک دهه پیش، صنعت برای هر وظیفه مجزا از مدل‌های متفاوتی استفاده می‌کرد؛ برای مثال، مدل‌های جداگانه‌ای برای تحلیل احساسات، ترجمه یا شناسایی موجودات نام‌دار (NER) به کار می‌رفت.

به نقل از متریال دوره، مقاله «Attention Is All You Need» در سال ۲۰۱۷ نقطه عطف این مسیر بود. این مقاله ترنسفورمر را معرفی کرد که نه تنها نتایج را بهبود بخشید، بلکه مقیاس‌پذیری (Scalability) را ممکن کرد. این به این معناست که افزایش حجم داده‌ها، قدرت محاسباتی و اندازه مدل، منجر به پیشرفتی با نرخ بسیار بالاتر از هر معماری قبلی می‌شود. این تکامل در نهایت به عرضه ChatGPT در نوامبر ۲۰۲۲ و ظهور عصر عامل‌های کدنویسی در سال ۲۰۲۶ ختم شد.

کالبدشکافی مکانیزم‌های اصلی

جلسه اول چهار مفهوم حیاتی را به‌طور مفصل باز می‌کند:

  • توکن‌سازی (Tokenization) — فرآیند تبدیل متن به عدد. دوره توضیح می‌دهد چرا Byte Pair Encoding (BPE) استاندارد فعلی صنعت است و چرا روش‌های مبتنی بر کلمه (که باعث تورم واژگان می‌شوند) یا روش‌های مبتنی بر کاراکتر (که کند هستند و تفسیر آن‌ها دشوار است) کنار گذاشته شده‌اند. واژگان مدرن بسیار حجیم هستند و اغلب حدود ۲۰۰,۰۰۰ توکن دارند. برای مثال، جمله "a cute teddy bear is reading" ممکن است به شش توکن تقسیم شود، در حالی که "teddy bear" احتمالاً به عنوان یک واحد عمل می‌کند.
  • بردارهای معنایی (Word Embeddings) — گذار از رمزگذاری one-hot (که در آن بردارها متعامد هستند و فاقد معنای معنایی‌اند) به word2vec. این روش از وظایف جایگزینی مانند CBOW (پیش‌بینی کلمه مرکزی از روی متن اطراف) و skip-gram (پیش‌بینی متن اطراف از روی کلمه مرکزی) برای ثبت روابط استفاده می‌کند؛ مانند این رابطه که «پاریس نسبت به فرانسه، همان برلین نسبت به آلمان است».
  • خودتوجهی (Self-Attention) — قلب تپنده ترنسفورمر است. مدرسان بر استفاده از بردارهای Query (پرسش)، Key (کلید) و Value (مقدار) تأکید می‌کنند. یک Query می‌پرسد «من باید به چه کسی توجه کنم؟»، Key به عنوان برچسبی برای مقایسه عمل می‌کند و Value محتوای واقعی است. فرمول شامل ضرب داخلی Q و K است که بر ریشه دوم بُعد کلید تقسیم می‌شود تا از مشکلات واریانس جلوگیری شود و سپس با یک تابع softmax، وزن‌های نهایی برای بردارهای Value ایجاد می‌گردند.
  • رمزگذاری موقعیت (Positional Embedding) — استفاده از توابع سینوسی و کسینوسی در فرکانس‌های مختلف برای دادن حس ترتیب کلمات به مدل. این رویکرد «عقربه‌های ساعت» تضمین می‌کند که موقعیت‌های نزدیک مقادیر مشابهی داشته باشند و از محدودیت‌های طولی موجود در رمزگذاری‌های یادگیری‌شده (learned embeddings) جلوگیری می‌کند.

نقشه راه سال ۲۰۲۶

سیلابس پاییز ۲۰۲۶ تمرکز شدیدی بر هوش مصنوعی در سطح تولید (Production-grade) دارد. این سری ۹ جلسه‌ای فراتر از تئوری، موارد زیر را پوشش می‌دهد:

  • جلسه ۲ (مدل‌های زبانی): ترکیب خبره‌ها (MoE)، مقایسه MHA در مقابل MQA و GQA، رمزگذاری‌های RoPE، طول زمینه (Context Length) و استراتژی‌های نمونه‌گیری مانند Temperature.
  • جلسه ۳ (آموزش): پیش‌آموزش (Pretraining)، تنظیم نظارت‌شده (SFT)، لورا (LoRA)، همراستاسازی با ترجیحات انسانی و تقطیر On-policy.
  • جلسه ۴ (یادگیری تقویتی): طراحی پاداش، گرادیان‌های سیاست، PPO و GRPO.
  • جلسه ۵ (سیستم‌های LLM): آموزش توزیع‌شده، KV Caching، رمزگشایی گمانه‌زنانه (Speculative Decoding)، توجه برق‌آسا (Flash Attention) و توازن‌های سخت‌افزاری.
  • جلسه ۶ (عامل‌های AI): استفاده از ابزار، پروتکل زمینه مدل (MCP)، حافظه، بازیابی (Retrieval)، فشرده‌سازی زمینه (Context Compaction) و بهینه‌سازی هارنس. در این مسیر، انتخاب ابزار مناسب حیاتی است، چرا که حتی برخی از محبوب‌ترین ابزارهای ساخت عامل‌ها به دلیل تغییرات سریع تکنولوژی متوقف شده‌اند.
  • جلسه ۷ (ارزیابی): مدل زبانی به‌مثابه داور (AI-as-a-judge)، سوگیری‌ها، تله‌های بنچمارک و ارزیابی عامل‌ها. برای بهبود این ارزیابی‌ها، رویکردهایی مانند استفاده از گزارش‌های HTML برای کاهش بار شناختی توسعه‌دهندگان در تحلیل رفتار عامل‌ها پیشنهاد شده است.
  • جلسه ۸ (مدل‌های انتشار): انتشار پیوسته، گسسته و ماسک‌شده (Masked Diffusion).
  • جلسه ۹ (مباحث داغ): دیدگاه‌های چندوجهی (Multimodal).

برای کسانی که نمی‌توانند در جلسات زنده جمعه‌ها شرکت کنند، مدرسان یک «راهنمای مطالعه جامع» و یک برگه تقلب (Cheat Sheet) چندزبانه فراهم کرده‌اند که به حدود ۱۵ زبان مختلف ترجمه شده است؛ از جمله نسخه تایلندی که در مخزن گیت‌هاب دوره در پوشه /th یافت می‌شود.

این برنامه درسی نشان‌دهنده تغییری بنیادین در آموزش AI است. با گنجاندن مفاهیمی مثل «فشرده‌سازی زمینه» و «بهینه‌سازی هارنس» در ماژول عامل‌های هوشمند، استنفورد پذیرفته است که گلوگاه اصلی هوش مصنوعی امروز دیگر صرفاً اندازه مدل نیست، بلکه کارایی حلقه عملیاتی عامل (Operational Loop) است.

درک این جزئیات داخلی در حال تبدیل شدن به یک پیش‌نیاز پایه برای هر توسعه‌دهنده‌ای است که از عامل‌های کدنویسی استفاده می‌کند. کسانی که مدل‌های زبانی را به عنوان جعبه سیاه می‌بینند، در عیب‌یابی خطاهای ظریفی که هنگام اشباع پنجره زمینه یا انحراف مکانیزم توجه رخ می‌دهد، با دشواری زیادی روبرو خواهند شد.

گام بعدی شما

  • سری ویدیوهای کامل دوره را در کانال یوتیوب Stanford Online دنبال کنید.
  • برگه تقلب (Cheat Sheet) به‌روزرسانی شده را از وب‌سایت رسمی دوره دانلود کنید.
  • مفاهیم جلسه ۶ درباره پروتکل MCP را برای بهینه‌سازی عامل‌های شخصی خود بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دوره با تکیه بر اعتبار علمی استنفورد، استانداردی برای آموزش مهندسی مدل‌های زبانی ایجاد می‌کند که فراتر از آموزش‌های سطحی است. دسترسی رایگان به این متریال، دموکراتیزه کردن دانش عمیق معماری ترنسفورمر را تسریع می‌کند.

تأثیر برای ایران

این دوره یک فرصت استثنایی برای دانشجویان و پژوهشگران ایرانی است تا بدون محدودیت‌های پذیرش، از متریال به‌روزترین کلاس‌های استنفورد برای ارتقای سطح فنی خود استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز استنفورد بر مفاهیمی مثل «بهینه‌سازی هارنس» و «فشرده‌سازی زمینه» نشان می‌دهد که عصر رشد کورکورانه پارامترها به پایان رسیده و اکنون نبرد اصلی بر سر بهره‌وری استنتاج است. این تغییر رویکرد، توسعه‌دهندگان را از نقش «نویسنده پرامپت» به «مهندس سیستم‌های عامل‌محور» تبدیل می‌کند که باید محدودیت‌های سخت‌افزاری را در طراحی منطق مدل لحاظ کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.