پرش به محتوای اصلی
پرش به محتوای مقاله

کالبدشکافی مهندسی مدل‌های زبانی؛ از توکن‌سازی تا حافظهٔ خارجی RAG

·۳۰ تیر ۱۴۰۵۴ دقیقه مطالعه
راهنما
مدل‌های زبانی بزرگ: راهنمای فاینمن
مدل‌های زبانی بزرگ: راهنمای فاینمن
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأکید بر گذار از مدل‌های صرفاً مولد به ابزارهای مبتنی بر RAG؛ جایی که حافظه خارجی جایگزین حافظه داخلی مدل برای دسترسی به داده‌های به‌روز می‌شود.

تصور کنید ابزارهایی مثل ChatGPT یا Claude نه با درک مفاهیم، بلکه با حل میلیاردها معمای ریاضی به شما پاسخ می‌دهند. باید بدانید که آنچه ما «هوش» می‌نامیم، در واقع یک خط لوله (Pipeline) پیچیده از موتورهای تطبیق الگو است که هیچ ارتباطی با آگاهی انسانی ندارد. به نقل از راهنمای فنی منتشر شده در dev.to، این ادعا که «گذار از داده‌های خام به یک دستیار مفید در چهار مرحله متمایز رخ می‌دهد»، رمز و راز مدل‌های زبانی را می‌زداید. مهندسی این مدل‌ها تا تاریخ ۲۱ ژوئیه ۲۰۲۶، بر پایه تبدیل زبان به اعداد استوار است و نه روی مفاهیمی چون آگاهی یا «درک» اندیشه‌ی انسان. برای توضیح این فرآیند، این راهنما از تکنیک ریچارد فاینمن استفاده می‌کند؛ یعنی ساده‌سازی سیستم‌های پیچیده از طریق به‌کارگیری تمثیل‌های روزمره.

زمینه مهندسی مدل‌های زبانی بزرگ (LLM)

بسیاری از کاربران با هوش مصنوعی به عنوان یک رابط یکپارچه تعامل می‌کنند، اما سیستم در ابتدا زبان را به عنوان زنجیره‌ای از پازل‌های ریاضی می‌بیند. کامپیوترها نمی‌توانند کلماتی مثل «فیل» یا «هیدروژن» را بخوانند؛ آن‌ها فقط اعداد را می‌فهمند. برای پر کردن این شکاف، تصور کنید مدل کلمات را نمی‌خواند، بلکه آن‌ها را از مجموعه‌ای وسیع از بلوک‌های قابل استفاده مجدد سرهم می‌کند. این تغییر مفهومی توضیح می‌دهد که چرا هوش مصنوعی می‌تواند کلمات پیچیده‌ای را که هرگز قبلاً با آن‌ها مواجه نشده است، مدیریت کند. در اینجا مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — وارد عمل می‌شود تا شکاف بین کلمات و اعداد را پر کند.

مدل‌های زبانی بزرگ: راهنمای فاینمن

جزئیات توکن‌سازی (Tokenization)

این فرآیند با توکن‌سازی — شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — آغاز می‌شود. مدل‌های مدرن از تکنیکی به نام «کدگذاری جفت‌بایت» (BPE) استفاده می‌کنند تا زبان را به واحدهای زیر-کلمه‌ای (subword units) تقسیم کنند.

پس از آماده‌سازی بلوک‌ها، معماری ترنسفورمر (Transformer) مکانیسم «خودتوجهی» (Self-Attention) را اجرا می‌کند. این سازوکار شبیه به یک نورافکن ریاضی در یک کتابخانه تاریک است. در جمله‌ای مثل «بانک بسته بود چون تعطیل بود»، مدل برخلاف انسان، متن را از چپ به راست نمی‌خواند. در عوض، کل جمله را به‌طور هم‌زمان اسکن می‌کند تا محاسبه کند کدام کلمات قوی‌ترین رابطه را با یکدیگر دارند.

مدل‌های زبانی بزرگ: راهنمای فاینمن

مکانیسم‌های توجه

این نورافکن روی کلمه «تعطیل» متمرکز می‌ماند تا توضیح دهد چرا «بانک» بسته بود. با محاسبه اینکه کدام کلمه قوی‌ترین رابطه را با کلمه‌ای دارد که در حال حاضر در حال پردازش آن است، هوش مصنوعی می‌تواند تشخیص دهد که ضمیر «آن» (it) به بانک اشاره دارد یا به تعطیلات.

  • اسکن غیرخطی: برخلاف انسان‌ها، مدل کل توالی را یک‌باره می‌بیند.
  • رمزگشایی ظرافت‌ها: این حرکت فراتر از یک «تکمیل‌کننده متن شیک»، به سیستم اجازه می‌دهد تشخیص دهد که چگونه کلمات خاص، معنا را در طول یک توالی بلند از متن تغییر می‌دهند.

یادگیری استفاده از این نورافکن در دو مرحله رخ می‌دهد. ابتدا مدل تحت «پیش‌آموزش» (Pre-training) قرار می‌گیرد، جایی که کل اینترنت را می‌خواند تا میلیاردها بار بازی «کلمه بعدی را حدس بزن» را انجام دهد. این مرحله شبیه دانش‌آموزی است که ۱۰۰ هزار کتابخانه را بدون معلم می‌خواند. این مرحله الگوهای زبانی را آموزش می‌دهد، اما اغلب شامل رفتارهای توهین‌آمیز یا غیرمفید است، زیرا مدل فقط الگوهای داده را یاد می‌گیرد و نه اخلاقیات را. در واقع، تکرار بیش از حد همین الگوهای آماری در مدل‌ها می‌تواند منجر به تولید انبوه محتوای پیش‌بینی‌پذیر و بی‌کیفیت شود.

مدل‌های زبانی بزرگ: راهنمای فاینمن

آموزش و پالایش

برای اصلاح این وضعیت، مهندسان از «یادگیری تقویتی با بازخورد انسانی» (RLHF) استفاده می‌کنند. این مرحله در واقع همان فاز «بازخورد معلم» است.

  • فرآیند: معلمان انسانی خروجی‌ها را بررسی می‌کنند و بازخوردهای باینری (دوگانه) ارائه می‌دهند؛ یعنی لایک (شست به بالا) یا دیس‌لایک (شست به پایین).
  • تشبیه: مهندسان پاسخ‌هایی را که مفید، صادقانه و بی‌ضرر هستند «آبیاری» می‌کنند و در مقابل، پاسخ‌هایی را که گیج‌کننده یا خطرناک هستند «هرس» می‌کنند.

این فرآیند، یک حدس‌زنِ متنیِ آشفته را به ابزاری امن و قابل‌اعتماد تبدیل می‌کند. با این حال، با وجود این آموزش‌ها، مدل‌های زبانی بزرگ از «تاریخ قطع دانش» (knowledge cutoffs) رنج می‌برند؛ به این معنا که نمی‌توانند وقایعی را که پس از پایان آموزش آن‌ها رخ داده است، به یاد آورند. برای حل این مشکل، توسعه‌دهندگان «تولید بازیابی‌افزا» (RAG) را پیاده‌سازی می‌کنند. این کار تجربه هوش مصنوعی را به یک «امتحان با کتاب باز» تبدیل می‌کند.

مدل‌های زبانی بزرگ: راهنمای فاینمن

RAG و حافظه خارجی

در یک سیستم مجهز به RAG، عامل به‌جای حدس زدن (یا دچار توهم (Hallucination) شدن — شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند) درباره خبری از دیروز، از یک «پایگاه‌داده برداری» (Vector Database) امن استعلام می‌گیرد. برای مدیریت بهینه این حافظه، استفاده از تکنیک‌های تلخیص توکن‌محور می‌تواند هزینه‌های مربوط به تاریخچه گفتگوها را تا ۲۵ برابر کاهش دهد.

  • گردش کار: مدل به یک قفسه مجازی می‌رود، کتاب درست را برمی‌دارد و قبل از پاسخ دادن، جواب را می‌خواند.
  • مزیت: این روش خطاهای محیط‌های عملیاتی را به‌شدت کاهش می‌دهد و به «عامل‌های هوش مصنوعی» (AI Agents) اجازه می‌دهد اطلاعاتی را بیابند که هرگز به‌طور صریح به آن‌ها آموزش داده نشده بود.

این تغییر معماری به این معناست که مزیت برای کاربر، گذار از یک «اسباب‌بازی مولد» به یک «ابزار واقع‌گرایانه و مستند» است. برای بررسی عمیق‌تر این مکانیسم‌ها، این راهنما به کارهای بنیادین سباستین راشکا (Sebastian Raschka) در کتاب «ساخت یک مدل زبانی بزرگ (از صفر)» در مورد معماری ترنسفورمر، «کتابچه مهندسی LLM» اثر پل ایوزتین و ماکسیم لابون برای الگوهای تولیدی، و توضیحات بصری جِی آلامار (Jay Alammar) و مارتن گروتندورست استناد می‌کند. علاوه بر این، آثار لویی-فرانسوا بوشار در مورد «ساخت LLM برای محیط تولید»، تحلیلی عمیق درباره قابلیت اطمینان ارائه می‌دهد.

این منابع تأکید می‌کنند که مدل‌های زبانی موجودات متفکر نیستند، بلکه قدرتمندترین ابزارهای زبانی هستند که بشر تا به امروز ساخته است. برای تسلط بر این ابزارها، باید تکامل پایگاه‌داده‌های برداری را زیر نظر بگیرید، زیرا آن‌ها موتور اصلی پشت قابلیت اطمینان RAG هستند. بررسی اینکه چگونه توکن‌سازهای مختلف BPE بر تأخیر (Latency) مدل اثر می‌گذارند، گام بعدی منطقی برای کسانی است که استک‌های هوش مصنوعی سفارشی را مستقر می‌کنند.

گام بعدی شما

  • بررسی تکامل پایگاه‌داده‌های برداری برای بهبود دقت سیستم‌های RAG.
  • مطالعه اثر توکن‌سازهای مختلف BPE بر میزان تأخیر (Latency) در استقرار مدل‌های شخصی.
  • آزمایش تفاوت پاسخ‌های مدل در حالت پیش‌آموزش در برابر حالت RLHF.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این کالبدشکافی با تکیه بر اعتبار پژوهشگرانی چون سباستین راشکا، نشان می‌دهد که LLMها ابزارهای پردازش زبان هستند، نه موجوداتی متفکر. درک این مرز برای جلوگیری از اتکای کورکورانه به خروجی‌های مدل در محیط‌های حساس حیاتی است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی، پیاده‌سازی RAG به دلیل عدم نیاز به آموزش مجدد مدل‌های سنگین، ارزان‌ترین و سریع‌ترین راه برای ساخت دستیارهای تخصصی با داده‌های فارسی است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر RAG نشان می‌دهد که صنعت از توهمِ «مدل همه‌دان» فاصله گرفته و به سمت «مدل‌های متصل به داده» حرکت می‌کند. این یعنی ارزش افزوده دیگر در اندازه مدل (Parameters) نیست، بلکه در کیفیت بازیابی داده‌ها و مدیریت حافظه خارجی است. در واقع، مدل زبانی از نقش «دانشمند» به نقش «مدیر ارشد اطلاعات» تغییر جایگاه داده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.