تصور کنید یک مدل هوش مصنوعی را مانند یک ماشین ریاضی خالی در اختیار دارید که بدون قطعات حیاتی، هیچ واکنشی به ورودیهای شما نخواهد داشت. طبق راهنمای فنی منتشر شده در ۲۹ سپتامبر ۲۰۲۶ در وبسایت dev.to، هوش یک مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — به تعامل دقیق سه جزء وابسته است: وزنها، پیکربندی و توکنساز.
بدون وزنها (Weights)، مدل تنها شبکهای از میلیاردها معادله خالی است که نه میتواند بخواند و نه پاسخ دهد. وزنها در واقع همان «دانش» مدل هستند؛ شبکهای عظیم از اعداد اعشاری پیشمحاسبهشده که کامپیوتر آنها را در معادلات جایگذاری میکند تا منطق شکل بگیرد. این پیوند میان ریاضیات مدل و هزینههای عملیاتی، در تحلیل جامع ما درباره نقش تنسورها در استقرار مدلها به تفصیل بررسی شده است.

برای اینکه این اعداد کار کنند، سیستم به دو ستون دیگر نیاز دارد:
- پیکربندی (Config): فایلی کوچک که مانند دفترچه راهنما عمل میکند و معماری مدل و نحوه جریان دادهها بین لایهها را توصیف میکند.
- توکنساز (Tokenizer): مترجمی که متن انسانی را به توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — تبدیل کرده و سپس آنها را به اعداد شناسایی و در نهایت به بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی آن با کلمات دیگر را مشخص میکند — تبدیل میکند. این فرآیند در واقع پل ارتباطی میان زبان طبیعی انسان و منطق ریاضی ماشین است که زیربنای تمام مدلهای زبانی را تشکیل میدهد.
همانطور که در تحلیلهای پیشین ما دربارهی زیرساختهای مدلهای بازمتن اشاره کردیم، برای عملکرد صحیح، توکنساز باید دقیقاً با وزنها مطابقت داشته باشد. بر اساس مستندات فنی، این فرآیند یک خط لوله سختگیرانه را طی میکند: متن $\rightarrow$ توکن $\rightarrow$ عدد شناسایی $\rightarrow$ بردار $\rightarrow$ ریاضیات $\rightarrow$ بردار $\rightarrow$ عدد $\rightarrow$ متن. در نهایت مدل، توکن بعدی را یکییکی پیشبینی میکند. برای بهینهسازی این مسیر، مکانیزمهای جدید کشینگ برای رفع گلوگاههای پردازشی CPU معرفی شدهاند تا سرعت تبدیل متن به توکن افزایش یابد.
در محیطهای حرفهای، این مجموعه اغلب از طریق NVIDIA GPU Cloud (NGC) مدیریت میشود که کانتینرهای بهینهشده برای GPU و مدلهای پیشآموزشدیده را فراهم میکند. این مدلها معمولاً در مخازنی مانند Harbor ذخیره میشوند تا آخرین نسخه روی سختافزار مستقر شود.
در حالی که مدلهای بسته مانند ChatGPT و Claude جزئیات داخلی خود را پنهان میکنند، مدلهای وزنهای باز (Open Weights) — یعنی مدلهایی که «دستور پخت» آنها علناً منتشر شده — مانند Llama، Mistral، DeepSeek و Qwen، فایلهای باینری یا .pkl خود را منتشر میکنند. این دسترسی به توسعهدهندگان اجازه میدهد دقیقاً ببینند مدل چه چیزی آموخته و ساختارش چگونه است.
برای شخصیسازی این مدلها، ابزارهایی مثل Unsloth یا کتابخانه Transformers امکان تنظیم دقیق (Fine-tuning) — شبیه وقتی که به یک پزشک عمومی، تخصص پوست میدهیم تا روی یک حوزه دقیق شود — را فراهم میکنند. این فرآیند وزنهای موجود را برای دادههای خاص تغییر میدهد، به شرطی که توسعهدهنده سختافزار لازم و محیطهای اجرایی مانند vLLM، llama.cpp یا Ollama را داشته باشد.
گام بعدی شما
- بررسی کارتهای داده (Data Cards) در Hugging Face برای درک دادههای آموزشی و لایسنس مدلهای باز.
- آزمایش مدلهای کوچکتر با استفاده از Ollama برای درک عملی نحوه تعامل توکنساز و وزنها.
- مطالعه مستندات Unsloth برای کاهش هزینههای سختافزاری در هنگام تنظیم دقیق.
اما درک این ساختار تنها نیمی از مسیر است؛ تأثیر کوانتش وزنها بر سرعت استنتاج را در گزارش بعدی بررسی خواهیم کرد.




گفتگو