پرش به محتوای اصلی
پرش به محتوای مقاله

تنظیمات Temperature در مدل‌های زبانی ابزاری برای خلاقیت نیستند

·۱۷ مرداد ۱۴۰۵۹ دقیقه مطالعه۲ بازدید
راهنما
دمای مدل، خلاقیت نمی‌آورد
دمای مدل، خلاقیت نمی‌آورد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

توضیح دقیق ریاضیاتی رابطه‌ی لاجیت‌ها و دما که ثابت می‌کند رتبه‌بندی توکن‌ها هرگز تغییر نمی‌کند و «خلاقیت» تنها یک توهم ناشی از نمونه‌برداری از احتمالات پایین است.

اگر فکر می‌کنید با بالا بردن دمای مدل، به یک «نابغه» دست یافته‌اید که ایده‌های نو خلق می‌کند، در اشتباهید. حقیقت این است که شما فقط در حال شانس دادن به گزینه‌هایی هستید که مدل از ابتدا آن‌ها را «کم‌احتمال» تشخیص داده بود.

به نقل از تحلیل فنی منتشر شده در ۸ اوت ۲۰۲۶ در وب‌سایت dev.to، تنظیمات Temperature (دما) در یک مدل زبانی بزرگ (LLM) — که شبیه کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — هرگز باعث خلق خلاقیت واقعی نمی‌شود. این تحلیل توضیح می‌دهد که این تنظیمات صرفاً تعیین می‌کنند که مدل چقدر حاضر است توکن‌هایی را انتخاب کند که از قبل روی میز بودند، اما در اولویت‌های پایین قرار داشتند.

بسیاری از کاربران به دما به چشم یک «پیچ خلاقیت» نگاه می‌کنند تا ایده‌های جدید را آزاد کنند. اما در واقعیت، مدل با افزایش دما توکن جدیدی را اختراع نمی‌کند؛ بلکه فقط دستش را بیشتر به سمت «دم» (Tail) توزیع احتمالات موجود خود می‌برد. همان‌طور که در بحث‌های گذشته ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، درک مکانیسم‌های داخلی مدل برای پیش‌بینی رفتار آن‌ها حیاتی است.

تصور کنید سرآشپزی را دارید که منوی ثابتی دارد. سرآشپز برای هر غذا یک امتیاز ترجیح (Preference Score) تعیین کرده است. دما، غذاهای جدیدی به منو اضافه نمی‌کند؛ بلکه فقط تصمیم می‌گیرد سرآشپز چقدر سخت از رتبه‌بندی خودش پیروی کند. دمای پایین یعنی سرآشپز دقیقاً به آیتم‌های رتبه اول می‌چسبد. دمای بالا یعنی احتمال بیشتری وجود دارد که او غذایی را از انتهای لیست انتخاب کند.

مکانیسم لاجیت‌ها و سافت‌مکس

پیش از آنکه مدل کلمه‌ای را انتخاب کند، برای هر توکن در دایره لغات خود، امتیازات خامی به نام لاجیت‌ها (Logits) تولید می‌کند. این‌ها اعداد ساده‌ای هستند که هرچه بزرگ‌تر باشند، آن توکن بیشتر مورد توجه است. لاجیت‌ها می‌توانند هر عدد حقیقی باشند و مجموع آن‌ها به مقدار معناداری نمی‌رسد.

چون این اعداد خام مجموع مشخصی ندارند، مدل از تابع سافت‌مکس (Softmax) استفاده می‌کند تا آن‌ها را به احتمالات تبدیل کند که مجموعشان ۱۰۰٪ (یا ۱) شود. سافت‌مکس هر لاجیت را به توان عدد $e$ می‌رساند — که باعث می‌شود هر مقدار مثبت شود و فاصله‌ها کشیده شوند — و سپس آن را بر مجموع کل تقسیم می‌کند تا همه چیز در نهایت برابر با ۱ شود.

Softmax

برای مثال، اگر پرامپت «هوای امروز...» (The weather today is) باشد، مدل ممکن است پنج توکن کاندید برای کلمه بعدی تولید کند. با استفاده از فرمولی که در آن $z_i$ لاجیت توکن $i$ است، مدل احتمال را محاسبه می‌کند. اگر لاجیت‌ها به شرح زیر باشند:

  • sunny: ۳ (e³ ≈ ۲۰.۱)
  • cloudy: ۲ (e² ≈ ۷.۴)
  • warm: ۱ (e¹ ≈ ۲.۷)
  • terrible: ۰ (e⁰ = ۱.۰)
  • purple: ۱- (e⁻¹ ≈ ۰.۳۷)

با مجموع کل حدود ۳۱.۶، احتمالات نهایی به این صورت خواهد بود: sunny (۶۳.۶٪)، cloudy (۲۳.۴٪)، warm (۸.۶٪)، terrible (۳.۲٪) و purple (۱.۲٪). دقت کنید که کلمه «بنفش» (purple) حتی قبل از اعمال هر دمایی، با احتمال ۱.۲٪ در لیست حضور داشت.

دما چگونه احتمالات را بازطراحی می‌کند؟

دما (T) عددی است که وارد فرآیند سافت‌مکس می‌شود. مدل هر لاجیت را پیش از به توان رساندن، بر T تقسیم می‌کند. این یک تابع متفاوت از سافت‌مکس نیست، بلکه همان سافت‌مکس است که یک مرحله اضافی دارد. در T = ۱، شما دقیقاً همان نتیجه ساده سافت‌مکس را می‌گیرید؛ در واقع دما، سافت‌مکس را تعمیم می‌دهد نه اینکه جایگزین آن شود.

softmax logits divide by t

وقتی T را کاهش می‌دهید (مثلاً T = ۰.۵)، توزیع احتمالات «تیز» (Sharpen) می‌شود. جرم احتمالات در رأس متمرکز می‌شود و توکن محتمل‌ترین، حتی مسلط‌تر می‌شود. در مثال ما، احتمال sunny به ۸۶.۵٪ می‌رسد و «دم» توزیع فرو می‌پاشد.

اما وقتی T را بالا می‌برید (مثلاً T = ۲)، توزیع «تخت» (Flatten) می‌شود. برتری توکن اول کم شده و «دم» — یعنی توکن‌های نامحتمل — دید بیشتری پیدا می‌کنند. احتمال sunny به ۴۲.۹٪ می‌رسد، در حالی که احتمال purple به ۵.۸٪ افزایش می‌یابد که حدود پنج برابر مقدار آن در T = ۱ است.

چرا رتبه‌بندی هرگز تغییر نمی‌کند؟

نکته کلیدی و حیاتی این است که رتبه‌بندی توکن‌ها هرگز جابه‌جا نمی‌شود. اگر sunny امتیاز (لاجیت) بالاتری نسبت به cloudy داشته باشد، در هر دمایی باز هم احتمالش بیشتر از cloudy خواهد بود. دلیل این امر آن است که نسبت احتمال دو توکن به مقدار $e$ به توان (اختلاف امتیازها تقسیم بر T) بستگی دارد.

از آنجایی که T همیشه مثبت است، تقسیم بر آن هرگز نمی‌تواند علامت اختلاف (Gap) را تغییر دهد. اگر اختلاف مثبت باشد، مثبت می‌ماند. دما فقط مقیاس فاصله‌های بین احتمالات را تغییر می‌دهد، اما نمی‌تواند جهت این فاصله‌ها را عوض کند.

ratio

توهم خلاقیت

اگر رتبه‌بندی ثابت است، پس چرا دمای بالا «خلاقانه» به نظر می‌رسد؟ این «خلاقیت» در واقع فقط نمونه‌برداری از توکن‌های غیرمنتظره‌ای است که از قبل در توزیع احتمالات وجود داشتند.

اگر توکنی مثل purple در T = ۱ شانس ۱.۲٪ داشته باشد، بالا بردن دما به T = ۲ ممکن است این شانس را به ۵.۸٪ برساند. مدل به دلیل دما به کلمه «بنفش» فکر نکرد؛ بلکه «بنفش» همیشه آنجا بود. دما فقط سهم او را از کیک احتمالات بزرگ‌تر کرد.

این یعنی دما فقط در جایی اثر دارد که مدل از قبل «نامطمئن» باشد:

  • قطعیت بالا: اگر یک لاجیت جهش بسیار بزرگی نسبت به بقیه داشته باشد، عملاً «دمی» برای دسترسی وجود ندارد، بنابراین T بالا تغییر زیادی ایجاد نمی‌کند.
  • نامطمئنی بالا: اگر چندین توکن لاجیت‌های مشابهی داشته باشند، دما اثرگذاری (Leverage) زیادی دارد.

«خلاقیت» ناشی از دمای بالا به طور یکنواخت در کل متن ظاهر نمی‌شود. بلکه دقیقاً در نقاطی ظاهر می‌شود که مدل از قبل چندین ادامه منطقی و محتمل را در نظر داشت.

خطرات افراط در تنظیمات

هیچ‌کدام از دو extrem دمایی واقعاً خلاق نیستند. در T = ۰، مدل از رمزگشایی حریصانه (Greedy decoding) استفاده می‌کند. چون تقسیم بر صفر از نظر ریاضی غیرممکن است، پیاده‌سازی‌ها یا مستقیماً بالاترین لاجیت (argmax) را برمی‌دارند یا T را به یک مقدار بسیار کوچک مثبت (epsilon) محدود می‌کنند.

رمزگشایی حریصانه اغلب منجر به حلقه‌های تکراری می‌شود. مدل‌ها تمایل دارند به عبارتی که تکرار شده است، در هر بار ظهور احتمال بیشتری بدهند؛ وقتی یک تکرار شروع شود، خودش را تقویت می‌کند و رمزگشایی حریصانه هیچ تصادفی‌سازی‌ای برای شکستن این چرخه ندارد.

در مقابل، دمای بسیار بالا (بالای ۱.۵) بدون تبعیض از دمِ توزیع نمونه‌برداری می‌کند. چون در انتهای لیست هم توکن‌های «جالب» مثل purple و هم توکن‌های «مزخرف» وجود دارند، خروجی در نهایت به نویز تصادفی تبدیل می‌شود.

برش زدن: Top-K و Top-P

در حالی که دما احتمالات را بازتوزیع می‌کند، پارامترهایی مثل نمونه‌گیری K برتر (Top-K) و نمونه‌گیری هسته‌ای (Top-P یا Nucleus Sampling) در واقع توکن‌ها را کلاً از دایره بررسی حذف می‌کنند. در مثال سرآشپز، این‌ها یعنی خط زدن برخی غذاها از منو، نه تغییر ترجیحات آشپز.

جزئیات Top-K:

  • سازوکار: توکن‌ها را بر اساس احتمال مرتب می‌کند، K تای اول را نگه می‌دارد، بقیه را دور می‌ریزد و سپس بازماندگان را دوباره نرمال‌سازی می‌کند تا مجموعشان ۱ شود.
  • مثال: با K = ۳ در مثال آب و هوا، فقط sunny، cloudy و warm باقی می‌مانند.
  • ضعف: K یک عدد ثابت است. اگر مدل خیلی مطمئن باشد اما K = ۴۰ باشد، باز هم ۳۹ توکن را وارد می‌کند که مدل آن‌ها را نمی‌خواست. اگر مدل بین ۱۰۰ گزینه مردد باشد، K = ۴۰ به طور تصادفی ۶۰ گزینه را حذف می‌کند.

جزئیات Top-P (نمونه‌گیری هسته‌ای):

  • سازوکار: توکن‌ها را مرتب کرده و کوچک‌ترین مجموعه‌ای را نگه می‌دارد که مجموع احتمالات تجمعی آن‌ها حداقل به P برسد. توکنی که مجموع را از P عبور دهد نیز اضافه شده و سپس نرمال‌سازی انجام می‌شود.
  • مثال: با P = ۰.۸ در جدول ۱، sunny (۶۳.۶٪) به علاوه cloudy (۲۳.۴٪) به ۸۷٪ می‌رسد. بازماندگان {sunny, cloudy} هستند.
  • قوت: اندازه مجموعه متغیر است. یک توزیع مطمئن، P را با دو توکن پوشش می‌دهد؛ یک توزیع نامطمئن ممکن است به ده‌ها توکن نیاز داشته باشد. این به مدل اجازه می‌دهد با میزان اطمینان خود سازگار شود.

خلاصه مقایسه‌ای

پارامتر عملکرد حذف توکن‌ها؟ سازگاری با اطمینان؟
دما بازتوزیع احتمالات هرگز —
Top-K حذف توکن‌ها بله (تعداد ثابت) خیر
Top-P حذف توکن‌ها بله (تعداد متغیر) بله

جمع‌بندی: فرآیند نهایی قرعه‌کشی

در اکثر پیاده‌سازی‌ها، جریان به این ترتیب است: لاجیت‌ها $ \rightarrow $ بازطراحی با دما $ \rightarrow $ برش با Top-K/Top-P $ \rightarrow $ نمونه‌برداری تصادفی.

دما و Top-P به هم گره خورده‌اند. Top-P احتمالات تجمعی را بعد از اینکه دما آن‌ها را بازطراحی کرد، بررسی می‌کند. بالا بردن دما توزیع را تخت می‌کند، به این معنی که توکن‌های بیشتری نیاز است تا به آستانه احتمالی P برسند. این امر به عنوان یک اثر جانبی، مجموعه Top-P را گسترش می‌دهد. به همین دلیل توصیه می‌شود یا دما را تغییر دهید یا Top-P را، اما نه هر دو را همزمان.

گام نهایی، قرعه‌کشی تصادفی است. توکن‌های بازمانده روی یک خط اعداد از ۰ تا ۱ قرار می‌گیرند، به طوری که عرض هر بخش برابر با احتمال آن توکن باشد. یک عدد تصادفی یکنواخت استخراج می‌شود؛ هر بخشی که عدد روی آن بیفتد، توکن برنده است. توکنی با احتمال ۶۰٪، ۶۰٪ مواقع برنده می‌شود، در حالی که توکن ۱.۲٪ یک برش باریک است که گهگاه برنده می‌شود. این قرعه‌کشی تصادفی جایی است که «خلاقیت» در عمل ظاهر می‌شود.

راهنمای عملی پیاده‌سازی

بسته به هدف خود، باید پارامترها را متفاوت تنظیم کنید:

  • پاسخ قطعی (کدنویسی، استخراج داده، ریاضی): از دمای پایین (۰ تا ۰.۳) استفاده کنید. وقتی یک توکن صحیح وجود دارد، نمی‌خواهید «دم» توزیع برنده شود.
  • هوش مصنوعی گفتگو محور: دمای حدود ۰.۷ را به کار ببرید تا تنوع کافی برای جلوگیری از تکرارهای رباتیک ایجاد شود و در عین حال انسجام حفظ گردد.
  • تولید متن باز (ایده‌پردازی، داستان‌نویسی): از T = ۱.۰ یا بالاتر استفاده کنید زیرا جایگزین‌های پذیرفتنی در «دم» توزیع زندگی می‌کنند.
  • پیش‌فرض‌های برش: Top-P را روی ۰.۹ تا ۰.۹۵ تنظیم کنید تا نویزها حذف شوند. از Top-K فقط زمانی استفاده کنید که بخواهید یک سقف سخت برای تعداد کاندیداها بگذارید.
  • حد بالا: از T بسیار بالاتر از ۱.۵ اجتناب کنید مگر اینکه خروجی تقریباً تصادفی بخواهید، زیرا در آن نقطه دمِ توزیع دیگر جالب نیست و به نویز تبدیل می‌شود.

این واقعیت فنی، نگاه ما را به «تخیل» هوش مصنوعی تغییر می‌دهد. تنوع در وزن‌های مدل در طول آموزش جاسازی شده است. پارامترهایی که ما تغییر می‌دهیم ابزارهای خلق نیستند، بلکه فیلترهایی برای دسترسی هستند. بهینه کردن این فیلترها در مقیاس صنعتی می‌تواند منجر به بهره‌وری چشمگیری شود؛ برای مثال، استفاده بهینه از عامل‌های هوش مصنوعی توانسته است هزینه‌های تولید محتوا را تا ۸۷.۷ درصد کاهش دهد.

اما تأثیر این تنظیمات بر مدل‌های استدلالی جدید که از زنجیره تفکر استفاده می‌کنند، پیچیده‌تر است — به تحلیل ما درباره مدل‌های Reasoning مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع بر اساس تخصص در معماری ترنسفورمرها نشان می‌دهد که کنترل خروجی مدل‌ها باید از طریق مهندسی دقیق‌تر پرامپت و داده‌ها صورت گیرد، نه تکیه بر شانس در نمونه‌برداری. درک این تفاوت برای توسعه‌دهندگانی که به دنبال خروجی‌های قابل پیش‌بینی و در عین حال متنوع هستند، حیاتی است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از APIهای مدل‌های زبانی برای اتوماسیون استفاده می‌کنند، درک این موضوع مانع از اتلاف وقت در تنظیمات اشتباه Temperature برای بهبود کیفیت پاسخ‌ها می‌شود.

·نگاه ما
تحریریه دات‌هوش

بسیاری از مهندسان پرامپت به اشتباه تصور می‌کنند با دستکاری Temperature می‌توانند مدل را به «تفکر خارج از چارچوب» وادار کنند، در حالی که این پارامتر صرفاً یک فیلتر دسترسی است، نه یک موتور تولید. این واقعیت نشان می‌دهد که برای دستیابی به خلاقیت واقعی، باید روی داده‌های آموزش یا تکنیک‌های RAG تمرکز کرد، نه روی تنظیمات استنتاج. در واقع، هر آنچه مدل می‌تواند بگوید، در زمان آموزش در وزن‌هایش حک شده است و دما فقط صدای برخی از این وزن‌ها را بلندتر می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.