پرش به محتوای اصلی
پرش به محتوای مقاله

«توزیع احتمالات نه خلاقیت»؛ تحلیل عملکرد پارامتر Temperature در LLM

·۱۲ مرداد ۱۴۰۵۴ دقیقه مطالعه
راهنما
دکمه خلاقیت نیست. اینجا ببینید واقعاً چه‌کار می‌کند.
دکمه خلاقیت نیست. اینجا ببینید واقعاً چه‌کار می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شفاف‌سازی ریاضیِ تفاوت بین «خلاقیت» و «توزیع احتمالات» در Temperature و ارائه دستورالعمل دقیق برای تفکیک کاربردهای T=0 از T>0 در خط‌لوله‌های عامل‌محور.

تصور کنید در حال طراحی یک سیستم پاسخ‌گویی خودکار هستید و متوجه می‌شوید مدل شما پاسخ‌هایی «خسته‌کننده» می‌دهد؛ اولین وسوسه شما این است که پیچ Temperature را بچرخاند و آن را بالا ببرید. اما باید بدانید که این کار شبیه به این است که برای پیدا کردن یک جواب درست، به‌جای مطالعه بیشتر، شانس تصادفی را بالا ببرید.

تنظیمات دما را نه به عنوان یک پیچ تنظیم برای خلاقیت در طوفان فکری، بلکه به عنوان ابزاری ببینید که توزیع احتمالی توکن بعدی را بازسازی می‌کند. این باور اشتباه که Temperature یک «کلید خلاقیت» است، یکی از رایج‌ترین خطاهای توسعه در هوش مصنوعی است، زیرا این مکانیسم می‌تواند به‌طور نامحسوس صحت خروجی‌ها را در محیط‌های عملیاتی تخریب کند. درک دقیق این یک مکانیسم به توسعه‌دهنده می‌گوید چه زمانی دقیقاً باید آن را تغییر دهد و در بیشتر موارد، چه زمانی باید دست از تغییرش بردارد.

همان‌طور که در پوشش قبلی خود درباره این موضوع بحث کردیم که چرا توسعه‌دهندگانی مانند آنکور ستی (Ankur Sethi) اغلب کدهای تولید شده توسط هوش مصنوعی را به‌صورت دستی بازتایپ می‌کنند تا از کیفیت آن‌ها مطمئن شوند، هسته اصلی مشکل اغلب در اعتماد به خروجی مدل است. برای بسیاری، دما اولین پیچ تنظیمی است که برای رفع یک پاسخ «خسته‌کننده» می‌چرخانند، اما این سوءتفاهم به‌جای نوآوری واقعی، منجر به شکست معنایی (Semantic Failure) می‌شود.

طبق یک راهنمای فنی که در ۳ اوت ۲۰۲۶ در وب‌سایت dev.to منتشر شد، Temperature در واقع امتیازهای خام یا همان لاجیت‌ها (Logits) را که مدل برای هر توکن در واژگان خود تولید می‌کند، پیش از اعمال تابع سافت‌مکس (Softmax) تقسیم می‌کند. این موضوع بخشی از فرآیند پیچیده‌ی پردازش زبان است که در کالبدشکافی مهندسی مدل‌های زبانی به صورت مفصل‌تر از توکن‌سازی تا حافظه خارجی بررسی شده است. این عملیات ریاضی با فرمول p_i = softmax(z_i / T) بیان می‌شود.

این عملیات، نحوه نمونه‌برداری مدل از کلمه بعدی را به طور کامل تغییر می‌دهد:

  • T = ۱.۰: توزیع احتمالات دقیقاً همان‌طور که هست و بدون تغییر استفاده می‌شود.
  • T < ۱.۰: تقسیم بر عددی کمتر از یک، شکاف‌ها و فاصله‌ها بین لاجیت‌ها را بزرگ‌نمایی می‌کند. در این حالت، توکن‌های با احتمال بالا، محتمل‌تر می‌شوند و کاندیداهای دمِ توزیع (Tail)e خرد و حذف می‌گردند که نتیجه آن ایجاد یک توزیع «تیز» و متمرکز است.
  • T > ۱.۰: شکاف‌ها بین لاجیت‌ها کوچک می‌شوند. توکن‌های نامحتمل، به‌طور نسبی محتمل‌تر می‌شوند و این امر منجر به یک توزیع «تخت» می‌گردد.
  • T → ۰: نمونه‌برداری به حالت رمزگشایی حریصانه (Greedy Decoding) یا همان argmax تبدیل می‌شود، جایی که همیشه محتمل‌ترین توکن انتخاب می‌گردد.

برای تجسم این موضوع، سه توکن کاندید با لاجیت‌های [۲.۰، ۱.۰، ۰.۱] را در نظر بگیرید. تغییرات احتمال بر اساس دما به شکل چشم‌گیری تغییر می‌کند:

  • در دمای ۰.۵: توکن A (۸۶٪)، توکن B (۱۲٪)، توکن C (۲٪)
  • در دمای ۱.۰: توکن A (۶۶٪)، توکن B (۲۴٪)، توکن C (۱۰٪)
  • در دمای ۲.۰: توکن A (۵۰٪)، توکن B (۳۰٪)، توکن C (۱۹٪)

نکته حیاتی این است که دمای بالا، ایده‌های «بهتری» که مدل پیش از این به آن‌ها باور نداشته را احضار نمی‌کند. دما تنها می‌تواند احتمالات را بین توکن‌هایی که مدل در حال حاضر امتیاز داده است، بازپخش کند. اگر کلمه درست در راس توزیع نباشد، بالا بردن دما آن را پیدا نمی‌کند؛ بلکه فقط کاندیداهای متوسط را محتمل‌تر می‌کند. فراتر از یک نقطه مشخص، خروجی دیگر «خلاقانه» نیست، بلکه گسسته و نامفهوم است؛ یعنی متنی تولید می‌کند که از نظر دستوری درست است اما از نظر معنایی فروپاشیده است. این تغییر در توزیع احتمالات می‌تواند بر سبک خروجی اثر بگذارد، هرچند اینکه بررسی اثرانگشت نویسندگی در مدل‌های مختلف نشان می‌دهد که الگوهای ساختاری عمیق‌تری نیز در هر مدل وجود دارد.

برای کسانی که خط‌لوله‌های عامل‌محور (Agentic) می‌سازند، قانون کلی این است: برای هر وظیفه‌ای که یک «پاسخ درست» مشخص دارد، پیش‌فرض را روی T = ۰ قرار دهید.

از T = ۰ برای موارد زیر استفاده کنید:

  • طبقه‌بندی و مسیریابی (مثلاً: «این ورودی در کدام یک از این دسته‌ها قرار می‌گیرد؟»)
  • استخراج داده و خروجی‌های ساختاریافته، مانند پارس کردن فیلدها یا فرمت JSON
  • فراخوانی ابزارها (Tool Calls) یا انتخاب توابع مناسب
  • پاسخ‌های تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از نقل می‌آورد — جایی که مدل باید دقیقاً به متن ارائه شده پایبند باشد
  • هر مرحله‌ای که خروجی آن، ورودی و پیش‌نیاز مرحله بعدی باشد

تغییرات احتمالی یا واریانس (T = ۰.۷ تا ۱.۰) را فقط برای تولیدات باز و بدون پاسخ قطعی، مانند متن‌های بازاریابی، طوفان فکری یا نام‌گذاری به کار ببرید. این حالت زمانی مفید است که قصد دارید چندین کاندید تولید کنید تا بهترین آن‌ها را انتخاب نمایید، یا زمانی که یکسان بودن ورودی‌ها و خروجی‌ها یک نقطه ضعف محسوب شود. در محیط‌های عملیاتی و تولید، توسعه‌دهندگان تقریباً هرگز نباید از T = ۱.۰ فراتر روند.

همچنین باید مراقب «افسانه قطعیت» بود. تنظیم دمای صفر، بازتولید دقیق بیت-به-بیت (Bit-for-bit reproducibility) را تضمین نمی‌کند. عواملی مانند غیرارتباطی بودن عملیات اعداد ممیز در اندازه‌های مختلف دسته (Batch Size) و مکانیسم مسیریابی در معماری ترکیب خبره‌ها (MoE) می‌تواند باعث شود فراخوانی‌های کاملاً یکسان در سمت سرور متفاوت پاسخ دهند. برای دستیابی به پایداری بیشتر، توسعه‌دهندگان باید نسخه مدل را تثبیت (Pin) کرده و در صورت امکان از یک بذر (Seed) ثابت استفاده کنند و با این موضوع به عنوان یک راهکار «بیشترین تلاش» (Best-effort) برخورد کنند.

در نهایت، این راهنما هشدار می‌دهد که هم‌زمان Temperature و نمونه‌گیری هسته‌ای (Top-p) را تنظیم نکنید. در حالی که دما شکل توزیع را تغییر می‌دهد، Top-p توزیع را می‌بُرد و آن را به کوچک‌ترین مجموعه‌ای از توکن‌ها محدود می‌کند که احتمال تجمعی آن‌ها از p بیشتر شود. تنظیم هم‌زمان هر دو پارامتر باعث می‌شود استدلال درباره اثرات آن‌ها دشوار شود؛ توصیه می‌شود Top-p روی ۱.۰ بماند و فقط دما تغییر کند.

برای اکثر عامل‌های عملیاتی، هدف پایداری است، نه تنوع. وقتی به دما به عنوان یک تغییردهنده ریاضی شکل توزیع نگاه کنید، نه یک کلید هوشمندی و خلاقیت، تصمیم ساده می‌شود: اگر کاری پاسخ درست دارد، روی صحت آن قمار نکنید.

گام بعدی شما

  • تمام پرامپت‌های استخراج داده و Tool-use خود را روی T = 0 تنظیم کنید تا نرخ خطای ساختاری کاهش یابد.
  • برای تست خلاقیت، به‌جای بالا بردن دما، از روش Sample-and-Rank استفاده کنید (تولید ۵ پاسخ با دمای متوسط و انتخاب بهترین توسط یک مدل ارزیاب).
  • بررسی کنید که آیا در سیستم خود از Top-p و Temperature به‌طور هم‌زمان استفاده می‌کنید یا خیر؛ یکی را ثابت نگه دارید.

اما پایداری مدل تنها با تنظیمات به دست نمی‌آید؛ اثر معماری‌های جدید در کاهش توهمات را در تحلیل ما درباره مدل‌های استدلالی بررسی کنید.

چرا این موضوع مهم است؟

این موضوع بر اعتبار و قابل‌پیش‌بینی بودن سیستم‌های AI در محیط‌های تجاری تأثیر مستقیم دارد. بر اساس استانداردهای مهندسی نرم‌افزار، جایگزینی شانس با قطعیت در لایه‌های استخراج داده، تخصص لازم برای کاهش هزینه‌های نظارت انسانی است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از طریق APIهای محدود یا مدل‌های Open-weights فعالیت می‌کنند، درک این پارامتر برای کاهش هزینه‌های استنتاج (از طریق حذف تکرارهای بیهوده) و افزایش دقت ابزارهای استخراج داده حیاتی است.

·نگاه ما
تحریریه دات‌هوش

اشتباه متداول در استفاده از Temperature نشان می‌دهد که بسیاری از تیم‌های توسعه هنوز با مدل‌های زبانی به عنوان «جعبه سیاه» برخورد می‌کنند تا ابزاری ریاضی. جابه‌جایی نگاه از «خلاقیت» به «توزیع احتمالات» در واقع مرز بین یک Prototype ساده و یک محصول مقیاس‌پذیر را مشخص می‌کند. در پروژه‌های جدی، تنوع باید در لایه طراحی پرامپت یا استراتژی نمونه‌برداری باشد، نه در دستکاری پارامترهای آماری مدل.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.