پرش به محتوای اصلی
پرش به محتوای مقاله

OpenAI: تعریف محدودیت‌ها بیشترین اثر را بر خروجی مدل‌ها دارد

·۱۳ مرداد ۱۴۰۵۸ دقیقه مطالعه
پنج بخش مؤثر و پنج بخش مزاحم در پرامپت هوش مصنوعی
پنج بخش مؤثر و پنج بخش مزاحم در پرامپت هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات علمی بی‌اثری پرسوناهای متخصص و ادب در مدل‌های مدرن؛ تغییر پارادایم از «ترغیب مدل» به «محدود کردن مدل» برای افزایش دقت و کاهش هزینه.

اگر هنوز در ابتدای هر پرامپت می‌نویسید «تو یک متخصص جهانی هستی»، احتمالاً دارید وقت و هزینه خود را تلف می‌کنید. بر اساس مجموعه‌ای از بنچ‌مارک‌های مستقل و راهنمای رسمی OpenAI، Anthropic و مدرسه وارتون، استفاده از پرسونای فرضی و مودبانه بودن، تنها جایگاه‌های توخالی هستند که به‌طور مستمر دقت مدل را بهبود نمی‌بخشند و تأثیر ثابتی بر صحت پاسخ‌ها ندارند.

این تغییر دیدگاه در حالی رخ می‌دهد که مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن، مثل کسی که می‌داند چطور از یک مشاور باتجربه بهترین جواب را بگیرد — از یک «هنر سیاه» مبتنی بر حدس و گمان برای یافتن کلمات جادویی، به یک فرآیند ساختاریافته برای تعیین مشخصات فنی (Specification Process) تبدیل شده است. این تکامل در روش‌های تعامل با مدل‌ها در حالی رخ می‌دهد که پیچیدگی‌های امنیتی نیز افزایش یافته و برای مثال، تزریق پرامپت به عنوان یک ابزار حمله توسط شرکت‌های امنیتی مانند CrowdStrike به طور گسترده مستند شده است. برای بسیاری از کاربران، عادت به افزودن کلمات اضافی و توصیفات حاشیه‌ای از رفتارهای مدل‌های اولیه می‌آید؛ جایی که برخی محرک‌های خاص به نظر مفید می‌رسیدند، اما با تکامل مدل‌ها، این پرامپت‌های «جادویی» اکنون تنها نویز آماری هستند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی توکن‌ها اشاره کردیم، هر کلمه‌ی اضافی در ورودی، ریسک گمراه شدن مدل را افزایش می‌دهد.

افسانه پرسونای متخصص

یک مطالعه توسط EMNLP 2024، تعداد ۱۶۲ نقش مختلف را در ۲۴۱۰ پرسش واقع‌گرایانه (Factual Questions) با استفاده از چهار خانواده‌ی مدل مختلف آزمایش کرد. نتیجه تکان‌دهنده و صریح بود: افزودن یک پرسونا به پرامپت سیستمی (System Prompt)، هیچ بهبود قابل‌سنجی در دقت نسبت به گروه کنترل (که هیچ پرسونایی نداشتند) ایجاد نکرد.

تحقیقات تکمیلی در مدرسه وارتون با استفاده از محک‌های سخت‌گیرانه GPQA Diamond و MMLU-Pro این روند را تأیید کرد. نتایج نشان داد در حالی که پرسونای «متخصص» کمکی به بهبود پاسخ نمی‌کند، اما در مقابل، استفاده از پرسونای «دانش کم» — مثلاً وقتی از مدل می‌خواهند طوری رفتار کند که انگار یک کودک است — به‌طور مداوم و سیستماتیک عملکرد مدل را کاهش داد. شرکت Anthropic نیز به‌طور مستقل در مستندات خود به این نتیجه رسیده است که نقش‌آفرینی‌های سنگین (Heavy Role Prompting) برای مدل‌های مدرن عملاً غیرضروری است.

پنج بخش مؤثر و پنج بخش بی‌اثر در پرامپت هوش مصنوعی

پارادوکس مودبانه بودن

افزودن کلماتی مثل «لطفاً» یا عبارت‌هایی چون «به تو دستور می‌دهم» به یک درخواست، نتایج نامنظم و متناقضی ایجاد می‌کند. در گزارش مدرسه وارتون، مشاهده شد که تغییر تنها یک کلمه از نظر ادب، در برخی پرسش‌ها باعث شد نتایج تا ۶۰ درصد در هر دو جهت (مثبت یا منفی) تغییر کند.

وقتی این داده‌ها در کل مجموعه‌ها میانگین‌گیری می‌شوند، اثر ادب کاملاً ناپدید می‌شود. این «نوسانات محلی» است که توهم «پرامپت جادویی» را ایجاد می‌کند؛ کاربر عبارتی را می‌یابد که برای یک تسک خاص جواب می‌دهد و به اشتباه تصور می‌کند این یک قانون جهانی است، در حالی که در واقع صرفاً یک تصادف آماری و اتفاقی است.

کجاست سود واقعی؟

راهنمای به‌روزرسانی شده‌ی OpenAI — که به‌طور خاص برای خانواده مدل‌های عرضه شده در ۹ جولای ۲۰۲۶ بهینه شده است — بر پرامپت‌های «ناب» یا Lean تأکید دارد. اندازه‌گیری‌های داخلی آن‌ها نشان می‌دهد که حذف دستورات تکراری و کلمات اضافی، نتایج ارزیابی را ۱۰ تا ۱۵ درصد افزایش داده و در عین حال مصرف توکن (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خرد — را ۴۱ تا ۶۶ درصد کاهش داده است. این امر منجر به کاهش ۳۳ تا ۶۷ درصدی هزینه‌ها شده است.

به نقل از Anthropic، عناصری که واقعاً بر نتیجه اثر می‌گذارند و «عقربه را تکان می‌دهند»، عبارتند از: الزامات عینی (Concrete Requirements)، محدودیت‌های شفاف، تبیین انگیزه‌ها و ارائه مثال‌های مستقیم. وقتی کلمات توصیفی شکست می‌خورند، یک مثال یادگیری با نمونهٔ اندک (Few-shot example) همیشه برتر و مؤثرتر از یک پاراگراف توصیفی طولانی است.

برای به حداکثر رساندن خروجی، توسعه‌دهندگان باید بر این ۵ بخش یا «اسلات» متمرکز شوند:

  • اکشن تسک (Task Action): یک فعل صریح و دقیق (مثلاً: مقایسه کن، محاسبه کن، بازنویسی کن).
  • داده‌های ورودی (Input Data): متن خام یا زمینه‌ای که مدل باید پردازش کند.
  • محدودیت‌های سخت (Hard Constraints): «نباید»های صریح و قاطع (مثلاً: حق جعل حقایق را نداری، از بودجه تعیین شده تجاوز نکن).
  • قالب و حجم (Format and Volume): مشخصات دقیق خروجی (مثلاً: حداکثر ۷ مورد گلوله‌ای، هر کدام زیر ۱۵ کلمه، بدون هیچ‌گونه مقدمه).
  • معیار پذیرش (Acceptance Criteria): یک شرط عینی و ملموس برای تأیید اعتبار و صحت پاسخ.

پنج جایگاه مؤثر و پنج جایگاه بی‌اثر در پرامپت هوش مصنوعی

مبارزه با «سوگیری طول»

بسیاری از کاربران از «پرگویی» و زیاده‌گویی هوش مصنوعی شاکی هستند. این یک نقص تصادفی یا عادت مدل نیست، بلکه یک اعوجاج سیستماتیک ناشی از RLHF (یادگیری تقویتی با بازخورد انسانی) است. مدل‌های پاداش در این سیستم تمایل دارند پاسخ‌های طولانی‌تر را ترجیح دهند، فارغ از اینکه کیفیت واقعی آن‌ها چطور باشد؛ پدیده‌ای که «سوگیری طول» (Length Bias) نام دارد.

صرفاً درخواست برای «کوتاه نوشتن» یا «مختصر بودن» اغلب شکست می‌خورد چون معیار عینی و عددی ارائه نمی‌دهد. تنها راه مطمئن و قابل اتکا، تعیین دقیق حجم و ساختار است؛ مثلاً ممنوع کردن کامل و صریح جملات مقدماتی و پاراگراف‌های نتیجه‌گیری.

ناپایداری قالب‌بندی

حتی بهبودهای ساختاری هم بدون نقص نیستند. پژوهش روی GPT-3.5-turbo و GPT-4 نشان داد تغییر قالب خروجی از متن ساده به JSON یا YAML می‌تواند باعث نوسان ۴۰ درصدی در دقت تسک‌های ترجمه کد شود.

اگرچه GPT-4 پایدارتر از نسل قبل است، اما هیچ مدلی در برابر تغییرات قالب‌بندی مصون نیست. OpenAI هشدار داده است که «بهترین روش‌های» قدیمی — مانند استفاده از بلوک‌های XML یا اسکریپت‌های مقدماتی (Preamble scripts) — در نسخه‌های جدید مدل‌ها حتی اثر معکوس داشته و غیربهینه شده‌اند.

این واقعیت کلیدی است: هیچ چک‌لیست جهانی وجود ندارد. اثر یک پرامپت به شدت به نسخه خاص مدل بستگی دارد. پرامپت-ی که دیروز جواب می‌داد، ممکن است امروز شکست بخورد. تنها راه تضمین پایداری، تست پرامپت‌ها در برابر یک معیار پذیرش ثابت در نسخه‌های مختلف است، مثلاً با استفاده از APIهای یکپارچه مثل provod.ai که جابجایی سریع بین تأمین‌کنندگان مختلف را ممکن می‌کند.

هزینه «فروشگاه‌های پرامپت»

این ناپایداری، بازار‌هایی مثل PromptBase را ریسکی می‌کند. در حالی که این سایت‌ها بیش از ۳۱۰ هزار پرامپت لیست کرده‌اند، بسیاری از این قالب‌ها بر همان «پرسوناهای خبره» تکیه دارند که پژوهش‌های علمی آن‌ها را رد کرده است.

علاوه بر این، بهینه‌ساز رایگان OpenAI اکنون همان نقصاتی را شناس می‌کند که مردم در فروشگاه‌ها برایش پول می‌دهند: تضادهای منطقی، فقدان توصیف دقیق قالب و نبود مشخصات برای موارد خاص و مرزی (Edge-cases). از آنجایی که مدل‌ها باید به عنوان خانواده‌های جدید برای تنظیم (Tune) در نظر گرفته شوند، نه جایگزین‌های مستقیم (Drop-in replacement)، یک قالب پولی لحظه‌ای که مدل جدیدی عرضه شود، به داراییی منسوخ تبدیل می‌گردد.

معنای این اتفاق برای گردش کار شما، تغییر از «شعر نوشتن» به «نوشتن مشخصات فنی» است. هدف دیگرe دل‌ربایی یا جادو کردن هوش مصنوعی نیست، بلکه محدود کردن (Constrain) آن است. با تمرکز بر محدودیت‌های سخت و قالب‌های مشخص، هزینه را کم و قابلیت اطمینان را بالا می‌برید.

گام بعدی شما

  • موفق‌ترین پرامپت خود را بردارید و تمام صفت‌ها، کلمات مودبانه و ادعاهای «خبره بودن» را حذف کنید.
  • جایگزین آن‌ها را یک لیست شماره‌دار از محدودیت‌ها و یک قالب خروجی سخت‌گیرانه قرار دهید.
  • این نسخه «ناب» را ۵ بار اجرا کرده و با نسخه اصلی مقایسه کنید؛ احتمالاً نتایج سازگارتر و ارزان‌تر خواهند بود.

اما اثر این تغییر در مدل‌های استدلالی جدید حتی عمیق‌تر است؛ در تحلیل ما درباره مدل‌های Reasoning بررسی کنید که چرا زنجیره تفکر جایگزین مهندسی پرامپت سنتی می‌شود.

چرا این موضوع مهم است؟

این یافته‌ها با تکیه بر اعتبار داده‌های EMNLP و OpenAI، هزینه‌های عملیاتی توسعه‌دهندگان را از طریق کاهش توکن‌ها به‌شدت پایین می‌آورد. همچنین ریسک تکیه بر بازار‌های غیرعلمی پرامپت را افشا کرده و استانداردی مبتنی بر داده برای بهینه‌سازی مدل‌ها تعریف می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه دلاری برای APIها روبر هستند، حذف توکن‌های اضافی و استفاده از پرامپت‌های Lean می‌تواند هزینه‌های استنتاج را تا ۶۷٪ کاهش دهد.

·نگاه ما
تحریریه دات‌هوش

انتقال از «هنر پرامپت‌نویسی» به «تدوین مشخصات فنی»، نشان‌دهنده‌ی بلوغ مدل‌ها در درک دستورات است. وقتی مدل‌ها دیگر نیازمند تحریکات احساسی یا نقش‌های فرضی برای استخراج حداکثر توان نیستند، تمرکز مهندسان باید از لایه‌ی زبان به لایه‌ی منطق و ساختار خروجی منتقل شود. در واقع، هرچه مدل‌ها هوشمندتر شوند، پرامپت‌های «ساده و سخت» جایگزین پرامپت‌های «پیچیده و نرم» می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.