پرش به محتوای اصلی
پرش به محتوای مقاله

رویکرد Scaffolds: جایگزینی الگوهای آماری با چرخهٔ چهارگانهٔ استدلال

·۱۸ تیر ۱۴۰۵۱۵ دقیقه مطالعه۲ بازدید
راهنما
بیش از «گام‌به‌گام فکر کن»: ساختار استدلال برای واداشتن هوش مصنوعی به تفکر واقعی
بیش از «گام‌به‌گام فکر کن»: ساختار استدلال برای واداشتن هوش مصنوعی به تفکر واقعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از زنجیره تفکر (CoT) آزاد به استدلال ساختاریافته مبتنی بر متد علمی؛ جایی که مدل را مجبور به تولید فرضیات متضاد و تست آن‌ها پیش از نتیجه‌گیری می‌کند.

تصور کنید یک متخصص تشخیص می‌دهد که چرا تولید یک کارخانه ناگهان افت کرده است؛ او مستقیماً به سراغ حدس نمی‌رود، بلکه ابتدا تمام شواهد را می‌شمارد. اگر شما هنوز از دستورات ساده برای حل مسائل پیچیده استفاده می‌کنید، احتمالاً با نتایجی روبه‌رو هستید که ظاهر منطقی دارند اما در واقع توهماتی متقاعدکننده هستند.

بسیاری از کاربران برای افزایش دقت مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — از روش زنجیره تفکر (Chain-of-Thought) استفاده می‌کنند. طبق گزارش منتشرشده در ۹ جولای ۲۰۲۶ در وب‌سایت dev.to، این روش اغلب شکست می‌خورد زیرا مدل‌ها به‌جای به‌کارگیری منطق واقعی، صرفاً شکل ظاهری داده‌های آموزشی را تقلید می‌کنند. این یعنی مدل از «مسیر دارای کمترین مقاومت آماری» می‌رود تا پاسخی تولید کند که فقط «شبیه» جواب‌های درست باشد.

فراتر از «گام‌به‌گام فکر کن»: ساخت داربست استدلال برای اجبار هوش مصنوعی به تفکر واقعی

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی خطاهای استدلالی مدل‌های زبانی اشاره کردیم، مشکل اصلی در نبودِ ساختار است. وقتی به مدل می‌گوییم «گام‌به‌گام فکر کن»، هیچ چارچوبی برای نوع تفکر ارائه نمی‌دهیم. در نتیجه، مدل در مسائل مبهم یا تصمیمات حساس، گام‌هایش را به‌سمت یک پاسخ غلط اما با اطمینان بالا می‌برد. در واقع زنجیره تفکر شکست نمی‌خورد، بلکه «داربستی» برای هدایت آن وجود ندارد.

برای حل این مشکل، روش داربست استدلالی (Reasoning Scaffold) معرفی شده است. این چارچوب دقیقاً شبیه روش علمی در پژوهش‌های تجربی عمل می‌کند تا مدل پیش از تحلیل کامل فضای مسئله، به نتیجه عجله نکند. این سیستم مدل را مجبور می‌کند به‌جای تولید استدلال‌های عمومی، یک دستورالعمل چهارمرحله‌ای را اجرا کند:

  • مشاهده (Observe): مدل باید تمام واقعیات، داده‌ها و محدودیت‌های ورودی را بدون هیچ تفسیری لیست کند. این کار مانع از آن می‌شود که مدل پیش از شناخت کامل مسئله، بر اساس الگوهای تکراری نتیجه‌گیری کند.
  • فرضیه (Hypothesize): هوش مصنوعی باید حداقل دو توضیح یا راهکار متفاوت ارائه دهد. اجباری بودنِ چند فرضیه، مدل را مجبور می‌کند تمام احتمالات را بررسی کند و از پذیرفتن اولین حدس به‌دست‌آمده پرهیز کند.
  • تست (Test): در این مرحله، مدل برای هر فرضیه شواهد موافق و مخالف را بررسی می‌کند یا نتیجه را شبیه‌سازی می‌کند. اینجاست که فشار ذهنی اصلی وارد می‌شود؛ بدون این مرحله، فرضیه‌ها بدون بررسی باقی می‌مانند.
  • نتیجه‌گیری (Conclude): پاسخ نهایی باید صرفاً بر اساس نتایج مرحله تست باشد. مدل اجازه ندارد در این مرحله اطلاعات جدیدی اضافه کند یا با عبارات مبهم، پاسخ را تعدیل کند.

تفاوت این دو رویکرد در چند محور کلیدی است. در زنجیره تفکر معمولی، مسیر شناختی آزاد است و اثرات اشتباه در هر گام، به‌سادگی به مراحل بعد منتقل می‌شود. اما در داربست استدلالی، هر مرحله گزینه‌های غلط را حذف می‌کند و مسیر را باریک‌تر و دقیق‌تر می‌سازد. همچنین، تفکیک ساختاری این مراحل باعث می‌شود هر بخش به‌صورت مستقل قابل بازبینی باشد.

به نقل از مقاله سال ۲۰۲۳ Li et al در مورد تولید کد، انطباق ساختار پرامپت با معماری منطقیِ یک حوزه، منجر به بهبودهای چشمگیر و مستمر در عملکرد مدل می‌شود. این مکانیزم بر اساس محدود کردن فضای جست‌وجو در توزیع خروجی مدل عمل می‌کند.

برای محیط‌های عملیاتی، استفاده از تگ‌های XML (مثل <observe></observe>) بسیار مؤثرتر از بولد کردن متن است. مدل‌های مدرن مرزهای این تگ‌ها را بهتر درک می‌کنند و این ساختار مانع از ادغام یا فشرده‌سازی مراحل در مدل‌های کوچک‌تر یا کوانتیده (Quantized) می‌شود. علاوه بر این، استخراج داده‌ها برای تیم‌های توسعه با استفاده از regex بسیار ساده‌تر می‌شود.

برای مقیاس‌پذیری، توصیه می‌شود از کتابخانه‌هایی مثل instructor و طرح‌واره‌های Pydantic استفاده کنید تا داربست را در سطح API و از طریق خروجی‌های ساختاریافته (Structured Outputs) پیاده کنید. با تعریف یک کلاس ReasoningScaffold می‌توان محدودیت‌های سختی اعمال کرد؛ مثلاً فیلد min_length=2 برای فرضیه‌ها یا فیلد اجباری verification_query برای مرحله تست، تا مدل نتواند با پاسخ‌های مبهم از زیر کار در برود.

به عنوان مثال، اگر یک تولیدکننده شاهد افت ارسال به‌موقع از ۹۱٪ به ۶۶٪ باشد، یک مدل با زنجیره تفکر معمولی احتمالاً می‌گوید «هر سه عامل تغییرات ممکن است اثر داشته باشند و باید بررسی شوند». اما با داربست استدلالی، مدل پیش‌بینی‌های تست‌پذیر می‌سازد: ابتدا افت ۲۵ درصدی را مشاهده می‌کند، سپس سه فرضیه (شکست سیستم WMS، تغییر شریک لجستیکی یا تغییر ابعاد کالا) می‌سازد و برای هر کدام یک پرس‌وجوی داده‌ای دقیق تعریف می‌کند (مثلاً: «اگر نرخ تأخیر در ماه آپریل ۳ برابر سیستم قدیمی باشد، فرضیه اول درست است»). در نهایت، اولویت‌بندی دقیقی برای بررسی سریع‌ترین مسیر ارائه می‌دهد.

البته این روش جایگزین همگانی نیست زیرا هزینه استنتاج (Inference) — مثل کرایه یک آشپزخانه صنعتی که هرچه دستور پخت سنگین‌تر باشد هزینه هر وعده بیشتر است — را بالا می‌برد و تعداد توکن‌ها را از ۱۵۰ به ۹۰۰ می‌رساند. این روش برای کارهای ساده مثل ترجمه یا خلاصه‌سازی توصیه نمی‌شود و تنها زمانی کاربرد دارد که اشتباه در نتیجه‌گیری، هزینه‌ی سنگینی داشته باشد.

یک الگوی پیشرفته، استفاده از این داربست به‌عنوان یک مرحله تحلیل جداگانه در یک زنجیره پرامپت است. در این حالت، مدلی قدرتمند مثل GPT-4o یا Claude 3.5 Sonnet ردپای استدلالی را تولید می‌کند و سپس این مستندات به مدلی ارزان‌تر مثل GPT-4o mini یا Haiku فرستاده می‌شود تا خروجی نهایی را قالب‌بندی کند. این کار هزینه را بهینه می‌کند بدون اینکه منطق تحلیل آسیب ببیند.

برای جلوگیری از لغزش مدل در استقرار، باید محدودیت‌های صریحی وضع کرد: برای جلوگیری از ادغام مراحل، دستور «هر مرحله را کامل کن و سپس به مرحله بعد برو» را اضافه کنید. برای بهبود کیفیت فرضیه‌ها، تأکید کنید که فرضیه‌ها نباید تغییراتی جزئی روی یک توضیح واحد باشند، بلکه باید از نظر ماهوی متفاوت باشند. در نهایت، اگر ورودی شما فاقد داده‌های عینی است، از این روش استفاده نکنید زیرا مدل شروع به ساختن «داده‌های مشاهده‌شده» از حافظه خود می‌کند که منجر به توهم می‌شود.

برای کسانی که پیش از پیاده‌سازی API در حال آزمایش هستند، ابزار Prompt Scaffold برای مدیریت فیلدهای نقش، وظیفه و زمینه بسیار مفید است. در هر مسئله‌ای که پاسخ آن بلافاصله قابل استنتاج نباشد، محدودیت ساختاری همواره بر آزادی عمل غلبه می‌کند.

گام بعدی شما

  • پرامپت‌های فعلی خود را که حاوی «think step by step» هستند با ساختار چهارگانه (مشاهده $
    ightarrow$ فرضیه $
    ightarrow$ تست $
    ightarrow$ نتیجه) جایگزین کنید.
  • برای مدل‌های کوچکتر، به‌جای استفاده از Markdown، از تگ‌های XML برای تفکیک مراحل استفاده کنید تا از ادغام گام‌ها جلوگیری شود.
  • اگر از API استفاده می‌کنید، خروجی‌ها را از طریق Pydantic سخت‌گیرانه تعریف کنید تا تحلیل‌های مدل قابل بازبینی و Audit باشد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این روش با ایجاد ردپای قابل بازبینی (Audit Trail)، اعتماد متخصصان حوزه‌های حساس مانند پزشکی و زنجیره تأمین را به استدلال‌های AI جلب می‌کند. تخصص در طراحی این داربست‌ها، جایگزین مهندسی پرامپت‌های ساده شده و استانداردی برای کاهش نرخ توهم در محیط‌های تجاری می‌شود.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که روی عامل‌های هوش مصنوعی (AI Agents) برای تحلیل داده‌های تجاری کار می‌کنند، می‌توانند با پیاده‌سازی این ساختار در Pydantic، دقت خروجی‌های مدل‌های ارزان‌قیمت را به سطح مدل‌های پیشرفته نزدیک کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی آزادی عمل با محدودیت‌های ساختاری در پرامپت‌نویسی، نشان‌دهنده‌ی گذار از «تلاش برای راهنمایی مدل» به «مهندسی مسیر تفکر» است. این رویکرد ثابت می‌کند که مشکل بسیاری از توهمات، نه در دانش مدل، بلکه در نبودِ یک پروتکل بازبینی داخلی است. در واقع، ما در حال تبدیل کردن مدل‌های زبانی از «ماشین‌های پیش‌بینی توکن» به «سیستم‌های اجرای دستورالعمل منطقی» هستیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.