اگر امروز یک عامل هوش مصنوعی میسازید که در محاسبات منطقی خطا میکند، احتمالاً با یک جعبه سیاه طرف هستید که نمیدانید کجا اشتباه کرده است. برای حذف توهمات، شما به یک ردپای حسابرسی (Audit Trail) نیاز دارید، نه فقط یک پرامپت بهتر. در واقع، ساختن یک عامل استدلالی که دچار توهم نشود، مستلزم وجود یک مسیر قابل مشاهده برای بررسی است.
در ۱۰ سپتامبر ۲۰۲۶، یک راهنمای فنی منتشر شد که با جزئیات توضیح میداد توسعهدهندگان چگونه میتوانند با استفاده از Oxlo.ai مدلها را مجبور کنند تا پیش از متعهد شدن به یک پاسخ نهایی، منطق داخلی خود را آشکار کنند. اکثر کاربران با مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — بهصورت یک جعبه سیاه تعامل میکنند و پاسخی را دریافت میکنند بدون اینکه بدانند مدل چگونه به آن نتیجه رسیده است. همین نبودِ شفافیت است که عیبیابی خطاهای ساده منطقی را تقریباً غیرممکن میکند.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت و شفافیت مدلهای زاینده اشاره کردیم، جداسازی لایهی تفکر از لایهی پاسخ، کلید رسیدن به سیستمهای قابل اعتماد است. با پیادهسازی معماری زنجیره تفکر (Chain-of-Thought یا CoT) — شبیه وقتی شاگرد ریاضی پای تخته بلند بلند فکر میکند تا به جواب برسد — توسعهدهندگان میتوانند استدلال هوش مصنوعی را بهعنوان یک جریان داده مجزا از خروجی نهایی مدیریت کنند. این رویکرد در کاربردهای تخصصی، مانند بهبود دقت بازرسی امنیتی کدهای پایتون، نقش تعیینکنندهای در کاهش خطاهای مثبت کاذب داشته است.
سازوکار زنجیره تفکر
پرامپتینگ زنجیره تفکر با مجبور کردن مدل به آشکار کردن استدلالهایش پیش از تثبیت پاسخ نهایی عمل میکند. این کار مانع از آن میشود که مدل عجولانه به یک نتیجهگیری نادرست برسد. در این پیادهسازی خاص، استدلال بهعنوان یک ردپای صریح ظاهر میشود که میتوان آن را بهطور جداگانه از پاسخ نهایی ثبت و حسابرسی کرد.
طبق گزارش منتشرشده در dev.to، مکانیزم اصلی این روش بر پایه یک پرامپت سیستمی سختگیرانه است که مدل را مجبور میکند از تگهای XML استفاده کند. مدل موظف است تمام مراحل محاسباتی و منطقی را داخل تگهای <thinking> و نتیجه نهایی را در تگ <answer> قرار دهد. این ساختار باعث میشود استخراج دادهها توسط یک بکاند پایتونی از طریق Regular Expressions بسیار ساده و بدیهی شود.
جزئیات پیادهسازی فنی
برای استقرار این سیستم، راهنمای مذکور ترکیب ابزارهای زیر را پیشنهاد میدهد:
- زیرساخت: پایتون ۳.۱۰ به بالا و SDK شرکت OpenAI (
pip install openai) که به آدرس پایه Oxlo.ai (https://api.oxlo.ai/v1) متصل شده است. - دسترسی API: کلید دسترسی از پورتال
https://portal.oxlo.ai؛ این پلتفرم یک سطح رایگان فراهم کرده است که به کاربران اجازه میدهد بدون نیاز به وارد کردن کارت اعتباری، آموزشها را اجرا کنند. - انتخاب مدل: برای استدلالهای استاندارد از deepseek-v3.2 استفاده شده است، اما در این راهنما اشاره شده که مدل kimi-k2.6 برای مسائل استدلالی سختتر مناسبتر است و مدل qwen-3-32b در محیطهای چندزبانه عملکرد برتری دارد. در واقع مدل kimi-k2.6 با قابلیت استدلال عمیق خود، میتواند ریشهی خطاهای فنی را بهصورت خودکار تشخیص دهد.
- منطق تجزیه: تابعی به نام
parse_cotبا استفاده ازre.DOTALLمحتوای بین تگها را استخراج میکند. اگر تگها در خروجی غایب باشند، این تابع برای جلوگیری از کرش کردن عامل، کل خروجی را بهعنوان استدلال در نظر میگیرد. - مدیریت هزینه: بهدلیل قیمتگذاری ثابت بهازای هر درخواست در Oxlo.ai، توسعهدهندگان میتوانند نمونههای آموزشی (Few-shot) گستردهای را در پرامپت سیستمی بگنجانند بدون اینکه نگران جهشهای پیشبینینشده در هزینههای توکنمحور باشند.
آزمون منطق و نتایج
این عامل روی تلههای منطقی کلاسیک تست شد تا تأیید شود که مدل هم فرمت را رعایت میکند و هم مسئله را درست حل میکند. در یک مورد، مسئلهای درباره کشاورزی با ۱۰ گاو مطرح شد که در آن گفته شد «همه بهجز ۳ تا مردند»؛ مدل توانست بهدرستی تشخیص دهد که ۳ گاو باقی ماندهاند.
در مثالی دیگر، ۱۰۰ ماشین که ۱۰۰ قطعه تولید میکنند بررسی شد. مدل deepseek-v3.2 بهدرستی استدلال کرد که چون ۵ ماشین در ۵ دقیقه ۵ قطعه میسازند، هر ماشین ۵ دقیقه زمان میبرد تا یک قطعه بسازد. چون ماشینها بهصورت موازی کار میکنند، ۱۰۰ ماشین هم همچنان فقط ۵ دقیقه زمان میبرند. بدون ردپای CoT، مدلها معمولاً اعداد را در هم ضرب کرده و به پاسخ غلط ۱۰۰ دقیقه میرسند.
این تغییر رویکرد، نقش توسعهدهنده را از یک مهندس پرامپت به یک حسابرس تبدیل میکند. شما دیگر حدس نمیزنید چرا مدل شکست خورد، بلکه میتوانید دقیقاً نقطهای را در بلوک <thinking> که در آن منطق مدل منحرف شده است، شناسایی کنید. این موضوع برای محیطهای عملیاتی که پاسخ غلط در آنها میتواند پیامدهای مالی یا عملیاتی داشته باشد، حیاتی است.
برای انتقال به محیط تولید، راهنما پیشنهاد میکند که اعتبارسنجی Pydantic را به تجزیهکننده (Parser) اضافه کنید و هر ردپای استدلال را در یک پایگاهداده ذخیره کنید. این کار یک رکورد دائمی از «فرآیند تفکر» هوش مصنوعی برای تکتک تعاملات کاربران ایجاد میکند.
برای بهینهسازی بیشتر تجربه کاربری، توسعهدهندگان میتوانند قابلیت stream=True را در فراخوانی API (client.chat.completions.create) پیاده کنند. این کار اجازه میدهد فرآیند استدلال بهصورت لحظهای به رابط کاربری ارسال شود و کاربر نهایی پیش از ظاهر شدن پاسخ نهایی، حسی از پیشرفت مدل داشته باشد.
گام بعدی شما
- اگر از مدلهای استدلالی استفاده میکنید، خروجیها را با تگهای XML تفکیک کنید تا نقاط شکست منطقی را بیابید.
- برای کاهش هزینههای استنتاج در پرامپتهای طولانی، مدلهای قیمتگذاری ثابت مانند Oxlo.ai را بررسی کنید.
- پیادهسازی
stream=Trueرا برای بهبود تجربه کاربری در هنگام استدلالهای طولانی امتحان کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو