پرش به محتوای اصلی
پرش به محتوای مقاله

تفسیرپذیری مدل‌های جعبه‌سیاه با مکانیزم پرامپت‌نویسی متضاد

·۶ مرداد ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
راهنما
نمودار روش‌های تفسیرپذیری مدل‌های زبانی بزرگ: دسته‌بندی و مقایسه تکنیک‌های مختلف
نمودار روش‌های تفسیرپذیری مدل‌های زبانی بزرگ: دسته‌بندی و مقایسه تکنیک‌های مختلف
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک چارچوب عملیاتی برای رسیدن به تفسیرپذیری (Interpretability) بدون نیاز به دسترسی به وزن‌ها (Weights) یا فعال‌سازها، تنها از طریق API و مقایسه پاسخ‌های متضاد.

تصور کنید می‌خواهید بفهمید چرا یک مدل زبانی در یک مسئله ریاضی خاص اشتباه می‌کند، اما هیچ دسترسی به کدهای داخلی یا وزن‌های آن ندارید. برای مهندسان نرم‌افزار، این وضعیت شبیه به تلاش برای عیب‌یابی یک موتور است در حالی که کاپوت ماشین جوش داده شده و بسته است. auditing یا حسابرسی منطق داخلی یک مدل معمولاً نیازمند دسترسی به وزن‌ها و فعال‌سازها (activations) است؛ امتیازاتی که تنها در اختیار آزمایشگاه‌های سازنده مدل‌هاست.

به نقل از راهنمای منتشرشده در ۲۸ جولای ۲۰۲۶ در وب‌سایت dev.to، یک اسکنر جدید برای تفسیرپذیری (Interpretability) مدل‌های «جعبه‌سیاه» معرفی شده است که این مانع را دور می‌زند. این ابزار هر مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — را به عنوان هدف قرار می‌دهد و از طریق پرامپت‌نویسی متضاد (Contrastive Prompting) فرضیات تخصیص را استخراج می‌کند.

این رویکرد در زمانی عرضه می‌شود که توسعه‌دهندگان از آزمایش‌های تک‌پرامپتی به سمت ساخت عامل‌های (Agent) پیچیده در محیط تولید حرکت می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی Routara و نحوه یکپارچه‌سازی چندین ارائه‌دهنده AI از طریق یک نقطه انتهایی (endpoint) واحد اشاره کردیم، تمرکز اکنون از «اتصال» به «تشخیص» تغییر یافته است. این گردش‌کار بر لایه تشخیص تمرکز دارد: درک اینکه چرا یک مدل کلمات خاصی را نسبت به کلمات دیگر انتخاب می‌کند. برای یک مهندس، این فرآیند شبیه به انجام یک تست استرس پزشکی روی مدل است تا نقاط شکست و نحوه بازیابی آن شناسایی شود.

سازوکار متضاد

این اسکنر با تولید «ضد-واقعیت‌ها» (Counterfactuals) عمل می‌کند تا تشخیص دهد کدام ویژگی‌های ورودی باعث تولید یک پاسخ خاص شده‌اند. طبق مستندات، فرآیند با ثبت یک پاسخ پایه (baseline) از مدل هدف، مانند Llama 3.3 70B میزبانی شده در Oxlo.ai، آغاز می‌شود. برای مثال، یک پرامپت پایه معمولاً شامل یک محدودیت است؛ مانند اینکه از مدل خواسته شود دلیل آبی بودن آسمان را بدون استفاده از کلمه «پراکندگی» (scattering) توضیح دهد.

پس از تعیین پاسخ پایه، سیستم تغییراتی (Perturbations) ایجاد می‌کند که نسخه‌های اصلاح‌شده‌ای از پرامپت بر اساس تغییرات منطقی خاص هستند. این کار توسط تابع perturb_prompt مدیریت می‌شود که گونه‌های مختلفی از پرامپت را ایجاد می‌کند، از جمله:

  • سلب (Negation): تغییر یک محدودیت از «بدون» به «با».
  • جایگزینی موجودیت: تعویض اصطلاحات، مثلاً جایگزینی «آسمان» با «اقیانوس» و «آبی» با «قرمز».
  • وارونگی دستور: الزام مستقیم مدل به استفاده از کلمه‌ای که پیش‌تر ممنوع بود، مانند اجباری کردن استفاده از کلمه «پراکندگی».

به دلیل مدل قیمت‌گذاری ثابت در هر درخواست (flat per-request pricing) در Oxlo.ai، مهندسان می‌توانند ده‌ها مورد از این تغییرات را بدون هزینه‌های سرسام‌آور توکن‌محور اجرا کنند. این مدل اقتصادی که پیش‌تر در تحلیل ما درباره حذف هزینه‌های پنجره زمینه در Oxlo.ai بررسی شد، اجازه می‌دهد «شبکه تغییرات» (perturbation grid) متراکم‌تر شود و نقاط داده بیشتری برای تحلیل تخصیص به دست آید.

خط لوله تحلیل چندمدلی

پس از جمع‌آوری پاسخ‌های تغییریافته، گردش‌کار از یک استراتژی استدلالی لایه‌بندی شده با استفاده از مدل‌های تخصصی مختلف در پلتفرم Oxlo.ai استفاده می‌کند:

  • تحلیل تخصیص: یک مدل استدلالی، به طور خاص Kimi K2.6، نقش تحلیل‌گر مکانیکی را ایفا می‌کند. این مدل با استفاده از یک سیستم‌پرامپت تخصصی، بررسی می‌کند که تغییرات پرامپت ورودی چگونه بر خروجی‌ها اثر گذاشته است. این مدل توکن‌های تغییریافته را شناسایی می‌کند، دلتای خروجی (تفاضل) را ثبت می‌نماید و یک فرضیه تخصیص (attribution hypothesis) شکل می‌دهد. این فرآیند در واقع شبیه‌سازی «وصله‌زنی تخصیص» (attribution patching) در سطح API است.
  • ردپاهای استدلالی: برای تخمین فعال‌سازی ویژگی‌های داخلی، مدل هدف مجبور می‌شود یک زنجیره تفکر (Chain-of-Thought) — شبیه به وقتی شاگرد ریاضی بلند بلند فکر می‌کند تا جواب دهد — را درون تگ‌های <thinking> تولید کند. در این گردش‌کار، مدل DeepSeek V3.2 (که برای آزمایش‌های اولیه در سطح رایگان در دسترس است) این مرحله سنگین استدلالی را بر عهده دارد و منطق گام‌به‌گام خود را پیش از ارائه پاسخ نهایی شرح می‌دهد.
  • سنتز گزارش: در مرحله نهایی، مجدداً مدل Llama 3.3 70B تمام این مصنوعات را در قالب یک سند JSON ساختاریافته تدوین می‌کند. این گزارش شامل خلاصه‌ای از پاسخ پایه، یافته‌های متضاد، فرضیات تخصیص، یک بررسی بولی (boolean) برای ردپای استدلالی و یک پیشنهاد برای پیگیری‌های بعدی است.

الزامات فنی و راه‌اندازی

برای پیاده‌سازی این اسکنر، مهندسان به محیطی نیاز دارند که Python 3.10 یا نسخه‌های جدیدتر را اجرا کند. وابستگی‌های اصلی شامل OpenAI SDK (که از طریق pip install openai نصب می‌شود) و یک کلید API معتبر از پورتال Oxlo.ai است.

کل این گردش‌کار در اسکریپتی به نام interpretability_scanner.py کدگذاری شده است. این اسکریپت از URL پایه سازگار با OpenAI یعنی https://api.oxlo.ai/v1 استفاده می‌کند تا درخواست‌ها را بین خانواده‌های مختلف مدل (Llama، Kimi و DeepSeek) مسیریابی کند.

کاربرد عملی: استدلال عددی

در یک تست واقعی روی مدل Qwen 3 32B به عنوان هدف برای یک تکلیف استدلالی چندزبانه، اسکنر یک مسئله محاسبه فاصله را تحلیل کرد. پرامپت پایه می‌پرسید: «اگر قطاری ۶۰ کیلومتر را در ۳۰ دقیقه طی کند، در ۲ ساعت چقدر راه می‌رود؟»

با ایجاد یک تغییر (perturbation) که اعداد را به «۱۲۰ کیلومتر در ۶۰ دقیقه» و «۳ ساعت» تغییر می‌داد، تحلیل‌گر Kimi K2.6 توانست دو خروجی را با هم مقایسه کند. تحلیل‌گر تشخیص داد که مدل به جای توجه به کلمات ظاهری پرامپت، بر روی «نسبت عددی» و «تبدیل واحد زمان» تمرکز کرده است.

این روش به کاربران اجازه می‌دهد بدون دیدن ماتریس وزن‌ها، دقیقاً بفهمند مدل چگونه مقیاس‌پذیری و منطق ریاضی را مدیریت می‌کند. خروجی JSON به‌طور صریح توکن‌های تغییریافته (مثلاً «60 km» به «120 km») را لیست کرده و تأیید می‌کند که فاصله نهایی به‌صورت متناسب تغییر یافته است.

پیامدهای مهندسی

این تغییر رویکرد، تفسیرپذیری را از یک پژوهش تئوریک به یک ابزار عیب‌یابی عملی برای توسعه‌دهندگان تبدیل می‌کند. با اتوماسیون تولید گراف‌های مترادف و ادغام logprobs، مهندسان می‌توانند پیمایش‌های تخصیص بدون نظارت را روی کل مجموعه‌داده‌ها اجرا کنند. این قابلیتات در کنار رویکردهای اتوماسیون طبقه‌بندی اسناد در Oxlo.ai، مسیر را برای ساخت خط لوله‌های تحلیل داده بدون نیاز به زیرساخت‌های محلی پیچیده هموار می‌کند.

برای صنعت، این بدان معناست که «جعبه‌سیاه» مدل‌های تجاری در حال تبدیل شدن به نیمه‌شفاف است. توسعه‌دهندگان دیگر مجبور نیستند حدس بزنند چرا مدل دچار توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد — شده است یا چرا یک محدودیت را نادیده گرفته است؛ بلکه می‌توانند آن را از طریق شواهد متضاد اثبات کنند.

برای مقیاس‌پذیری بیشتر، باید در صورتی که ارائه‌دهنده پشتیبانی می‌کند، logprobs را برای سنجش جابجایی احتمال در سطح توکن‌ها ادغام کنید. همچنین می‌توانید مولد تغییرات را به گونه‌ای اتوماتیک کنید که هزاران نسخه — و گسترش شبکه از ۱۰ مورد به ۲۰ یا ۳۰ گونه — را روی یک مجموعه‌داده تولید اجرا کند تا شکست‌های سیستمی شناسایی شوند.

گام بعدی شما

  • اگر از مدل‌های بسته‌-سورس (closed-source) استفاده می‌کنید، یک شبکه کوچک از پرامپت‌های متضاد (Symmetry tests) برای حساس‌ترین توابع مدل خود طراحی کنید.
  • برای افزایش دقت، در صورتی که ارائه‌دهنده شما پشتیبانی می‌کند، مقدار logprobs را برای سنجش جابجایی احتمال در سطح توکن‌ها ادغام کنید.
  • مولد تغییرات (Perturbation Generator) را برای اجرای هزاران نسخه روی داده‌های واقعی تولید بسط دهید تا شکست‌های سیستمی مدل شناسایی شوند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی با تکیه بر اعتبار تحلیل‌های متقاطع (Cross-Model Analysis)، شفافیت مدل‌های تجاری را افزایش می‌دهد. در نتیجه، ریسک استقرار عامل‌های هوش مصنوعی در محیط‌های حساس کاهش می‌یابد زیرا دلیل خطاها قابل اثبات می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به پلتفرم Oxlo.ai برای توسعه‌دهندگان ایرانی دشوار است، اما منطق این اسکنر را می‌توان روی هر مدل در دسترس (مانند مدل‌های Open Source روی GPU شخصی) پیاده کرد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی دسترسی به وزن‌ها با تحلیل رفتاری، قدرت را از آزمایشگاه‌های بزرگ مدل‌های بنیادی به دست توسعه‌دهندگانی می‌برد که مدل‌ها را در محیط واقعی به کار می‌گیرند. این روش در واقع «مهندسی معکوس» رفتار مدل است و نشان می‌دهد که برای درک منطق AI، لزوماً نیاز به ریاضیات پیچیده لایه‌های عصبی نیست، بلکه تحلیل الگوهای ورودی-خروجی کافی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.