بیش از ۷۳.۴۳٪ از خطاهای بنیادین در ادعاهای مقالات پژوهشی اکنون توسط یک سامانه داوری جدید از شرکت Sakana AI قابل شناسایی است. این دستاورد که در مقالهای با عنوان «فراتر از تقلید» (Beyond Imitation) در TMLR منتشر شده، شیوه استفاده از هوش مصنوعی برای بررسی آثار علمی را بهطور بنیادین تغییر میدهد. این سامانه بهجای پیروی از استانداردهای رایج صنعت که بر آموزش AI برای تقلید از داوران انسانی متمرکز است، بر روی وظیفه دشوارتر یعنی «تشخیص خطا» تمرکز کرده است.
این تحول در حالی رخ میدهد که جامعه علمی همچنان با چالش قابلیت اطمینان مدلهای زبانی بزرگ (LLM) در حوزههای فنی دستوپنجه نرم میکند. همانطور که در تحلیل قبلی ما دربارهی توهمات مدلهای کوچک اشاره کردیم، مدلهایی مانند SmolLM2-135M در مواجهه با مسائل دشوار در بنچمارکهای خاص، ۹۸.۳٪ از سوالات غیرقابلپاسخ را دچار توهم شدند. پژوهش Sakana AI بر روی یک شکاف مداوم تأکید میکند: هوش مصنوعی اغلب «ظاهر و لحن» یک داوری را به «راستیآزمایی دقیق» ادعاها ترجیح میدهد. این تمایل به اولویت دادن به ظاهر بر حقیقت، با یافتههای اخیر همسو است که نشان میدهد برخی مدلها تنها در صورت درخواست صریح صداقت، نقصهای فنی را افشا میکنند.
بستر سامانه
طبق اعلام محققان، اکثر داوران AI بر اساس میزان شباهتشان به داوران انسانی ارزیابی میشوند. Sakana AI استدلال میکند که این رویکرد ناکافی است. آنها بهجای تقلید، این پرسش را مطرح کردند که آیا یک AI میتواند یک «اشتباه تعمدی» (Planted Mistake) را بیابد یا خیر. برای دستیابی به این هدف، آنها سامانهای توسعه دادند که میتواند تا ۱۰ صفحه از متن اصلی را با استفاده از مدلهای API آماده (Off-the-shelf)، بدون نیاز به واحد پردازش گرافیکی (GPU) اختصاصی یا تنظیم دقیق (Fine-tuning) پردازش کند.
برای حل این مسئله، تیم پژوهشی سامانه داوری چندلایه یا MLR (Multi-Layered Review) را معرفی کرد. برخلاف داوران تک-پرامپتی، MLR از یک جریان کاری عاملمحور (Agentic) تخصصی با استفاده از مدلهای آماده بهره میبرد:
- عامل پیوست (Appendix Agent): با استفاده از Claude Haiku 3.5 جزئیات پیادهسازی و آزمایشها را از بخش پیوست استخراج و خلاصه میکند.
- عامل مرور ادبیات (Literature Review Agent): یک عامل اختیاری بر پایه Claude Sonnet 4 که با استفاده از جستوجوی وب، جایگاه مقاله را در میان کارهای پیشین و پیشینه پژوهشی میسنجد.
- عامل داور (Review Agent): یک عامل Claude Sonnet 4 که زنجیرهای سه-مرحلهای از پرامپتها را اجرا میکند که از «رویکرد سه-مرحلهای کشاو» (Keshav’s Three-Pass Approach) الهام گرفته شده است. در مرحله اول (Pass 1)، یک طرح کلی در سطح بالا مینویسد؛ در مرحله دوم (Pass 2)، متن را با جزئیات میخواند تا نقاط ضعف، مفروضات و شکافها را علامتگذاری کند؛ و در مرحله سوم (Pass 3)، تمام خروجیهای عوامل را در قالب نقاط قوت، نقاط ضعف، پرسشها، توصیه نهایی، امتیاز و یک لیست اقدامات (To-Do list) ادغام میکند.

محک تناقضات
بر اساس مستندات این پژوهش، برای آزمایش سامانه، «محک تناقضات» (Contradiction Benchmark) طراحی شد. این فرآیند شامل چندین مرحله برای تضمین سختگیرانه بودن تست بود:
- جمعآوری داده: تیم پژوهشی ۲۵۷ مقاله با مجوز CC را از کنفرانسهای ACL، AISTATS، CVPR و ICML ۲۰۲۵ و همچنین NeurIPS ۲۰۲۴ جمعآوری کرد.
- گراف دانش: مدل Gemini 2.5 Pro یک گراف دانش (Knowledge Graph) از ادعاها، شواهد و روشهای هر مقاله ساخت.
- تزریق خطا: مدل GPT-4.1 هر گره را بر اساس فاصله، به یک تناقض بازنویسی کرد که در نهایت منجر به ایجاد ۱,۱۶۴ نقطه داده شد.
- سنجش شدت: شدت خطا بر اساس «فاصله گره» از ادعای اصلی اندازهگیری شد. خطاهای «فاصله صفر» مستقیماً ادعای بنیادین مقاله را هدف میگرفتند، در حالی که فواصل بیشتر به جزئیات فرعی اشاره داشتند.
- اعتبارسنجی: یک داور o3 خروجیها را ۱۰ بار امتیازدهی کرد و به دقت ۹۹.۹٪ در مقالات سالم و حساسیت ۸۶.۸٪ در شناسایی خطاهای تأیید شده بهصورت دستی رسید.

جزئیات عملکرد و تشخیص
عملکرد MLR بهطور قابلتوجهی از مدلهای پایه (Baselines) پیشی گرفت. در حالی که بهترین مدل پایه یعنی AgentReview تنها ۱۴.۸۱٪ از خطاهای فاصله-صفر را یافت، MLR با چهار بار داوری به نرخ ۷۳.۴۳٪ رسید. حتی یک بار اجرای MLR توانست ۶۰.۷۹٪ از این خطاهای بحرانی را شناسایی کند. بهطور کلی، MLR توانست ۴۰.۹۵٪ از تمام تناقضات موجود در کل بنچمارک را شکار کند. با این حال، پایداری این نتایج در محیطهای مختلف همچنان یک چالش است، چرا که برخی محکهای عاملهای هوش مصنوعی ناپایداری ۸ تا ۲۰ درصدی را نشان دادهاند.
- بهرهوری: این سامانه بسیار بهینه است و هزینه هر داوری حدود ۰.۴۷ دلار است و از ۱۸۹,۰۶۲ توکن ورودی استفاده میکند. این مقدار تقریباً نصف توکنهای مورد نیاز AI Reviewer (۴۰۳,۶۵۴ توکن) است.
- بهینهسازی هزینه: نسخهای با تک-پرامپت توانست هزینهها را دو-سوم کاهش دهد، هرچند دقت تشخیص حدود ۳.۵ امتیاز افت کرد.
- تست دنیای واقعی: در مجموعه داده WithdrarXiv-Check که شامل ۲۱۱ مقاله پسگرفته شده (Retracted) بود، دقت MLR برای تطابقهای دقیق به ۱۶.۱۱٪ و برای تطابقهای «مشابه» به ۲۶.۰۷٪ کاهش یافت.

با این حال، این سامانه همچنان در برابر پیچیدگیهای دنیای واقعی آسیبپذیر است. محققان اشاره کردند که تمام داوران AI آزمایش شده، از جمله MLR، در برابر تزریق پرامپت (Prompt Injection) پنهان واکنش نشان میدهند و آسیبپذیر هستند.
برای جامعه فنی، این نتیجه ثابت میکند که طراحی سامانه — بهویژه جریانهای کاری عاملمحور چندمرحلهای — برای وظایف اعتبارسنجی، بسیار مؤثرتر از افزایش صرفِ اندازه مدل است. مطالعه حذف (Ablation Study) نشان داد که صرفاً جایگزینی GPT-4.1 با Claude Sonnet 4 در یک داور ساده، تشخیص خطاهای فاصله-صفر را از ۱۴.۵۶٪ به ۳۵.۴۰٪ رساند، اما معماری MLR این عدد را ۲۵ واحد دیگر افزایش داد. این رویکرد ساختاری برای جلوگیری از رفتارهایی مانند استراتژیهای «بازی با پاداش» برای پیروزی در آزمونها و تقلب در بنچمارکها ضروری است.
اگرچه همبستگی امتیازات پیشبینیشده MLR برای مقالات ارسالی ICLR ۲۰۲۵ با داوران انسانی ۰.۵۸۶ بود (در مقابل ۰.۷۴۲ برای مرجع انسان-انسان)، اما تمرکز این دو متفاوت است. در کنفرانس ICML ۲۰۲۵، AI Reviewer حتی با امتیاز ۰.۴۳۹ در مقابل ۰.۴۲۹ انسانها را پشت سر گذاشت. با این حال، انسانها بر نوآوری و شفافیت تمرکز میکنند، در حالی که MLR بر اعتبار و دقت آزمایشها متمرکز است. بنابراین، این ابزار بیشتر یک «حسابرس مکمل» است تا جایگزینی برای انسان.
پژوهشگران و توسعهدهندگان اکنون باید نظارهگر باشند که آیا این رویکرد چندلایه میتواند برای شناسایی نقصهای ظریفتر و غیرتناقضی در داوری همتا (Peer Review) مقیاسپذیر شود یا خیر.
گام بعدی شما
- اگر پژوهشگر هستید، از مدلهای چندعاملی برای بررسی تناقضات داخلی پیشنویسهای خود پیش از ارسال به کنفرانس استفاده کنید.
- بررسی کنید که آیا جریان کاری مقاله شما دارای «نقاط شکست» منطقی است که یک عامل استخراجکننده گراف دانش بتواند آنها را بیابد.
- برای کاهش هزینههای استنتاج، مدلهای کوچکتر را برای استخراج اولیه (مانند Haiku) و مدلهای قدرتمند را برای تحلیل نهایی به کار ببرید.
اما چالش اصلی، شناسایی خطاهای غیرتناقضی و ظریفتر است — در گزارشهای آینده بررسی خواهیم کرد که آیا مدلهای استدلالی جدید میتوانند این شکاف را پر کنند یا خیر.




گفتگو