پرش به محتوای اصلی
پرش به محتوای مقاله

«بازتولید نتایج پژوهشی»؛ قابلیت جدید عامل‌های هوشمند در سیستم Paper2Agent

·۲۶ شهریور ۱۴۰۵۵ دقیقه مطالعه
چارچوب Paper2Agent برای تبدیل مقالات پژوهشی به عامل‌های هوش مصنوعی
چارچوب Paper2Agent برای تبدیل مقالات پژوهشی به عامل‌های هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل مقالات ایستا به سرورهای MCP؛ این اولین بار است که یک سیستم به طور خودکار کد یک مقاله را به ابزارهای اجرایی تبدیل می‌کند که توسط عامل‌های هوش مصنوعی قابل فراخوانی و استدلال هستند.

تصور کنید به جای صرف روزها وقت برای نصب کتابخانه‌های قدیمی و رفع خطاهای کد یک مقاله، بتوانید مستقیماً از خودِ مقاله بپرسید: «این تحلیل را روی داده‌های من اجرا کن». این رویای بازتولید سریع در علم، اکنون با سیستمی به نام Paper2Agent در دسترس است.

به نقل از نشریه Nature، تیمی به رهبری جیاچنگ میاو و جیمز زو در ۱۶ سپتامبر ۲۰۲۶ سیستمی را معرفی کردند که «قفل PDF» را می‌شکند. این سامانه مقالات ایستا و کدهای همراه آن‌ها را به یک سرور پروتکل زمینهٔ مدل (Model Context Protocol یا MCP) تبدیل می‌کند تا مقالات به عامل‌هایی اجرایی تبدیل شوند.

بحران بازتولید در پژوهش‌های محاسباتی سال‌هاست که ادامه دارد؛ جایی که خواننده باید به صورت دستی کدها را کلون کرده و محیط‌های پیچیده را دیباگ کند. این اصطکاک باعث می‌شود بسیاری از متدهای علمی مفید، درون فایل‌های PDF محبوس بمانند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی زیرساخت‌های محاسباتی و هزینه‌های مراکز داده (مانند پوشش ما روی TVA) اشاره کردیم، محدودیت‌ها همیشه سخت‌افزاری نبوده‌اند، بلکه اصطکاک‌های نرم‌افزاری مانع از به‌کارگیری متدهای علمی در دنیای واقعی می‌شدند. Paper2Agent دقیقاً همین اصطکاک در سطح نرم‌افزار را هدف قرار داده است.

سازوکار سیستم

هر عامل (Agent) سازگار با MCP، مانند Claude Code، می‌تواند متدهای یک مقاله را از طریق زبان طبیعی اجرا کند. نویسندگان این سیستم را یک «نویسنده مسئول مجازی» می‌نامند. این ابزار با مجوز MIT منتشر شده و به عنوان یک مهارت (Skill) برای Codex یا Claude Code قابل نصب است. با این حال، چالش‌های مربوط به دقت عامل‌های کدنویس همچنان پابرجاست؛ چنان‌که برخی پژوهش‌ها نشان داده‌اند این عامل‌ها در صورت عدم دسترسی به داده‌ها، ممکن است به جعل اطلاعات روی بیاورند.

طبق گزارش marktechpost.com، این سیستم توسط یک ارکستراتور مرکزی و ۶ زیر-عامل تخصصی مدیریت می‌شود. این خط لوله (Pipeline) بر روی SDK عامل Claude Code اجرا می‌شود و مراحل زیر را طی می‌کند:

  • مکان‌یابی (Locate): یافتن و دانلود کد منبع مربوط به مقاله.
  • مدیریت محیط (Environment Management): ساخت یک محیط مجازی ایزوله برای جلوگیری از تداخلات نرم‌افزاری.
  • اسکن آموزش‌ها (Tutorial Scanning): فهرست‌بندی و ایندکس کردن آموزش‌های (Tutorials) قابل استفاده در کد.
  • اجرای آموزش (Tutorial Execution): اجرای کامل آموزش‌ها از ابتدا تا انتها برای ثبت خروجی‌های مرجع.
  • استخراج ابزار (Tool Extraction): تبدیل آموزش‌های اجرا شده به ابزارهای پارامتریک MCP.
  • تأیید تست (Test Verification): اعتبارسنجی ابزارها پیش از استقرار نهایی در سرور.

اعتبارسنجی فنی و عملکرد

برای تضمین دقت، یک ابزار تنها زمانی تأیید می‌شود که فایل‌های مورد انتظار ایجاد شوند و نتایج عددی با تلرانس ۳٪ مطابقت داشته باشند. تصاویر نیز با استفاده از هش‌های ادراکی (Perceptual Hashes) و فاصله همینگ (Hamming distance) زیر ۲۰ تأیید می‌شوند. در این فرآیند، تأییدکننده تا ۶ تلاش برای هر تابع فرصت دارد؛ ابزارهایی که پس از ۶ بار تلاش همچنان شکست بخورند، از سرور نهایی حذف می‌شوند. این سیستم از مدل Claude Sonnet 4 برای عملیات خود استفاده می‌کند و سه مؤلفه اصلی را ارائه می‌دهد:

  • ابزارهای MCP: توابع اجرایی که متدهای مقاله را در بر می‌گیرند.
  • منابع MCP: دسترسی مستقیم به دست‌نوشته‌ها، لینک‌های کد، مجموعه‌داده‌ها و تصاویر.
  • پرامپت‌های MCP: گردش‌کارهای چندمرحله‌ای رمزگذاری‌شده (مانند ترتیب صحیح پیش‌پردازش در Scanpy).

در یک آزمون رودررو با استفاده از عامل AlphaGenome، سامانه Paper2Agent در ۱۵ پرس‌وجوی جدید به صحت ۱۰۰٪ رسید، در حالی که Biomni تنها ۵۶٪ و ترکیب استاندارد Claude + Repository حدود ۷۸.۷٪ موفق بودند. در مورد ۱۵ پرس‌وجوی مشتق شده از آموزش‌ها، Paper2Agent امتیاز ۹۸.۷٪ را کسب کرد، در حالی که Biomni تنها ۳۷.۳٪ بود. همچنین برای ۳۰ پرس‌وجوی باز (Open-ended)، این سیستم به امتیاز ۸۲.۷٪ رسید. این نتایج حاصل ۵ بار اجرا و ارزیابی توسط دو متخصص انسانی با توافق ۹۶.۷٪ بین ارزیابان است. هزینه ساخت این عامل ۴۵ دقیقه زمان و ۱۴ دلار هزینه داشت.

مقیاس‌پذیری در رشته‌های مختلف

پژوهشگران این سیستم را روی ۱۰۰ مقاله زیست‌شناسی محاسباتی از bioRxiv آزمایش کردند و ۷۴ مورد را با موفقیت «عامل‌محور» کردند. از ۵۹۹ ابزار پیشنهادی، ۵۹۳ مورد از فیلتر اعتبارسنجی عبور کردند. در آزمونی با ۳۰۰ پرسش، Paper2Agent با صحت ۹۱.۲٪، مدل Claude + Repo (با نسخه Sonnet 4.6) را که ۸۶.۳٪ صحت داشت، شکست داد. همچنین از نظر بهره‌وری، هزینه هر پرس‌وجو تنها ۰.۲۰ دلار و زمان اجرا ۱.۶ دقیقه بود، در حالی که برای مدل پایه این ارقام به ترتیب ۰.۳۸ دلار و ۴.۳ دقیقه بود.

این سیستم در خارج از زیست‌شناسی نیز کارآمد بود و در ۱۰ مقاله غیرزیستی از جمله SAM 2، TabPFN و SAELens دقت ۹۸.۱٪ را حفظ کرد. در مورد ۲۶ مقاله داده‌محور، لایه منابع ۳۴ برابر ارزان‌تر و ۱۵ برابر سریع‌تر از استفاده از مرورگر بود. سیستم همچنین استحکام خود را با رد کردن ۱۰۰٪ پرس‌وجوهای خارج از محدوده (Out-of-scope) و بازیابی موفق از خطاهای تایپی، APIهای منسوخ شده و شکست‌های مسیر فایل (File-path) نشان داد.

کاربردهای دنیای واقعی و همکاری عامل‌ها

تیم پژوهشی فراتر از بازتولید ساده، «همکاری عامل‌ها» را به نمایش گذاشتند. با اتصال سه عامل مختلف (AlphaGenome، یک اسکرین scCRISPRi متصل به MPRA و یک مجموعه‌داده Perturb-seq سلول‌های T CD4+)، آن‌ها ژن GPR137 را به عنوان عامل احتمالی بیماری پسوریازیس در لوکوس rs887314 شناسایی کردند. این عامل با امتیاز کوانتیل RNA-seq برابر با ۰.۹۹۷، این ژن را علامت‌گذاری کرد. پس از اینکه پژوهشگر استراتژی همبستگی امضا (Signature correlation) را انتخاب کرد، تنها ناک‌داون (Knockdown) ژن GPR137 با امضای اختلال CRE مطابقت داشت (ضریب اسپیرمن ۰.۶۱۳ در Stim8hr و ۰.۶۳۰ در Stim48hr).

سایر کاربردها شامل عامل Scanpy برای شمارش سلول‌ها و ژن‌ها در چهار مجموعه‌داده عمومی (که نتایجی مشابه با پژوهشگران انسانی داشت) و عامل TISSUE برای بازتولید نتایج ترانسکریپتومیکس فضایی بود. جالب اینجاست که عامل AlphaGenome با بررسی مجدد یک واریانت کلسترول LDL (در مختصات chr1:109274968:G>T)، ژن SORT1 را به عنوان عامل احتمالی معرفی کرد، در حالی که مقاله اصلی بر CELSR2 و PSRC1 تأکید داشت.

این تحول، فرض بنیادین مصرف پژوهش را تغییر می‌دهد. به جای اینکه انسانی روزها وقت صرف پیکربندی محیط کند تا یک فرضیه را آزمایش کند، خودِ مقاله به یک «نویسنده مسئول مجازی» تبدیل می‌شود که می‌توان از او پرس‌وجو کرد و او را اجرا نمود. معیار موفقیت از «در دسترس بودن کد» به «دسترسی عامل‌محور» تغییر یافته است. این رویکرد در کنار پیشرفت‌های معماری مدل‌ها، مانند مدل‌های جدیدی که با حجم انبوه داده‌ها جایگزین یادگیری تقویتی شده‌اند، افق‌های جدیدی را در اتوماسیون پژوهشی می‌گشاید.

برای توسعه‌دهندگان و پژوهشگران، کد این سیستم تحت مجوز MIT در دسترس است. سرورهای پیش‌ساخته برای Scanpy، TISSUE و AlphaGenome در حال حاضر در Hugging Face Spaces و وب‌سایت paper2agent.ai میزبانی می‌شوند.

گام بعدی شما

  • اگر پژوهشگر هستید، سرورهای پیش‌ساخته Scanpy و AlphaGenome را در Hugging Face Spaces یا سایت paper2agent.ai بررسی کنید.
  • برای توسعه‌دهندگان، بررسی مستندات Model Context Protocol (MCP) برای تبدیل ابزارهای داخلی به قابلیت‌های قابل فراخوانی توسط LLM توصیه می‌شود.
  • بررسی کنید آیا کدهای پروژه‌های قبلی شما قابلیت تبدیل به یک عامل اجرایی برای تسهیل استفاده دیگران را دارد یا خیر.

اما این تنها بخشی از داستان است؛ نحوه تعامل این عامل‌ها با سخت‌افزارهای تخصصی برای تحلیل‌های سنگین‌تر، در گزارش‌های بعدی ما بررسی خواهد شد.

چرا این موضوع مهم است؟

این سیستم با حذف اصطکاک‌های نصب و دیباگ، سرعت بازتولید نتایج علمی را به شدت افزایش می‌دهد. اعتبار این دستاورد از طریق انتشار در Nature و تست روی ۱۰۰ مقاله واقعی تأیید شده است.

تأثیر برای ایران

پژوهشگران ایرانی در حوزه‌های بیوانفورماتیک و علوم داده می‌توانند بدون درگیر شدن در پیچیدگی‌های محیطی، متدهای پیشرفته جهانی را روی داده‌های بومی اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

انتقال از «کد باز» به «عامل باز» یک جهش کیفی در متدولوژی علم است. Paper2Agent نشان می‌دهد که دسترسی به کد به تنهایی کافی نیست، بلکه لایه انتزاعی (Abstraction Layer) برای اجرای کد است که ارزش واقعی را آزاد می‌کند. این رویکرد احتمالاً منجر به ظهور «کتابخانه‌های عامل‌محور» می‌شود که در آن متدهای علمی به جای توابع، به صورت مهارت‌های قابل استدلال تعریف می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.