پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Claude با نرخ موفقیت ۲۶.۸ درصدی طراحی پروتئین را خودکار کرد

·۲۶ شهریور ۱۴۰۵۱۱ دقیقه مطالعه۱ بازدید
طراحی پروتئین با هوش مصنوعی آنتروپیک: ۳۵۴ بایندر، ۲۷٪ موفقیت و چه چیزی هنوز اثبات نشده
طراحی پروتئین با هوش مصنوعی آنتروپیک: ۳۵۴ بایندر، ۲۷٪ موفقیت و چه چیزی هنوز اثبات نشده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین نمایش موفق ارکستراسیون کامل (End-to-End) یک کمپین بیولوژی محاسباتی توسط یک LLM عمومی — مدل نه تنها توالی تولید نکرد، بلکه ابزارها را مدیریت و نتایج را رتبه‌بندی کرد.

یک مدل زبانی چندمنظوره اکنون می‌تواند یک کمپین چندروزه بیولوژی محاسباتی را به‌طور کامل و از ابتدا تا انتها (end-to-end) اجرا کند و مولکول‌هایی تولید کند که در یک آزمایشگاه فیزیکی واقعاً کار می‌کنند. در ۱۸ آگوست ۲۰۲۶، شرکت آنتروپیک (Anthropic) مقاله‌ای با عنوان «طراحی خودکار پروتئین با Claude» منتشر کرد که فاش می‌کند مدل‌های این شرکت قادرند تمام چرخه حیات طراحی پروتئین‌های متصل‌شونده (Protein Binder) را، از انتخاب هدف اولیه تا تفسیر داده‌های نهایی، بدون هیچ‌گونه دخالت انسانی در مراحل میانی مدیریت کنند.

این پیشرفت در حالی رخ می‌دهد که حوزه کشف دارو با هوش مصنوعی از تولید ساده توالی‌ها به سمت ارکستراسیون پیچیده عامل‌محور (Agentic Orchestration) حرکت می‌کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی تلاش‌های آنتروپیک برای ادغام ابزارهای بهره‌وری مانند اسناد و اسلایدهای بومی اشاره کردیم، این پژوهش مدل را از محیط دفتر کار به داخل آزمایشگاه‌های تر (Wet Lab) منتقل می‌کند. چالش اصلی در طراحی پروتئین، تنها تولید یک توالی نیست، بلکه فرآیند «قضاوت‌محور» برای انتخاب اپیتوپ‌ها، پیکربندی ابزارها و مدیریت بودجه محاسباتی است؛ کارهایی که به‌طور سنتی هفته‌ها زمان متخصصان را می‌گرفت.

چارچوب اتوماسیون

آنتروپیک برای این کمپین‌ها از دو مدل استفاده کرد: Claude Opus 4.8 و Mythos Preview (نسخه پیش‌نمایش محدود و دعوت‌نامه‌ای که پیش‌درآمدی برای Claude Mythos 5 بود). پژوهشگران هیچ هدف یا داربست (Scaffold) خاصی به مدل‌ها ندادند. در عوض، یک پرامپت سیستمی ۱۶ هزار کلمه‌ای را به‌عنوان دستورالعمل اجرایی ارائه کردند.

این پرامپت به سه بخش عملکردی تقسیم شده بود:

  • علوم و ابزارها (۳۴.۲٪): شامل پرونده‌های هدف، انتخاب اپیتوپ، استراتژی طراحی، فیلترها و امتیازات رتبه‌بندی.
  • ارکستراسیون و تایید (۳۴.۷٪): شامل تفویض اختیار به زیر-عامل‌ها، انضباط زمانی و قوانین رتبه‌بندی.
  • عملیات (۳۱.۱٪): شامل بودجه محاسباتی (Compute Budget)، یک کنترل‌کننده سرعت (Pacing Governor) و گزارش‌دهی.

طبق مستندات این پژوهش، نقش انسان‌ها به چهار مورد بسیار محدود شد: انتخاب ۱۶ هدف (که تنها به صورت نام، شناسه‌های UniProt، ارگانیسم و حالت‌های اولیگومریک ارائه شدند)، تأمین یک حساب GPU ابری با بودجه و محدودیت زمانی ثابت، ثبت سفارش سنتز مولکول‌ها و تفسیر داده‌های نهایی اتصال. تمام تصمیمات دیگر — از جمله اینکه کدام ناحیه از پروتئین مورد حمله قرار گیرد، کدام‌یک از ۱۰ مولد (Generator) اجرا شود، شدت فیلترها چقدر باشد و کدام ۳۰ طرح نهایی با چه ترتیبی تحویل داده شود — توسط Claude اتخاذ شد.

کمپین‌ها به‌طور بدون نظارت بین ۲۴ تا ۴۸ ساعت اجرا شدند. در مقاله ذکر شده است که سیستم بسیار تاب‌آور بود؛ به‌طوری که پس از قطعی‌های زیرساختی، «تنها دستورات کوتاه و غیرفنی برای ازسرگیری کار مورد نیاز بود».

طراحی پروتئین با هوش مصنوعی آنتروپیک: ۳۵۴ بایندر، ۲۷٪، و آنچه ثابت نشده است

اعداد: نرخ موفقیت و میل ترکیبی

در میان ۱۶ هدف اولیه، یک هدف — دیمر بالغ GDF-8 — در شرایط آزمایشگاهی دچار تجمع (Aggregation) شد و در هر دو سازمان تحقیقاتی پیمانکار (CRO)، خوانش‌های غیرقابل تفسیری ارائه داد. در نتیجه، ۱۲۰ طرح مربوط به این هدف از تمام محاسبات حذف شدند. این امر منجر به باقی ماندن ۱,۳۲۰ طرح در ۱۵ هدف شد.

Claude برای ۱۴ هدف از این ۱۵ هدف، متصل‌شونده‌های تایید شده تولید کرد. این دستاورد در واقعیت به معنای طراحی موفق پروتئین‌های فعال زیستی برای تقریباً تمام اهداف مورد بررسی بود. در مجموع، ۳۵۴ طرح متصل شدند که منجر به نرخ موفقیت کلی (Pooled Hit Rate) ۲۶.۸ درصدی شد. بر اساس مقاله نوشته شده توسط امیر شاه‌نساززاده، این عدد به‌طور قابل‌توجهی از خط پایه ۱۰ تا ۱۵ درصدی که در کمپین‌های منتشرشده معمول است، فراتر است. تحلیل‌های دقیق‌تر نشان می‌دهد که این جهش در نرخ موفقیت، نتیجه‌ی مستقیم ارکستراسیون هوشمندانه ابزارها توسط عامل‌های Claude است.

عملکرد مدل‌ها بر اساس مدل و فرمت اجرا متفاوت بود:

  • Claude Opus 4.8 (چند-هدفه، ۴۸ ساعته): نرخ موفقیت ۲۲.۶٪ (۸۸ مورد از ۳۹۰ طرح).
  • Mythos Preview (چند-هدفه، ۴۸ ساعته): نرخ موفقیت ۲۶.۷٪ (۱۰۴ مورد از ۳۹۰ طرح).
  • Mythos Preview (تک-هدفه، ۲۴ ساعته): نرخ موفقیت ۳۵.۱٪ (۱۵۸ مورد از ۴۵۰ طرح).

در فرمت تک-هدفه، مدل Mythos Preview تقریباً ۲.۸ برابر بیشتر از هر هدف بودجه محاسباتی دریافت کرد. مقاله اشاره می‌کند که نمی‌توان به طور مجزا تعیین کرد که آیا این موفقیت بیشتر به دلیل «تمرکز» روی یک هدف بوده یا «بودجه» بیشتر.

سیگنال رتبه‌بندی داخلی Claude

نکته حیاتی این است که رتبه‌بندی داخلی مدل یک سیگنال واقعی را نشان داد. هر کمپین ۳۰ طرح را بر اساس قضاوت خود Claude پیش از سنتز، به ترتیب رتبه تحویل داد. اگر رتبه‌بندی مدل صرفاً نویز بود، نرخ موفقیت در تمام رتبه‌ها یکسان می‌شد. اما نتایج نشان داد که موفقیت با میزان اعتماد مدل رابطه مستقیم دارد:

  • تنها رتبه ۱: نرخ موفقیت ۴۹٪
  • ۵ رتبه برتر: نرخ موفقیت ۴۴٪
  • ۱۰ رتبه برتر: نرخ موفقیت ۳۹٪
  • تمام ۳۰ طرح تحویل داده شده: نرخ موفقیت ۲۸٪

این موضوع نشان می‌دهد که مدل دارای نوعی «آگاهی متا» (Meta-awareness) از کیفیت خروجی‌های خود است؛ به این معنا که اگر کاربر تنها رتبه اول را سفارش می‌داد، تقریباً نیمی از آن‌ها کار می‌کردند.

رویارویی: Claude در برابر انسان

تکان‌دهنده‌ترین نتیجه در هدف RBX1 رخ داد که زیرواحدی از یک لیگاز اوبیکوئیتین E3 است. RBX1 اخیراً موضوع یک رقابت طراحی باز بود. در میان ۲۴۵ طرح de novo که توسط شرکت‌کنندگان انسانی ارسال شده بود، تنها ۹ مورد متصل شدند که نرخ موفقیت ۳.۷ درصدی را نشان می‌دهد. در مقابل، سه کمپین Claude برای همین هدف، ۲۸ متصل‌شونده از ۹۰ طرح تولید کردند که نرخ موفقیت ۳۱.۱ درصدی است.

داده‌های میل ترکیبی (Affinity) نیز این شکاف را تایید کرد. قوی‌ترین متصل‌شونده Claude برای RBX1 مقدار ثابت تفکیک (KD) برابر ۳.۹ نانومولار داشت. برنده رقابت انسانی، که مجدداً سنتز و در همان صفحه و تحت همان شرایط اندازه‌گیری شد، مقدار ۴۵ نانومولار را نشان داد؛ یعنی نتیجه هوش مصنوعی تقریباً ۱۰ برابر قوی‌تر بود. آنتروپیک اشاره می‌کند که اگرچه این یک مقایسه واقعی است، اما کنترل‌شده نیست، زیرا شرکت‌کنندگان انسانی تحت محدودیت‌ها و بودجه‌های خاص خود کار می‌کردند.

قدرت اتصال و کاربرد بین‌گونه‌ای

صرفاً متصل شدن یک سطح پایین از موفقیت است؛ این «میل ترکیبی» است که کاربرد را تعیین می‌کند. از میان ۳۵۴ متصل‌شونده:

  • ۱۴۲ مورد زیر ۱۰۰ نانومولار بودند.
  • ۷۸ مورد زیر ۱۰ نانومولار (آستانه استاندارد برای یک واکنش‌گر مفید) بودند.
  • ۳۸ مورد زیر ۱ نانومولار بودند.
  • ۶ متصل‌شونده TREM2 حتی زیر ۱۰۰ پیکومولار بودند و به کف تشخیص دستگاه رسیدند.

آنتروپیک گزارش می‌دهد که متصل‌شونده‌های با میل ترکیبی بالا (KD زیر ۱۰ نانومولار) برای حداقل ۶ هدف تولید شده و طرح‌هایی ایجاد شده که میل ترکیبی آن‌ها با بهترین نتایج گزارش‌شده قبلی برابری کرده یا از آن‌ها پیشی گرفته است (در حداقل ۴ هدف).

علاوه بر این، ۱۳۰ مورد از ۲۳۳ متصل‌شونده‌ای که روی نسخه‌های موشی اهداف تست شدند، فعال باقی ماندند. این واکنش‌پذیری بین‌گونه‌ای برای تست‌های حیوانی ضروری است، هرچند در پرامپت تنها یک هدف ثانویه بود.

نقاط شکست سیستم

این پژوهش حالت‌های شکست بحرانی را برجسته می‌کند. در سه هدف، نتایج بسیار ضعیف بود:

  • MBP (پروتئین متصل‌شونده به مالتوز): صفر از ۹۰ طرح متصل شدند.
  • 15-PGDH: تنها ۱ مورد از ۳۰ طرح متصل شد.
  • TNFα: یک هموتریمر فشرده که پیش‌تر هدف ۵ داروی بیولوژیک تایید شده بود. تنها ۱۲ مورد از ۱۵۰ طرح (۸٪) متصل شدند و تمام آن‌ها متعلق به Opus 4.8 بودند. هر دو کمپین Mythos Preview برای TNFα نتیجه صفر از ۶۰ را ثبت کردند.

نگران‌کننده‌ترین یافته این است که امتیازات اعتماد in-silico مدل برای طرح‌های شکست‌خورده MBP و BBF-14، مشابه امتیازات اهداف موفق بود. سیستم «ساکت» شکست خورد؛ یعنی نتوانست پیش‌بینی کند چه زمانی طرح‌هایش احتمالاً بی‌فایده هستند. در حوزه‌ای که هدف «فیلتر در محیط شبیه‌سازی و سنتز تنها برندگان» است، این شکست ساکت یک ریسک مالی قابل توجه است.

پشته فنی و هزینه‌ها

آنتروپیک کاملاً بر ابزارهای متن‌باز تکیه کرد و از نرم‌افزارهای لایسنس‌دار مانند AlphaFold 3، Rosetta/PyRosetta یا ESM3 استفاده نکرد. پشته طراحی شامل موارد زیر بود:

مولدهای ساختار (Structure Generators):

  • PXDesign: ۳۵۸ طرح (بزرگ‌ترین سهم).
  • RFdiffusion3: ۲۶۷ طرح.
  • Genie 3: ۱۸۵ طرح.
  • RFdiffusion: ۱۱۸ طرح.
  • FreeBindCraft: ۱۳۵ طرح.
  • BoltzGen: ۱۳۴ طرح.
  • Proteina-Complexa: ۱۰۰ طرح.
  • FoldCraft: ۱۴ طرح.
  • BoltzDesign1: ۲ طرح.
  • Protein Hunter: ۲ طرح.

توالی و رتبه‌بندی:

  • طراحی توالی: SolubleMPNN (نسخه محلول ProteinMPNN) ۱,۱۳۳ طرح را فراهم کرد، که ۱۱۱ مورد از SolubleCaliby و ۲۱ مورد از ProteinMPNN استاندارد بود.
  • رتبه‌بندی: مجموعه‌ای (Ensemble) از ESMFold2، ESMFold2-Fast و Protenix v2.

هزینه‌های محاسباتی بسیار زیاد بود. یک کمپین ۴۸ ساعته چند-هدفه تقریباً به ۱۲,۵۰۰ ساعت NVIDIA H100 نیاز داشت. فرمت‌های تک-هدفه حدود ۲,۵۰۰ ساعت H100 برای هر هدف مصرف کردند که روی GPUهای ابری اجاره‌ای اجرا شدند.

تحلیل: چرخش در مفهوم تخصص

این نتیجه فرض بنیادی طراحی پروتئین را تغییر می‌دهد: «متخصص» دیگر کسی نیست که پارامترها را تنظیم می‌کند، بلکه کسی است که پروتکل را می‌نویسد. با انتقال تخصص به یک پرامپت منجمد ۱۶ هزار کلمه‌ای که روی ۱۶ هدف مختلف بدون تغییر کار کرد، آنتروپیک ثابت کرد ارکستراسیون نرم‌افزارهای علمی یک مسئله زبانی است.

دو سوم پرامپت مربوط به علم نیست؛ بلکه آموزش مدل برای اجرای یک شغل ۴۸ ساعته بدون فروپاشی است — تفویض اختیار به زیر-عامل‌ها، نظارت بر ساعت و جلوگیری از سوزاندن بودجه در ساعت ششم. یک منتقد می‌تواند استدلال کند که تخصص انسانی هرگز حذف نشده است، اما این حقیقت که یک پرامپت واحد برای تمام اهداف به کار رفت، نشان می‌دهد که تخصص با موفقیت کدگذاری شده است.

محدودیت‌ها و دیدگاه‌های انتقادی

محدودیت‌های مقاله صریح است. شواهد بر اساس «اتصال» (Binding) است، نه ساختار یا عملکرد. هیچ طرحی از نظر ساختاری حل (Resolve) نشد و تمام حالت‌ها (Poses) پیش‌بینی هستند. همچنین هیچ طرحی برای فعالیت بیولوژیکی تست نشد؛ متصل شدن به TNFα لزوماً به معنای انجام یک عملکرد مفید توسط مولکول نیست.

علاوه بر این، طرح‌ها کاملاً مستقل نبودند. گونه‌های توالی از یک داربست واحد به عنوان طرح‌های مجزا شمارش شدند. وقتی تنها بهترین توالی از هر ۸۰۹ داربست تولیدشده شمارش شود، نرخ موفقیت به ۲۴.۷٪ (۲۰۰ مورد متصل) کاهش می‌یابد.

منتقدان خارجی، از جمله مارتین شرلی (مدیر سابق داروسازی)، استدلال کرده‌اند که این کار «تأثیرگذار نیست» و اشاره کرده‌اند که میل ترکیبی‌ها برای این کلاس از مولکول‌ها معمولی است و هیچ‌یک از اهداف درون‌سلولی نیستند. اهداف خارج‌سلولی (Extracellular) نیمی از مسئله هستند که راحت‌تر حل می‌شوند؛ اهداف «غیردارویی» (Undruggable) در داخل سلول قرار دارند.

چرا این موضوع همچنان اهمیت دارد

اگر هایپ را کنار بگذاریم، یک ادعای محکم باقی می‌ماند: یک مدل زبانی چندمنظوره، با یک پروتکل مکتوب و بودجه GPU، یک کمپین بیولوژی محاسباتی چندروزه را به‌طور کامل اجرا کرد و مولکول‌هایی تولید کرد که در آزمایشگاه شخص دیگری کار کردند، آن هم با نرخی بالاتر از استانداردهای منتشرشده و روی اهدافی که هرگز ندیده بود.

تایید تجربی به‌طور مستقل توسط Adaptyv Bio (لوزان) با استفاده از رزونانس پلاسمون سطحی در پنج غلظت هدف و توسط Twist Bioscience انجام شد. هیچ‌یک از این دو CRO داده‌های دیگری را ندیدند یا نمی‌دانستند کدام مدل کدام توالی را تولید کرده است. Adaptyv Bio برای ۱,۲۹۶ مورد از ۱,۳۲۰ طرح، نتایج قابل استفاده بازگرداند.

از آنجا که پرامپت‌ها، مدل‌های طراحی ۱۴۴۰ تایی و داده‌های اتصال در Hugging Face تحت لایسنس CC BY 4.0 (و اسکریپت‌ها تحت MIT) منتشر شده‌اند، هر آزمایشگاهی اکنون می‌تواند بدون نیاز به PhD در بیولوژی محاسباتی، یک کمپین طراحی سطح بالا را اجرا کند. خبر واقعی این نیست که هوش مصنوعی پروتئین طراحی کرد، بلکه این است که ارکستراسیون گران‌قیمت و قضاوت‌محور طراحی پروتئین، اکنون قابل‌نوشتن و عمومی است.

گام بعدی شما

  • بررسی مجموعه‌داده‌های منتشرشده در Hugging Face برای تحلیل ساختار پرامپت ۱۶ هزار کلمه‌ای آنتروپیک.
  • ارزیابی ابزارهای متن‌باز ذکرشده (مانند PXDesign و RFdiffusion) برای ادغام در گردش‌کارهای بیوانفورماتیک.
  • دنبال کردن گزارش‌های مربوط به تست‌های فعالیت بیولوژیکی (Biological Activity) برای این مولکول‌ها.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار مراکز مستقل Adaptyv Bio و Twist Bioscience، ثابت می‌کند که ارکستراسیون پیچیده علمی را می‌توان به زبان طبیعی تبدیل کرد. این تغییر، سد ورود به طراحی پروتئین را برای غیرمتخصصان به‌شدت کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل انتشار پرامپت‌ها و مدل‌ها در Hugging Face، پژوهشگران بیوانفورماتیک ایرانی می‌توانند بدون نیاز به لایسنس‌های گران‌قیمت، از این متدولوژی برای طراحی پروتئین استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

انتقال تخصص از «تنظیم پارامتر» به «نگارش پروتکل» نشان می‌دهد که مدل‌های زبانی در حال تبدیل شدن به لایه‌ی سیستم‌عامل برای نرم‌افزارهای تخصصی هستند. ریسک اصلی اکنون «شکست ساکت» است؛ جایی که مدل با اعتماد کامل، خروجی بی‌فایده تولید می‌کند و این یعنی در آینده، ابزارهای اعتبارسنجی مستقل (Verification) بسیار مهم‌تر از خودِ مدل‌های مولد خواهند بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.