پرش به محتوای اصلی
پرش به محتوای مقاله

بهینه‌سازی ۳۰ مدل زیست‌مولکولی توسط Claude؛ افزایش ۴ برابری سرعت استنتاج

·۲۷ شهریور ۱۴۰۵۶ دقیقه مطالعه
کلود بیش از ۳۰ مدل زیست‌مولکولی متن‌باز را بهینه‌سازی کرد
کلود بیش از ۳۰ مدل زیست‌مولکولی متن‌باز را بهینه‌سازی کرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اتوماسیون کامل مهندسی کرنل GPU توسط LLM بدون نیاز به متخصص سیستم؛ تبدیل بهینه‌سازی سخت‌افزاری به یک تسک تولید کد که منجر به شتاب ۴ برابری مدل‌های زیست‌مولکولی شد.

بهینه‌سازی مدل‌های پیچیده زیست‌مولکولی که پیش‌تر سال‌ها زمان می‌برد، اکنون با سپردن مهندسی کرنل به یک مدل زبانی بزرگ، در عرض چند هفته انجام می‌شود. در ۱۷ سپتامبر ۲۰۲۶، شرکت آنتروپیک (Anthropic) گزارش داد که کلود (Claude) توانسته است بیش از ۳۰ مدل متن‌باز زیست‌مولکولی را در کمتر از چهار هفته بهینه‌سازی کرده و سرعت آن‌ها را به‌طور متوسط ۴ برابر افزایش دهد.

این پیشرفت در حالی رخ می‌دهد که حوزه زیست‌شناسی مبتنی بر هوش مصنوعی با هزینه‌های محاسباتی هنگفت در بخش‌های «توجه مثلثی» (Triangle Attention) و ضرب ماتریسی دست‌وپنجه نرم می‌کند که هزینه‌ای مکعبی دارند. اگرچه سخت‌افزارهای تخصصی وجود دارند، اما کرنل‌های نرم‌افزاری همچنان گلوگاه اصلی پژوهشگران هستند. همان‌طور که در تحلیل قبلی ما درباره‌ی توانایی کلود کد (Claude Code) در مدیریت عامل‌های موازی در فضای ابری اشاره کردیم، این دستاورد جدید نشان می‌دهد که کلود قادر است بدون دخالت مستقیم انسان و بدون نیاز به هدایت دستی، بهینه‌سازی‌های عمیق و سطح پایین سیستم را انجام دهد.

چارچوب بهینه‌سازی

به نقل از گزارش فنی آنتروپیک، یک مدل پژوهشی داخلی و چندمنظوره، ۳۶ بسته بهینه‌شده تولید کرده است. این بسته‌ها شش خانواده متمایز از مدل‌سازی زیست‌مولکولی را پوشش می‌دهند:

  • پیش‌بینی ساختار و هم‌تاشدگی (۱۴ بسته)
  • ژنومیک (۷ بسته)
  • تولید ساختار (۶ بسته)
  • توهم یا Hallucination (۳ بسته)
  • هم‌تاشدگی معکوس (۳ بسته)
  • مدل‌های زبانی پروتئین (۳ بسته)

نکته کلیدی این است که کلود تنها توسط دو کارمند نظارت شد. هیچ‌یک از این دو نفر تجربه‌ای در بهینه‌سازی استنتاج (Inference) یا مهندسی کرنل نداشتند، با این حال کد تولیدشده به‌گونه‌ای است که با وزن‌های اصلی مدل‌ها بدون تغییر اجرا می‌شود.

حالت‌های عملکرد و بنچمارک‌ها

آنتروپیک برای هر بسته سه حالت عملیاتی متمایز تعریف کرد تا تعادلی میان دقت و مصرف منابع ایجاد کند. حالت «Exact» خروجی‌ها را به‌صورت بیت‌به‌بیت و بدون هیچ تغییری بازتولید می‌کند. حالت «Fast» دقت عددی اندکی را فدای سرعت می‌کند و حالت «Big» اولویت را به بهره‌وری حافظه برای ورودی‌های بزرگ‌تر می‌دهد.

بر اساس مستندات، در پردازنده‌های گرافیکی NVIDIA H100، حالت Exact مدل‌های پیش‌بینی ساختار را به‌طور متوسط ۱.۶ برابر سریع‌تر اجرا کرد. حالت Fast در ۱۳ مدل به شتاب ۴.۱ برابری رسید و حالت Big میانگینی ۳.۴ برابری را ثبت کرد. برای مثال، مدل Chai-1 در حالت Fast شتاب ۶.۴ برابری و مدل OpenDDE شتاب ۲.۳ برابری را تجربه کردند. همچنین مدل‌های ژنومیک و مدل‌های زبانی پروتئین در حالت Exact شاهد بهبودهایی بین ۱.۲ تا ۵.۰ برابر بودند.

صحت و محدودیت‌ها

برای تأیید این اعداد، آنتروپیک از FoldBench-Lite استفاده کرد که یک بنچمارک تجمیعی شامل ۱,۹۲۵ جفت مدل-هدف در ۱۳ پیکربندی مختلف است. سهم پیش‌بینی‌های پذیرفته‌شده در تمام حالت‌ها ثابت ماند: ۵۴.۸٪ برای حالت پیش‌فرض، ۵۵.۰٪ برای Exact، ۵۴.۵٪ برای Fast و ۵۴.۲٪ برای Big. گزارش تأکید می‌کند که هیچ تغییر تجمیعی قابل تشخیص از صفر در این نتایج مشاهده نشد.

با این حال، محدودیت‌های مشخصی نیز در گزارش ذکر شده است:

  • تمام اندازه‌گیری‌ها منحصراً روی GPUهای H100 انجام شده است.
  • شتاب ColabFold نسبت به نسخه ۱.۶.۱ سنجیده شده است، یعنی پیش از آنکه خودِ آن پروژه کرنل‌های تلفیقی (Fused Kernel) خود را منتشر کند.
  • حالت‌های Exact و Fast ممکن است تا ۳.۲ برابر حافظه بیشتری نسبت به تنظیمات پیش‌فرض مصرف کنند.

کرنل‌های FlashPairformer v1

برای حل گلوگاه هزینه‌های مکعبی که در مدل‌هایی مانند AlphaFold3، OpenFold3 و Boltz-2 یافت می‌شود، کلود ابزاری به نام FlashPairformer v1 را توسعه داد. این کرنل‌های سفارشی GPU از استانداردهای فعلی این حوزه مانند cuEquivariance و BioNeMo Inference Runtime پیشی گرفته‌اند.

در پهنای جفت ۱۲۸ (که توسط AlphaFold3 و Boltz-2 استفاده می‌شود)، FlashPairformer v1 توجه مثلثی را ۲.۷ برابر سریع‌تر از کرنل‌های استاندارد اجرا کرد. در پهنای ۲۵۶ (مورد استفاده در Protenix v2)، این شتاب به ۲.۹ برابر رسید. همچنین ضرب مثلثی روی یک کارت NVIDIA H100 به ترتیب ۱.۷ و ۳.۲ برابر بهبود یافت.

علاوه بر کرنل‌ها، کلود چندین بهینه‌سازی مهندسی نرم‌افزار را اعمال کرد:

  • Memoization متغیرهای میانی برای جلوگیری از محاسبات تکراری
  • Constant-folding برای شاخه‌هایی که خروجی‌های ثابت دارند
  • استفاده از CUDA graph capture
  • تلفیق کرنل‌ها (Kernel fusion)

مقیاس‌پذیری در سیستم‌های عظیم

حالت «Big» امکان مدل‌سازی سیستم‌های بزرگ‌تر از ۱۰,۰۰۰ توکن (شامل اسیدهای آمینه، نوکلئوتیدها و اتم‌های مربوط به یون‌ها و مولکول‌های کوچک) را روی یک گره GPU فراهم می‌کند؛ کاری که پیش‌تر غیرممکن پنداشته می‌شد. آنتروپیک با موفقیت ساختارهای پیچیده‌ای مانند کمپلکس I میتوکندری انسانی، کمپلکس چپرون TRiC، یک پروتئازوم و ریبوزوم ۷۰S باکتریایی را با امتیاز TM بین ۰.۹۲ تا ۰.۹۹۷ پیش‌بینی کرد.

آنتروپیک اشاره می‌کند که این‌ها از بزرگ‌ترین ساختارهایی هستند که تاکنون به‌دقت هم‌تا شده‌اند. برای درک بهتر، مقاله AlphaFold3 پیش‌بینی ریبوزوم ۴۰S با ۷,۶۶۳ توکن را برجسته کرده بود، در حالی که خود AlphaFold3 روی تکه‌هایی (Crops) با حداکثر ۷۶۸ توکن آموزش دیده بود.

برای تست مرزهای نهایی، کلود پیش‌بینی ساختار کپسیدهای ویروسی و محفظه‌های پروتئینی با ۳۱,۰۰۰ تا بیش از ۷۰,۰۰۰ باقی‌مانده (Residues) را روی یک گره شامل هشت GPU B300 امتحان کرد. اگرچه اجراها کامل شدند، اما پیش‌بینی‌ها به شکل توپ‌های فشرده‌ای تبدیل شدند (امتیاز TM بین ۰.۰۸ تا ۰.۱۴). آنتروپیک فرض می‌کند این شکست ناشی از عدم تعمیم‌پذیری مدل است و نه محدودیت محاسباتی، زیرا این مجموعه‌ها ۴۰ تا ۹۰ برابر بزرگ‌تر از تکه‌های آموزشی AlphaFold3 هستند.

طراحی خودکار بایندرها

در یک تست بهره‌وری مجزا، آنتروپیک یک کمپین طراحی بایندر با بودجه بالا را با یک اجرای ساده تحت هدایت کلود مقایسه کرد. کمپین اصلی با پرامپتی ۱۶,۰۰۰ کلمه‌ای، استفاده از زیر-عامل‌ها و هزینه تقریبی ۱۰,۰۰۰ دلار به ازای هر هدف در ۲,۵۰۰ ساعت GPU طی ۲۴ ساعت اجرا شده بود.

در مقابل، ساختار جدید تنها از یک مدل کلود (Opus 5، Mythos 5 یا Mythos 5.1) روی یک GPU H200 با پرامپتی ۱,۱۰۰ کلمه‌ای استفاده کرد. این روش بدون زیر-عامل و بدون نظارت انسانی بود. این رویکرد به عملکرد مشابهی در محیط شبیه‌سازی رسید؛ به طوری که Opus 5 به امتیاز میانه ipSAE برابر ۰.۷۸۵، Mythos 5.1 به ۰.۷۸۱ و Mythos 5 به ۰.۷۳۹ رسید، در حالی که این عدد برای کمپین‌های قبلی ۰.۷۴۹ بود. بهترین امتیازات طراحی به ترتیب ۰.۸۳۳، ۰.۸۲۵ و ۰.۸۱۳ بود، در مقابل ۰.۸۱۷ در روش قدیمی.

این رویکرد بودجه GPU را ۱۰۰ برابر کاهش داد و هزینه کل را به حدود ۱۵۰ دلار برای توکن‌ها و محاسبات رساند. البته تأکید شده که این نتایج در محیط شبیه‌سازی (in silico) است و هنوز آزمایش‌های تجربی روی آن‌ها صورت نگرفته است. این بهینه‌سازی در هزینه‌ها، در ادامه مسیر خودکارسازی طراحی پروتئین با نرخ موفقیت ۲۶.۸ درصدی صورت می‌گیرد که پیش‌تر توسط کلود به دست آمده بود.

متن‌بازسازی و رقابت

آنتروپیک در ۱۷ سپتامبر ۲۰۲۶، ۳۶ کیت بهینه‌سازی را تحت لایسنس Apache 2.0 در یک مخزن عمومی گیت‌هاب منتشر کرد. این کیت‌ها نسخه‌های مرجعی هستند که برای GPUهای NVIDIA H100 80 GB روی لینوکس x86-64 تنظیم شده‌اند و از برخی پیکربندی‌های A100, H200, B200 یا B300 پشتیبانی می‌کنند. این مخزن نگهداری نمی‌شود و پذیرای مشارکت نیست؛ همچنین برنامه‌ریزی شده بود که ایمیج‌های Docker و Apptainer پیش‌ساخته ظرف یک هفته پس از انتشار ارائه شوند.

همچنین، آنتروپیک و Adaptyv Bio یک رقابت طراحی پروتئین را آغاز کرده‌اند. آن‌ها ۱ میلیون دلار برای اعتبارسنجی تجربی ۵,۰۰۰ طرح در آزمایشگاه خودکار Adaptyv و ۱ میلیون دلار اعتبار کلود اختصاص داده‌اند. شرکت Modal تا ۲۵۰,۰۰۰ دلار اعتبار محاسباتی و Twist Bioscience DNAهای مورد نیاز را فراهم می‌کنند. این رقابت بر مسائل پیشرو مانند حساسیت به pH، واکنش متقاطع گونه‌ها، اختصاصی بودن پپتید-MHC و GPCRها تمرکز دارد. این تلاش برای اعتبارسنجی تجربی، پس از آن می‌آید که کلود در ۱۴ مورد از ۱۵ هدف، پروتئین‌های فعال زیستی طراحی کرد و پتانسیل خود را در دنیای واقعی ثابت کرد.

سه مسیر مشارکت تعریف شده است:

  • آزمایشگاه‌ها و شرکت‌ها: تا ۵۰,۰۰۰ دلار (آکادمیک) یا ۲۵,۰۰۰ دلار (صنعتی) اعتبار کلود برای حدود ۲۰ تیم، که برای هر چالش حدود ۱۸ طرح در آزمایشگاه تست می‌شود.
  • افراد و تیم‌های کوچک (تا ۳ نفر): دسترسی رایگان به Claude Max 20x.
  • مسیر باز: پشتیبانی شخصی با استفاده اختیاری از کلود.

ثبت‌نام‌ها از ۱۶ تا ۲۴ سپتامبر ۲۰۲۶ انجام شد. پنج چالش هفتگی از ۲۸ سپتامبر تا ۳۱ اکتبر ۲۰۲۶ برگزار می‌شود. اعتبارسنجی تجربی تا ۳۰ نوامبر تکمیل شده و نتایج در ۱۵ دسامبر ۲۰۲۶ در Proteinbase منتشر خواهد شد. شرکت‌کنندگان مالکیت طرح‌های خود را حفظ می‌کنند و تمام نتایج، حتی نتایج منفی، به‌صورت باز منتشر می‌شوند.

تحلیل فنی

این تغییر نشان می‌دهد که گلوگاه در هوش مصنوعی علمی از معماری مدل به «مایل آخر» پیاده‌سازی سخت‌افزاری منتقل شده است. آنتروپیک با خودکارسازی مهندسی کرنل، در واقع با CUDA و بهینه‌سازی GPU به عنوان یک مسئله ترجمه برخورد می‌کند که مدل‌های زبانی بزرگ می‌توانند آن را حل کنند. این امر مانع ورود زیست‌شناسانی را که تخصص عمیقی در برنامه‌نویسی سیستم‌ها ندارند، برای استقرار مدل‌های پیشرفته از بین می‌برد.

علاوه بر این، نتایج طراحی بایندر نشان‌دهنده سقوط شدید هزینه‌های اکتشاف در محیط شبیه‌سازی است. اگر یک اجرای ۱۵۰ دلاری بتواند با یک اجرای ۱۰,۰۰۰ دلاری برابری کند، حجم پروتئین‌های کاندیدایی که می‌توانند پیش از ورود به آزمایشگاه واقعی غربال شوند، دو مرتبه بزرگی (۱۰۰ برابر) افزایش می‌یابد. این امر چرخه «طراحی-ساخت-تست» را به‌طور بنیادین شتاب می‌بخشد. این جهش در بهره‌وری، پاسخی به این پرسش است که چرا نرخ موفقیت کلود در طراحی پروتئین از استانداردهای فعلی پیشی گرفت و چگونه مدل‌های زبانی بزرگ در حال بازتعریف متدولوژی‌های زیست‌شناسی هستند.

پژوهشگران باید نتایج Proteinbase را در دسامبر دنبال کنند تا ببینند آیا این دستاوردهای شبیه‌سازی‌شده به موفقیت‌های تجربی تبدیل می‌شوند یا خیر. شما می‌توانید کیت‌های بهینه‌سازی را از گیت‌هاب دریافت کنید تا خط لوله‌های زیست‌مولکولی خود را روی سخت‌افزار H100 تست کنید.

گام بعدی شما

  • اگر از سخت‌افزار H100 استفاده می‌کنید، کیت‌های بهینه‌سازی آنتروپیک را از گیت‌هاب دریافت کرده و روی خط لوله‌های زیست‌مولکولی خود تست کنید.
  • نتایج Proteinbase را در دسامبر دنبال کنید تا ببینید آیا شتاب‌های شبیه‌سازی‌شده به موفقیت‌های آزمایشگاهی تبدیل شده‌اند یا خیر.
  • در صورت داشتن تخصص در طراحی پروتئین، ساختار رقابت‌های Adaptyv Bio را برای دسترسی به اعتبارهای محاسباتی بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص آنتروپیک در سیستم‌های سطح پایین، مانع ورود زیست‌شناسان به مدل‌های پیشرفته را حذف می‌کند. تبدیل مهندسی کرنل به یک تسک خودکار، سرعت اکتشافات دارویی را از مقیاس سال به هفته می‌رساند.

تأثیر برای ایران

این ابزارها به‌دلیل متن‌باز بودن در گیت‌هاب، برای پژوهشگران بیوانفورماتیک ایرانی که به سخت‌افزارهای H100 دسترسی دارند، در دسترس است و هزینه محاسباتی آن‌ها را به‌شدت کاهش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

انتقال گلوگاه از معماری مدل به لایه پیاده‌سازی سخت‌افزاری، نشان می‌دهد که بهینه‌سازی CUDA اکنون به یک مسئله ترجمه تبدیل شده است که مدل‌های زبانی می‌توانند آن را حل کنند. کاهش ۱۰۰ برابری هزینه طراحی بایندرها، حجم غربالگری پروتئین‌ها را پیش از ورود به آزمایشگاه به شدت افزایش می‌دهد و چرخه طراحی-ساخت-تست را بنیادین تغییر می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.