پرش به محتوای اصلی
پرش به محتوای مقاله

Elsevier با مدل MolMole تصاویر شیمیایی را به داده‌های قابل جست‌وجو تبدیل کرد

·۲۴ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
ادغام مدل بینایی شیمیایی LG AI Research در پلتفرم Reaxys Elsevier
ادغام مدل بینایی شیمیایی LG AI Research در پلتفرم Reaxys Elsevier
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از استخراج تک‌تصویر به پردازش کامل PDF؛ مدل MolMole برخلاف ابزارهای قبلی، کل سند را می‌خواند و ساختارهای شیمیایی را به‌صورت یکپارچه و بدون نیاز به برش دستی استخراج می‌کند.

تصور کنید یک پژوهشگر شیمی ساعت‌ها وقت خود را صرف ورق زدن هزاران صفحه پتنت کند تا ببیند آیا مولکولی که به دنبالش است در یک تصویر پیچیده رسم شده یا خیر. این بن‌بست اطلاعاتی اکنون به پایان رسیده است.

در ۱۵ سپتامبر ۲۰۲۶، شرکت Elsevier فناوری بینایی ماشین تخصصی شرکت LG AI Research را در سامانه Reaxys ادغام کرد تا موادی که تنها به صورت ترسیم یا طرح واکنش هستند، کاملاً قابل جست‌وجو شوند.

برای دهه‌ها، حجم عظیمی از دانش شیمی در تصاویر و طرح‌های واکنش محبوس مانده بود. از آن‌جا که این تصاویر متن نیستند، شیمی‌دان‌ها مجبور بودند برای تأیید وجود یک ترکیب، اسناد را دستی بررسی کنند. این فرآیند خسته‌کننده به‌ویژه در شیمی معدنی و ارگانومتالیک — جایی که روابط فضایی پیچیده است — یک چالش بزرگ بود. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی استخراج داده‌های ساختاریافته از اسناد غیرمتنی اشاره کردیم، تبدیل تصویر به داده، کلید بهره‌وری در علوم پایه است. این تلاش‌ها در راستای تسهیل دسترسی محققان به ابزارهای تخصصی است، مشابه آنچه در راه‌اندازی دایرکتوری جدید AI برای اتصال توسعه‌دهندگان به ابزارهای علمی مشاهده کردیم.

چالش‌های شیمیِ وابسته به تصویر

ترسیم‌های شیمیایی معانی حیاتی را از طریق پیوندها، اتم‌ها، استریوشیمی و روابط فضایی کدگذاری می‌کنند. مدلی که حتی یک پیوند را اشتباه بخواند، ممکن است ترکیب کاملاً متفاوتی را شناسایی کند. از سوی دیگر، نادیده گرفتن کامل یک ساختار باعث می‌شود شیمی‌دانان با تصویری ناقص از دانش موجود مواجه شوند.

این عدم قابلیت جست‌وجو، گلوگاه‌های قابل توجهی را در حوزه‌های پژوهشی خاص ایجاد کرده است:

  • جست‌وجوی نوآوری (Novelty searching)
  • هوش رقابتی (Competitive intelligence)
  • برنامه‌ریزی سنتز (Synthesis planning)

نویسه‌خوانی نوری (OCR) — شبیه به چشم‌های دیجیتالی است که حروف و نمادها را می‌بیند و آن‌ها را به متنی تبدیل می‌کند که کامپیوتر بفهمد — در دنیای شیمی بسیار دشوارتر است. طبق گزارش unite.ai، این ادغام از مدلی به نام MolMole استفاده می‌کند که بخشی از برنامه «درک عمیق اسناد» (Deep Document Understanding) در LG است. هدف این برنامه ساخت هوش مصنوعی است که بتواند متن، نمودار و جداول را در اسناد عمومی و همچنین فرمول‌های ساختاری مولکولی و فرمول‌های واکنش را در پتنت‌ها و مقالات شیمی تفسیر کند.

برخلاف ابزارهای قدیمی که نیاز به برش تصاویر (Cropped images) داشتند، MolMole کل فایل PDF را به عنوان ورودی می‌گیرد و تمام داده‌های شیمیایی شناسایی شده از یک سند را به صورت یک‌جا بازمی‌گرداند. بر اساس مستندات منتشر شده در arXiv که اولین بار در ۳۰ آوریل ۲۰۲۵ ارسال و در ۸ مه ۲۰۲۵ اصلاح شد، این سیستم از سه ماژول تخصصی تشکیل شده است:

  • ViDetect: نواحی حاوی ساختارهای مولکولی را در PDF پیدا کرده و دور آن‌ها کادر (Bounding boxes) می‌کشد.
  • ViReact: واکنش‌دهنده‌ها، محصولات و شرایط واکنش را در نمودارها شناسایی و طبقه‌بندی می‌کند.
  • ViMore: این ساختارهای بصری را به فرمت‌های استاندارد شیمیایی مثل SMILES، InChI و Mol تبدیل می‌کند. این بخش از تکنیک‌های تخصصی برای مدیریت صفحات نویزی و اسکن‌شده‌ی پتنت‌ها استفاده می‌کند.

به نقل از LG AI Research، ماژول ViMore در سه محک استاندارد OCSR (شامل CLEF، UOB و USPTO) نتایج پیشرو (State-of-the-art) به دست آورده است. این مدل به‌ویژه در مجموعه داده JPO که شامل تصاویر چالش‌برانگیز و کم‌کیفیت پتنت‌های ژاپنی است، از رقبایی مثل DECIMER Image Transformer، MolScribe و MolGrapher پیشی گرفته است.

بنچمارک‌ها و اعتبارسنجی

برای رفع مشکل نبود یک بنچمارک استاندارد در سطح صفحه، نویسندگان یک مجموعه آزمون ۵۵۰ صفحه‌ای ارائه کردند که با کادرهای مولکولی، برچسب‌های واکنش و فایل‌های MOL حاشیه‌نویسی شده بود و یک معیار ارزیابی جدید را معرفی کردند.

در یک بنچمارک اختصاصی روی ۳۰۰ صفحه پتنت و ۲۵۰ صفحه مقاله، خط لوله ترکیبی ViDetect و ViMore در هر دو معیار دقت (Precision) — یعنی درصد پاسخ‌های درست در میان تمام پاسخ‌های داده شده — و بازخوانی (Recall) — یعنی توانایی مدل در پیدا کردن تمام موارد موجود — برتر از مدل‌های Decimer Segmentation، Image Transformer، MolDetect و MolScribe بود. علاوه بر این، ماژول ViReact در تجزیه و تحلیل نمودارهای واکنش، از ReactionDataExtractor2.0 و RxnScribe عملکرد بهتری داشت.

در جریان کاری Elsevier، هر خط لوله استخراج پیش از فعال شدن، با محک‌های داخلی Reaxys اعتبارسنجی می‌شود. سیستم کامل پیش از استقرار گسترده، یک دوره تست سخت‌گیرانه را در سراسر داده‌ها و ابزارهای جریان کاری Elsevier پشت سر گذاشت تا دقت آن تضمین شود.

این تغییر، داده‌های بصری خام را به دانش ساختاریافته تبدیل می‌کند و زمان جست‌وجوی نوآوری و برنامه‌ریزی سنتز را به‌شدت کاهش می‌دهد. برای کسب‌وکارهای داروسازی، این یعنی هوش رقابتی سریع‌تر. وقتی پتنت یک رقیب حاوی مولکولی حیاتی است که فقط رسم شده، اکنون به جای یک جزئیات پنهان، به یک نقطه داده ایندکس‌شده تبدیل می‌شود.

مریت الدور، مدیر بخش علوم زیستی در Elsevier، معتقد است ساختار موجود در یک تصویر باید «سند» باشد، نه «بن‌بست». هوایونگ ادوارد لی از LG AI Research افزود که این مدل به‌طور خاص برای رمزگشایی معنای نهفته در هر پیوند و چیدمان فضایی طراحی شده است.

این مشارکت اکنون به سمت مرحله بعدی یعنی «استخراج واکنش» (Reaction Extraction) حرکت می‌کند. این قابلیت، توانمندی سیستم را از شناسایی تک‌substances به گسترش شواهد واکنش‌های موجود در Reaxys می‌برد. همچنین دو شرکت در حال بررسی چالش‌های بیشتر مشتریان از طریق ترکیب هوش مصنوعی تخصصی LG با تخصص علمی و کیوریشن (Curating) شرکت Elsevier هستند.

هر دو سازمان اعلام کردند که این همکاری از «اصول هوش مصنوعی مسئولانه و حریم خصوصی» Elsevier پیروی می‌کند تا یکپارچگی و امنیت داده‌ها تضمین شود.

گام بعدی شما

  • اگر در حوزه شیمی یا داروسازی فعال هستید، قابلیت‌های جدید جست‌وجوی تصویری در Reaxys را برای تحلیل پتنت‌های قدیمی بررسی کنید.
  • برای توسعه‌دهندگان، بررسی معماری MolMole در arXiv برای درک نحوه ترکیب تشخیص اشیا با تبدیل فرمت‌های تخصصی توصیه می‌شود.
  • منتظر به‌روزرسانی‌های بعدی برای استخراج خودکار واکنش‌های شیمیایی (Reaction Extraction) باشید.

اما این تنها شروع همکاری LG و Elsevier است؛ اثر این مدل بر سرعت کشف داروهای جدید را در گزارش‌های آینده بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این فناوری با حذف بررسی دستی هزاران صفحه سند، سرعت نوآوری در داروسازی را افزایش می‌دهد. اعتبار این دستاورد از طریق برتری در محک‌های استاندارد USPTO و JPO تأیید شده است.

تأثیر برای ایران

این ابزار بیشتر برای پژوهشگران مدل‌های بنیادی و شیمی‌دانان در مراکز تحقیقاتی اهمیت دارد تا بازار مصرف ایران؛ دسترسی به Reaxys برای کاربران ایرانی همچنان نیازمند زیرساخت‌های دورادور است.

·نگاه ما
تحریریه دات‌هوش

این همکاری نشان می‌دهد که مدل‌های چندوجهی در حال حرکت از «توصیف کلی تصویر» به سمت «رمزگشایی دقیق تخصصی» هستند. تبدیل یک رسم شیمیایی به فرمت SMILES صرفاً یک تبدیل فرمت نیست، بلکه تبدیل یک تصویر به یک موجودیت ریاضی قابل محاسبه است که اجازه می‌دهد مدل‌های استدلالی روی آن عملیات انجام دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.