تصور کنید یک پژوهشگر شیمی ساعتها وقت خود را صرف ورق زدن هزاران صفحه پتنت کند تا ببیند آیا مولکولی که به دنبالش است در یک تصویر پیچیده رسم شده یا خیر. این بنبست اطلاعاتی اکنون به پایان رسیده است.
در ۱۵ سپتامبر ۲۰۲۶، شرکت Elsevier فناوری بینایی ماشین تخصصی شرکت LG AI Research را در سامانه Reaxys ادغام کرد تا موادی که تنها به صورت ترسیم یا طرح واکنش هستند، کاملاً قابل جستوجو شوند.
برای دههها، حجم عظیمی از دانش شیمی در تصاویر و طرحهای واکنش محبوس مانده بود. از آنجا که این تصاویر متن نیستند، شیمیدانها مجبور بودند برای تأیید وجود یک ترکیب، اسناد را دستی بررسی کنند. این فرآیند خستهکننده بهویژه در شیمی معدنی و ارگانومتالیک — جایی که روابط فضایی پیچیده است — یک چالش بزرگ بود. همانطور که در تحلیلهای پیشین ما دربارهی استخراج دادههای ساختاریافته از اسناد غیرمتنی اشاره کردیم، تبدیل تصویر به داده، کلید بهرهوری در علوم پایه است. این تلاشها در راستای تسهیل دسترسی محققان به ابزارهای تخصصی است، مشابه آنچه در راهاندازی دایرکتوری جدید AI برای اتصال توسعهدهندگان به ابزارهای علمی مشاهده کردیم.
چالشهای شیمیِ وابسته به تصویر
ترسیمهای شیمیایی معانی حیاتی را از طریق پیوندها، اتمها، استریوشیمی و روابط فضایی کدگذاری میکنند. مدلی که حتی یک پیوند را اشتباه بخواند، ممکن است ترکیب کاملاً متفاوتی را شناسایی کند. از سوی دیگر، نادیده گرفتن کامل یک ساختار باعث میشود شیمیدانان با تصویری ناقص از دانش موجود مواجه شوند.
این عدم قابلیت جستوجو، گلوگاههای قابل توجهی را در حوزههای پژوهشی خاص ایجاد کرده است:
- جستوجوی نوآوری (Novelty searching)
- هوش رقابتی (Competitive intelligence)
- برنامهریزی سنتز (Synthesis planning)
نویسهخوانی نوری (OCR) — شبیه به چشمهای دیجیتالی است که حروف و نمادها را میبیند و آنها را به متنی تبدیل میکند که کامپیوتر بفهمد — در دنیای شیمی بسیار دشوارتر است. طبق گزارش unite.ai، این ادغام از مدلی به نام MolMole استفاده میکند که بخشی از برنامه «درک عمیق اسناد» (Deep Document Understanding) در LG است. هدف این برنامه ساخت هوش مصنوعی است که بتواند متن، نمودار و جداول را در اسناد عمومی و همچنین فرمولهای ساختاری مولکولی و فرمولهای واکنش را در پتنتها و مقالات شیمی تفسیر کند.
برخلاف ابزارهای قدیمی که نیاز به برش تصاویر (Cropped images) داشتند، MolMole کل فایل PDF را به عنوان ورودی میگیرد و تمام دادههای شیمیایی شناسایی شده از یک سند را به صورت یکجا بازمیگرداند. بر اساس مستندات منتشر شده در arXiv که اولین بار در ۳۰ آوریل ۲۰۲۵ ارسال و در ۸ مه ۲۰۲۵ اصلاح شد، این سیستم از سه ماژول تخصصی تشکیل شده است:
- ViDetect: نواحی حاوی ساختارهای مولکولی را در PDF پیدا کرده و دور آنها کادر (Bounding boxes) میکشد.
- ViReact: واکنشدهندهها، محصولات و شرایط واکنش را در نمودارها شناسایی و طبقهبندی میکند.
- ViMore: این ساختارهای بصری را به فرمتهای استاندارد شیمیایی مثل SMILES، InChI و Mol تبدیل میکند. این بخش از تکنیکهای تخصصی برای مدیریت صفحات نویزی و اسکنشدهی پتنتها استفاده میکند.
به نقل از LG AI Research، ماژول ViMore در سه محک استاندارد OCSR (شامل CLEF، UOB و USPTO) نتایج پیشرو (State-of-the-art) به دست آورده است. این مدل بهویژه در مجموعه داده JPO که شامل تصاویر چالشبرانگیز و کمکیفیت پتنتهای ژاپنی است، از رقبایی مثل DECIMER Image Transformer، MolScribe و MolGrapher پیشی گرفته است.
بنچمارکها و اعتبارسنجی
برای رفع مشکل نبود یک بنچمارک استاندارد در سطح صفحه، نویسندگان یک مجموعه آزمون ۵۵۰ صفحهای ارائه کردند که با کادرهای مولکولی، برچسبهای واکنش و فایلهای MOL حاشیهنویسی شده بود و یک معیار ارزیابی جدید را معرفی کردند.
در یک بنچمارک اختصاصی روی ۳۰۰ صفحه پتنت و ۲۵۰ صفحه مقاله، خط لوله ترکیبی ViDetect و ViMore در هر دو معیار دقت (Precision) — یعنی درصد پاسخهای درست در میان تمام پاسخهای داده شده — و بازخوانی (Recall) — یعنی توانایی مدل در پیدا کردن تمام موارد موجود — برتر از مدلهای Decimer Segmentation، Image Transformer، MolDetect و MolScribe بود. علاوه بر این، ماژول ViReact در تجزیه و تحلیل نمودارهای واکنش، از ReactionDataExtractor2.0 و RxnScribe عملکرد بهتری داشت.
در جریان کاری Elsevier، هر خط لوله استخراج پیش از فعال شدن، با محکهای داخلی Reaxys اعتبارسنجی میشود. سیستم کامل پیش از استقرار گسترده، یک دوره تست سختگیرانه را در سراسر دادهها و ابزارهای جریان کاری Elsevier پشت سر گذاشت تا دقت آن تضمین شود.
این تغییر، دادههای بصری خام را به دانش ساختاریافته تبدیل میکند و زمان جستوجوی نوآوری و برنامهریزی سنتز را بهشدت کاهش میدهد. برای کسبوکارهای داروسازی، این یعنی هوش رقابتی سریعتر. وقتی پتنت یک رقیب حاوی مولکولی حیاتی است که فقط رسم شده، اکنون به جای یک جزئیات پنهان، به یک نقطه داده ایندکسشده تبدیل میشود.
مریت الدور، مدیر بخش علوم زیستی در Elsevier، معتقد است ساختار موجود در یک تصویر باید «سند» باشد، نه «بنبست». هوایونگ ادوارد لی از LG AI Research افزود که این مدل بهطور خاص برای رمزگشایی معنای نهفته در هر پیوند و چیدمان فضایی طراحی شده است.
این مشارکت اکنون به سمت مرحله بعدی یعنی «استخراج واکنش» (Reaction Extraction) حرکت میکند. این قابلیت، توانمندی سیستم را از شناسایی تکsubstances به گسترش شواهد واکنشهای موجود در Reaxys میبرد. همچنین دو شرکت در حال بررسی چالشهای بیشتر مشتریان از طریق ترکیب هوش مصنوعی تخصصی LG با تخصص علمی و کیوریشن (Curating) شرکت Elsevier هستند.
هر دو سازمان اعلام کردند که این همکاری از «اصول هوش مصنوعی مسئولانه و حریم خصوصی» Elsevier پیروی میکند تا یکپارچگی و امنیت دادهها تضمین شود.
گام بعدی شما
- اگر در حوزه شیمی یا داروسازی فعال هستید، قابلیتهای جدید جستوجوی تصویری در Reaxys را برای تحلیل پتنتهای قدیمی بررسی کنید.
- برای توسعهدهندگان، بررسی معماری MolMole در arXiv برای درک نحوه ترکیب تشخیص اشیا با تبدیل فرمتهای تخصصی توصیه میشود.
- منتظر بهروزرسانیهای بعدی برای استخراج خودکار واکنشهای شیمیایی (Reaction Extraction) باشید.
اما این تنها شروع همکاری LG و Elsevier است؛ اثر این مدل بر سرعت کشف داروهای جدید را در گزارشهای آینده بررسی خواهیم کرد.




گفتگو