پرش به محتوای اصلی
پرش به محتوای مقاله

AutoFigure: تبدیل توصیفات متنی به نمودارهای علمی با خط لوله عامل‌محور

·۳۱ مرداد ۱۴۰۵۱۳ دقیقه مطالعه۱ بازدید
راهنما
ساخت خطوط پردازش هوشمند اسناد عامل‌محور: ایجاد شکل‌های علمی با AutoFigure
ساخت خطوط پردازش هوشمند اسناد عامل‌محور: ایجاد شکل‌های علمی با AutoFigure
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل مستقیم متدولوژی مقالات PDF به نمودارهای قابل ویرایش (Editable) از طریق یک خط لوله عامل‌محور تکرارشونده، به‌جای تولید تک‌مرحله‌ای تصویر.

تصور کنید پژوهشگری باشید که می‌تواند پیچیده‌ترین توصیفات سیستمی را بدون لمس حتی یک ابزار طراحی، به نموداری آماده برای چاپ در ژورنال‌های معتبر تبدیل کند. این رویای اتوماسیون اکنون با AutoFigure محقق شده است؛ ابزاری که تولید نمودارهای علمی را مستقیماً از متن، توضیحات متدولوژی یا کل مقالات پژوهشی ممکن می‌کند.

ترسیم بصری معماری‌های هوش مصنوعی سال‌هاست که به یکی از گلوگاه‌های دستی در نشر آکادمیک تبدیل شده است. اکثر محققان برای رسیدن به استانداردهای سخت‌گیرانه مجلات، ساعت‌ها وقت خود را در ابزارهایی مثل Lucidchart یا Draw.io صرف همراستاسازی جعبه‌ها و فلش‌ها می‌کنند. AutoFigure این اصطکاک را با یک راهکار برنامه‌ریزی‌شده حل می‌کند و تولید تصویر را به‌جای یک دستور تک‌مرحله‌ای (Single-shot prompt)، به عنوان یک فرآیند تکرارشونده و عامل‌محور (Agentic) تعریف می‌کند؛ شبیه به یک طراح گرافیک که چندین پیش‌نویس می‌زند تا به تایید نهایی مشتری برسد.

خط لوله تولید عامل‌محور (Agentic Generation Pipeline)

به نقل از آموزش منتشرشده در Marktechpost در هفته جاری، AutoFigure به عنوان یک خط لوله هوشمند پردازش اسناد عمل می‌کند. این سیستم صرفاً «رسم نمی‌کند»، بلکه استخراج، رندر و اصلاح را به صورت متوالی انجام می‌دهد. این ابزار برای مدیریت ورودی‌های متنوع طراحی شده است و می‌تواند فایل‌های PDF، گزارش‌های اسکن‌شده، فایل‌های Markdown، جداول یا اسنادی با چیدمان‌های ترکیبی (Mixed-layout) را پردازش کند.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

گردش کار اصلی این سیستم از یک توالی معماری مشخص پیروی می‌کند:

  • نرمال‌سازی اسناد (Document Normalization): در اولین گام، سیستم متن خام، سلسله‌مراتب بخش‌ها، جداول، اشکال و متاداده‌ها را از سند منبع استخراج می‌کند.
  • برنامه‌ریز مسیریابی (Routing Planner): یک مدل زبانی بزرگ (LLM) تصمیم می‌گیرد که هر بخش از سند به چه عملیاتی نیاز دارد؛ برای مثال آیا نیاز به خلاصه‌سازی است، یا استخراج فیلد، بازسازی جدول، تحلیل بصری و یا استناد به منابع (Citation grounding).
  • ماژول‌های خبره تخصصی (Specialized Expert Modules): عامل‌های مجزا وظایف خاص را بر عهده می‌گیرند. برای مثال، «خبره جدول» (Table Expert) جداول را با دقت بازسازی می‌کند، «خبره خلاصه‌ساز» (Summarizer Expert) خلاصه‌های سلسله‌مراتبی ایجاد می‌کند و «خبره بصری» (Visual Expert) نمودارها و دیاگرام‌ها را توصیف می‌کند. همچنین یک «خبره استناد» (Citation Expert) ادعاها را به بخش‌های شواهدی در متن متصل می‌کند و «خبره استخراج» (Extraction Expert) داده‌ها را در قالب فیلدهای JSON برمی‌گرداند.
  • لایه ارکستراسیون (Orchestration Layer): برای مدیریت هزینه‌ها، این لایه به‌طور پویا بین مدل‌های LLM کوچک‌تر یا بزرگ‌تر بر اساس پیچیدگی، میزان اطمینان و بودجه اختصاص یافته به هر تکه (Chunk) از داده‌ها تصمیم می‌گیرد.
  • لایه تایید (Verification Layer): یک بررسی نهایی برای اطمینان از اعتبار شمای داده‌ها (Schema validity)، انطباق با منبع، سازگاری جداول و سطح اطمینان پیش از نهایی کردن تصویر انجام می‌شود.
  • خروجی نهایی: این فرآیند به یک فضای کاری آماده برای تحلیل‌گر ختم می‌شود که شامل خلاصه‌ها، فیلدهای استخراج‌شده، جداول دقیق، پاسخ‌های مستند و گزارش‌های بازرسی (Audit logs) است.

پیاده‌سازی فنی و رندرینگ

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی اتوماسیون گردش‌های کاری اشاره کردیم، کلید موفقیت این سیستم در حلقه بازخورد آن است. AutoFigure برای رسیدن به یک آستانه کیفی مشخص (Quality Score) طراحی شده است که در پیاده‌سازی فعلی، این نمره ۸.۵ در نظر گرفته شده است. اگر تصویر تولیدشده نتواند این آستانه را کسب کند، عامل طراحی را مجدداً تکرار می‌کند. تعداد این تکرارها توسط پارامتر MAX_ITERATIONS کنترل می‌شود.

آشنایی با S1-mini: نرمالایزر متن ۴۶۲ مگابایتی سوپرویسپر که رونویسی‌های خام را به متن تمیز تبدیل می‌کند

این ابزار برای کاربردهای مختلف پژوهشی، سه فرمت خروجی کلیدی ارائه می‌دهد تا در مراحل مختلف تحقیق مفید باشد:

  • SVG: فرمت اصلی برای تصاویر با وضوح بالا و مقیاس‌پذیر که برای چاپ در مقالات ضروری است. سیستم شامل یک بررسی پیش‌نیاز (Preflight check) آفلاین برای تایید سینتکس SVG و رندر کردن PNGها پیش از ارسال درخواست‌های API است.
  • PNG: برای پیش‌نمایش‌های سریع و مستندات داخلی استفاده می‌شود.
  • mxGraph XML: این قابلیت بسیار حیاتی است زیرا اجازه می‌دهد خروجی هوش مصنوعی به ابزار draw.io منتقل شود. بدین ترتیب، نمودار پس از اینکه هوش مصنوعی کارهای سخت را انجام داد، به‌طور کامل توسط انسان قابل ویرایش است. برای فعال‌سازی این مسیر، نصب Chromium از طریق Playwright الزامی است.

برای حفظ یکپارچگی بصری، کاربران می‌توانند «تصاویر مرجع» (Custom reference figures) ارائه دهند. مثلاً اگر پژوهشگر استایلی با ماژول‌های تمیز، سایه‌های ملایم و تایپوگرافی آکادمیک را ترجیح دهد، یک تصویر نمونه بارگذاری می‌کند و عامل هوش مصنوعی آن سبک را تقلید می‌کند. استایل پیش‌فرض سیستم به عنوان «تصویرسازی علمی آماده برای چاپ، همراستاسازی دقیق، سایه‌های ملایم، تایپوگرافی آکادمیک واضح، کنتراست بالا و حداقل شلوغی» تعریف شده است.

تنظیمات محیطی و وابستگی‌ها

راه‌اندازی AutoFigure نیازمند محیطی خاص برای پردازش PDF و رندرینگ است. فرآیند نصب شامل چندین وابستگی سیستمی حیاتی است:

  • بسته‌های سیستمی: نصب libcairo2 ،libpango-1.0-0 ،libpangocairo-1.0-0 ،libgdk-pixbuf-2.0-0 ،libffi-dev و shared-mime-info برای عملیات رندرینگ ضروری است.
  • سازگاری Pillow: برای جلوگیری از تداخلات نسخه‌ها، سیستم به‌طور اجباری نسخه Pillow==11.3.0 را نصب کرده و ماژول‌های بارگذاری‌شده را پاک می‌کند تا اطمینان حاصل شود نسخه صحیح فعال است.
  • یکپارچگی API: این ابزار مستقل از تامین‌کننده (Provider-agnostic) است و از OpenRouter، Google Gemini و Bianxie پشتیبانی می‌کند. برای تولید محتوا از مدل google/gemini-3.1-pro-preview و برای بهبود تصاویر از gemini-3.1-flash-image-preview استفاده می‌کند.

مکانیزم‌های دقیق گردش کار

برای تضمین استانداردهای آکادمیک، مکانیزم‌های داخلی دقیقی برای اعتبارسنجی تعبیه شده است:

  • پیش‌تایید آفلاین (Offline Preflight): سیستم پیش از مصرف اعتبار API، یک تست روی کد SVG نمونه اجرا می‌کند تا از سلامت خط لوله رندرینگ (تبدیل SVG به PNG) مطمئن شود. این تست شامل یک SVG با viewBox ابعاد ۱۳۳۳x۷۵۰ حاوی مستطیل‌ها و فلش‌ها برای تایید تابع code_to_png است.
  • اصلاح تکرارشونده: عامل از یک فایل generation_report.json برای ردیابی تاریخچه تکرارها، نمرات کیفیت و بهبودهای اعمال شده استفاده می‌کند. این امر به کاربر اجازه می‌دهد دقیقاً ببیند تصویر چگونه از پیش‌نویس اول به نسخه نهایی تکامل یافته است.
  • تقلید از مرجع: با ارائه فایل reference_architecture_style.png ،کاربر می‌تواند هوش مصنوعی را هدایت کند تا از نشانه‌های طراحی خاصی مانند ماژول‌های هم‌راستا، برچسب‌های کم و جهت جریان قوی استفاده کند. تصویر مرجع معمولاً شامل یک خط لوله ماژولار با جعبه‌هایی برای ورودی (Input)، برنامه‌ریز (Planner)، خبرگان (Experts) و تاییدکننده (Verifier) است.
  • کنترل چیدمان: سیستم می‌تواند به‌طور صریح دستور بگیرد تا از ابعاد خاصی، مانند چیدمان عریض ۱۶:۹، برای انطباق با بخش متدولوژی یک مقاله پژوهشی استفاده کند.

از مقاله به نمودار

این سیستم شامل یک ماژول MethodologyExtractor است که می‌تواند یک مقاله PDF یا Markdown را خوانده و به‌طور خودکار بخش «متد» (Method) را ایزوله کند. سپس توصیفات متنی یک سیستم — مثلاً یک خط لوله هوش مالی — را به یک جریان بصری تبدیل می‌کند.

برای مثال، در یک مورد تست روی گزارش‌های مالی طولانی، عامل توانست جریانی از «نرمال‌سازی سند» به «برنامه‌ریز مسیریابی» و در نهایت به «فضای کاری تحلیل‌گر» را شناسایی کند. سیستم انتقال از متن انتزاعی به یک چیدمان عریض ۱۶:۹ با جعبه‌های ماژولار و فلش‌های واضح را مدیریت کرد. فرآیند استخراج، یک گراف سند حاوی گره‌های بخش، پاراگراف، جدول، شکل و متاداده را به یک نمایش بصری ساختاریافته تبدیل می‌کند.

در این مثال خاص هوش مالی، خط لوله موارد زیر را پردازش کرد:

  • ورودی‌ها: PDFها، گزارش‌های اسکن‌شده، فایل‌های Markdown و جداول.
  • پردازش خبرگان: خبره خلاصه‌سازی، خلاصه‌های سلسله‌مراتبی تولید کرد، در حالی که خبره استخراج، شمای JSON سخت‌گیرانه‌ای را برای موجودیت‌ها، تاریخ‌ها، ریسک‌ها و معیارهای مالی پر کرد. خبره جدول، جداول را دقیقاً بازسازی و هم‌راستایی سطر و ستون را تایید کرد و خبره بصری، نمودارها را توصیف نمود.
  • اعتبارسنجی: لایه تایید، سازگاری عددی، پشتیبانی استنادی و یکپارچگی جداول را بررسی کرد و موارد ناموفق را برای تعمیر به مراحل قبل بازگرداند.

مدیریت خروجی و اکسپورت

پس از تکمیل تولید، AutoFigure مجموعه‌ای از ابزارها برای سازماندهی دارایی‌ها ارائه می‌دهد:

  • گالری HTML: تابع make_output_gallery یک صفحه HTML مستقل می‌سازد. این گالری تمام PNGها، SVGها و فایل‌های mxGraph XML تولید شده را در یک چیدمان کارت‌محور برای بررسی آسان نمایش می‌دهد و پیش‌نمایشی از generation_report.json را شامل می‌شود.
  • گزارش‌های بازرسی (Audit Logs): سیستم فایل generation_report.json را صادر می‌کند که شامل تاریخچه تکرارها و نمرات کیفیت است و شفافیتی در مورد فرآیند تصمیم‌گیری هوش مصنوعی ایجاد می‌کند.
  • خروجی آرشیوی: تمام خروجی‌ها، شامل گالری و فایل‌های خام، در یک آرشیو zip (مثلاً /content/autofigure_colab_outputs.zip) بسته‌بندی می‌شوند تا انتقال به سیستم محلی یا پورتال‌های ارسال مقاله آسان شود.

تحلیل تحریریه

این چرخش به سمت «نمودار به‌مثابه کد» (Figure-as-Code) از طریق LLMها، رویه بنیادی ارتباطات علمی را تغییر می‌دهد. با جداسازی طراحی مفهومی از فرآیند رسم دستی، پژوهشگران می‌توانند هم‌زمان با تغییر در معماری سیستم خود، نمودارها را به‌روزرسانی کنند.

برای حوزه گسترده‌تر هوش مصنوعی، این یک حرکت به سمت گردش‌های کاری عامل‌محور چندوجهی (Multimodal agentic workflows) است که در آن خروجی تنها متن یا کد نیست، بلکه دارایی‌های بصری ساختاریافته است. گنجاندن فایل‌های قابل ویرایش mxGraph یک جزئیات حیاتی است؛ زیرا اذعان می‌کند که هوش مصنوعی در حال حاضر ابزاری برای «پیش‌نویس اول» است و پلی برای اصلاحات انسانی فراهم می‌کند، به‌جای آنکه تقاضای اعتماد مطلق به خروجی داشته باشد.

برای شروع این گردش کار، کاربران می‌توانند مخزن AutoFigure را از طریق Google Colab مستقر کرده و آن را با تامین‌کنندگانی مانند OpenRouter یا Google Gemini برای تامین منطق تولید متصل کنند. خروجی نهایی را می‌توان در یک گالری HTML سازماندهی کرد یا برای انتشار به صورت یک آرشیو zip صادر نمود.

گام بعدی شما

  • مخزن AutoFigure را از طریق Google Colab مستقر کنید.
  • آن را به APIهای OpenRouter یا Gemini متصل کنید تا منطق تولید فعال شود.
  • یک تصویر مرجع از استایل مورد علاقه خود در مقالات مشابه بارگذاری کنید تا خروجی‌ها با استانداردهای بصری شما هم‌راستا شوند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف گلوگاه‌های دستی در طراحی، سرعت انتشار مقالات علمی را افزایش می‌دهد. تکیه بر استانداردهای SVG و XML نشان‌دهنده تخصص در نیازهای واقعی ناشران آکادمیک است.

تأثیر برای ایران

پژوهشگران و دانشجویان ایرانی که در حال نگارش مقالات ISI هستند، می‌توانند با استفاده از این ابزار و APIهای رایگان یا ارزان Gemini، کیفیت بصری مقالات خود را بدون نیاز به مهارت طراحی ارتقا دهند.

·نگاه ما
تحریریه دات‌هوش

جدا کردن طراحی مفهومی از اجرای بصری، نمودارها را از «اسناد ایستا» به «دارایی‌های پویا» تبدیل می‌کند. نکته کلیدی در اینجا ارائه خروجی mxGraph است؛ این یعنی سازندگان ابزار پذیرفته‌اند که هوش مصنوعی فعلاً برای «پیش‌نویس اول» است و پل ارتباطی برای اصلاح انسانی را حفظ کرده‌اند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.