تصور کنید پژوهشگری باشید که میتواند پیچیدهترین توصیفات سیستمی را بدون لمس حتی یک ابزار طراحی، به نموداری آماده برای چاپ در ژورنالهای معتبر تبدیل کند. این رویای اتوماسیون اکنون با AutoFigure محقق شده است؛ ابزاری که تولید نمودارهای علمی را مستقیماً از متن، توضیحات متدولوژی یا کل مقالات پژوهشی ممکن میکند.
ترسیم بصری معماریهای هوش مصنوعی سالهاست که به یکی از گلوگاههای دستی در نشر آکادمیک تبدیل شده است. اکثر محققان برای رسیدن به استانداردهای سختگیرانه مجلات، ساعتها وقت خود را در ابزارهایی مثل Lucidchart یا Draw.io صرف همراستاسازی جعبهها و فلشها میکنند. AutoFigure این اصطکاک را با یک راهکار برنامهریزیشده حل میکند و تولید تصویر را بهجای یک دستور تکمرحلهای (Single-shot prompt)، به عنوان یک فرآیند تکرارشونده و عاملمحور (Agentic) تعریف میکند؛ شبیه به یک طراح گرافیک که چندین پیشنویس میزند تا به تایید نهایی مشتری برسد.
خط لوله تولید عاملمحور (Agentic Generation Pipeline)
به نقل از آموزش منتشرشده در Marktechpost در هفته جاری، AutoFigure به عنوان یک خط لوله هوشمند پردازش اسناد عمل میکند. این سیستم صرفاً «رسم نمیکند»، بلکه استخراج، رندر و اصلاح را به صورت متوالی انجام میدهد. این ابزار برای مدیریت ورودیهای متنوع طراحی شده است و میتواند فایلهای PDF، گزارشهای اسکنشده، فایلهای Markdown، جداول یا اسنادی با چیدمانهای ترکیبی (Mixed-layout) را پردازش کند.

گردش کار اصلی این سیستم از یک توالی معماری مشخص پیروی میکند:
- نرمالسازی اسناد (Document Normalization): در اولین گام، سیستم متن خام، سلسلهمراتب بخشها، جداول، اشکال و متادادهها را از سند منبع استخراج میکند.
- برنامهریز مسیریابی (Routing Planner): یک مدل زبانی بزرگ (LLM) تصمیم میگیرد که هر بخش از سند به چه عملیاتی نیاز دارد؛ برای مثال آیا نیاز به خلاصهسازی است، یا استخراج فیلد، بازسازی جدول، تحلیل بصری و یا استناد به منابع (Citation grounding).
- ماژولهای خبره تخصصی (Specialized Expert Modules): عاملهای مجزا وظایف خاص را بر عهده میگیرند. برای مثال، «خبره جدول» (Table Expert) جداول را با دقت بازسازی میکند، «خبره خلاصهساز» (Summarizer Expert) خلاصههای سلسلهمراتبی ایجاد میکند و «خبره بصری» (Visual Expert) نمودارها و دیاگرامها را توصیف میکند. همچنین یک «خبره استناد» (Citation Expert) ادعاها را به بخشهای شواهدی در متن متصل میکند و «خبره استخراج» (Extraction Expert) دادهها را در قالب فیلدهای JSON برمیگرداند.
- لایه ارکستراسیون (Orchestration Layer): برای مدیریت هزینهها، این لایه بهطور پویا بین مدلهای LLM کوچکتر یا بزرگتر بر اساس پیچیدگی، میزان اطمینان و بودجه اختصاص یافته به هر تکه (Chunk) از دادهها تصمیم میگیرد.
- لایه تایید (Verification Layer): یک بررسی نهایی برای اطمینان از اعتبار شمای دادهها (Schema validity)، انطباق با منبع، سازگاری جداول و سطح اطمینان پیش از نهایی کردن تصویر انجام میشود.
- خروجی نهایی: این فرآیند به یک فضای کاری آماده برای تحلیلگر ختم میشود که شامل خلاصهها، فیلدهای استخراجشده، جداول دقیق، پاسخهای مستند و گزارشهای بازرسی (Audit logs) است.
پیادهسازی فنی و رندرینگ
همانطور که در تحلیلهای قبلی ما دربارهی اتوماسیون گردشهای کاری اشاره کردیم، کلید موفقیت این سیستم در حلقه بازخورد آن است. AutoFigure برای رسیدن به یک آستانه کیفی مشخص (Quality Score) طراحی شده است که در پیادهسازی فعلی، این نمره ۸.۵ در نظر گرفته شده است. اگر تصویر تولیدشده نتواند این آستانه را کسب کند، عامل طراحی را مجدداً تکرار میکند. تعداد این تکرارها توسط پارامتر MAX_ITERATIONS کنترل میشود.

این ابزار برای کاربردهای مختلف پژوهشی، سه فرمت خروجی کلیدی ارائه میدهد تا در مراحل مختلف تحقیق مفید باشد:
- SVG: فرمت اصلی برای تصاویر با وضوح بالا و مقیاسپذیر که برای چاپ در مقالات ضروری است. سیستم شامل یک بررسی پیشنیاز (Preflight check) آفلاین برای تایید سینتکس SVG و رندر کردن PNGها پیش از ارسال درخواستهای API است.
- PNG: برای پیشنمایشهای سریع و مستندات داخلی استفاده میشود.
- mxGraph XML: این قابلیت بسیار حیاتی است زیرا اجازه میدهد خروجی هوش مصنوعی به ابزار draw.io منتقل شود. بدین ترتیب، نمودار پس از اینکه هوش مصنوعی کارهای سخت را انجام داد، بهطور کامل توسط انسان قابل ویرایش است. برای فعالسازی این مسیر، نصب Chromium از طریق Playwright الزامی است.
برای حفظ یکپارچگی بصری، کاربران میتوانند «تصاویر مرجع» (Custom reference figures) ارائه دهند. مثلاً اگر پژوهشگر استایلی با ماژولهای تمیز، سایههای ملایم و تایپوگرافی آکادمیک را ترجیح دهد، یک تصویر نمونه بارگذاری میکند و عامل هوش مصنوعی آن سبک را تقلید میکند. استایل پیشفرض سیستم به عنوان «تصویرسازی علمی آماده برای چاپ، همراستاسازی دقیق، سایههای ملایم، تایپوگرافی آکادمیک واضح، کنتراست بالا و حداقل شلوغی» تعریف شده است.
تنظیمات محیطی و وابستگیها
راهاندازی AutoFigure نیازمند محیطی خاص برای پردازش PDF و رندرینگ است. فرآیند نصب شامل چندین وابستگی سیستمی حیاتی است:
- بستههای سیستمی: نصب
libcairo2،libpango-1.0-0،libpangocairo-1.0-0،libgdk-pixbuf-2.0-0،libffi-devوshared-mime-infoبرای عملیات رندرینگ ضروری است. - سازگاری Pillow: برای جلوگیری از تداخلات نسخهها، سیستم بهطور اجباری نسخه
Pillow==11.3.0را نصب کرده و ماژولهای بارگذاریشده را پاک میکند تا اطمینان حاصل شود نسخه صحیح فعال است. - یکپارچگی API: این ابزار مستقل از تامینکننده (Provider-agnostic) است و از OpenRouter، Google Gemini و Bianxie پشتیبانی میکند. برای تولید محتوا از مدل
google/gemini-3.1-pro-previewو برای بهبود تصاویر ازgemini-3.1-flash-image-previewاستفاده میکند.
مکانیزمهای دقیق گردش کار
برای تضمین استانداردهای آکادمیک، مکانیزمهای داخلی دقیقی برای اعتبارسنجی تعبیه شده است:
- پیشتایید آفلاین (Offline Preflight): سیستم پیش از مصرف اعتبار API، یک تست روی کد SVG نمونه اجرا میکند تا از سلامت خط لوله رندرینگ (تبدیل SVG به PNG) مطمئن شود. این تست شامل یک SVG با viewBox ابعاد ۱۳۳۳x۷۵۰ حاوی مستطیلها و فلشها برای تایید تابع
code_to_pngاست. - اصلاح تکرارشونده: عامل از یک فایل
generation_report.jsonبرای ردیابی تاریخچه تکرارها، نمرات کیفیت و بهبودهای اعمال شده استفاده میکند. این امر به کاربر اجازه میدهد دقیقاً ببیند تصویر چگونه از پیشنویس اول به نسخه نهایی تکامل یافته است. - تقلید از مرجع: با ارائه فایل
reference_architecture_style.png،کاربر میتواند هوش مصنوعی را هدایت کند تا از نشانههای طراحی خاصی مانند ماژولهای همراستا، برچسبهای کم و جهت جریان قوی استفاده کند. تصویر مرجع معمولاً شامل یک خط لوله ماژولار با جعبههایی برای ورودی (Input)، برنامهریز (Planner)، خبرگان (Experts) و تاییدکننده (Verifier) است. - کنترل چیدمان: سیستم میتواند بهطور صریح دستور بگیرد تا از ابعاد خاصی، مانند چیدمان عریض ۱۶:۹، برای انطباق با بخش متدولوژی یک مقاله پژوهشی استفاده کند.
از مقاله به نمودار
این سیستم شامل یک ماژول MethodologyExtractor است که میتواند یک مقاله PDF یا Markdown را خوانده و بهطور خودکار بخش «متد» (Method) را ایزوله کند. سپس توصیفات متنی یک سیستم — مثلاً یک خط لوله هوش مالی — را به یک جریان بصری تبدیل میکند.
برای مثال، در یک مورد تست روی گزارشهای مالی طولانی، عامل توانست جریانی از «نرمالسازی سند» به «برنامهریز مسیریابی» و در نهایت به «فضای کاری تحلیلگر» را شناسایی کند. سیستم انتقال از متن انتزاعی به یک چیدمان عریض ۱۶:۹ با جعبههای ماژولار و فلشهای واضح را مدیریت کرد. فرآیند استخراج، یک گراف سند حاوی گرههای بخش، پاراگراف، جدول، شکل و متاداده را به یک نمایش بصری ساختاریافته تبدیل میکند.
در این مثال خاص هوش مالی، خط لوله موارد زیر را پردازش کرد:
- ورودیها: PDFها، گزارشهای اسکنشده، فایلهای Markdown و جداول.
- پردازش خبرگان: خبره خلاصهسازی، خلاصههای سلسلهمراتبی تولید کرد، در حالی که خبره استخراج، شمای JSON سختگیرانهای را برای موجودیتها، تاریخها، ریسکها و معیارهای مالی پر کرد. خبره جدول، جداول را دقیقاً بازسازی و همراستایی سطر و ستون را تایید کرد و خبره بصری، نمودارها را توصیف نمود.
- اعتبارسنجی: لایه تایید، سازگاری عددی، پشتیبانی استنادی و یکپارچگی جداول را بررسی کرد و موارد ناموفق را برای تعمیر به مراحل قبل بازگرداند.
مدیریت خروجی و اکسپورت
پس از تکمیل تولید، AutoFigure مجموعهای از ابزارها برای سازماندهی داراییها ارائه میدهد:
- گالری HTML: تابع
make_output_galleryیک صفحه HTML مستقل میسازد. این گالری تمام PNGها، SVGها و فایلهای mxGraph XML تولید شده را در یک چیدمان کارتمحور برای بررسی آسان نمایش میدهد و پیشنمایشی ازgeneration_report.jsonرا شامل میشود. - گزارشهای بازرسی (Audit Logs): سیستم فایل
generation_report.jsonرا صادر میکند که شامل تاریخچه تکرارها و نمرات کیفیت است و شفافیتی در مورد فرآیند تصمیمگیری هوش مصنوعی ایجاد میکند. - خروجی آرشیوی: تمام خروجیها، شامل گالری و فایلهای خام، در یک آرشیو zip (مثلاً
/content/autofigure_colab_outputs.zip) بستهبندی میشوند تا انتقال به سیستم محلی یا پورتالهای ارسال مقاله آسان شود.
تحلیل تحریریه
این چرخش به سمت «نمودار بهمثابه کد» (Figure-as-Code) از طریق LLMها، رویه بنیادی ارتباطات علمی را تغییر میدهد. با جداسازی طراحی مفهومی از فرآیند رسم دستی، پژوهشگران میتوانند همزمان با تغییر در معماری سیستم خود، نمودارها را بهروزرسانی کنند.
برای حوزه گستردهتر هوش مصنوعی، این یک حرکت به سمت گردشهای کاری عاملمحور چندوجهی (Multimodal agentic workflows) است که در آن خروجی تنها متن یا کد نیست، بلکه داراییهای بصری ساختاریافته است. گنجاندن فایلهای قابل ویرایش mxGraph یک جزئیات حیاتی است؛ زیرا اذعان میکند که هوش مصنوعی در حال حاضر ابزاری برای «پیشنویس اول» است و پلی برای اصلاحات انسانی فراهم میکند، بهجای آنکه تقاضای اعتماد مطلق به خروجی داشته باشد.
برای شروع این گردش کار، کاربران میتوانند مخزن AutoFigure را از طریق Google Colab مستقر کرده و آن را با تامینکنندگانی مانند OpenRouter یا Google Gemini برای تامین منطق تولید متصل کنند. خروجی نهایی را میتوان در یک گالری HTML سازماندهی کرد یا برای انتشار به صورت یک آرشیو zip صادر نمود.
گام بعدی شما
- مخزن AutoFigure را از طریق Google Colab مستقر کنید.
- آن را به APIهای OpenRouter یا Gemini متصل کنید تا منطق تولید فعال شود.
- یک تصویر مرجع از استایل مورد علاقه خود در مقالات مشابه بارگذاری کنید تا خروجیها با استانداردهای بصری شما همراستا شوند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو