پرش به محتوای اصلی
پرش به محتوای مقاله

ADA تحلیل داده‌ها را بدون ارسال ردیف‌های خام به مدل‌های هوش مصنوعی خودکار کرد

·۲۸ تیر ۱۴۰۵۷ دقیقه مطالعه
تلاش برای خودکارسازی تحلیلگر داده: پروژه‌ای که فرآیندهای تحلیل داده را با هوش مصنوعی ساده می‌کند.
تلاش برای خودکارسازی تحلیلگر داده: پروژه‌ای که فرآیندهای تحلیل داده را با هوش مصنوعی ساده می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جداکردن کامل لایه استنتاج ریاضی از لایه تفسیر زبانی در یک ابزار متن‌باز؛ به گونه‌ای که مدل AI هرگز به ردیف‌های داده دسترسی ندارد و فقط ساختار ستون‌ها را می‌بیند.

اگر مدیر یک کسب‌وکار هستید و هر بار برای تحلیل یک فایل اکسل باید ساعت‌ها با ابزارهای پیچیده BI کلنج بروید، ADA دقیقاً برای پایان دادن به این وضعیت ساخته شده است. این ابزار اجازه می‌دهد یک کاربر تازه‌کار، بدون هیچ پیش‌زمینه فنی، یک جدول داده را آپلود کند و فوراً بفهمد در قلب بیزنس او چه می‌گذرد.

ADA (تحلیل‌گر داده‌های خودکار) که در ۱۸ ژوئیه ۲۰۲۶ منتشر شد، برخلاف اکثر ابزارهای تحلیل داده که مانند «جعبه‌های سیاه» عمل می‌کنند، محاسبات را قطعی (Deterministic) و قابل ردیابی نگه می‌دارد. طبق مستندات این پروژه، هدف اصلی این است که کاربر بدون پیکربندی حتی یک ابزار تحلیل داده (BI)، بتواند یک صفحه گسترده خام را آپلود کرده و یک گزارش اجرایی کامل دریافت کند.

بسیاری از ابزارهای فعلی که با قدرت هوش مصنوعی ادعا می‌کنند، در واقع صرفاً یک رابط ساده (Wrapper) برای چت‌بات‌ها هستند که داده‌های شما را به مدل می‌فرستند و در پاسخ، متنی می‌سازند که «به نظر درست می‌رسد». این رویکرد اغلب منجر به توهم (Hallucination) — یعنی وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد — و همچنین نشت‌های شدید حریم خصوصی می‌شود. ADA مسیری متفاوت را برگزیده است: این ابزار تفسیرهای سطح بالا را از اجرای ریاضیاتی جدا می‌کند تا دقت تضمین شود. این رویکرد دقیقاً مشابه تلاشاتی است که برای تبدیل زبان طبیعی به استراتژی‌های معاملاتی دقیق در ابزارهایی مانند Vibe-Trading صورت گرفته تا از خطاهای احتمالی مدل‌های زبانی کاسته شود.

تلاش برای خودکارسازی تحلیلگر داده: پروژه‌ای که فرآیندهای تحلیل داده را با هوش مصنوعی ساده می‌کند.

زمینه: رویکردی نو در تحلیل کسب‌وکار (BI)

ابزارهای سنتی BI معمولاً به هفته‌ها زمان برای مدل‌سازی داده‌ها و ساخت دستی نمودارها نیاز دارند. در مقابل، بسیاری از ابزارهای مدرن «چت با CSV» پاسخ‌ها را به‌صورت متنی ارائه می‌دهند، در حالی که منطق استدلال در آن‌ها پنهان است و ردیف‌های خام داده‌ها مستقیماً به مدل ارسال می‌شود. ADA برای یک مورد کاربردی ساده طراحی شده است که نرم‌افزارهای تحلیل داده معمولاً آن را دشوار می‌کنند: یک کاربر برای اولین بار باید بتواند یک فایل اکسل را آپلود کند و بلافاصله متوجه شود در کسب‌وکار او چه اتفاقی در حال رخ دادن است. این سطح از اتوماسیون در تحلیل داده‌ها می‌تواند به طور مستقیم بر مقیاس‌پذیری و افزایش بازگشت سرمایه در استارتاپ‌های SaaS تاثیرگذار باشد.

برای تضمین یک مرز سختگیرانه در اعتماد و امنیت، ADA در چهار لایه متمایز عمل می‌کند:

  • لایه محاسبات (Calculation): این لایه روندها، محرک‌ها (Drivers)، ناهنجاری‌ها، تمرکز داده‌ها، روابط، استثنائات و کیفیت داده‌ها را شناسایی می‌کند. این لایه کاملاً قطعی و قابل ردیابی است.
  • لایه گفتگو (Conversation): این بخش سوالات به زبان انگلیسی ساده را به برنامه‌های پرس‌وجوی پانداس (pandas) تبدیل می‌کند که به‌صورت محلی اجرا می‌شوند. هر پاسخ حتماً محاسبات ریاضی خود را نمایش می‌دهد.
  • لایه تفسیر (Interpretation): این لایه محاسبات را به بررسی‌های اولویت‌بندی شده تبدیل می‌کند. این موارد به‌وضوح برچسب‌گذاری شده‌اند و هرگز به‌عنوان «اثبات علی و معلولی» ارائه نمی‌شوند.
  • لایه هوش مصنوعی اختیاری (Optional AI): این یک لایه انتخابی است که پرس‌وجوهایی را برنامه‌ریزی می‌کند که قوانین قطعی قادر به خواندن آن‌ها نیستند و خوانش‌های استراتژیک را روی شواهد محاسبه‌شده می‌نویسد. نکته حیاتی این است که ردیف‌های خام آپلود شده هرگز به مدل ارسال نمی‌شوند.

مقایسه با ابزارهای سنتی

در مقایسه با راهکارهای موجود، ADA تمرکز را از مدل‌سازی داده به «شواهد فوری» تغییر می‌دهد. در حالی که BI سنتی نیازمند هفته‌ها تنظیمات است و تنها پس از ساخت دستی نمودارها پاسخ‌های دقیق می‌دهد، ADA اجازه می‌دهد کاربر تنها با «آپلود کردن» وارد تحلیل شود. برخلاف ابزارهای AI معمولی که متون پذیرفتنی با استدلال‌های پنهان ارائه می‌دهند، ADA محاسبات قطعی را همراه با نمایش فرمول‌ها ارائه می‌کند.

به‌طور خاص، نحوه مدیریت داده‌ها متفاوت است: در حالی که بسیاری از فروشندگان ردیف‌های داده را به مدل می‌فرستند، ADA هرگز چنین نمی‌کند. هوش مصنوعی اختیاری تنها «طرح داده‌ها» (Schema) و شواهد استخراج شده را می‌بیند. علاوه بر این، شناسایی ناهنجاری‌ها و پیش‌بینی‌ها که در ابزارهای دیگر اغلب به‌عنوان افزونه‌های پولی یا درخواست‌های غیرقابل‌تأیید ارائه می‌شوند، در ADA به‌صورت داخلی تعبیه شده‌اند و دارای خطای بازپیمایش‌شده‌ای (Backtested Error) هستند که کاربر می‌تواند آن را بخواند.

معماری محلی-محور (Local-First)

هسته مرکزی این سیستم با استریم‌لیت (Streamlit) و پانداس (pandas) ساخته شده و اجازه می‌دهد ابزار کاملاً بدون نیاز به کلید API کار کند. وقتی کاربر یک فایل CSV (با جداکننده کاما، نقطه-کاما یا تب)، XLSX یا XLSM آپلود می‌کند، ADA به‌طور خودکار موارد زیر را شناسایی و تشخیص می‌دهد:

  • یک خروجی اصلی (مانند درآمد، فروش، سود، هزینه، مبلغ یا تعداد واحدها).
  • یک فیلد زمانی برای بررسی تغییرات دوره‌ای، تشخیص ناهنجاری و پیش‌بینی خط مبنا.
  • یک قطعه‌بندی (Segment) مفید (مانند محصول، دسته‌بندی، کانال، منطقه، مشتری یا وضعیت).
  • شناسه‌ها، داده‌های گم‌شده، داده‌های پرت (Outliers)، تمرکز داده‌ها و روابط عددی.

تلاش برای خودکارسازی تحلیلگر داده: پروژه‌ای که فرآیندهای تحلیل داده را با هوش مصنوعی ساده می‌کند.

اگر طرح داده‌های منبع غیرمعمول باشد، کاربران می‌توانند بدون نیاز به بازسازی داشبورد، متریک، تاریخ و قطعه‌بندی شناسایی شده را دستی تغییر دهند. این قابلیت به کاربر اجازه می‌دهد کل تحلیل را روی یک برش (Slice) خاص از قطعه‌بندی متمرکز کند.

برای کسانی که لایه‌ی AI را از طریق کلید API OpenAI فعال می‌کنند، ADA از مجموعه محدودی از فراخوانی‌های مدل استفاده می‌کند که هم دارای «تایپ» (Typed) هستند و هم روی همان موتور محلی اجرا می‌شوند. برنامه‌ریز پرس‌وجو (Query Planner) تنها زمانی فعال می‌شود که پارسر قطعی نتواند سوال را بفهمد. این برنامه‌ریز فقط طرح ستون‌ها (نام‌ها، انواع و نقش‌ها) و خودِ سوال را دریافت کرده و یک QueryPlan تایپ شده صادر می‌کند. طرح‌های غیرقابل‌حل به‌جای حدس زدن، رد می‌شوند و پاسخ‌های برنامه‌ریزی شده توسط AI به‌وضوح دارای یک نشان (Badge) خاص هستند.

جزئیات محصول و قابلیت‌ها

ADA قابلیت‌های داخلی متعددی را ارائه می‌دهد که معمولاً نیازمند اشتراک‌های گران‌قیممت BI هستند:

تحلیل و پیش‌بینی

  • رادار ناهنجاری: دوره‌هایی که خارج از باند خط روند قوی هستند، روی نمودار، در دفترچه شواهد و در اقدامات پیشنهادی علامت‌گذاری می‌شوند.
  • پیش‌بینی خط مبنای محافظت‌شده: این بخش شامل فصلی بودن ماه-در-سال، یک باند عدم قطعیت و خطای بازپیمایش‌شده است که در کنار نمودار چاپ می‌شود.
  • آبشار تغییرات (Movement Waterfall): آخرین تغییرات را بر اساس قطعه‌بندی تطبیق می‌دهد و شامل یک نقشه حرارتی (Heatmap) از شدت تغییرات در هر دوره است.
  • تمرکز روی جزئیات (Drill-down Focus): امکان تحلیل یک مقدار خاص از قطعه‌بندی و گروه‌بندی خودکار کل داشبورد بر اساس بُعد مفید بعدی.

تعامل و گزارش‌دهی

  • قابلیت Ask ADA: یک رابط زبان طبیعی برای استخراج مجموع‌ها، رتبه‌بندی‌ها، تفکیک‌ها، روندها، رشد، شمارش‌ها و فیلترهای زمانی/قطعه‌بندی. پاسخ‌ها به‌صورت محلی پردازش شده و محاسبات نمایش داده می‌شوند.
  • پاک‌سازی خودکار: انجام پاک‌سازی محافظه‌کارانه، استنتاج نوع داده و حذف موارد تکراری، که همگی توسط یک گزارش بازرسی (Audit) قابل مشاهده پشتیبانی می‌شوند.
  • خروجی‌های مدیریتی: ارائه یک تیتر اجرایی، چهار KPI کلیدی بیزنسی و یک گزارش توجیهی به زبان ساده. کاربران همچنین می‌توانند گزارش اجرایی را به‌صورت Markdown و فایل CSV پاک‌سازی شده را دانلود کنند.
  • دفترچه شواهد (Evidence Ledger): هر سیگنال نمایش داده شده توسط یک دفترچه پشتیبانی می‌شود که شامل محاسبه دقیق مورد استفاده برای استخراج آن سیگنال است.
  • انتخاب کاربرگ (Worksheet Picker): پشتیبانی از کتاب‌های کاری اکسل با چندین برگه، که به کاربران اجازه می‌دهد برگه‌های خاصی را برای تحلیل انتخاب کنند.

تلاش برای خودکارسازی تحلیلگر داده: پروژه‌ای که فرآیندهای تحلیل داده را با هوش مصنوعی ساده می‌کند.

طراحی فنی و حریم خصوصی

کدبیس به ماژول‌های تخصصی تقسیم شده تا موتور بیزنس بدون نیاز به Streamlit یا دسترسی به شبکه قابل تست باشد:

  • app.py: ارکستراسیون و مدیریت وضعیت نشست (Session State).
  • pipeline.py: آماده‌سازی، پاک‌سازی و عملیات Drill-down.
  • analysis.py: پاک‌سازی محافظه‌کارانه و پروفایل‌بندی داده‌ها.
  • business_insights.py: تشخیص طرح (Schema)، محاسبات و توصیه‌های قطعی.
  • nlq.py: تبدیل سوالات زبان طبیعی به طرح‌های پرس‌وجوی قابل حسابرسی.
  • anomalies.py و forecasting.py: تشخیص خط روند و پیش‌بینی فصلی.
  • ai_insights.py: برنامه‌ریزی و ترکیب پاسخ‌های API تایپ شده.
  • ui.py و file_io.py: اجزای نمایش و پارسینگ اعتبارسنجی شده (شامل انتخاب کاربرگ برای اکسل‌های چندبرگی).

برای جلوگیری از توهم، ADA از طرح‌های پایدانتیک (Pydantic) برای تمام پاسخ‌های AI استفاده می‌کند. ذخیره‌سازی داده‌ها برای هر درخواست غیرفعال است و از یک شناسه نشست ناشناس و هش‌شده برای کنترل‌های امنیتی استفاده می‌شود. برای خوانش‌های استراتیک پیچیده، ابزار از مدل‌های gpt-5.6-luna (استدلال پایین برای بهره‌وری) یا gpt-5.6-terra (استدلال متوسط برای تصمیمات مبهم) پشتیبانی می‌کند. این فراخوانی‌ها با دکمه فعال شده و برای هر بسته شواهد کش (Cache) می‌شوند تا از هزینه‌های تصادفی جلوگیری شود.

استقرار و دسترسی

این معماری فرض بنیادین مبنی بر اینکه «تحلیل داده با AI نیازمند فدا کردن حریم خصوصی است» را تغییر می‌دهد. با تبدیل مدل زبانی بزرگ (LLM) به یک مترجم برای طرح‌های پرس‌وجو به‌جای یک ماشین حساب، ADA تضمین می‌کند که ریاضیات تحلیل‌ها، فارغ از مدل مورد استفاده، معتبر باقی بماند. هر کارت شواهد و هر پاسخ چت، محاسبات خود را افشا می‌کند و نیاز به چک کردن دستی توسط انسان در یک اکسل جداگانه را از بین می‌برد.

اپراتورهای علاقه‌مند می‌توانند این ابزار را با کلون کردن مخزن گیت‌هاب و اجرای آن در یک محیط مجازی پایتون به‌صورت محلی استقرار کنند. این رویکرد استقرار محلی با استفاده از گیت‌هاب به‌عنوان فضای عملیاتی برای مهار هرج‌ومرج Vibe Coding هم‌سویی دارد تا کنترل دقیق‌تری روی کد و خروجی‌ها داشته باشند. مراحل اجرا:

  1. git clone https://github.com/saineshnakra/automated-data-analyst.git
  2. cd automated-data-analyst
  3. python -m venv .venv
  4. source .venv/bin/activate (یا .venv\Scripts\activate در ویندوز)
  5. python -m pip install -r requirements.txt
  6. streamlit run app.py

برای استفاده‌های پایه هیچ کلید سری (Secret) مورد نیاز نیست. بازدیدکنندگان می‌توانند کلید API خود را در نوار کناری (که فقط در طول نشست فعال است) وارد کنند، یا در استقرار‌های خصوصی، مقدار OPENAI_API_KEY را در فایل .streamlit/secrets.toml قرار دهند. برای جلوگیری از هزینه‌های غیرمجاز در استقرار‌های عمومی، توصیه می‌شود احراز هویت و کنترل‌های هزینه اضافه شود. GitHub Actions عملیات یکپارچه‌سازی مستمر (CI) را بر عهده دارد و با هر Push، بررسی‌های Linting توسط Ruff و مجموعه کامل تست‌ها را اجرا می‌کند.

این پروژه تحت لایسنس MIT منتشر شده و برای استفاده تجاری آزاد است. مشارکت‌ها برای متریک‌های قطعی جدید، الگوهای سوال برای Ask ADA، نمونه‌های تشخیص طرح (Schema-detection fixtures) و مجموعه‌داده‌های تست متخاصم (Adversarial) پذیرفته می‌شود. هر توصیه جدید ارسالی باید شامل یک تست و محاسبه‌ای باشد که آن را پشتیبانی می‌کند.

گام بعدی شما

  • اگر با داده‌های حساس سازمانی سروکار دارید، ADA را به‌صورت محلی (Local) نصب کنید تا داده‌ها هرگز از سیستم شما خارج نشوند.
  • سعی کنید یک فایل اکسل با ساختار پیچیده را آپلود کرده و خروجی «دفترچه شواهد» را با محاسبات دستی خود مقایسه کنید.
  • برای کاهش هزینه‌ها، در تنظیمات از مدل luna برای پرس‌وجوهای ساده استفاده کنید.

اما تأثیر این رویکرد بر آینده ابزارهای تحلیل داده در مقیاس سازمانی حتی عمیق‌تر است؛ در بررسی ما درباره استقرار مدل‌های محلی در محیط‌های Enterprise بخوانید.

چرا این موضوع مهم است؟

این ابزار با حذف ارسال داده‌های خام به ابر، استاندارد جدیدی برای حریم خصوصی در تحلیل داده‌های تجاری ایجاد می‌کند. اعتبار این سیستم از این می‌آید که هر ادعای تحلیلی با یک فرمول ریاضی قابل‌اثبات پشتیبانی می‌شود، نه یک پاسخ احتمالی.

تأثیر برای ایران

به‌دلیل متن‌باز بودن و قابلیت استقرار محلی (Local Deployment)، توسعه‌دهندگان ایرانی می‌توانند بدون نگرانی از تحریم‌های API یا نشت داده‌های حساس سازمانی، از این ابزار برای تحلیل‌های بیزینسی استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

ADA با تغییر نقش LLM از «محاسبه‌گر» به «مترجم»، نقطه ضعف تاریخی مدل‌های زبانی در ریاضیات را دور می‌زند. این رویکرد نشان می‌دهد که آینده تحلیل داده نه در مدل‌های بزرگ‌تر، بلکه در لایه‌های میانی است که مدل را به ابزارهای قطعی (مانند pandas) متصل می‌کنند. در واقع، اعتماد به AI در تحلیل داده تنها زمانی ممکن است که مدل اجازه حدس زدن نداشته باشد و مجبور به ارائه کد قابل-اجرا باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.