پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Kumo Tabular انویدیا پیش‌بینی داده‌های جدولی را بدون آموزش ممکن کرد

·۷ مهر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
مدل جدولی Kumo انویدیا برای پیش‌بینی داده‌های جدولی منتشر شد
مدل جدولی Kumo انویدیا برای پیش‌بینی داده‌های جدولی منتشر شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی نخستین مدل بنیادی باز برای داده‌های جدولی که از In-Context Learning برای پیش‌بینی Zero-shot استفاده می‌کند و نیاز به آموزش (Training) را برای تسک‌های جدید حذف می‌کند.

تصور کنید بتوانید یک مجموعه داده پیچیده را به مدل بدهید و بدون صرف هفته‌ها زمان برای پاک‌سازی و آموزش، بلافاصله پیش‌بینی‌های دقیقی دریافت کنید. انویدیا با معرفی Kumo Tabular در ۲۹ سپتامبر ۲۰۲۶، این رویای تحلیلگران داده را به واقعیت تبدیل کرده است. این عرضه، پارادایم پیش‌بینی‌های جدولی را تغییر می‌دهد.

به نقل از مستندات انویدیا، این مدل بنیادی (Foundation Model) برای طبقه‌بندی و رگرسیون داده‌های جدولی، از طریق یک گذر پیشرو (Forward Pass) عمل می‌کند. این یعنی مدل برای پیش‌بینی برچسب‌های ردیف‌های جدید، نیازی به آموزش، تنظیم یا مهندسی ویژگی (Feature Engineering) ندارد. در حالی که پیش‌بینی‌های جدولی سنتی بر چرخه‌های طاقت‌فرسای برچسب‌گذاری دستی و مهندسی ویژگی متکی بودند، Kumo Tabular این نیاز را حذف می‌کند.

برای دو دهه، تسک‌های جدولی در سازمان‌ها تحت سلطه درخت‌های تقویت‌شده با گرادیان (Gradient-Boosted Trees) بوده‌اند. این روش‌های سنتی دانشمندان داده را مجبور می‌کرد تا برای هر مجموعه داده جدید، یک خط لوله (Pipeline) صلب شامل برچسب‌گذاری، تنظیم، اعتبارسنجی و استقرار را تکرار کنند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های بنیادی اشاره کردیم، هدف این است که مدل‌ها از «تخصص در یک تسک» به «درک کلی ساختار» برسند. Kumo Tabular دقیقاً همین کار را می‌کند؛ این مدل الگوی یادگیری در بستر متن (In-Context Learning) را که در مدل‌های زبانی بزرگ رایج است، به جداول ساختاریافته می‌آورد و یک جدول برچسب‌دار را به عنوان زمینه (Context) برای پیش‌بینی مستقیم ردیف‌های جدید می‌بیند.

طبق اعلام انویدیا در Hugging Face، این مدل بخشی از مجموعه مدل‌های ساختاریافته Kumo است. این مدل در سه اندازه مختلف، از ۲۸ میلیون تا ۲۱۵ میلیون پارامتر عرضه شده است. مدل تحت لایسنس OpenMDW 1.1 منتشر شده که اجازه استفاده تجاری را می‌دهد و از طریق کتابخانه متن‌باز structured-data-models اجرا می‌شود. این کتابخانه در اولین استفاده، وزن‌های مدل را دانلود کرده و قابلیت‌های پیش‌پردازش، مجموعه‌سازی (Ensembling) و مدیریت کلاس‌های متعدد را که در ارزیابی‌های انویدیا به کار رفته، فراهم می‌کند. این رویکرد بهینه‌سازی داده‌ها در مقیاس صنعتی، یادآور همکاری انویدیا و پالانتیر برای کاهش اتلاف زنجیره تأمین با مدل‌های نموترون است که در آن نیز مدل‌های پیشرفته برای تحلیل ساختارهای پیچیده به کار گرفته شدند.

معماری فنی

Kumo Tabular یک ترنسفورمر (Transformer) است که اختصاصاً برای ساختارهای جدولی طراحی شده و از مکانیزم‌های توجه (Attention) ستونی، ردیفی و در بستر متن استفاده می‌کند که پیش‌تر در TabICL و TabPFN معرفی شده بودند. این مدل ابتدا معنای هر مقدار را در ستون خود، سپس تعامل ستون‌های یک ردیف و در نهایت رابطه ردیف‌های زمینه با ردیف‌های هدف (Query) که برچسب‌هایشان ناشناخته است را تحلیل می‌کند.

فرآیند پردازش داده‌ها از یک مرحله پیچیده بردار معنایی (Embedding) سلولی عبور می‌کند:

  • مقادیر عددی و دسته‌ای از طریق ویژگی‌های فوریه (Fourier features) و با استفاده از سینوس و کسینوس فرکانس‌های آموخته‌شده تبدیل می‌شوند، به طوری که برای هر نوع داده، وزن‌های جداگانه‌ای در نظر گرفته شده است.
  • مقادیر گم‌شده (Missing values) به‌صورت بومی مدیریت می‌شوند و نیازی به جایگزینی (Imputation) یا پر کردن داده‌ها نیست.
  • هر توکن در زمینه، یک بردار معنایی برچسب (Label embedding) دریافت می‌کند.
  • بردار‌های ردیفی با استفاده از توجه ستونی متناوب (یک نوع self-attention القایی با رشد هزینه خطی) و توجه ردیفی با موقعیت‌های دورانی (Rotary positions) فشرده می‌شوند تا ستون‌ها از هم متمایز شوند.
  • چهار توکن CLS یادگیرنده به هر ردیف اضافه می‌شوند تا به عنوان خروجی نهایی (Readout) عمل کنند.

مکانیزم‌های پیش‌بینی

یک ترنسفورمر نهایی روی بردار‌های ردیفی عمل می‌کند. ردیف‌های زمینه به یکدیگر توجه می‌کنند، اما ردیف‌های هدف (Query) فقط به ردیف‌های زمینه توجه دارند. این ساختار تضمین می‌کند که هر پیش‌بینی صرفاً وابسته به زمینه و خودِ ردیف باشد. برای بهینه‌سازی عملکرد، کلیدها (Keys) و مقادیر (Values) زمینه یک‌بار محاسبه و برای پیش‌بینی‌های بعدی بازاستفاده می‌شوند.

برای حفظ کارایی، مدل از Test-GQA برای کوچک کردن حافظه پنهان (Cache) در هنگام استنتاج استفاده می‌کند. همچنین یک دمای توجه (Attention temperature) وابسته به طول، پرس‌وجوها را بر اساس لگاریتم تعداد کلیدها مقیاس‌بندی می‌کند. این سازوکار از یک ضریب استفاده می‌کند که برای هر «سر» (Head) به‌طور جداگانه آموخته شده است و باعث می‌شود مدل حتی زمانی که جداول استنتاج بسیار طولانی‌تر از جداول آموزش هستند، دقت و تیزبینی خود را حفظ کند. خروجی مدل برای طبقه‌بندی، احتمالات کلاس‌ها و برای رگرسیون، ۹۹۹ چندک (Quantile) را ارائه می‌دهد که هم پیش‌بینی نقطه‌ای و هم تخمین عدم قطعیت را فراهم می‌کند.

موتور داده‌های مصنوعی

برخلاف مدل‌های سنتی که روی مجموعه‌داده‌های ایستا آموزش می‌بینند، Kumo Tabular کاملاً روی داده‌های مصنوعی پیش‌آموزش دیده است. انویدیا از یک مدل علّی ساختاری (Structural Causal Model) برای تولید جداول در ۶ مرحله استفاده کرد. این ژنراتور ابتدا یک پیکربندی برای جدول رسم کرده و متغیرهای پنهان را با یک گراف علّی تصادفی مرتبط می‌کند. این گراف‌ها از ریشه تا برگ با استفاده از توابعی که به‌طور تصادفی انتخاب شده‌اند (شامل نقشه‌های خطی، شبکه‌های عصبی کوچک، درخت‌ها و فرآیندهای گاوسی) ارزیابی می‌شوند.

برخی گره‌ها به ستون‌های عددی یا دسته‌ای تبدیل شده و یکی به عنوان هدف (Target) تعیین می‌شود. بقیه گره‌ها پنهان می‌مانند تا علت‌های اندازه‌گیری‌نشده در داده‌های واقعی شبیه‌سازی شوند. سپس در مرحله پس‌پردازش، گروه‌های ستونی همبسته شده، مقادیر پرت (Outliers) برش داده شده و مقادیر گم‌شده تزریق می‌شوند. در نهایت، یک بررسی مبتنی بر مجموعه درختی (Tree-ensemble check) هر جدولی را که فاقد سیگنال قابل یادگیری باشد، حذف می‌کند.

برای شبیه‌سازی داده‌های «کثیف» دنیای واقعی، نقص‌های خاصی تزریق شده است:

  • گم شدن مقادیر در چندین الگوی متمایز.
  • درشت‌سازی (Coarsening) برخی ویژگی‌ها تا ردیف‌های مشابه بتوانند برچسب‌های متفاوتی داشته باشند.
  • طراحی ستون‌های دسته‌ای به گونه‌ای که سطوح (Levels) بسیار زیادی داشته باشند.
  • هدف‌های رگرسیونی با توزیع دنباله سنگین (Heavy-tailed).

فرآیند آموزش از تابع زیان cross-entropy برای طبقه‌بندی و quantile loss برای رگرسیون استفاده کرد. آموزش در سه مرحله انجام شد: ابتدا جداولی با ۱۰۲۴ ردیف (تا ۱۰۰ ستون)، سپس زمینه‌هایی از ۴۰۰ تا ۱۰,۲۴۰ ردیف، و در نهایت زمینه‌هایی تا ۶۰,۰۰۰ ردیف. نسخه‌های کوچک، متوسط و بزرگ به ترتیب روی تقریباً ۳۵ میلیون، ۷۱ میلیون و ۱۳۷ میلیون جدول مصنوعی آموزش دیده‌اند.

عملکرد در محک‌ها

بر اساس گزارش انویدیا، Kumo Tabular در حال حاضر با امتیاز ELO ۱۹۵۰ در رتبه اول جدول TabArena قرار دارد. در یک ارزیابی یکسان با استفاده از RTX 6000 Pro، این مدل ۲۶ برابر سریع‌تر از LimiX-2 عمل کرد. انویدیا ادعا می‌کند که این سه اندازه، یک استاندارد جدید (State of the art) را در جبهه پارتو (Pareto front) دقت-کارایی ایجاد کرده‌اند.

نتایج تکمیلی عبارتند از:

  • BeyondArena: رتبه اول با ELO ۱۴۱۸ و امتیاز بهبودپذیری (Improvability) ۷.۷۸٪.
  • TALENT: رتبه برتر کلی در دقت طبقه‌بندی، log-loss و RMSE رگرسیون، با رتبه‌های متوسط ۶.۶۷، ۳.۹۸ و ۴.۲۲.
  • ScoringBench: نسخه‌های بزرگ و متوسط در رتبه‌های اول و دوم برای توزیع‌های پیش‌بینی قرار گرفتند.

این تغییر نشان‌دهنده یک چرخش بنیادین در یادگیری ماشین جدولی است؛ گذار از رویکرد «آموزش برای هر تسک» به سمت مدل‌های بنیادی که مهندسی ویژگی را با پنجره‌های زمینه (Context Window) شبیه به پرامپت‌ها جایگزین می‌کنند.

محدودیت‌ها و دسترسی

Kumo Tabular محدودیت‌های خاصی دارد. این مدل تنها از ستون‌های عددی و دسته‌ای پشتیبانی می‌کند؛ متن‌ها، تصاویر یا برچسب‌های زمانی باید ابتدا از طریق دستورالعمل‌های پیش‌پردازش داخلی به ویژگی تبدیل شوند. در یک گذر پیشرو، حداکثر ۱۰ کلاس پشتیبانی می‌شود، هرچند کتابخانه مربوطه این محدودیت را با استفاده از کدهای خروجی تصحیح‌کننده خطا (Error-correcting output codes) برای هر تعداد کلاسی گسترش می‌دهد.

انویدیا هشدار می‌دهد که اگر توزیع ردیف‌های هدف با ردیف‌های زمینه متفاوت باشد یا اگر جداول بسیار فراتر از محدوده‌های آموزش باشند، دقت مدل کاهش می‌یابد. آن‌ها توصیه می‌کنند پیش از استقرار در محیط عملیاتی، دقت و کالیبراسیون مدل روی داده‌های کنار گذاشته شده (Held-out data) اعتبارسنجی شود.

توسعه‌دهندگان می‌توانند از طریق بسته structured-data-models که بومی GPU است و نیازمند Python 3.11+ و PyTorch 2.7+ است، به مدل دسترسی یابند. انویدیا توصیه می‌کند برای عملیات دیتافریم روی GPU از cudf استفاده شود تا داده‌ها در حافظه GPU باقی بمانند. مخزن این پروژه که تحت لایسنس Apache 2.0 است، پیاده‌سازی‌های مرجع TabICLv2، TabFM و مدل رابطه‌ای KumoRelational را نیز میزبانی می‌کند. انویدیا اشاره کرده است که دستورالعمل‌های آموزش و ژنراتورهای داده‌های مصنوعی به‌زودی منتشر خواهند شد.

گام بعدی شما

  • اگر با داده‌های جدولی کار می‌کنید، کتابخانه structured-data-models را نصب کرده و مدل Small را روی یک مجموعه داده کوچک بدون آموزش تست کنید.
  • برای داده‌های با ابعاد بالا، از cudf استفاده کنید تا گلوگاه انتقال داده بین CPU و GPU را حذف کنید.
  • نتایج پیش‌بینی مدل را با یک مدل XGBoost ساده مقایسه کنید تا نقطه بهینه بین سرعت و دقت را برای تسک خود بیابید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با حذف نیاز به آموزش مجدد برای هر جدول، سرعت استقرار مدل‌های پیش‌بینی در سازمان‌ها را از هفته‌ها به میلی‌ثانیه‌ها می‌رساند. اعتبار این ادعا با رتبه اول در TabArena و استفاده از معماری ترنسفورمر به تأیید رسیده است.

تأثیر برای ایران

این مدل به‌دلیل متن‌باز بودن و انتشار در Hugging Face، برای توسعه‌دهندگان ایرانی در دسترس است و می‌تواند هزینه محاسباتی آموزش مدل‌های سنگین جدولی را در استارتاپ‌های داخلی به‌شدت کاهش دهد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مهندسی ویژگی با یادگیری در بستر متن، در واقع «پرامپت‌نویسی برای جداول» است. این رویکرد احتمالاً باعث می‌شود نقش دانشمند داده از یک «سازنده مدل» به یک «مدیر زمینه» تغییر کند که تمرکزش روی انتخاب بهترین نمونه‌های ردیفی برای هدایت مدل است. این یک گام بزرگ به سوی حذف کامل چرخه آموزش-ارزیابی در تحلیل‌های سریع سازمانی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.