تصور کنید بتوانید یک مجموعه داده پیچیده را به مدل بدهید و بدون صرف هفتهها زمان برای پاکسازی و آموزش، بلافاصله پیشبینیهای دقیقی دریافت کنید. انویدیا با معرفی Kumo Tabular در ۲۹ سپتامبر ۲۰۲۶، این رویای تحلیلگران داده را به واقعیت تبدیل کرده است. این عرضه، پارادایم پیشبینیهای جدولی را تغییر میدهد.
به نقل از مستندات انویدیا، این مدل بنیادی (Foundation Model) برای طبقهبندی و رگرسیون دادههای جدولی، از طریق یک گذر پیشرو (Forward Pass) عمل میکند. این یعنی مدل برای پیشبینی برچسبهای ردیفهای جدید، نیازی به آموزش، تنظیم یا مهندسی ویژگی (Feature Engineering) ندارد. در حالی که پیشبینیهای جدولی سنتی بر چرخههای طاقتفرسای برچسبگذاری دستی و مهندسی ویژگی متکی بودند، Kumo Tabular این نیاز را حذف میکند.
برای دو دهه، تسکهای جدولی در سازمانها تحت سلطه درختهای تقویتشده با گرادیان (Gradient-Boosted Trees) بودهاند. این روشهای سنتی دانشمندان داده را مجبور میکرد تا برای هر مجموعه داده جدید، یک خط لوله (Pipeline) صلب شامل برچسبگذاری، تنظیم، اعتبارسنجی و استقرار را تکرار کنند. همانطور که در تحلیلهای پیشین ما دربارهی مدلهای بنیادی اشاره کردیم، هدف این است که مدلها از «تخصص در یک تسک» به «درک کلی ساختار» برسند. Kumo Tabular دقیقاً همین کار را میکند؛ این مدل الگوی یادگیری در بستر متن (In-Context Learning) را که در مدلهای زبانی بزرگ رایج است، به جداول ساختاریافته میآورد و یک جدول برچسبدار را به عنوان زمینه (Context) برای پیشبینی مستقیم ردیفهای جدید میبیند.
طبق اعلام انویدیا در Hugging Face، این مدل بخشی از مجموعه مدلهای ساختاریافته Kumo است. این مدل در سه اندازه مختلف، از ۲۸ میلیون تا ۲۱۵ میلیون پارامتر عرضه شده است. مدل تحت لایسنس OpenMDW 1.1 منتشر شده که اجازه استفاده تجاری را میدهد و از طریق کتابخانه متنباز structured-data-models اجرا میشود. این کتابخانه در اولین استفاده، وزنهای مدل را دانلود کرده و قابلیتهای پیشپردازش، مجموعهسازی (Ensembling) و مدیریت کلاسهای متعدد را که در ارزیابیهای انویدیا به کار رفته، فراهم میکند. این رویکرد بهینهسازی دادهها در مقیاس صنعتی، یادآور همکاری انویدیا و پالانتیر برای کاهش اتلاف زنجیره تأمین با مدلهای نموترون است که در آن نیز مدلهای پیشرفته برای تحلیل ساختارهای پیچیده به کار گرفته شدند.
معماری فنی
Kumo Tabular یک ترنسفورمر (Transformer) است که اختصاصاً برای ساختارهای جدولی طراحی شده و از مکانیزمهای توجه (Attention) ستونی، ردیفی و در بستر متن استفاده میکند که پیشتر در TabICL و TabPFN معرفی شده بودند. این مدل ابتدا معنای هر مقدار را در ستون خود، سپس تعامل ستونهای یک ردیف و در نهایت رابطه ردیفهای زمینه با ردیفهای هدف (Query) که برچسبهایشان ناشناخته است را تحلیل میکند.
فرآیند پردازش دادهها از یک مرحله پیچیده بردار معنایی (Embedding) سلولی عبور میکند:
- مقادیر عددی و دستهای از طریق ویژگیهای فوریه (Fourier features) و با استفاده از سینوس و کسینوس فرکانسهای آموختهشده تبدیل میشوند، به طوری که برای هر نوع داده، وزنهای جداگانهای در نظر گرفته شده است.
- مقادیر گمشده (Missing values) بهصورت بومی مدیریت میشوند و نیازی به جایگزینی (Imputation) یا پر کردن دادهها نیست.
- هر توکن در زمینه، یک بردار معنایی برچسب (Label embedding) دریافت میکند.
- بردارهای ردیفی با استفاده از توجه ستونی متناوب (یک نوع self-attention القایی با رشد هزینه خطی) و توجه ردیفی با موقعیتهای دورانی (Rotary positions) فشرده میشوند تا ستونها از هم متمایز شوند.
- چهار توکن CLS یادگیرنده به هر ردیف اضافه میشوند تا به عنوان خروجی نهایی (Readout) عمل کنند.
مکانیزمهای پیشبینی
یک ترنسفورمر نهایی روی بردارهای ردیفی عمل میکند. ردیفهای زمینه به یکدیگر توجه میکنند، اما ردیفهای هدف (Query) فقط به ردیفهای زمینه توجه دارند. این ساختار تضمین میکند که هر پیشبینی صرفاً وابسته به زمینه و خودِ ردیف باشد. برای بهینهسازی عملکرد، کلیدها (Keys) و مقادیر (Values) زمینه یکبار محاسبه و برای پیشبینیهای بعدی بازاستفاده میشوند.
برای حفظ کارایی، مدل از Test-GQA برای کوچک کردن حافظه پنهان (Cache) در هنگام استنتاج استفاده میکند. همچنین یک دمای توجه (Attention temperature) وابسته به طول، پرسوجوها را بر اساس لگاریتم تعداد کلیدها مقیاسبندی میکند. این سازوکار از یک ضریب استفاده میکند که برای هر «سر» (Head) بهطور جداگانه آموخته شده است و باعث میشود مدل حتی زمانی که جداول استنتاج بسیار طولانیتر از جداول آموزش هستند، دقت و تیزبینی خود را حفظ کند. خروجی مدل برای طبقهبندی، احتمالات کلاسها و برای رگرسیون، ۹۹۹ چندک (Quantile) را ارائه میدهد که هم پیشبینی نقطهای و هم تخمین عدم قطعیت را فراهم میکند.
موتور دادههای مصنوعی
برخلاف مدلهای سنتی که روی مجموعهدادههای ایستا آموزش میبینند، Kumo Tabular کاملاً روی دادههای مصنوعی پیشآموزش دیده است. انویدیا از یک مدل علّی ساختاری (Structural Causal Model) برای تولید جداول در ۶ مرحله استفاده کرد. این ژنراتور ابتدا یک پیکربندی برای جدول رسم کرده و متغیرهای پنهان را با یک گراف علّی تصادفی مرتبط میکند. این گرافها از ریشه تا برگ با استفاده از توابعی که بهطور تصادفی انتخاب شدهاند (شامل نقشههای خطی، شبکههای عصبی کوچک، درختها و فرآیندهای گاوسی) ارزیابی میشوند.
برخی گرهها به ستونهای عددی یا دستهای تبدیل شده و یکی به عنوان هدف (Target) تعیین میشود. بقیه گرهها پنهان میمانند تا علتهای اندازهگیرینشده در دادههای واقعی شبیهسازی شوند. سپس در مرحله پسپردازش، گروههای ستونی همبسته شده، مقادیر پرت (Outliers) برش داده شده و مقادیر گمشده تزریق میشوند. در نهایت، یک بررسی مبتنی بر مجموعه درختی (Tree-ensemble check) هر جدولی را که فاقد سیگنال قابل یادگیری باشد، حذف میکند.
برای شبیهسازی دادههای «کثیف» دنیای واقعی، نقصهای خاصی تزریق شده است:
- گم شدن مقادیر در چندین الگوی متمایز.
- درشتسازی (Coarsening) برخی ویژگیها تا ردیفهای مشابه بتوانند برچسبهای متفاوتی داشته باشند.
- طراحی ستونهای دستهای به گونهای که سطوح (Levels) بسیار زیادی داشته باشند.
- هدفهای رگرسیونی با توزیع دنباله سنگین (Heavy-tailed).
فرآیند آموزش از تابع زیان cross-entropy برای طبقهبندی و quantile loss برای رگرسیون استفاده کرد. آموزش در سه مرحله انجام شد: ابتدا جداولی با ۱۰۲۴ ردیف (تا ۱۰۰ ستون)، سپس زمینههایی از ۴۰۰ تا ۱۰,۲۴۰ ردیف، و در نهایت زمینههایی تا ۶۰,۰۰۰ ردیف. نسخههای کوچک، متوسط و بزرگ به ترتیب روی تقریباً ۳۵ میلیون، ۷۱ میلیون و ۱۳۷ میلیون جدول مصنوعی آموزش دیدهاند.
عملکرد در محکها
بر اساس گزارش انویدیا، Kumo Tabular در حال حاضر با امتیاز ELO ۱۹۵۰ در رتبه اول جدول TabArena قرار دارد. در یک ارزیابی یکسان با استفاده از RTX 6000 Pro، این مدل ۲۶ برابر سریعتر از LimiX-2 عمل کرد. انویدیا ادعا میکند که این سه اندازه، یک استاندارد جدید (State of the art) را در جبهه پارتو (Pareto front) دقت-کارایی ایجاد کردهاند.
نتایج تکمیلی عبارتند از:
- BeyondArena: رتبه اول با ELO ۱۴۱۸ و امتیاز بهبودپذیری (Improvability) ۷.۷۸٪.
- TALENT: رتبه برتر کلی در دقت طبقهبندی، log-loss و RMSE رگرسیون، با رتبههای متوسط ۶.۶۷، ۳.۹۸ و ۴.۲۲.
- ScoringBench: نسخههای بزرگ و متوسط در رتبههای اول و دوم برای توزیعهای پیشبینی قرار گرفتند.
این تغییر نشاندهنده یک چرخش بنیادین در یادگیری ماشین جدولی است؛ گذار از رویکرد «آموزش برای هر تسک» به سمت مدلهای بنیادی که مهندسی ویژگی را با پنجرههای زمینه (Context Window) شبیه به پرامپتها جایگزین میکنند.
محدودیتها و دسترسی
Kumo Tabular محدودیتهای خاصی دارد. این مدل تنها از ستونهای عددی و دستهای پشتیبانی میکند؛ متنها، تصاویر یا برچسبهای زمانی باید ابتدا از طریق دستورالعملهای پیشپردازش داخلی به ویژگی تبدیل شوند. در یک گذر پیشرو، حداکثر ۱۰ کلاس پشتیبانی میشود، هرچند کتابخانه مربوطه این محدودیت را با استفاده از کدهای خروجی تصحیحکننده خطا (Error-correcting output codes) برای هر تعداد کلاسی گسترش میدهد.
انویدیا هشدار میدهد که اگر توزیع ردیفهای هدف با ردیفهای زمینه متفاوت باشد یا اگر جداول بسیار فراتر از محدودههای آموزش باشند، دقت مدل کاهش مییابد. آنها توصیه میکنند پیش از استقرار در محیط عملیاتی، دقت و کالیبراسیون مدل روی دادههای کنار گذاشته شده (Held-out data) اعتبارسنجی شود.
توسعهدهندگان میتوانند از طریق بسته structured-data-models که بومی GPU است و نیازمند Python 3.11+ و PyTorch 2.7+ است، به مدل دسترسی یابند. انویدیا توصیه میکند برای عملیات دیتافریم روی GPU از cudf استفاده شود تا دادهها در حافظه GPU باقی بمانند. مخزن این پروژه که تحت لایسنس Apache 2.0 است، پیادهسازیهای مرجع TabICLv2، TabFM و مدل رابطهای KumoRelational را نیز میزبانی میکند. انویدیا اشاره کرده است که دستورالعملهای آموزش و ژنراتورهای دادههای مصنوعی بهزودی منتشر خواهند شد.
گام بعدی شما
- اگر با دادههای جدولی کار میکنید، کتابخانه
structured-data-modelsرا نصب کرده و مدل Small را روی یک مجموعه داده کوچک بدون آموزش تست کنید. - برای دادههای با ابعاد بالا، از
cudfاستفاده کنید تا گلوگاه انتقال داده بین CPU و GPU را حذف کنید. - نتایج پیشبینی مدل را با یک مدل XGBoost ساده مقایسه کنید تا نقطه بهینه بین سرعت و دقت را برای تسک خود بیابید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو