پرش به محتوای اصلی
پرش به محتوای مقاله

مدل PatchTST-FM-r2 آی‌بی‌ام پیشتاز پیش‌بینی سری‌های زمانی تجاری شد

·۱۸ شهریور ۱۴۰۵۷ دقیقه مطالعه۱ بازدید
مدل Granite Time Series PatchTST-FM-r2 با مجوز تجاری‌دوستانه منتشر شد
مدل Granite Time Series PatchTST-FM-r2 با مجوز تجاری‌دوستانه منتشر شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی معماری Conformer در مدل‌های سری زمانی تجاری که اجازه می‌دهد مدل هم‌زمان روی الگوهای کوتاه‌مدت و بلندمدت بدون اتلاف محاسبات تمرکز کند.

تصور کنید شرکتی را که برای پیش‌بینی دقیق بارهای انرژی، تقاضای بازار و داده‌های تله‌متری، مجبور است برای هر مجموعه داده، یک مدل مجزا آموزش دهد. این فرآیند زمان‌بر و هزینه‌بر است. اما با انتشار مدل PatchTST-FM-r2 توسط IBM در ۸ سپتامبر ۲۰۲۶، این دشواری به پایان رسید و پیش‌بینی‌های دقیق بدون نیاز به آموزش مجدد ممکن شد. این مدل در حال حاضر عنوان باکارآمدترین مدل پیش‌بینی Zero-shot را دارد که تحت یک مجوز تجاری باز (Permissive) در دسترس است.

پیش‌بینی سری‌های زمانی — شبیه پیش‌بینی وضعیت ترافیک شهر بر اساس داده‌های سال‌های گذشته — به‌طور سنتی نیازمند مدل‌های سفارشی (Bespoke) برای هر جریان داده جدید بود. این موضوع برای شرکت‌هایی که هزاران حسگر یا واحدهای موجود کالا (SKU) را مدیریت می‌کنند، یک بار نگهداری عظیم ایجاد می‌کرد. اما مدل‌های بنیادی (Foundation Models) — مثل یک متخصص همه‌فن‌حریف که اصول کلی داده‌ها را می‌داند و می‌تواند روی هر موضوع جدیدی نظر بدهد — این بازی را با قابلیت Zero-shot تغییر دادند؛ یعنی یک مدل پیش‌آموزش‌دیده می‌تواند مقادیر آینده را برای داده‌هایی که هرگز قبلاً ندیده است، پیش‌بینی کند.

جدیدترین عرضه IBM به عنوان بخشی از خانواده گسترده‌تر Granite TSFM معرفی شده است. این رویکرد در راستای توسعه اکوسیستم مدل‌های Granite است که پیش از این در حوزه‌های دیگر نیز موفق بوده‌اند؛ برای مثال، مدل Granite Speech 5.0 توانست استانداردهای جدیدی را در تبدیل سریع صوت به متن تعریف کند. هدف این مدل، پر کردن شکاف میان مدل‌های آکادمیک با عملکرد بالا و الزامات سخت‌گیرانه بخش‌های حقوقی شرکت‌ها است. IBM با استفاده از یک مجوز سازگار با محیط‌های تجاری، این مدل را به عنوان انتخاب پیش‌فرض برای هوش مصنوعی صنعتی آماده برای تولید (Production-ready) معرفی می‌کند.

زمینه و بنچ‌مارک‌ها

به نقل از مستندات IBM، برای ارزیابی این مدل از محک GIFT-Eval استفاده شده است. این یک بنچ‌مارک جامع برای پیش‌بینی سری‌های زمانی است که طراحی شده تا مدل‌ها را در سناریوهای متنوع و روی مجموعه‌داده‌های ناهمگون آزمایش کند. هدف اصلی این بود که اطمینان حاصل شود مدل به سری‌های زمانی که به‌طور خاص روی آن‌ها آموزش ندیده است، تعمیم می‌یابد و از تله رایج «نشت داده» (Test Leakage) جلوگیری شود.

طبق گزارش‌های منتشر شده در ۸ سپتامبر ۲۰۲۶، مدل PatchTST-FM-r2 در رتبه دوم کل مدل‌های Zero-shot قابل بازتولید در جدول GIFT-Eval قرار دارد. اما وقتی دایره بررسی به مدل‌هایی محدود می‌شود که دارای مجوزهای باز و تجاری هستند، PatchTST-FM-r2 رتبه اول را به خود اختصاص می‌دهد:

  • امتیاز CRPS: مدل به میانگین هندسی ۰.۴۶۷ رسید که آن را بلافاصله پس از TimesFM-3 در این مقایسه قرار می‌دهد.
  • امتیاز MASE: این مدل عدد ۰.۶۸۴۶ را به عنوان میانگین هندسی ثبت کرد.

تحلیل عملکرد مقایسه‌ای

نکته جالب این است که این مدل حتی در برابر مدل‌های «پیش‌آموزش‌دیده» (Pretrained) که اجازه داشتند داده‌های آموزش GIFT-Eval را ببینند، رقابتی عمل می‌کند. برخی از مدل‌های موجود در جدول رده‌بندی، به جای Zero-shot خالص، در دسته Pretrained قرار می‌گیرند؛ به این معنی که آن‌ها می‌توانستند بخش‌های آموزشی مجموعه‌داده‌های ارزیابی را در بدنه پیش‌آموزش خود بگنجانند.

حتی زمانی که این مدل‌های پیش‌آموزش‌دیده به مقایسه اضافه می‌شوند، PatchTST-FM-r2 همچنان در نزدیکی صدر جدول باقی می‌ماند. این مدل در رتبه سوم برای CRPS و رتبه چهارم برای MASE در میان مدل‌های قابل بازتولید قرار دارد. همچنین، این مدل از چندین مدل پیش‌آموزش‌دیده از جمله Chronos-2، Timer-S1 و نسخه‌های مختلف Toto پیشی گرفت، در حالی که برخی از این رقبای مدل، از نظر اندازه به‌طور قابل توجهی بزرگ‌تر بودند.

تکامل معماری

تغییر اصلی در انتقال از نسخه r1 به r2، حرکت به سمت بلوک‌های Conformer است. در حالی که نسخه r1 بر لایه‌های ترنسفورمر استاندارد — که ترکیبی از توجه چندسر (Multi-head Self-attention) و شبکه پیش‌خور (Feed-forward) بود — تکیه داشت، نسخه r2 اکنون کانولوشن زمانی (Temporal Convolution) را در کنار مکانیزم توجه ادغام کرده است.

مدل پیشرفته Granite Time Series PatchTST-FM-r2 آی‌بی‌ام با مجوز تجاری منتشر شد

این رویکرد ترکیبی به مدل اجازه می‌دهد دو مقیاس زمانی متفاوت را به‌طور هم‌زمان مدیریت کند. لایه‌های کانولوشن ساختارهای محلی و کوتاه‌مدت را استخراج می‌کنند، در حالی که مکانیزم توجه بر روابط بلندمدت در سراسر سری زمانی تمرکز می‌کند. این طراحی مانع از آن می‌شود که مدل توجه خود را روی همسایگان نزدیک تلف کند، زیرا لایه کانولوشن پیش از آن این کار را انجام داده است.

این تفاوت در الگوهای توجه با استفاده از نمونه‌های واقعی از مجموعه‌داده ETTh1 مشهود است. در ترنسفورمرهای استاندارد، بخش قابل توجهی از توجه روی قطر ماتریس (روابط محلی) متمرکز است. اما در بلوک Conformer، توجه روی فواصل دور (دور از قطر) متمرکز می‌شود، زیرا لایه کانولوشن فواصل کوتاه را پوشش داده است.

جزئیات فنی

  • مکانیزم Conformer: ستون فقرات مدل از بلوک‌های سبک Conformer تشکیل شده که شامل دو لایه پیش‌خور نیم‌گام است که لایه توجه چندسر و یک لایه کانولوشن زمانی را احاطه کرده‌اند. این ساختار دو مکانیزم مکمل برای استدلال روی سری زمانی فراهم می‌کند.
  • الگوی کرنل: بلوک‌های کانولوشن از اندازه‌های متناوب ۳ و ۵ در یک الگوی تکرارشونده {۵، ۵، ۳، ۳} استفاده می‌کنند.
  • تعداد پارامترها: حدود ۳۸۵ میلیون پارامتر.
  • پنجره زمینه (Context Window) — مانند میز کاری که تعیین می‌کند مدل چقدر از داده‌های گذشته را هم‌زمان در ذهن دارد — تا ۸,۱۹۲ گام را پشتیبانی می‌کند.
  • هموارسازی: استفاده از وصله‌های ۵۰٪ هم‌پوشان با وزن‌دهی پنجره همینگ (Hamming-window) و پیش‌بینی با روش overlap-and-add برای حذف لبه‌های دندانه‌دار در پیش‌بینی‌ها و افزایش دقت.
  • عمق: افزایش تعداد بلوک‌ها از ۲۰ به ۳۰ برای دستیابی به پایداری بیشتر در آموزش و استنتاج.
  • خروجی: یک سر پیش‌بینی ۹۹-کوانتایل که هم پیش‌بینی‌های نقطه‌ای و هم خروجی‌های کوانتایلی را برای ارائه توزیع‌های پیش‌بینی و بازه‌های عدم قطعیت فراهم می‌کند.
  • انعطاف‌پذیری: پشتیبانی از طول‌های پیش‌بینی متغیر و قابلیت جایگذاری (Imputation) مقادیر گم‌شده در داده‌ها.

شفافیت داده‌ها و مجوزها

بر اساس مستندات IBM، شفافیت در مورد داده‌های آموزشی برای پذیرندگان سازمانی به اندازه عملکرد در جدول رده‌بندی اهمیت دارد. IBM یک بدنه پیش‌آموزش مستند را ارائه کرده است تا نیازهای حاکمیتی شرکت‌ها برآورده شود. داده‌های آموزشی از چهار منبع اصلی تشکیل شده‌اند:

  1. GiftEvalPretrain: مجموعه‌داده‌های منتخب از این بنچ‌مارک.
  2. KernelSynth: داده‌های مصنوعی سفارشی با استفاده از کرنل‌های متناوب اصلاح‌شده و تقویت (Augmentation) محدود.
  3. TSMixup: مجموعه‌ای تولید شده با رویکرد Chronos، اما به‌طور سخت‌گیرانه محدود به داده‌های خارج از مجموعه ارزیابی GIFT-Eval.
  4. CauKer: حدود ۵۰۰,۰۰۰ توالی مصنوعی CauKer که هر کدام دارای طول ۴,۰۹۶ هستند.

این شفافیت یک حرکت استراتژیک است. اکثر مدل‌های بنیادی از مجموعه‌داده‌های مبهم استفاده می‌کنند که بررسی عدم استفاده از داده‌های محرمانه یا نشت‌شده را برای حقوقدانان شرکت‌ها دشوار می‌کند. رویکرد IBM فرآیند بررسی داخلی را برای سازمان‌ها تسهیل می‌کند، هرچند نیاز به بررسی حاکمیتی داخلی هر سازمان را از بین نمی‌برد.

برای به حداکثر رساندن پذیرش، مدل تحت دو مجوز Apache 2.0 و OpenMDW 1.0 عرضه شده است. کاربران می‌توانند هر کدام را که با چارچوب حقوقی‌شان سازگار است انتخاب کنند. مجوز OpenMDW که توسط بنیاد لینوکس ارائه شده، به‌طور خاص برای مدل‌های هوش مصنوعی طراحی شده است تا اطمینان شود وزن‌ها، معماری و خط لوله استنتاج بدون حق امتیازهای محدودکننده، قابل تغییر و توزیع باشند.

ادغام در محیط تولید

برای توسعه‌دهندگان، این مدل از طریق بسته پایتون granite-tsfm (نسخه ۰.۳.۹ یا بالاتر) و Hugging Face Hub در دسترس است. این پیاده‌سازی با چک‌پوینت‌های PatchTST-FM-r1 سازگار است. مدل را می‌توان با استفاده از PatchTSTFMForPrediction.from_pretrained بارگذاری و از طریق TimeSeriesForecastingPipeline مستقر کرد.

این مدل از پیش‌بینی احتمالی (Probabilistic Forecasting) از طریق سر پیش‌بینی ۹۹-کوانتایل پشتیبانی می‌کند؛ به این معنی که تنها یک عدد واحد نمی‌دهد، بلکه یک محدوده از عدم قطعیت را ارائه می‌کند. این ویژگی آن را برای طیف وسیعی از کاربردها از جمله پیش‌بینی تقاضا، تله‌متری حسگرها، میزان استفاده از CPU، مصرف انرژی، حجم تراکنش‌ها، ترافیک و ردیابی قیمت‌ها مناسب می‌سازد.

فراتر از نوت‌بوک‌های ایستا، IBM این مدل‌ها را با Confluent Cloud ادغام کرده است. این همکاری که در ابتدای سپتامبر ۲۰۲۶ با هدف پیش‌بینی داده‌های زنده از طریق SQL معرفی شد، امکاناتی را فراهم می‌کند که با بهره‌گیری از Apache Flink، مدل‌ها بتوانند استنتاج (Inference) — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند — را مستقیماً روی جریان‌های داده زنده انجام دهند. این یعنی نتایج پیش‌بینی و تشخیص ناهنجاری از جریان‌های زنده تولید می‌شوند و نیازی به انتقال داده‌ها به یک محیط ML مجزا نیست.

پورتفولیوی اولیه موجود در برنامه دسترسی زودهنگام (Early Access) شامل موارد زیر است:

  • PatchTST-FM-r1
  • FlowState-r1.1
  • TTM-r3
  • TSPulse

این تغییر به سمت هوش مصنوعی جریانی (Streaming AI) به این معنی است که یک شرکت می‌تواند جهش در شبکه برق یا سقوط قیمت را در میلی‌ثانیه‌ها شناسایی کند، به جای اینکه منتظر اجرای یک پردازش دسته‌ای (Batch) هر یک ساعت بماند.

برای حوزه هوش مصنوعی سری‌های زمانی، این عرضه سیگنالی است که «قوانین مقیاس‌پذیری» (Scaling Laws) مدل‌های زبانی بزرگ (LLMs) اکنون به پیش‌بینی‌های زمانی منتقل شده است. ما از عصر «آمارشناس متخصص» که مدل‌های سفارشی ARIMA می‌ساخت، به سمت دنیایی از هوش زمانی همه‌منظوره حرکت می‌کنیم.

گام بعدی شما

  • وزن‌های PatchTST-FM-r2 را از Hugging Face دریافت کرده و روی داده‌های خصوصی خود تست کنید.
  • دقت Zero-shot این مدل را با خط مبنای (Baseline) فعلی خود مقایسه کنید.
  • اگر با داده‌های جریانی (Streaming) سروکار دارید، ادغام با Confluent Cloud را بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با ترکیب عملکرد بالا و مجوز تجاری، سد ورود شرکت‌های صنعتی به حوزه پیش‌بینی Zero-shot را می‌شکند. اعتبار IBM در حوزه داده‌های سازمانی، این مدل را به رقیبی جدی برای مدل‌های آکادمیک تبدیل می‌کند.

تأثیر برای ایران

به‌دلیل دسترسی آزاد در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای محدود، این مدل را برای تحلیل داده‌های صنعتی و مالی داخلی به کار بگیرند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی ترنسفورمر خالص با معماری Conformer در این مدل، نشان‌دهنده یک چرخش فنی است؛ IBM پذیرفته که برای داده‌های زمانی، «توجه» به تنهایی کافی نیست و باید ساختارهای محلی را با کانولوشن بازگرداند. این رویکرد احتمالاً استاندارد جدیدی برای مدل‌های سری زمانی سبک اما قدرتمند ایجاد می‌کند که به جای افزایش پارامتر، روی بهینه‌سازی ساختار تمرکز دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.