پرش به محتوای اصلی
پرش به محتوای مقاله

درون آزمایش Hetzner برای کاهش هزینه‌های استنتاج مدل‌های وزن‌باز

·۲ مرداد ۱۴۰۵۵ دقیقه مطالعه
بررسی اولیه سرویس استنتاج ابری هتزنر
بررسی اولیه سرویس استنتاج ابری هتزنر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر استراتژی یک غول زیرساختی از فروش سرور خام به ارائه API استنتاج مدل‌های باز؛ این یعنی حرکت به سمت مدل درآمدی اشتراکی در لایه GPU.

اگر همین امروز برای استفاده از مدل‌های زبانی هزینه پرداخت می‌کنید، باید بدانید که رقابت در لایه زیرساختی در حال شعله‌ور شدن است. در حالی که اکثر رقبای مدل‌های زبانی بزرگ (LLM) بر توسعه خودِ مدل‌ها تمرکز کرده‌اند، شرکت Hetzner تصمیم گرفته است از سمت زیرساخت وارد این رقابت شود. این ارائه‌دهنده تخصصی خدمات ابری در حال حاضر یک API استنتاج آزمایشی را اجرا می‌کند که به کاربران اجازه می‌دهد مدل‌های وزن‌باز (Open-weight) را از طریق یک نقطه اتصال (Endpoint) سازگار با OpenAI فراخوانی کنند.

این اقدام در زمانی صورت می‌گیرد که بازار استنتاج مدل‌های وزن‌باز در حال تبدیل شدن به یک کالای عمومی یا Commodity است. از آنجا که اکثر ارائه‌دهندگان از وزن‌ها و نرم‌افزارهای یکسانی استفاده می‌کنند، نبرد فعلی به یک «رقابت برای رسیدن به کف قیمت» تبدیل شده است. برای توسعه‌دهندگان، انتخاب نهایاً به این برمی‌گردد که چه کسی می‌تواند خوشه‌های واحد پردازش گرافیکی (GPU) — که شبیه به موتورهای قدرتمند پردازشی برای هوش مصنوعی هستند — را با بیشترین بهره‌وری و بدون قربانی کردن سرعت مدیریت کند.

طبق گزارش sliplane.io در ۲۴ جولای ۲۰۲۶، این سرویس صرفاً یک آزمایش است و در حال حاضر هیچ سیستم پرداخت (Billing)، هیچ توافق‌نامه سطح خدمات (SLA) و هیچ تضمینی برای استفاده در محیط‌های عملیاتی (Production) ندارد. هدف Hetzner از این اقدام، جمع‌آوری داده در مورد تقاضای کاربران و مقیاس‌پذیری سیستم پیش از تصمیم‌گیری برای عرضه رسمی محصول است. هتزنر به‌طور خاص می‌خواهد بیاموزد که کدام ویژگی‌ها برای کاربران اهمیت بیشتری دارند و سیستم می‌تواند چه میزان بار (Load) را تحمل کند.

بررسی اولیه سرویس استنتاج Hetzner: رابط کاربری و قابلیت‌های مدل‌های هوش مصنوعی

ادغام و دسترسی

سرویس استنتاج هتزنر برای سهولت در مهاجرت توسعه‌دهندگان طراحی شده است. به دلیل سازگاری با API شرکت OpenAI، برنامه‌نویسان می‌توانند به‌سادگی یک کلاینت موجود OpenAI را به آدرس URL پایه هتزنر متصل کنند. برای شروع کار، کاربران باید یک توکن API را در داخل داشبورد Experiments ایجاد نمایند.

برای کسانی که می‌خواهند بدون نوشتن هیچ کد سفارشی، این API را آزمایش کنند، هتزنر یک راهنمای کوتاه منتشر کرده است که به‌طور خاص نحوه اتصال OpenCode به این سرویس را شرح می‌دهد. این قابلیت اجازه می‌دهد تا نمونه‌سازی سریع (Rapid Prototyping) و تست توانمندی‌های مدل در یک محیط واقعی به‌سرعت انجام شود.

کالبد فنی سرویس

کاربران فنی می‌توانند از طریق داشبورد Experiments به این سرویس دسترسی پیدا کرده و توکن API خود را تولید کنند. در حال حاضر، این پیشنهاد تنها شامل یک مدل است: Qwen/Qwen3.6-35B-A3B-FP8.

مشخصات کلیدی این استقرار عبارت است از:

  • معماری: مدل ترکیب خبره‌ها (Mixture-of-Experts) با ۳۵ میلیارد پارامتر.
  • پارامترهای فعال: ۳ میلیارد پارامتر به ازای هر توکن (Token) — یعنی تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — که اجازه می‌دهد مدل بدون نیاز به یک خوشه عظیم GPU سرویس‌دهی شود. این رویکرد تداعی‌کننده تلاش‌هایی برای بهینه‌سازی سخت‌افزاری است، مشابه آنچه در پروژه Mesh LLM برای تجمیع GPUهای غیرمتمرکز برای اجرای مدل‌های غول‌پیکر دیده می‌شود.
  • قابلیت‌ها: پشتیبانی هم‌زمان از متن و تصویر.
  • پنجره زمینه (Context Window) — یعنی میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه به میز کاری که جا برای چند ورق دارد — برابر با ۲۶۲ هزار توکن است.
  • وزن‌ها: از روش کوانتیزاسیون (Quantization) در سطح FP8 برای افزایش کارایی استفاده شده است. فایل‌های FP8 برای این مدل تقریباً ۳۸ گیگابایت هستند، هرچند میزان واقعی مصرف حافظه VRAM بسته به اندازه حافظه پنه (Cache) و تنظیمات سرویس‌دهی، بیشتر از این مقدار است.

بر اساس تست‌های اولیه انجام شده در ۲۳ جولای ۲۰۲۶، عملکرد خام سیستم خیره‌کننده است. یک کلاینت توانست میانگین زمان تا نخستین توکن (TTFT) را ۱۵۳ میلی‌ثانیه در هفت درخواست کوتاه بر روی یک اتصال باز ثبت کند. برای تولیدات طولانی‌تر که روی ۵۱۲ توکن محدود شده بودند، این API سرعت ۲۲۴ توکن در ثانیه را ارائه داد.

با این حال، هوش مدل در سطح متوسطی است. در حالی که مدل دستورات فرمت‌بندی و بازیابی اطلاعات را به‌خوبی اجرا کرد و یک تصویر را به‌درستی پردازش نمود، اما در پاسخ به دو سوال ساده ریاضی شکست خورد. این موضوع تأیید می‌کند که این مدل بیشتر یک مدل تخصصی و کوچک است تا یک قدرت‌خانه در سطح مدل‌های پیشرو (Frontier-class).

یک قابلیت پنهان به نام enable_thinking نیز وجود دارد. زمانی که این گزینه غیرفعال باشد، مدل ممکن است بخش قابل توجهی از بودجه تکمیل متن خود را صرف استدلال‌های داخلی کند پیش از آنکه پاسخی قابل مشاهده بازگرداند. این قابلیت توسط Hetzner مستند نشده است، به این معنی که توسعه‌دهندگان نباید برای کدهای محیط تولید به آن اتکا کنند.

اقتصادِ استنتاج

بحرانی‌ترین بخش این داستان، مدل نیست، بلکه سخت‌افزار و منطق تجاری پشت آن است. Hetzner به دلیل ساختار هزینه‌ای بسیار بهینه و سخت‌گیرانه در عملیات مراکز داده‌اش مشهور است. اگر آن‌ها بتوانند همین کارایی را در مورد GPUها پیاده کنند، قادر خواهند بود تقریباً تمام ارائه‌دهندگان فعلی استنتاج را از نظر قیمتی شکست دهند.

سه راه اصلی برای به دست آوردن مزیت حاشیه سود در بازار کالاییِ استنتاج وجود دارد:
۱. خرید و اداره سخت‌افزارهای GPU به‌صورت ارزان‌تر از رقبا.
۲. حفظ بهره‌وری استثنایی سخت‌افزار برای اینکه GPUها همیشه در حال پردازش باشند.
۳. بهره‌برداری از ظرفیت‌های موجود GPU که در غیر این صورت بیکار می‌ماندند.

مدل کسب‌وکار هتزنر بر پایه مورد اول بنا شده است. علاوه بر این، یک API استنتاج به آن‌ها اجازه می‌دهد تا ظرفیت GPU را بین کاربران بسیاری به اشتراک بگذارند. این کار باعث می‌شود ظرفیت‌های خالی به‌طور موثرتری نسبت به سرورهای Bare-metal (که در آن یک GPU صرفاً متعلق به یک مشتری است، فارغ از اینکه واقعاً از آن استفاده می‌کند یا خیر) به درآمد تبدیل شود.

معمای سخت‌افزاری

در حال حاضر، ناوگان عمومی سرورهای Bare-metal آن‌ها بر روی GPUهای کلاس ورک‌استیشن متکی است، مانند:

  • NVIDIA RTX 4000 SFF Ada Generation (۲۰ گیگابایت VRAM)
  • NVIDIA RTX PRO 6000 Blackwell Max-Q (۹۶ گیگابایت VRAM)

این کارت‌ها برای مدل‌های کوچک مثل Qwen عالی هستند، اما فاقد اتصالات متراکم چند-GPU (Multi-GPU Interconnects) هستند که برای مدل‌های عظیم مورد نیاز است. برای مثال، مدل GLM-5 دارای ۷۵۴ میلیارد پارامتر است و دستورالعمل‌های رسمی سرویس‌دهی آن را می‌طلبد که مدل بین هشت GPU تقسیم شود. این چالش مدیریت حافظه در مدل‌های عظیم، دلیل ظهور راهکارهای توزیع‌شده‌ای است که در معماری Petals برای تبدیل GPUهای خانگی به یک ابرکامپیوتر مورد بررسی قرار گرفته است. حتی با کوانتیزاسیون تهاجمی، چنین مدل‌هایی به صدها گیگابایت VRAM و لینک‌های پرسرعتی نیاز دارند که معمولاً در سخت‌افزارهای کلاس B200/B300 یافت می‌شوند.

هتزنر در حال حاضر چنین سخت‌افزاری را در لیست عمومی Bare-metal خود ارائه نمی‌دهد. با این حال، احتمال دارد که این API آزمایشی بر روی سخت‌افزارهای داخلی متفاوتی در حال اجرا باشد که هنوز در کاتالوگ عمومی منعکس نشده است.

اگر این آزمایش منجر به استقرار خوشه‌های متراکم B200/B300 در مراکز داده اروپایی شود، چشم‌انداز رقابتی تغییر خواهد کرد. Hetzner پیش از این شهرت لازم در قیمت‌گذاری تهاجمی، شبکه و زیرساخت برای مقیاس‌پذیری سریع را به دست آورده است.

در حال حاضر، این سرویس به عنوان یک تجربه کم‌ریسک برای توسعه‌دهندگان عمل می‌کند تا ادغام‌های سازگار با OpenAI را تست کنند. سیگنال واقعی نه از افزودن مدل‌های جدید، بلکه از اعلان بعدی سخت‌افزاری در لیست سرورهای اختصاصی آن‌ها به دست خواهد آمد. مشخصات ناوگان GPU آن‌ها را زیر نظر بگیرید تا ببینید آیا از کارت‌های ورک‌استیشن به سمت خوشه‌های هوش مصنوعی سازمانی حرکت می‌کنند یا خیر.

گام بعدی شما

  • اگر از مدل‌های باز متن استفاده می‌کنید، API آزمایشی Hetzner را برای تست سرعت (Latency) بررسی کنید.
  • برای پروژه‌های حساس، فعلاً به دلیل نبود SLA از این سرویس در محیط تولید (Production) استفاده نکنید.
  • تغییرات لیست سرورهای اختصاصی Hetzner را زیر نظر بگیرید تا زمان ورود GPUهای سازمانی را بفهمید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام با تکیه بر تخصص Hetzner در مدیریت هزینه‌های مرکز داده، می‌تواند هزینه استنتاج برای توسعه‌دهندگان را به شدت کاهش دهد. اعتبار این شرکت در بهینه‌سازی زیرساخت، ریسک عملیاتی این مدل توزیع را برای کاربران پایین می‌آورد.

تأثیر برای ایران

به دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به این سرویس برای توسعه‌دهندگان ایرانی دشوار است؛ اما کاهش احتمالی قیمت‌های جهانی استنتاج، هزینه نهایی استفاده از مدل‌های باز را برای اپلیکیشن‌های ایرانی پایین می‌آورد.

·نگاه ما
تحریریه دات‌هوش

ورود Hetzner به بازار استنتاج، تغییر بازی از «رقابت مدل‌ها» به «رقابت بهره‌وری سخت‌افزاری» است. احتمالاً شاهد جنگ قیمت‌های شدیدتر خواهیم بود که در آن ارائه‌دهندگان کوچک‌تر بدون زیرساخت عمودی (Vertical Integration) حذف می‌شوند. این حرکت نشان می‌دهد که استنتاج مدل‌های باز در حال تبدیل شدن به یک خدمت коммунаلی (Utility) است، درست مثل برق یا اینترنت.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.