پرش به محتوای اصلی
پرش به محتوای مقاله

حراج لحظه‌ای استنتاج؛ راهکار Architect برای کاهش هزینه‌های مدل‌های زبانی

·۱۶ مهر ۱۴۰۵۳ دقیقه مطالعه
معمار پلتفرم استنتاج مایع را راه‌اندازی کرد: حراجی لحظه‌ای برای پردازش مدل‌های زبانی بزرگ
معمار پلتفرم استنتاج مایع را راه‌اندازی کرد: حراجی لحظه‌ای برای پردازش مدل‌های زبانی بزرگ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مدل قیمت‌گذاری ثابت API با حراج لحظه‌ای (Per-request auction) برای هر درخواست استنتاج؛ تبدیل دسترسی به مدل‌ها از یک سرویس اشتراکی به یک بازار نقدی (Spot Market).

هر درخواست شما از یک مدل هوش مصنوعی اکنون برچسب قیمتی دارد که می‌تواند در چند میلی‌ثانیه کاهش یابد. شرکت Architect Financial Technologies در ۸ اکتبر ۲۰۲۶ سرویس Liquid Inference را راه‌اندازی کرد تا استنتاج (Inference) — که مثل لحظه‌ی خودِ آشپزی است، نه دوره‌ی آموزش آشپز — را از مدل قیمت‌های ثابت API به یک مدل حراج رقابتی و زنده تبدیل کند.

این تغییر در حالی رخ می‌دهد که سازمان‌ها با هزینه‌های پیش‌بینی‌ناپذیر در مقیاس‌بندی گردش‌های کاری عامل‌محور (Agentic) دست‌وپنجه نرم می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی کاربرد مدل‌ها در بازارهای مالی اشاره کردیم، اکنون Architect منطق بورس را به لایه‌ی محاسباتی آورده است. تصور کنید یک بورس سهام دارید، اما به‌جای سهام، ارائه‌دهندگان برای پردازش پرامپت بعدی شما قیمت می‌دهند.

زمینه‌ی بازار

شرکت Architect یک آزمایشگاه AI نیست، بلکه یک شرکت معاملاتی است که بورس AX را مدیریت می‌کند. طبق گزارش این شرکت، آن‌ها در می ۲۰۲۶ یک بازار قراردادات رسمی در آمریکا (Designated Contract Market) را برای لیست کردن قراردادهای آتی واحد پردازش گرافیکی (GPU) خریداری کردند که در حال حاضر در انتظار بررسی‌های نظارتی است. این تیم از تجربه‌ی عمیق خود در ساخت بورس‌های مالی استفاده کرد تا سیستمی برای کشف قیمت دوطرفه در لایه‌ی استنتاج بسازد. این رویکرد یادآور سیستم‌های پیشرفته‌ای است که در تشخیص حملات Spoofing از طریق بازسازی لحظه‌ای دفتر سفارشات به کار می‌روند تا شفافیت بازار را افزایش دهند.

معمار پلتفرم «استنتاج مایع» را راه‌اندازی کرد: حراج لحظه‌ای برای پردازش مدل‌های زبانی بزرگ

به نقل از گزارش MarkTechPost، این سامانه در چهار مرحله عمل می‌کند: ابتدا کاربر یک فراخوان API استاندارد می‌فرستد، سپس محدودیت‌های خریدار پیشنهادها را فیلتر می‌کند، ارائه‌دهندگان در یک حراج زنده رقابت می‌کنند و در نهایت ارزان‌ترین پیشنهادِ واجد شرایط برنده می‌شود. قیمت نهایی پیش از تولید اولین توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کییک طولانی — قفل می‌شود تا هیچ صورت‌حساب غیرمنتظره‌ای صادر نشود. سیستم پرداخت تنها هزینه‌های مصرف‌شده بر اساس اندازه‌گیری دقیق (Metered Usage) را پوشش می‌دهد.

مشخصات فنی و کنترل‌ها

توسعه‌دهندگان می‌توانند با تغییر یک URL ساده، این سرویس را به ابزارهایی مثل Claude Code، Cursor، Cline، Codex، OpenCode و Pi متصل کنند و سازگاری کامل خود را با این ابزارها حفظ نمایند. این پلتفرم کنترل‌های دقیقی ارائه می‌دهد:

  • سقف عملکرد: تعیین محدودیت برای زمان تا نخستین توکن (Time-to-first-token) و حداقل توان عملیاتی (Throughput). این تمرکز بر سرعت پاسخ‌دهی، مشابه قابلیت پاسخ‌دهی زیر میلی‌ثانیه‌ی API شرکت Groq است که برای برنامه‌های بلادرنگ طراحی شده است.
  • حاکمیت داده‌ها: گزینه‌هایی برای عدم ذخیره‌سازی داده‌ها (ZDR)، انتخاب مناطق جغرافیایی مورد تأیید و لیست سفید ارائه‌دهندگان.
  • حالت خودکار: قابلیتی که بهترین مدل را برای هر واحد کاری به‌طور خودکار انتخاب می‌کند.
  • پیش‌تنظیم‌های مسیریابی: طبق پست لینکدین Harrison، این سیستم از پیش‌تنظیم‌های قوانین مسیریابی و پشتیبانی کامل از مدل‌های چندوجهی (Multimodal) برخوردار است.

Meet Together Link: ابزار خط فرمان رایگان برای اجرای مدل‌های باز مانند Kimi K3 و GLM 5.3 در Claude Code، Codex و OpenCode

شفافیت بازار

برخلاف APIهای سنتی، Liquid Inference داده‌های بازار را به‌طور شفاف نمایش می‌دهد. دارندگان حساب می‌توانند دفتر سفارشات زنده (Live Order Books)، قیمت‌های هر ارائه‌دهنده و هر مدل، و تراکنش‌های نهایی شده را مشاهده کنند. این یعنی خریدار دقیقاً می‌داند بازار در لحظه چه قیمتی برای هر مدل خاص تعیین کرده است.

برای ارائه‌دهندگان نیز فرآیند ورود بسیار سریع است. Harrison، یکی از مدیران Architect، اعلام کرد که تأیید ارائه‌دهندگان جدید «در عرض چند دقیقه، نه چند هفته» انجام می‌شود. ارائه‌دهندگان از طریق APIهای REST و WebSocket مدل‌های خود را ثبت کرده و قیمت‌ها را بر اساس ظرفیت خالی GPUهایشان به‌روز می‌کنند. پرداخت‌ها از طریق Stripe و بر اساس سوابق تفکیک‌شده‌ی هر پروژه انجام می‌شود.

معمار پلتفرم استنتاج مایع را راه‌اندازی کرد: حراجی لحظه‌ای برای پردازش مدل‌های زبانی بزرگ

چشم‌انداز رقابتی

در مقایسه با OpenRouter و Hugging Face، مدل Liquid Inference متفاوت است. در حالی که OpenRouter از توازن بار بر اساس قیمت (Price-weighted load balancing) استفاده می‌کند و Hugging Face به‌طور پیش‌فرض سریع‌ترین ارائه‌دهنده را انتخاب می‌کند، این پلتفرم برای هر درخواست یک حراج مجزا برگزار می‌کند. این سیستم از «صدها» مدل پشتیبانی می‌کند و برای ۵۰۰ کاربر اول، ۲۰ دلار اعتبار رایگان در نظر گرفته است. همچنین یک برنامه معرفی (Referral) وجود دارد که ۲۰٪ از هزینه‌های ارجاع‌شده را به‌عنوان استنتاج رایگان و ۱۰٪ برای ارجاعات سطح دوم پرداخت می‌کند.

این مدل، اقتصاد استقرار AI را به‌طور بنیادی تغییر می‌دهد. Architect با ایجاد کشف قیمت دوطرفه، «وابستگی به ارائه‌دهنده» (Provider Lock-in) را که معمولاً توسعه‌دهندگان را مجبور به پذیرش قیمت‌های یک فروشنده واحد می‌کند، از بین می‌برد. حالا مزیت به نفع خریدار است که می‌تواند استنتاج را به‌جای یک سرویس انحصاری، شبیه به یک کالای عمومی (Commodity) ببیند.

برای یک توسعه‌دهنده، این یعنی زیرساخت AI او بدون تغییر در حتی یک خط از منطق اصلی کدها، ارزان‌تر و منعطف‌تر می‌شود. شما دیگر یک اشتراک نمی‌خرید، بلکه در بازار نقدیِ (Spot Market) هوش مصنوعی شرکت می‌کنید.

باید منتظر ماند و دید این مدل حراج چگونه بر استراتژی قیمت‌گذاری آزمایشگاه‌های بزرگی مثل OpenAI و Anthropic تأثیر می‌گذارد، زیرا آن‌ها ممکن است مجبور شوند در سطح هر درخواست، با خوشه‌های GPU مستقل و کم‌هزینه‌تر رقابت کنند.

گام بعدی شما

  • اگر از ابزارهای کدنویسی AI استفاده می‌کنید، بررسی کنید آیا امکان تغییر Base URL برای اتصال به بازارهای حراج وجود دارد یا خیر.
  • هزینه‌های استنتاج فعلی خود را با قیمت‌های لحظه‌ای بازار مقایسه کنید تا میزان اتلاف بودجه را بسنجید.
  • مدل‌های ارزان‌تر اما بهینه‌تر را در حالت Auto Mode تست کنید تا تعادل میان هزینه و کیفیت را بیابید.

اما اثر این مدل حراج بر استراتژی قیمت‌گذاری غول‌هایی مثل OpenAI و Anthropic می‌تواند بسیار تندتر باشد — به تحلیل ما درباره‌ی جنگ قیمت‌های توکن‌ها مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار Architect در بازارهای مالی، ریسک قیمت‌های ثابت را حذف و بهره‌وری سرمایه در لایه‌ی محاسباتی را افزایش می‌دهد. در نتیجه، هزینه‌ی عملیاتی عامل‌های هوش مصنوعی در مقیاس صنعتی به‌شدت کاهش می‌یابد.

تأثیر برای ایران

به‌دلیل محدودیت‌های پرداخت و تحریم‌های API، دسترسی مستقیم به این بازار برای توسعه‌دهندگان ایرانی دشوار است، اما کاهش کلی قیمت‌های جهانی استنتاج، هزینه‌ی استفاده از واسطه‌ها را در بلندمدت پایین می‌آورد.

·نگاه ما
تحریریه دات‌هوش

تبدیل استنتاج به یک کالای عمومی (Commodity) از طریق حراج لحظه‌ای، قدرت را از آزمایشگاه‌های مدل‌ساز به دارندگان سخت‌افزار و خریداران منتقل می‌کند. این رویکرد احتمالاً منجر به ظهور «کارگزاران هوش مصنوعی» می‌شود که تخصصشان نه در ساخت مدل، بلکه در بهینه‌سازی هزینه استنتاج برای سازمان‌های بزرگ است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.