پرش به محتوای اصلی
پرش به محتوای مقاله

Oxlo.ai: کاهش شدید هزینه‌های استنتاج با مدل متراکم ۱۲۰ میلیارد پارامتری

·۲ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
نمودار مقایسه عملکرد مدل GPT-Oss 120B با سایر مدل‌های زبانی بزرگ در معیارهای استاندارد.
نمودار مقایسه عملکرد مدل GPT-Oss 120B با سایر مدل‌های زبانی بزرگ در معیارهای استاندارد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال مدل قیمت‌گذاری از توکن به «درخواست ثابت» برای یک مدل ۱۲۰ میلیاردی؛ این تغییر باعث حذف هزینه افزایشی برای پنجره‌های متنی طولانی در سیستم‌های عامل‌محور می‌شود.

اگر امروز برای اجرای عامل‌های هوش مصنوعی هزینه می‌پردازید، صورت‌حساب ماهانه شما می‌تواند تا ۱۰۰ برابر کمتر شود. این اتفاق با معرفی مدل GPT-Oss 120B رخ داده است؛ مدلی که شکاف میان مدل‌های کارآمد ۷۰ میلیارد پارامتری و سیستم‌های عظیم اما پراکنده را پر می‌کند. این مدل اکنون در نقطه‌ای قرار دارد که هم قدرت پردازشی بالا را فراهم می‌کند و هم پیچیدگی‌های سیستم‌های غول‌پیکر را ندارد.

این مدل با وزن‌های باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر شده و دیگر فقط یک غذای آماده در دست شرکت‌ها نیست — عرضه شده تا توسعه‌دهندگانی که به تأخیر پیش‌بینی‌پذیر نیاز دارند و نمی‌خواهند با پیچیدگی نقاط انتهایی (Endpoints) اختصاصی و بسته سر و کله بزنند، از محدودیت‌ها رها شوند. با ۱۲۰ میلیارد پارامتر، این یکی از بزرگ‌ترین مدل‌های هوش مصنوعی زاینده (Generative AI) است که امروز از طریق APIهای استنتاج (Inference) — همان لحظه تولید جواب، شبیه آشپزی واقعی نه دوره آموزش آن — در دسترس است. برای دستیابی به چنین سرعت‌های استنتاجی، بهینه‌سازی‌های سطح پایین در لایه‌های نرم‌افزاری حیاتی است؛ برای مثال، استفاده از کرنل‌های Triton توانسته است سرعت استنتاج در مدل‌های کم‌رتبه را تا ۳.۷۶ برابر افزایش دهد که مسیر را برای مدل‌های متراکم بزرگ‌تر هموارتر می‌کند.

این مدل در زمانی معرفی می‌شود که تیم‌های مهندسی با نوسانات عملکردی در معماری‌های ترکیب خبره‌ها (Mixture-of-Experts یا MoE) دست‌وپنجه نرم می‌کنند. در حالی که پوشش‌های قبلی ما بر اقدامات تخصصی OpenAI در بخش سلامت متمرکز بود، روند فعلی صنعت به سمت انعطاف‌پذیری متن‌باز برای استدلال‌های همه‌منظوره می‌رود. تفاوت این دو معماری را این‌طور تصور کنید: MoE شبیه تیمی از متخصصان است که هر لحظه فقط چند نفر روی یک مسئله کار می‌کنند، اما مدل متراکم (Dense) مثل یک خبره تمام‌عیار است که تمام دانشش را برای هر پاسخ به کار می‌گیرد؛ نتیجه این است که مدل متراکم در زمان پاسخ‌دهی بسیار منسجم‌تر و پایدارتر است.

جزئیات معماری و بستر مدل

به گزارش وب‌سایت dev.to که در ۲۴ جولای ۲۰۲۶ منتشر شد، GPT-Oss 120B از یک پشته ترنسفورمر (Transformer) فقط-رمزگشای متراکم استفاده می‌کند. برخلاف مدل‌های MoE، در هر بار پردازش (Forward Pass)، تمام ۱۲۰ میلیارد پارامتر فعال می‌شوند. این انتخاب معماری تضمین می‌کند که توان عملیاتی (Throughput) برای اپلیکیشن‌های تعاملی ثابت بماند و کاربر دچار افت سرعت ناگهانی نشود.

این مدل به‌طور خاص برای موارد زیر طراحی شده است:

  • دنبال کردن دقیق و گسترده دستورات (Instruction Following)
  • تکمیل متن‌های طولانی (Long-form text completion)
  • تولید کدهای پیچیده برنامه‌نویسی

از آنجا که این مدل از فعال‌سازی خبره‌های پراکنده (Routed Expert Activation) اجتناب می‌کند، برنامه‌ریزی ظرفیت برای تیم‌های مهندسی را ساده کرده و تأخیر (Latency) بسیار پیش‌بینی‌پذیری را ارائه می‌دهد؛ به این معنا که مهندسان دقیقاً می‌دانند هر درخواست چقدر زمان می‌برد.

محک‌های عملکرد و ادغام فنی

در پلتفرم Oxlo.ai، این مدل در کنار رقبای خود نقش‌های متمایزی ایفا می‌کند:

  • Llama 3.3 70B: یک مدل پرچمدار همه‌منظوره که کوچک‌تر و برای پرس‌وجوهای ساده سریع‌تر است، اما ظرفیت خام GPT-Oss 120B را برای کارهایی که نیاز به بودجه پارامتری بالاتر دارند، ندارد.
  • DeepSeek R1 671B: برای استدلال‌های عمیق و کدنویسی بسیار پیچیده از طریق فعال‌سازی خبره‌های پراکنده ساخته شده است. در استدلال برتر است، اما ثبات تأخیر یک مدل متراکم را ندارد.
  • Qwen 3 32B: متمرکز بر استدلال‌های چندزبانه و جریان‌های کاری عامل‌محور (Agentic) است، در حالی که GPT-Oss روی مقیاس خام مدل تمرکز کرده است تاست به جای تنظیم دقیق (Fine-tuning) برای عامل‌های خاص، قدرت پردازشی کلی داشته باشد.
  • DeepSeek V4 Flash: یک پیشنهاد بهینه MoE با پنجره متنی ۱ میلیون توکن (Token) — تکه‌های کوچک متن شبیه برش‌های کیک — دارد، در حالی که GPT-Oss برای اپلیکیشن‌هایی مناسب‌تر است که به جای طول متن بسیار زیاد، به یک مدل متراکم واحد نیاز دارند.

ادغام این مدل از طریق نقاط انتهایی کاملاً سازگار با OpenAI انجام می‌شود. توسعه‌دهندگان می‌توانند با تغییر URL پایه به https://api.oxlo.ai/v1 و تغییر رشته نام مدل به gpt-oss-120b آن را فعال کنند. این API از حالت استریم (Streaming)، حالت JSON و فراخوانی تابع (Function Calling) پشتیبانی می‌کند. یک مزیت کلیدی این است که برخلاف بسیاری از استقرار‌های بدون سرور (Serverless)، دچار تأخیر راه‌اندازی سرد (Cold Start) نمی‌شود؛ یعنی اولین درخواست پس از یک دوره خاموشی، با سرعت کامل پاسخ داده می‌شود.

اقتصاد جدید: پرداخت بر اساس درخواست

برای کسانی که عامل‌های هوش مصنوعی با تاریخچه گفتگوهای طولانی یا پرامپت‌های حجیم می‌سازند، تغییر مدل قیمت‌گذاری حیاتی‌ترین بخش خبر است. Oxlo.ai به جای روش استانداری که در صنعت رایج است (پرداخت به ازای هر توکن)، از قیمت‌گذاری «درخواست‌محور» (Request-based pricing) استفاده می‌کند. این بدان معناست که شما برای هر فراخوانی API مبلغ ثابتی می‌پردازید، فارغ از اینکه طول پرامپت شما چقدر است.

برای بارهای کاری که اندازه ورودی آن‌ها به‌شدت متغیر است، این روش می‌تواند ۱۰ تا ۱۰۰ برابر ارزان‌تر از ارائه‌دهندگانی مثل Together AI، Fireworks AI، OpenRouter، Replicate و Anyscale باشد. این رویکرد، هزینه‌های غیرقابل‌پیش‌بینی توکن‌ها را به یک هزینه عملیاتی قابل‌پیش‌بینی برای توسعه‌دهندگان تبدیل می‌کند.

این تغییر به نفع شرکت‌هایی است که عامل‌های پیچیده AI می‌سازند که تاریخچه گفتگوهای عظیمی را انباشته می‌کنند. با حذف «مالیات توکن» روی پرامپت‌های طولانی، مانعی برای استقرار مدل‌های متن‌باز با پارامتر بالا در محیط عملیاتی (Production) برداشته شده است. این مدل به‌ویژه برای موارد زیر مفید است:

  • خط‌لوله‌های عامل‌محوری که فراخوانی‌های ابزاری (Tool Calls) متعددی ارسال می‌کنند.
  • وظایف بازسازی کد (Code Refactoring) که از یک چک‌پوینت با ظرفیت بالا سود می‌برند.
  • بارهای کاری با متن طولانی که در آن‌ها اندازه پرامپت‌ها نوسان زیادی دارد.

توسعه‌دهندگان اکنون می‌توانند با استفاده از یک دوره آزمایشی ۷ روزه با دسترسی کامل، این ساختار را بسنجند و آن را با استک‌های اختصاصی فعلی خود مقایسه کنند. این دوره شامل دسترسی کامل به GPT-Oss 120B است تا پیش از تصمیم برای خرید پلان‌های سازمانی یا طرح‌های سهمیه روزانه، عملکرد آن را تست کنند.

گام بعدی شما

  • از دوره آزمایشی ۷ روزه Oxlo.ai برای مقایسه هزینه استنتاج مدل ۱۲۰ میلیاردی با استک فعلی خود استفاده کنید.
  • اگر عامل‌های شما تاریخچه گفتگوهای طولانی دارند، ساختار پرداخت را از Token-based به Request-based تغییر دهید تا هزینه‌ها را به شدت کاهش دهید.
  • عملکرد مدل را در وظایف کدنویسی پیچیده که نیاز به مدل‌های متراکم دارند بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر اعتبار معماری‌های Dense، موانع مالی استقرار عامل‌های هوش مصنوعی در تولید را می‌شکند. تخصص Oxlo.ai در قیمت‌گذاری درخواست‌محور، پیش‌بینی هزینه‌های عملیاتی را برای سازمان‌ها ممکن می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API، دسترسی توسعه‌دهندگان ایرانی به Oxlo.ai نیازمند زیرساخت‌های عبور از تحریم است، اما مدل قیمت‌گذاری درخواست‌محور برای تیم‌های کوچک ایرانی که بودجه محدودی برای توکن‌های حجیم دارند، بسیار جذاب است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های MoE با مدل‌های متراکم در مقیاس ۱۲۰ میلیارد پارامتر، بازگشتی به سمت ثبات است. در حالی که صنعت به دنبال بهینه‌سازی هزینه با پراکنده کردن پارامترها بود، GPT-Oss نشان می‌دهد که پیش‌بینی‌پذیری تأخیر برای محصولات تجاری ارزشمندتر از بهره‌وری تئوریک است. تغییر مدل قیمت‌گذاری از توکن به درخواست نیز عملاً مدل‌های زبانی را از «کالای مصرفی» به «سرویس ابری» تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.