پرش به محتوای اصلی
پرش به محتوای مقاله

OpenAI: تغییر مدل قیمت‌گذاری GPT-Image-2.5 مانع تورم بودجه توسعه‌دهندگان می‌شود

·۲۵ شهریور ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
راهنما
تخصیص بودجه GPT-Image-2.5 بر اساس تصاویر پذیرفته‌شده، نه درخواست‌ها
تخصیص بودجه GPT-Image-2.5 بر اساس تصاویر پذیرفته‌شده، نه درخواست‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی قیمت‌گذاری ثابت هر تصویر با مدل توکنی متغیر بر اساس سطح کیفیت (Low تا Max)؛ این اولین بار است که هزینه تولید تصویر دقیقاً با حجم محاسبات خروجی (Output Tokens) متناسب شده است.

اگر برای هر تصویر خروجی ۰.۰۵ دلار بودجه پیش‌بینی کرده‌اید، احتمالاً در پایان ماه با یک صورت‌حساب شوکه‌کننده روبرو می‌شوید. در مدل جدید GPT-Image-2.5، هزینه یک درخواست لزوماً به معنای هزینه یک تصویر کاربردی نیست. برای مثال، اگر گردش کار شما به گونه‌ای است که برای به دست آوردن ۶ دارایی قابل استفاده، نیاز به ۱۰ بار تولید تصویر دارید، هزینه واقعی هر دارایی پذیرفته‌شده پیش از محاسبه توکن‌های ورودی، به ۰.۰۸۷۸ دلار جهش می‌کند. این تمایز بسیار مهم‌تر از انتخاب بین مدل‌های Flare و Sunburst است، زیرا هر دو مدل از نرخ‌های توکنی رسمی یکسانی پیروی می‌کنند.

این تغییر در نحوه محاسبه هزینه‌ها درست زمانی رخ می‌دهد که اوپن‌ای‌آی از قیمت‌گذاری تخت (Flat-rate) فاصله گرفته و به سمت مدل‌های دانه‌بندی‌شده یا توکنی حرکت می‌کند. این رویکرد در ادامه موفقیت مدل GPT-6 Astra در انجام وظایف پیچیده OSWorld است. صنعت اکنون شاهد روندی گسترده‌تر است که در آن هزینه‌های هوش مصنوعی به جای تعداد درخواست‌های ساده، به محاسبات (Compute) واقعی مصرف‌شده گره خورده است. این تغییر رویکرد با تحلیل‌های پیشین ما درباره اهمیت معیار توکن به‌ازای هر وظیفه در بهینه‌سازی هزینه‌های AI هم‌راستا است. برای یک توسعه‌دهنده، این تغییر شبیه جایگزینی تاکسی‌های با قیمت ثابت با تاکسی‌متری است که حتی برای ثانیه‌های توقف در ترافیک هم هزینه می‌گیرد.

موتور صورت‌حساب توکنی

به نقل از مستندات رسمی مدل‌های Flare و Sunburst، صورت‌حساب API بر اساس سه دسته‌بندی مجزا محاسبه می‌شود. نرخ‌های استاندارد به شرح زیر است:

  • ورودی متنی: ۵.۰۰ دلار به ازای هر ۱ میلیون توکن
  • ورودی تصویری: ۸.۰۰ دلار به ازای هر ۱ میلیون توکن
  • خروجی تصویری: ۳۰.۰۰ دلار به ازای هر ۱ میلیون توکن
  • خروجی متنی: بدون هزینه (رایگان)

استفاده از ورودی‌های کش‌شده (Cached) تخفیف قابل‌توجهی ایجاد می‌کند و هزینه ورودی متنی را به ۱.۲۵ دلار و ورودی تصویری را به ۲.۰۰ دلار به ازای هر ۱ میلیون توکن کاهش می‌دهد. در حالت عادی (بدون کش)، هزینه هر درخواست از فرمول زیر پیروی می‌کند: (توکن‌های ورودی متنی × ۵ + توکن‌های ورودی تصویری × ۸ + توکن‌های خروجی تصویری × ۳۰) ÷ ۱,۰۰۰,۰۰۰.

یک تولید استاندارد با ۱۲۰ توکن ورودی متنی و ۱,۷۵۶ توکن خروجی تصویری، مجموعاً ۰.۰۵۳۲۸ دلار هزینه دارد (با فرض اینکه هیچ هزینه ورودی تصویری فعال نشده باشد). در حالی که پرامپت‌های کوتاه سهم کمی در هزینه نهایی نسبت به خروجی تصویر دارند، اما در فرآیندهای ویرایشی وضعیت متفاوت است. استفاده از چندین تصویر مرجع باعث فعال شدن هزینه‌های ورودی تصویری می‌شود؛ بنابراین تخمین‌های مربوط به تبدیل متن به تصویر را نمی‌توان برای خط لوله‌های ویرایشی که متکی به تصاویر مرجع هستند به کار برد. همچنین بسیار مهم است که بدانید اشتراک‌های ChatGPT شامل اعتبار API نمی‌شوند و مصرف توسعه‌دهندگان به‌طور جداگانه در حساب API آن‌ها صورت‌حساب می‌شود.

تخصیص بودجه GPT-Image-2.5 بر اساس تصاویر پذیرفته‌شده، نه درخواست‌ها

نردبان کیفیت و بودجه

طبق اعلام اوپن‌ای‌آی در ۸ سپتامبر ۲۰۲۶، خانواده GPT-Image-2.5 جایگزین برچسب‌های کیفی قدیمی شد و یک «نردبان بودجه توکنی» را معرفی کرد. از آنجا که ماشین‌حساب رسمی GPT Image 2 مصرف مدل GPT Image 2.5 را تخمین نمی‌زند، داده‌های مشاهده‌شده و ثبت‌شده توسط APIdog در ۹ سپتامبر ۲۰۲۶ معیار مناسبی برای شروع هستند.

برای تصاویر ۱۰۲۴×۱۰۲۴، هزینه‌های خروجی مشاهده‌شده عبارت است از:

  • Low (۱۹۶ توکن): ۰.۰۰۵۸۸ دلار
  • Medium (۴۳۹ توکن): ۰.۰۱۳۱۷ دلار
  • High (۱,۷۵۶ توکن): ۰.۰۵۲۶۸ دلار
  • XHigh (۳,۱۲۲ توکن): ۰.۰۹۳۶۶ دلار
  • Max (۷,۰۲۴ توکن): ۰.۲۱۰۷۲ دلار

برای تصاویر با ابعاد ۱۵۳۶×۱۰۲۴، هزینه‌ها کمی تغییر می‌کنند: حالت Low با ۱۵۸ توکن (۰.۰۰۴۷۴ دلار)، Medium با ۳۴۳ توکن (۰.۰۱۰۲۹ دلار)، High با ۱,۳۷۲ توکن (۰.۰۴۱۱۶ دلار)، XHigh با ۲,۴۵۹ توکن (۰.۰۷۳۷۷ دلار) و Max با ۵,۴۸۸ توکن (۰.۱۶۴۶۴ دلار).

توسعه‌دهندگانی که از GPT Image 2 مهاجرت می‌کنند، نباید کورکورانه تنظیمات High را حفظ کنند. هزینه High در نسخه قدیمی برای یک تصویر ۱۰۲۴×۱۰۲۴ حدود ۰.۲۱۱ دلار بود که اکنون با تنظیمات Max در نسخه جدید هم‌راستا است. تنظیم High جدید، هزینه را تا چهار برابر کاهش داده است، اما باید توجه داشت که این یک «معادل بودجه توکنی» است و ادعایی مبنی بر کیفیت بصری یکسان با High قدیمی نیست. اگر هدف شما حفظ همان بودجه توکنی قدیمی است، تنظیم Max گزینه نزدیک‌تری است.

Flare در برابر Sunburst: انتخاب نوع شکست

اوپن‌ای‌آی مدل Flare (gpt-image-2.5-flare) را به عنوان گزینه پیش‌فرض برای تکرارهای سریع و تولیدات انبوه معرفی کرده است. گزارش‌ها نشان می‌دهد که این مدل کیفیت تصویری بالاتر از GPT Image 2 دارد و تأخیر (Latency) آن تا ۵۰٪ کمتر است. در مقابل، Sunburst (gpt-image-2.5-sunburst) برای دقت بالا طراحی شده است؛ به‌ویژه برای ویرایش‌های کنترل‌شده و کارهای خلاقانه سطح بالا که در آن‌ها حفظ دقیق سوژه حیاتی است.

هر دو مدل از تنظیمات کیفی (low, medium, high, xhigh, max, auto) و ابعاد توصیه شده (۱۰۲۴×۱۰۲۴، ۱۵۳۶×۱۰۲۴، ۱۰۲۴×۱۵۳۶) پشتیبانی می‌کنند و خروجی‌های شفاف را در قالب PNG یا WebP ارائه می‌دهند. با این حال، قابلیت‌هایی مانند فراخوانی تابع (Function Calling)، خروجی‌های ساختاریافته (Structured Outputs) و تنظیم دقیق (Fine-tuning) بخشی از این رابط کاربری نیستند. برای پیش‌بینی‌پذیری در استقرار، توصیه می‌شود به‌جای تکیه بر ID متغیر مدل، از نسخه‌های تاریخ‌دار (مثلاً gpt-image-2.5-flare-2026-09-08) استفاده کنید.

اگرچه هر دو مدل نرخ ۳۰ دلار به ازای هر میلیون توکن خروجی را دارند، اما ارزش آن‌ها در «نوع شکست» آن‌هاست. اگر Sunburst بتواند در یک تلاش، یک دارایی کامل و بی‌نقص تحویل دهد در حالی که Flare به سه بار تکرار نیاز داشته باشد، Sunburst به‌رغم تأخیر بیشتر، گزینه ارزان‌تری برای عملیات است.

معیارهای عملکرد و ایمنی

نتایج اولیه بنچمارک Arena این جایگاه‌بندی را تأیید می‌کند. در تولید متن به تصویر و ویرایش تک‌تصویر، هر دو مدل از GPT Image 2 پیشی گرفته‌اند. Sunburst در امتیازات ویرایش تک‌تصویر با میانگین ۱۵۲۰ (± ۹) در مقابل ۱۴۹۱ (± ۹) برای Flare، حدود ۲۹ امتیاز جلوتر است، در حالی که مدل GPT Image 2 (در حالت medium) امتیاز ۱۴۶۱ (± ۳) را کسب کرده است.

ارزیابی‌های ایمنی معیار متفاوتی را می‌سنجند: نرخ ارائه تولیدات ناامن در مجموعه‌های متخاصم (Adversarial sets). Sunburst با ۱.۰۹٪ کمترین نرخ را گزارش کرده است و پس از آن Flare با ۱.۴۱٪ و مدل پایه Images 2.0 با ۱.۶۴٪ قرار دارند. تأکید می‌شود که این‌ها معیارهای ایمنی هستند و نه امتیازات کیفیت زیبایی‌شناختی.

تله تخفیف‌های واسطه‌ای

سرویس‌های واسطی مانند CometAPI نرخ‌های تخفیف‌خورده‌ای ارائه می‌دهند، مثلاً ۴ دلار برای ورودی و ۲۴ دلار برای خروجی (۲۰٪ کمتر از نرخ رسمی). برای تولید ۱۰,۰۰۰ تصویر با کیفیت High در ابعاد ۱۰۲۴×۱۰۲۴، این کار هزینه خروجی را از ۵۲۶.۸۰ دلار به ۴۲۱.۴۴ دلار کاهش می‌دهد.

با این حال، این درگاه‌ها اغلب از عناوین کلی «ورودی» استفاده می‌کنند. از آنجا که قیمت‌گذاری رسمی بین ورودی متنی (۵ دلار) و ورودی تصویری (۸ دلار) تفاوت قائل می‌شود، یک نرخ ثابت در درگاه واسط ممکن است هزینه واقعی خط لوله‌های ویرایشی سنگین (که متکی به تصاویر مرجع هستند) را پنهان کند. برای مثال، با نرخ ۲۴ دلار برای خروجی، یک تصویر با کیفیت Low هزینه ۰.۰۰۴۷۰ دلار و یک تصویر با کیفیت Max هزینه ۰.۱۶۸۵۸ دلار خواهد داشت.

پیاده‌سازی خط لوله تولید

برای بهینه‌سازی هزینه‌ها، توسعه‌دهندگان باید تنظیمات کیفیت را بر اساس مرحله گردش کار تعیین کنند، نه اینکه از یک تنظیم کلی استفاده کنند:

  • پیش‌نمایش و آزمایش‌های ارزان: استفاده از حالت 'low'.
  • تولید مفاهیم کلی: استفاده از حالت 'medium' و سپس فیلتر کردن نتایج.
  • کاندیداهای نهایی و اصلاح: استفاده از حالت 'high'.
  • پولیش و پرداخت نهایی: استفاده از 'xhigh' برای دارایی‌هایی که بودجه بیشتری را توجیه می‌کنند.
  • خروجی‌های نهایی حساس به جزئیات: استفاده از حالت 'max'.

برای تطبیق صورت‌حساب، شما باید موارد زیر را ردیابی کنید: نسخه مدل (Snapshot)، تنظیمات کیفیت، ابعاد تصویر، تعداد توکن‌ها (ورودی متنی، ورودی تصویری و خروجی تصویری)، میزان استفاده از ورودی‌های کش‌شده، تعداد دفعات تکرار (Retry) و اینکه آیا نتیجه نهایی پذیرفته شده است یا خیر. هدف نهایی نباید «ارزان‌ترین درخواست»، بلکه «ارزان‌ترین مسیر مطمئن برای رسیدن به یک تصویر تأییدشده» باشد. این استراتژی بهینه‌سازی، یادآور برتری مدل‌های کوچک در بهره‌وری و هزینه است که نشان می‌دهد همیشه مدل‌های عظیم‌ترین گزینه اقتصادی نیستند.

این تغییر به سمت صورت‌حساب توکنی به این معناست که مهندسی پرامپت دیگر فقط درباره کیفیت نیست، بلکه درباره بهره‌وری مالی است. گران‌ترین بخش خط لوله دیگر فراخوانی API نیست، بلکه نرخ رد شدن تصاویر توسط انسان است.

منتظر انتشار ماشین‌حساب‌های رسمی GPT-Image-2.5 از سوی اوپن‌ای‌آی باشید تا جایگزین تخمین‌های فعلی APIdog شوند.

گام بعدی شما

  • تحلیل نرخ پذیرش (Acceptance Rate) تصاویر خود را محاسبه کنید تا هزینه واقعی هر دارایی نهایی را بیابید.
  • برای مراحل اولیه ایده‌پردازی، تنظیمات را روی Low یا Medium قرار دهید تا بودجه برای خروجی‌های Max ذخیره شود.
  • از نسخه‌های تاریخ‌دار مدل استفاده کنید تا تغییرات ناگهانی در توکن‌های خروجی، بودجه ماهانه شما را به هم نریزد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر بر اساس تجربه عملی اوپن‌ای‌آی در مدیریت منابع محاسباتی صورت گرفته و استانداردی جدید برای مدل‌های چندوجهی ایجاد می‌کند. اکنون اعتبار مالی پروژه‌های AI به جای تعداد درخواست، به بهره‌وری در تولید دارایی‌های پذیرفته‌شده گره خورده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، توسعه‌دهندگان ایرانی که از واسطه‌ها استفاده می‌کنند باید مراقب تله نرخ‌های کلی باشند، زیرا هزینه‌های ورودی تصویری در مدل جدید می‌تواند بودجه آن‌ها را به‌سرعت تخلیه کند.

·نگاه ما
تحریریه دات‌هوش

انتقال به قیمت‌گذاری توکنی در تولید تصویر، در واقع پذیرش این واقعیت است که کیفیت بصری یک متغیر خطی نیست. این مدل جدید، مهندسی پرامپت را از یک هنر بصری به یک مسئله بهینه‌سازی مالی تبدیل می‌کند؛ جایی که کاهش نرخ رد (Rejection Rate) توسط کاربر، تأثیر بیشتری بر سودآوری دارد تا کاهش هزینه هر توکن.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.