تصور کنید میخواهید یک تصویر پیچیده را ویرایش کنید، اما هر بار که یک تغییر کوچک میخواهید، هوش مصنوعی کل صحنه را از نو میکشد و تمام جزئیاتی که قبلاً درست شده بود را بههم میریزد. مایکروسافت با معرفی GPT-image-2.5 در ۲۶ سپتامبر ۲۰۲۶، این کابوس تکرار برای طراحان و توسعهدهندگان را به پایان رساند. این سیستم اکنون به یک توسعهدهنده .NET اجازه میدهد تا یک تصویر پیچیده تولید شده توسط هوش مصنوعی را بدون بازترسیم کل صحنه یا از دست دادن چیدمان تثبیتشده، بهروزرسانی کند.
این بهروزرسانی با معرفی دو مدل مجزا به نامهای Flare و Sunburst، اجازه میدهد کاربر بدون از دست دادن ساختار کلی، تنها بخشهای مورد نیاز را تغییر دهد. این اقدام در حالی صورت میگیرد که صنعت با چالشی به نام «انحراف ویرایشی» (Edit Drift) دستوپنجه نرم میکند؛ وضعیتی که در آن دستورات متوالی به یک مولد تصویر، بهطور نامحسوس عناصری را که در مراحل قبل درست شده بودند، تغییر میدهند. در حالی که ما پیشتر پوشش دادیم که چگونه GPT-6 Astra به دقت ۸۰٪ در شناسایی خطاهای مونتاژ فیزیکی دست یافت، چالش مدلهای مولد همچنان ثبات بازبینیهای بصری در طول چندین نوبت تعامل بوده است.
برای یک توسعهدهنده معمولی، این تغییر شبیه تبدیل یک نقاشی ثابت به یک بوم دیجیتال است. بهجای اینکه امیدوار باشید یک پرامپت واحد معجزه کند، حالا میتوانید با تصویر مانند یک پیشنویس زنده برخورد کنید که در طول یک گفتگو تکامل مییابد. بهعنوان مثال در یک اپلیکیشن طراحی دکوراسیون، مشتری تایپ میکند: «یک آشپزخانه مدرن با کابینتهای تیره و یک جزیره مرکزی بزرگ را به من نشان بده». تصویر در چند ثانیه ظاهر میشود. سپس کاربر میگوید: «آن را روشنتر کن و المانهای چوبی طبیعی اضافه کن». اپلیکیشن بدون بازترسیم کل صحنه، تصویر را بهروز میکند. این دقیقاً همان تعاملی است که GPT-image-2.5 برای آن ساخته شده است.
استراتژی مدل دو لایه
مایکروسافت رویکرد «یک مدل برای همه» را کنار گذاشته و معماری جدیدی را معرفی کرده است که بار کاری را بر اساس موازنه بین سرعت و دقت تقسیم میکند:
- Flare: این مدل کوچکتر و با سرعت بسیار بالاست و برای اکثر بارهای کاری تولیدی طراحی شده است. Flare کیفیت بالاتری نسبت به GPT-image-2 ارائه میدهد در حالی که با تأخیر (Latency) ۵۰٪ کمتر عمل میکند. این سرعت برای نگه داشتن کاربر در یک چرخه تکرار زنده، بهجای انتظار برای هر تغییر کوچک، حیاتی است. این مدل در ارزیابیهای اخیر توانسته است دقت تایپوگرافی را به ۹۸.۴٪ برساند و استانداردهای جدیدی را در تولید متنهای بصری تعریف کند.
- Sunburst: این مدل جریانهای کاری خلاقانهای را هدف قرار میدهد که در آن کیفیت بر سرعت اولویت دارد. از Sunburst برای تولید داراییهای باfidelity بالا در کمپینهای تبلیغاتی و بصریهای صیقلخوردهای استفاده میشود که نیاز به حداکثر دقت و کنترل دارند.

حل چرخه بازبینی
به نقل از راهنمای فنی dev.to، پیشرفت اصلی در نحوه مدیریت ویرایشهای چندمرحلهای (Multi-turn editing) است. اکثر مدلهای انتشار (Diffusion Model) — که شبیه مجسمهسازی هستند و تصویر را از دل یک توده نویز استخراج میکنند — هنگام درخواست تغییر کوچک، یک «بازترسیم کامل» (Full Re-roll) انجام میدهند که اغلب ترکیببندی اصلی را نابود میکند.
اما GPT-image-2.5 ویرایشهای چندمرحلهای قدرتمندتری را معرفی کرده است. این قابلیت اجازه میدهد کاربر یک تصویر را از طریق دستورات متوالی اصلاح کند، بدون اینکه هویت بصری دچار انحراف یا تخریب شود. این موضوع مشکل رایجی را حل میکند که در آن ویرایش سوم، بهطور نامحسوس چیزی را که در ویرایش اول درست شده بود، تغییر میداد.
قابلیتهای فنی و جزئیات
علاوه بر سرعت و دقت، نسخه ۲.۵ مکانیزمهای خاصی را برای تولید داراییهای آمادهی بهرهبرداری (Production-ready) معرفی میکند:
- ویرایش هدفمند دقیق: مدلها میتوانند المانهای خاصی را بهروزرسانی کنند در حالی که بقیه تصویر را حفظ میکنند و نیاز به بازترسیم کامل برای تنظیمات کوچک را از بین میبرند.
- پیروی از دستورات: بهبود چشمگیر در تفسیر دستورات بصری پیچیده، چیدمانهای خاص و جهتگیریهای سبکشناختی مشاهده میشود.
- پسزمینههای شفاف: توسعهدهندگان اکنون میتوانند لوگوها، برشهای محصول (Product Cutouts)، داراییهای UI، آیکونها و استیکرها را مستقیماً با پسزمینه شفاف تولید کنند. این کار با تنظیم
background="transparent"وoutput_format="png"انجام میشود. توجه داشته باشید که فرمت PNG یا WebP الزامی است، زیرا JPEG از شفافیت پشتیبانی نمیکند. - آمادگی برای تولید: برخلاف بسیاری از مدلهای موجود در کاتالوگ، هر دو مدل Flare و Sunburst در حالت دسترسی عمومی (GA) هستند و هیچ هشدار یا محدودیت مربوط به نسخه پیشنمایش (Preview) ندارند.
پیادهسازی عملی در .NET
مایکروسافت این مدلها را مستقیماً در اکوسیستم Azure.AI.OpenAI ادغام کرده است. توسعهدهندگان .NET میتوانند تنها با تغییر نام استقرار (Deployment Name) در ImageClient بین Flare و Sunburst جابهجا شوند، بدون اینکه نیاز به بازنویسی کد موجود باشد. این پیادهسازی بر پایه Azure.AI.OpenAI ، Microsoft.Extensions.Configuration و dotnet run است و به هیچ وجه نیازی به پایتون یا نوتبوکها ندارد.
برای شروع، توسعهدهندگان میتوانند با دستور dotnet new console پروژه را ایجاد کرده و بستههای لازم شامل Azure.AI.OpenAI ، Azure.Identity ، Microsoft.Extensions.Configuration.UserSecrets و Microsoft.Extensions.Configuration.EnvironmentVariables را اضافه کنند. پیکربندی از طریق User Secrets برای مقادیر AZURE_AI_ENDPOINT ، AZURE_AI_API_KEY و نسخه API ویرایش تصویر AZURE_AI_IMAGE_EDIT_API_VERSION (که در حال حاضر 2025-04-01-preview است) مدیریت میشود.
کاربردهای عملی در دنیای واقعی
مورد اول: طراحی تکرارپذیر خانه
در یک اپلیکیشن طراحی خانه، کاربر ممکن است یک آشپزخانه مدرن درخواست کند. با استفاده از Flare، اپلیکیشن میتواند صحنه اولیه (مثلاً با ابعاد ۱۵۳۶ در ۸۶۴) را رندر کند و سپس یک بازبینی — مانند افزودن المانهای چوبی — را با فراخوانی نقطه اتصال edits روی تصویر اول اعمال کند. با استفاده از یک درخواست MultipartFormDataContent که شامل بایتهای تصویر اصلی و پرامپتی مانند «چیدمان، زاویه دوربین و ترکیببندی کلی را ثابت نگه دار» است، اپلیکیشن تضمین میکند که زاویه دوربین و جایگاه جزیره بین نسخهها یکسان بماند. این تفاوت — یعنی استفاده از فراخوانی ویرایش بهجای فراخوانی تولید مجدد — همان چیزی است که از تغییر کامل صحنه جلوگیری میکند.
مورد دوم: برنامهریزی سفر
اپلیکیشنهای سفر میتوانند یک الگوی دو لایه برای کاهش هزینه پیاده کنند. آنها از Flare برای تولید پیشنمایشهای ارزان و سریع (مثلاً ۱۰۲۴ در ۱۰۲۴) استفاده میکنند، در حالی که مسافر در حال کاوش در مقاصد است (مثلاً یک شهر ساحلی در پرتغال در ساعت طلایی). هنگامی که یک جهت خاص تثبیت شد — مثلاً افزودن یک بندر قایق و کافههای فضای باز — اپلیکیشن یک فراخوانی تک و گرانتر به Sunburst میزند تا تصویر نهایی و با رزولوشن بالای برنامه سفر را تولید کند. این کار از پرداخت هزینه کامل Sunburst برای پیشنمایشهای اکتشافی که احتمالاً دور ریخته میشوند، جلوگیری میکند.
مورد سوم: نمودارهای آموزشی تکاملی
در آموزشهای مبتنی بر هوش مصنوعی، نمودارها باید همگام با پیشرفت درس تکامل یابند. تأخیر کم Flare اجازه میدهد نمودار فتوسنتز در لحظهای که دانشآموز یک سؤال تکمیلی میپرسد — مثلاً تغییر از تبدیل انرژی کلی به تفاوت بین گیاهان C3 و C4 — بهروز شود. این امر یک رابط کاربری مبتنی بر چت ایجاد میکند که در آن نمودار بهصورت بلادرنگ بهروز میشود. دیگر نیازی به دکمه مجزای «تولید نمودار» یا استفاده دانشآموز از اصطلاحات پیچیده مهندسی پرامپت برای توصیف تغییر بصری نیست.
مورد چهارم: خردهفروشی و تجارت الکترونیک
برای بازاریابی، Sunburst ضعف تاریخی مدلهای انتشار در تولید متن خوانا را حل کرده است. این مدل میتواند تیترهای برجسته و خوانایی مانند "SUMMER SALE - 30% OFF" را با یک فونت Sans-serif مدرن و تمیز مستقیماً در یک بنر عریض رندر کند. در همین حال، Flare میتواند برای تولید دستهای و سازگار از عکسهای کاتالوگ محصول برای صدها SKU استفاده شود. با استفاده از یک قالب استایل ثابت (مثلاً «عکس استودیویی محصول روی پسزمینه سفید یکدست») و تنها با تغییر توصیف محصول (مثلاً «ماگ سرامیکی مشکی مات» در مقابل «سبز مریمگلی»)، نورپردازی و کادربندی در کل دسته ثابت میماند.
مورد پنجم: پرو مجازی (Virtual Try-On)
قابلیتهای پرو مجازی به پایداری شدید هویت نیاز دارند. Sunburst اجازه میدهد یک خریدار رنگ ژاکت را به سرمهای تغییر دهد و سپس شخص را به یک خیابان شهری در فضای باز منتقل کند، در حالی که چهره مشتری، فیگور و شکل ژاکت در طول چندین ویرایش دقیقاً یکسان بماند. این همان «ویرایش چندمرحلهای قدرتمند» در عمل است. با ساخت هر ویرایش بر اساس نتیجه قبلی، مدل از انحرافی که معمولاً باعث میشود کاربران پس از چند تلاش از قابلیتهای پرو مجازی دست بکشند، جلوگیری میکند.
تحلیل راهبردی
این چرخش به سمت یک سبد مدلهای لایهبندی شده نشان میدهد که «مرز» هوش مصنوعی تصویر دیگر فقط درباره رزولوشن خام نیست، بلکه درباره «کنترلپذیری» است. با تفکیک مرحله «کاوش» (Flare) از مرحله «نهاییسازی» (Sunburst)، مایکروسافت هم هزینههای محاسباتی ابری و هم تجربه کاربر را بهینه میکند.
برای اکوسیستم .NET، این اقدام «مالیات پایتون» را حذف میکند. توسعهدهندگان میتوانند خط لولههای تولید تصویر پیچیده و تکرارپذیر را با استفاده از ابزارهای استاندارد C# و زیرساخت Azure بسازند و تولید تصویر AI را از یک پرامپت تفننی به یک ابزار تولیدی قابلاتکا تبدیل کنند.
راهنمای انتخاب مدل
برای حداکثر بهرهوری، توسعهدهندگان باید این دستورالعملها را دنبال کنند:
- از Flare استفاده کنید وقتی: در حال تکرار زنده با کاربر هستید، تأخیر اولویت دارد، یا در حال تولید حجم بالایی از داراییها مانند کاتالوگها و پیشنمایشها هستید.
- از Sunburst استفاده کنید وقتی: خروجی یک دارایی نهایی و آماده ارسال است (مانند تصویر اصلی یک کمپین)، یا زمانی که دقت ویرایش در چندین نوبت متوالی، نیاز اصلی است.
- از هیچکدام استفاده نکنید وقتی: به تطابق پیکسل-به-پیکسل با دستورالعملهای برند بدون هیچ بازبینی انسانی نیاز دارید، یا وقتی حجم کاری شما به مدالیتههای غیرمتنی وابسته است که توسط APIهای تصویر پوشش داده نمیشوند.
با این حال، این مدلها جایگزینی برای مدیریت هنری انسانی نیستند. خروجی باید به عنوان یک پیشنویس قوی در نظر گرفته شود، نه یک دارایی نهایی که بدون تأیید قابل انتشار باشد. برای شروع پیادهسازی، توسعهدهندگان باید هر دو مدل را از کاتالوگ مدلهای Foundry مستقر کرده و نقطه اتصال edits را آزمایش کنند تا ببینند داراییهای خاص آنها چگونه با بازبینیهای چندمرحلهای برخورد میکنند.
گام بعدی شما
- هر دو مدل را از کاتالوگ مدلهای Foundry مستقر کنید و تفاوت تأخیر آنها را در محیط تست بسنجید.
- نقطه اتصال
editsرا برای داراییهای خاص خود آزمایش کنید تا میزان پایداری بصری در ویرایشهای متوالی را ارزیابی کنید. - اگر از .NET استفاده میکنید، کتابخانه
Azure.AI.OpenAIرا بهروزرسانی کرده و مدل Flare را برای پیشنمایشهای سریع جایگزین مدلهای قدیمی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو