اگر در استرالیا هستید و برای استقرار مدلهای پیشرفته OpenAI با محدودیتهای منطقهای دستوپنجه نرم میکردید، اکنون مسیر دسترسی شما باز شده است. طبق اعلام آمازون وب سرویسز (AWS)، مدلهای خانواده GPT-5.6 از ۲ سپتامبر ۲۰۲۶ در مناطق سیدنی (ap-southeast-2) و ملبورن (ap-southeast-4) در دسترس قرار گرفتند. این دسترسی از طریق قابلیت استنتاج متقاطع منطقهای جهانی (global cross-Region inference) در سرویس Amazon Bedrock فراهم شده است.
زمینه (Context)
این توسعه در حالی رخ میدهد که شرکتها از چتباتهای آزمایشی به سمت گردشهای کاری عاملمحور (Agentic) — شبیه به استخدام کارمندانی که نهتنها حرف میزنند، بلکه میتوانند ابزارها را برای انجام یک پروژه مدیریت کنند — حرکت میکنند. در حالی که پیشتر اشاره کردیم که ابزار PII-Tracer متعلق به Perplexity در وظایف خاص شناسایی دادهها عملکرد بهتری نسبت به GPT-5.6-sol داشت، اما کاربرد گستردهتر سری ۵.۶ در تطبیقپذیری آن با نیازهای مختلف محیطهای تولیدی نهفته است.
در این ساختار جدید، یک اپلیکیشن درخواست خود را به نقطه اتصال (Endpoint) زمان اجرای Amazon Bedrock در سیدنی یا ملبورن ارسال میکند و Bedrock این درخواست را برای پردازش به یک منطقه تجاری پشتیبانیشده در AWS هدایت میکند. این سازوکار به مشتریان استرالیایی اجازه میدهد بدون نیاز به مدیریت دستی مسیرهای منطقهای در سطح اپلیکیشن، به استخر ظرفیت گستردهتری دسترسی داشته باشند.
به نقل از مستندات AWS، این خانواده به سه پروفایل مجزا تقسیم شده است تا تخصیص منابع بهینه شود:
- GPT-5.6 Sol (global.openai.gpt-5.6-sol): برای استدلالهای دشوار، کدنویسی پیچیده و بارهای کاری عاملمحور مهندسی شده است.
- GPT-5.6 Terra (global.openai.gpt-5.6-terra): مدلی متوازن برای استفادههای روزمره تولیدی که عملکرد را در برابر هزینه میسنجد.
- GPT-5.6 Luna (global.openai.gpt-5.6-luna): برای برنامههایی با حجم بالا و حساس به تأخیر (Latency) — یعنی لحظهای که مدل واقعاً جواب تولید میکند و سرعت آن برای کاربر حیاتی است — بهینهسازی شده است تا استنتاجی سریع و مقرونبهصرفه ارائه دهد.
جزئیات فنی (Technical Details)
بر اساس گزارش وبلاگ یادگیری ماشین AWS، هر سه مدل از ورودیهای متنی و تصویری پشتیبانی کرده، متن تولید میکنند و پنجره زمینه (Context Window) — شبیه به میز کاری که تعیین میکند مدل همزمان چه مقدار اطلاعات را در ذهن نگه میدارد — آنها را تا ۱ میلیون توکن میرساند. توسعهدهندگان میتوانند از طریق سه مسیر در نقطه اتصال Bedrock Runtime به این مدلها متصل شوند:
۱. API پاسخهای OpenAI (OpenAI Responses API)
۲. API تکمیل چت OpenAI (OpenAI Chat Completions API)
۳. API گفتگو در Amazon Bedrock (Amazon Bedrock Converse API)
APIهای سازگار با OpenAI به جای استفاده از SDKهای AWS، از طریق مسیرهای /openai/v1 در نقطه اتصال فراخوانی میشوند. این نقطه اتصال هم امضای نسخه ۴ امضای AWS (SigV4) و هم کلید API استنتاج مدل Amazon Bedrock را میپذیرد.
برای کاهش هزینهها و تسریع استقرار، AWS قابلیت حافظه موقت پرامپت (Prompt Caching) را در دو حالت اجرا کرده است. حالت «ضمنی» (Implicit) بهصورت پیشفرض و بدون نیاز به تغییر در کد فعال است. در مقابل، حالت «صریح» (Explicit) به توسعهدهندگان اجازه میدهد تا پیشوندهای قابل استفاده مجدد، مرزهای حافظه موقت و کلیدهای کش را بهطور دقیق تعریف کنند تا هزینههای عملیاتی کاهش یابد.
این یکپارچگی به عامل کدنویسی Codex نیز گسترش یافته است. Codex اکنون از طریق ارائهدهنده Bedrock Runtime که در آخرین نسخه Codex CLI تعبیه شده، از این پروفایلهای استنتاج جهانی پشتیبانی میکند. AWS این پیکربندی را با استفاده از نسخه codex-cli 0.149.1 که مدل GPT-5.6 Sol را از منطقه سیدنی اجرا میکرد، اعتبارسنجی کرده است.
برای امنیت، AWS یک کمککننده اعتبارنامه (Credential Helper) برای سازمانهایی که از Okta، Auth0، Microsoft Entra ID، Amazon Cognito یا AWS IAM Identity Center استفاده میکنند، ارائه میدهد. این سیستم توکنهای OpenID Connect (OIDC) را با اعتبارنامههای موقت AWS مبادله میکند. سپس Codex این اعتبارنامهها را از طریق زنجیره استاندارد اعتبارنامه AWS میخواند و تضمین میکند که درخواستها با SigV4 امضا شوند بدون اینکه نیاز به کلیدهای API بلندمدت باشد. در صورتی که سیستم توسط IAM Identity Center پشتیبانی شود، اعتبارنامهها همزمان با نشست ورود یکپارچه (SSO) چرخش میکنند.
استقرار و نظارت (Deployment and Monitoring)
پیشنیازهای استقرار در استرالیا شامل یک حساب AWS با فعال بودن منطقه سیدنی یا ملبورن به عنوان منطقه منبع، یک نقش (Role) یا کاربر IAM با مجوزهای فراخوانی پروفایلهای GPT-5.6 و نصب پایتون ۳.۹ یا بالاتر به همراه بستههای openai ،boto3 و aws-bedrock-token-generator است.
مدیریت این مدلها نیازمند سهمیههای (Quotas) مشخص است که بر اساس تعداد درخواست در دقیقه و توکن در دقیقه اندازهگیری میشود. AWS به نرخ مصرف توکن (Token Burndown Rate) خاصی اشاره کرده است: توکنهای ورودی و توکنهای ورودیِ نوشتن در کش بهصورت یکبهیک محاسبه میشوند، اما هر توکن خروجی، ۱۰ توکن از سهمیه کل را مصرف میکند. مدیریت این سهمیهها از طریق کنسول Service Quotas در منطقه منبع انجام میشود.
نظارت بر این فرآیند از طریق CloudWatch Coding Agent Insights انجام میشود که داشبوردهایی برای میزان مصرف توکن، نرخ命中 (hit rate) حافظه موقت و فعالیت کاربران فعال ارائه میدهد. این دادههای تلهمتری از طریق پروتکل OpenTelemetry صادر میشوند. از آنجایی که درخواستها از API زمان اجرای Bedrock استفاده میکنند، فراخوانیها در لاگهای فراخوانی مدل به همراه شناسه پروفایل استنتاج و متادیتای فراخوانی ثبت میشوند.
برای سازمانهای سازمانی، AWS توصیه میکند از یک جمعکننده (Collector) محلی استفاده کنند که خروجیها را با استفاده از اعتبارنامههای فدرال با SigV4 امضا میکند. این روش بر رویکرد توکن حامل (Bearer-token) که به کلیدهای API بلندمدت متریه متکی است، ترجیح داده میشود؛ AWS استفاده از کلیدهای بلندمدت را تنها در مواردی توصیه میکند که دسترسی به اعتبارنامههای کوتاهمدت امکانپذیر نباشد.
این عرضه نشاندهنده رویکرد «جهانیگرایی منطقهای» است؛ جایی که کاربر از مزایای تأخیر کم در نقطه اتصال محلی بهره میبرد اما از ظرفیت پردازشی جهانی استفاده میکند. با حذف نیاز به مدیریت مسیرهای مقصد در سطح اپلیکیشن، AWS مانع ورود شرکتهای استرالیایی برای مقیاسبندی هوش مصنوعی عاملمحور را برداشته است.
گام بعدی شما
- مدیران سیستم باید سیاستهای کنترل سرویس (SCP) خود را بررسی کنند تا مطمئن شوند پروفایلهای استنتاج جهانی GPT-5.6 در منطقه منبع مجاز هستند.
- توسعهدهندگان میتوانند از طریق AWS CLI یا نمای پروفایلهای استنتاج در کنسول Amazon Bedrock، پروفایلهای فعال را تأیید کنند.
- برای بهینهسازی هزینه، استفاده از حالت صریح Prompt Caching را در بارهای کاری تکراری آزمایش کنید.
در نهایت، باید منتظر ماند و دید که این مدلهای تخصصی — بهویژه مدل Sol — در بنچمارکهای واقعی عاملمحور در مقایسه با مدلهای چندمنظوره نسل قبلی چه عملکردی خواهند داشت.




گفتگو