پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های GPT-5.6 برای کاربران استرالیایی در Amazon Bedrock فعال شد

·۱۲ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
دسترسی به GPT-5.6 در Amazon Bedrock از مناطق استرالیا توسط AWS فراهم شد
دسترسی به GPT-5.6 در Amazon Bedrock از مناطق استرالیا توسط AWS فراهم شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی سه پروفایل تخصصی (Sol, Terra, Luna) برای GPT-5.6 در محیط Bedrock که اجازه می‌دهد سازمان‌ها بر اساس نیاز به استدلال یا سرعت، مدل را انتخاب کنند، نه اینکه فقط یک مدل کلی داشته باشند.

اگر در استرالیا هستید و برای استقرار مدل‌های پیشرفته OpenAI با محدودیت‌های منطقه‌ای دست‌وپنجه نرم می‌کردید، اکنون مسیر دسترسی شما باز شده است. طبق اعلام آمازون وب سرویسز (AWS)، مدل‌های خانواده GPT-5.6 از ۲ سپتامبر ۲۰۲۶ در مناطق سیدنی (ap-southeast-2) و ملبورن (ap-southeast-4) در دسترس قرار گرفتند. این دسترسی از طریق قابلیت استنتاج متقاطع منطقه‌ای جهانی (global cross-Region inference) در سرویس Amazon Bedrock فراهم شده است.

زمینه (Context)

این توسعه در حالی رخ می‌دهد که شرکت‌ها از چت‌بات‌های آزمایشی به سمت گردش‌های کاری عامل‌محور (Agentic) — شبیه به استخدام کارمندانی که نه‌تنها حرف می‌زنند، بلکه می‌توانند ابزارها را برای انجام یک پروژه مدیریت کنند — حرکت می‌کنند. در حالی که پیش‌تر اشاره کردیم که ابزار PII-Tracer متعلق به Perplexity در وظایف خاص شناسایی داده‌ها عملکرد بهتری نسبت به GPT-5.6-sol داشت، اما کاربرد گسترده‌تر سری ۵.۶ در تطبیق‌پذیری آن با نیازهای مختلف محیط‌های تولیدی نهفته است.

در این ساختار جدید، یک اپلیکیشن درخواست خود را به نقطه اتصال (Endpoint) زمان اجرای Amazon Bedrock در سیدنی یا ملبورن ارسال می‌کند و Bedrock این درخواست را برای پردازش به یک منطقه تجاری پشتیبانی‌شده در AWS هدایت می‌کند. این سازوکار به مشتریان استرالیایی اجازه می‌دهد بدون نیاز به مدیریت دستی مسیرهای منطقه‌ای در سطح اپلیکیشن، به استخر ظرفیت گسترده‌تری دسترسی داشته باشند.

به نقل از مستندات AWS، این خانواده به سه پروفایل مجزا تقسیم شده است تا تخصیص منابع بهینه شود:

  • GPT-5.6 Sol (global.openai.gpt-5.6-sol): برای استدلال‌های دشوار، کدنویسی پیچیده و بارهای کاری عامل‌محور مهندسی شده است.
  • GPT-5.6 Terra (global.openai.gpt-5.6-terra): مدلی متوازن برای استفاده‌های روزمره تولیدی که عملکرد را در برابر هزینه می‌سنجد.
  • GPT-5.6 Luna (global.openai.gpt-5.6-luna): برای برنامه‌هایی با حجم بالا و حساس به تأخیر (Latency) — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند و سرعت آن برای کاربر حیاتی است — بهینه‌سازی شده است تا استنتاجی سریع و مقرون‌به‌صرفه ارائه دهد.

جزئیات فنی (Technical Details)

بر اساس گزارش وبلاگ یادگیری ماشین AWS، هر سه مدل از ورودی‌های متنی و تصویری پشتیبانی کرده، متن تولید می‌کنند و پنجره زمینه (Context Window) — شبیه به میز کاری که تعیین می‌کند مدل هم‌زمان چه مقدار اطلاعات را در ذهن نگه می‌دارد — آن‌ها را تا ۱ میلیون توکن می‌رساند. توسعه‌دهندگان می‌توانند از طریق سه مسیر در نقطه اتصال Bedrock Runtime به این مدل‌ها متصل شوند:

۱. API پاسخ‌های OpenAI (OpenAI Responses API)
۲. API تکمیل چت OpenAI (OpenAI Chat Completions API)
۳. API گفتگو در Amazon Bedrock (Amazon Bedrock Converse API)

APIهای سازگار با OpenAI به جای استفاده از SDKهای AWS، از طریق مسیرهای /openai/v1 در نقطه اتصال فراخوانی می‌شوند. این نقطه اتصال هم امضای نسخه ۴ امضای AWS (SigV4) و هم کلید API استنتاج مدل Amazon Bedrock را می‌پذیرد.

برای کاهش هزینه‌ها و تسریع استقرار، AWS قابلیت حافظه موقت پرامپت (Prompt Caching) را در دو حالت اجرا کرده است. حالت «ضمنی» (Implicit) به‌صورت پیش‌فرض و بدون نیاز به تغییر در کد فعال است. در مقابل، حالت «صریح» (Explicit) به توسعه‌دهندگان اجازه می‌دهد تا پیشوندهای قابل استفاده مجدد، مرزهای حافظه موقت و کلیدهای کش را به‌طور دقیق تعریف کنند تا هزینه‌های عملیاتی کاهش یابد.

این یکپارچگی به عامل کدنویسی Codex نیز گسترش یافته است. Codex اکنون از طریق ارائه‌دهنده Bedrock Runtime که در آخرین نسخه Codex CLI تعبیه شده، از این پروفایل‌های استنتاج جهانی پشتیبانی می‌کند. AWS این پیکربندی را با استفاده از نسخه codex-cli 0.149.1 که مدل GPT-5.6 Sol را از منطقه سیدنی اجرا می‌کرد، اعتبارسنجی کرده است.

برای امنیت، AWS یک کمک‌کننده اعتبارنامه (Credential Helper) برای سازمان‌هایی که از Okta، Auth0، Microsoft Entra ID، Amazon Cognito یا AWS IAM Identity Center استفاده می‌کنند، ارائه می‌دهد. این سیستم توکن‌های OpenID Connect (OIDC) را با اعتبارنامه‌های موقت AWS مبادله می‌کند. سپس Codex این اعتبارنامه‌ها را از طریق زنجیره استاندارد اعتبارنامه AWS می‌خواند و تضمین می‌کند که درخواست‌ها با SigV4 امضا شوند بدون اینکه نیاز به کلیدهای API بلندمدت باشد. در صورتی که سیستم توسط IAM Identity Center پشتیبانی شود، اعتبارنامه‌ها هم‌زمان با نشست ورود یکپارچه (SSO) چرخش می‌کنند.

استقرار و نظارت (Deployment and Monitoring)

پیش‌نیازهای استقرار در استرالیا شامل یک حساب AWS با فعال بودن منطقه سیدنی یا ملبورن به عنوان منطقه منبع، یک نقش (Role) یا کاربر IAM با مجوزهای فراخوانی پروفایل‌های GPT-5.6 و نصب پایتون ۳.۹ یا بالاتر به همراه بسته‌های openai ،boto3 و aws-bedrock-token-generator است.

مدیریت این مدل‌ها نیازمند سهمیه‌های (Quotas) مشخص است که بر اساس تعداد درخواست در دقیقه و توکن در دقیقه اندازه‌گیری می‌شود. AWS به نرخ مصرف توکن (Token Burndown Rate) خاصی اشاره کرده است: توکن‌های ورودی و توکن‌های ورودیِ نوشتن در کش به‌صورت یک‌به‌یک محاسبه می‌شوند، اما هر توکن خروجی، ۱۰ توکن از سهمیه کل را مصرف می‌کند. مدیریت این سهمیه‌ها از طریق کنسول Service Quotas در منطقه منبع انجام می‌شود.

نظارت بر این فرآیند از طریق CloudWatch Coding Agent Insights انجام می‌شود که داشبوردهایی برای میزان مصرف توکن، نرخ命中 (hit rate) حافظه موقت و فعالیت کاربران فعال ارائه می‌دهد. این داده‌های تله‌متری از طریق پروتکل OpenTelemetry صادر می‌شوند. از آنجایی که درخواست‌ها از API زمان اجرای Bedrock استفاده می‌کنند، فراخوانی‌ها در لاگ‌های فراخوانی مدل به همراه شناسه پروفایل استنتاج و متادیتای فراخوانی ثبت می‌شوند.

برای سازمان‌های سازمانی، AWS توصیه می‌کند از یک جمع‌کننده (Collector) محلی استفاده کنند که خروجی‌ها را با استفاده از اعتبارنامه‌های فدرال با SigV4 امضا می‌کند. این روش بر رویکرد توکن حامل (Bearer-token) که به کلیدهای API بلندمدت متریه متکی است، ترجیح داده می‌شود؛ AWS استفاده از کلیدهای بلندمدت را تنها در مواردی توصیه می‌کند که دسترسی به اعتبارنامه‌های کوتاه‌مدت امکان‌پذیر نباشد.

این عرضه نشان‌دهنده رویکرد «جهانی‌گرایی منطقه‌ای» است؛ جایی که کاربر از مزایای تأخیر کم در نقطه اتصال محلی بهره می‌برد اما از ظرفیت پردازشی جهانی استفاده می‌کند. با حذف نیاز به مدیریت مسیرهای مقصد در سطح اپلیکیشن، AWS مانع ورود شرکت‌های استرالیایی برای مقیاس‌بندی هوش مصنوعی عامل‌محور را برداشته است.

گام بعدی شما

  • مدیران سیستم باید سیاست‌های کنترل سرویس (SCP) خود را بررسی کنند تا مطمئن شوند پروفایل‌های استنتاج جهانی GPT-5.6 در منطقه منبع مجاز هستند.
  • توسعه‌دهندگان می‌توانند از طریق AWS CLI یا نمای پروفایل‌های استنتاج در کنسول Amazon Bedrock، پروفایل‌های فعال را تأیید کنند.
  • برای بهینه‌سازی هزینه، استفاده از حالت صریح Prompt Caching را در بارهای کاری تکراری آزمایش کنید.

در نهایت، باید منتظر ماند و دید که این مدل‌های تخصصی — به‌ویژه مدل Sol — در بنچمارک‌های واقعی عامل‌محور در مقایسه با مدل‌های چندمنظوره نسل قبلی چه عملکردی خواهند داشت.

چرا این موضوع مهم است؟

این اقدام با تکیه بر زیرساخت‌های گسترده AWS، دسترسی سازمان‌ها به مدل‌های استدلالی سطح بالا را بدون پیچیدگی‌های شبکه تسهیل می‌کند. اعتبار این مدل‌ها در محیط‌های تولیدی، استاندارد جدیدی برای تعادل میان هزینه و عملکرد در مقیاس سازمانی تعریف می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های منطقه‌ای و تحریم‌های AWS، دسترسی مستقیم به این پروفایل‌ها برای توسعه‌دهندگان ایرانی مقدور نیست و همچنان نیاز به واسطه‌های ابری یا VPNهای سازمانی است.

·نگاه ما
تحریریه دات‌هوش

تفکیک مدل‌ها به سه سطح Sol، Terra و Luna نشان می‌دهد که دوران مدل‌های «همه-کاره» به پایان رسیده و صنعت به سمت مدل‌های تخصصی برای هر سطح از هزینه و سرعت می‌رود. این استراتژی AWS برای حذف مدیریت مسیرها (Routing) توسط کاربر، در واقع لایه‌ی انتزاعی جدیدی ایجاد می‌کند که استقرار مدل‌های جهانی را به سادگیِ فراخوانی یک API محلی می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.