پرش به محتوای اصلی
پرش به محتوای مقاله

۲ قابلیت کلیدی GPT-۵.۶: تفکر چندلایه و استفاده از کامپیوتر

·۲۳ تیر ۱۴۰۵۵ دقیقه مطالعه
عنوان تصویر: راهنمای استفاده از GPT-5.6 در محیط کار
عنوان تصویر: راهنمای استفاده از GPT-5.6 در محیط کار
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

به‌کارگیری مکانیزم Computer Use برای کنترل مستقیم مکان‌نما و رابط کاربری در کنار معرفی پنج سطح تفکر متغیر برای مدیریت موازنه بین دقت استدلال و سهمیه مصرف.

اگر امروز از چت‌بات‌ها برای مدیریت کارهای اداری استفاده می‌کنید، باید بدانید که مرز بین «گفتگو با هوش مصنوعی» و «جایگزینی کاربر» در حال محو شدن است. در ۱۴ ژوئیه ۲۰۲۶، شرکت OpenAI مدل‌های GPT-5.6 را برای عموم کاربران منتشر کرد. این مدل‌ها دیگر صرفاً متن تولید نمی‌کنند؛ بلکه اکنون می‌توانند قابلیت «استفاده از رایانه» (Computer Use) را اجرا کنند. این به این معناست که مدل می‌تواند مکان‌نما (Cursor) کاربر را برای باز کردن اپلیکیشن‌ها و کلیک بر روی دکمه‌ها، بر اساس تحلیل بصری صفحه نمایش، هدایت کند.

این تحول در حالی رخ می‌دهد که رقابت برای دستیابی به جریان‌های کاری عامل‌محور (Agentic) به اوج خود رسیده است. این رویکرد در راستای استراتژی بلندمدت این شرکت برای خودکارسازی جریان‌های کاری است که پیش‌تر در تحلیل انتشار عمومی GPT-5.6 به آن پرداختیم. همان‌طور که در تحلیل قبلی ما درباره‌ی این موضوع که مدل GPT-5.6 Sol چگونه توکن‌های عامل را از طریق فراخوانی ابزارهای برنامه‌ریزی شده تا ۶۳.۵ درصد کاهش داد اشاره کردیم، به‌روزرسانی فعلی از بهینه‌سازی API فراتر رفته و به تعامل مستقیم با سیستم‌عامل (OS) می‌پردازد. برای اکثر کاربران، این تجربه شبیه به تبدیل شدن یک چت‌بات ساده به یک کارمند دیجیتال است که می‌تواند محیط دسکتاپ شما را ببیند و در آن عمل کند.

سلسله‌مراتب مدل‌های جدید

طبق اعلام OpenAI، سری ۵.۶ به سه مدل تخصصی تقسیم شده است. نکته جالب این است که از مدل Sol برای کمک به پیش‌آموزش (Post-train) مدل Luna استفاده شده است تا توانمندی‌های آن بهبود یابد:

  • Sol: قدرت‌مندترین مدل در زمینه خلاقیت و طراحی رابط کاربری (UI). این مدل در نوشتن و طراحی رابط‌ها، به‌ویژه زمانی که مراجع بصری در اختیار داشته باشد، برتری دارد. در سطح تفکر Max، برای نویسندگی و گفتگوهای جذاب و پیچیده بسیار اثرگذار است.
  • Terra: نسخه‌ای اصلاح‌شده و جانشین ورژن ۵.۵ که کنترل‌پذیری (Steerability) بهتری ارائه می‌دهد و بهبودهای جزئی در مهارت‌های نویسندگی و UI دارد. به دلیل کنترل‌پذیری بیشتر، استفاده از «مهارت‌ها» (Skills) در این مدل به‌طور ویژه‌ای کاربردی است.
  • Luna: مدل سریع‌تر و سبک‌تر. اگرچه این مدل ممکن است با پرامپت‌های مبهم دچار مشکل شود — وضعیتی که شبیه به «بوی مدل‌های کوچک» (Mini model smell) است و در آن مدل گاهی قصد کاربر را گم می‌کند — اما وظایف تعریف‌شده و شفاف را با قابلیت اطمینان بالایی اجرا می‌کند.

سطوح تفکر متغیر و حالت Ultra

تمام مدل‌های این سری اکنون دارای پنج سطح تفکر متمایز هستند: سبک (Light)، متوسط (Medium)، زیاد (High)، بسیار زیاد (XHigh) و حداکثری (Max). سطوح بالاتر استدلال‌های عمیق‌تری ارائه می‌دهند، اما سهمیه استفاده (Usage Limits) کاربر را با سرعت بسیار بیشتری مصرف می‌کنند.

در کنار این سطوح، حالت جدید Ultra معرفی شده است. این حالت به مدل اجازه می‌دهد تا اساساً «به هر سمتی برود» (Go haywire) و برای حل مسائل پیچیده، چندین زیر-عامل (Sub-agents) را به‌صورت هم‌زمان مستقر کند. با این حال، به کاربران هشدار داده شده که این حالت می‌تواند سهمیه‌های هفتگی آن‌ها را به‌سرعت تهی کند؛ برخی کاربران گزارش داده‌اند که برای اولین بار پس از استفاده از این حالت، موجودی سهمیه آن‌ها در Codex تقریباً به پایان رسیده است.

راهنمای استفاده از GPT-5.6: رابط کاربری، تنظیمات پیشرفته و بهترین روش‌های پرامپت‌نویسی

ادغام پلتفرم‌ها و «ChatGPT Work»

به گزارش Ben's Bites، اپلیکیشن macOS و اپلیکیشن Codex رسماً با یکدیگر ادغام شده‌اند. این یکپارچه‌سازی منجر به خلق حالت «ChatGPT Work» شده است؛ حالتی که به‌طور خاص برای بهره‌وری در زمینه‌های غیربرنامه‌نویسی تنظیم شده است، در حالی که بخش Codex همچنان بر توسعه نرم‌افزار و کدنویسی متمرکز است. هر دو محیط ظاهر مشابهی دارند، اما جزئیات آن‌ها برای نوع خاص کاری که در حال انجام است، به دقت تنظیم شده‌اند.

سایر قابلیت‌های جدید پلتفرم عبارتند از:

  • ChatGPT Sites: یک افزونه برای ساخت و میزبانی وب‌سایت‌ها. این ابزار شامل یک ویژگی اختیاری احراز احراز هویت «ورود با ChatGPT» برای اشتراک‌گذاری است، هرچند برخی کاربران اشاره کرده‌اند که این سیستم می‌تواند مزاحم باشد، زیرا سعی می‌کند هر درخواست را به یک «سایت» تبدیل کند.
  • Computer Use: این قابلیت به‌صورت مستقیم در اپلیکیشن Codex ادغام شده است. به کاربران توصیه شده تا مدل Sol را در تنظیمات متوسط یا زیاد امتحان کنند تا ببینند چگونه عامل (Agent) صفحه نمایش را پیمایش کرده و تسک‌های کوچک را به‌صورت لحظه‌ای اجرا می‌کند.

پایداری و محدودیت‌ها

استقرار این مدل‌ها بدون اصطکاک نبود. در بازه ۱۲ تا ۱۳ ژوئیه ۲۰۲۶، گزارش شد که OpenAI برای رفع باگ‌های ناشی از ادغام اپلیکیشن‌ها، محدودیت‌های استفاده را ۴ تا ۵ بار بازنشانی کرد. به عنوان یک اثر جانبی، محدودیت استاندارد ۵ ساعته موقتاً حذف شد. این یک جزئیات حیاتی برای کاربران است، زیرا به این معناست که آن‌ها ممکن است به‌طور اتفاقی کل سهمیه هفتگی خود را تنها در یک جلسه مصرف کنند.

چشم‌انداز گسترده‌تر هوش مصنوعی

در حالی که OpenAI بر کنترل سطح سیستم‌عامل تمرکز کرده، سایر غول‌های صنعت نیز ابزارهای عامل‌محور رقیبی را عرضه می‌کنند:

  • Anthropic: دسترسی به Fable 5 را در طرح‌های پولی گسترش داد و سهمیه Claude Code را تا ۱۹ ژوئیه ۵۰٪ افزایش داد. Claude Code اکنون دارای یک مرورگر داخلی برای پیمایش مستندات و طراحی‌هاست و Artifacts اکنون از لینک‌های عمومی و ویرایش چندنفره (از جمله ادغام با Slack از طریق Claude Tag) پشتیبانی می‌کند.
  • Meta: مدل Muse Spark 1.1 را عرضه کرد؛ یک مدل چندوجهی (Multimodal) برای کدنویسی و استفاده از رایانه. این مدل دارای پنجره متنی (Context Window) ۱ میلیون توکنی است و از طریق API با قیمتی ارزان‌تر از رقبای خود ارائه می‌شود.
  • Apple: در حال حاضر از OpenAI و دو نفر از کارکنان سابقش شکایت کرده است. اپل متهم به سرقت اسرار تجاری مربوط به سخت‌افزارهای آینده AI است و ادعا می‌کند به متقاضیان استخدام گفته شده که قطعات فیزیکی و اطلاعات محرمانه را به مصاحبه‌ها بیاورند.

ابزارهای اکوسیستم نوظهور

برای پشتیبانی از این آینده‌ی عامل‌محور، ابزارهای جدیدی در حال ظهور هستند:

  • زیرساخت: گوگل کلاود محیط‌های ایزوله‌ی Cloud Run sandboxes را برای ارائه رایانه‌های مجزا جهت استفاده عامل‌ها منتشر کرد. همچنین ادعا شده است که Inference AutoTune می‌تواند یک مدل پیشرو را در تقریباً ۲ ساعت و با هزینه کمتر از ۲۵۰ دلار، به یک مدل تخصصی ۱ تا ۳۰ میلیارد پارامتری تبدیل (Distill) کند.
  • بهره‌وری: ابزار Notion Ship OS اکنون مدیریت توسعه محصول را از مرحله بازخورد تا ادغام درخواست‌های Pull Request (PRs) بر عهده دارد. ابزار Tend نیز یک حلقه باز (Open-source loop) از ChatGPT Work را برای پشتیبانی و استخدام ارائه می‌دهد که از تاییدات کاربر یاد می‌گیرد.
  • طراحی: نسخه ۲.۰ سیستم‌های طراحی v0 اجازه وارد کردن اجزای Figma و Storybook را می‌دهد. ابزار NameThat نیز یک دیکشنری بصری برای الگوهای UI ارائه می‌دهد که توصیف آن‌ها برای عامل‌های هوش مصنوعی دشوار است.

این چرخش به سمت «استفاده از رایانه» نشان‌دهنده تغییری بنیادین در نحوه تعامل ما با هوش مصنوعی است. OpenAI با خروج از محیط چت‌باکس و ورود به لایه سیستم‌عامل، در تلاش است مشکل «آخرین کیلومتر» (Last Mile) بهره‌وری را حل کند. موفقیت GPT-5.6 احتمالاً نه با امتیازات بنچمارک، بلکه با میزان قابلیت اعتماد آن در پیمایش مجموعه‌های نرم‌افزاری قدیمی (Legacy) بدون دخالت انسان سنجیده خواهد شد.

اگر از نسخه ۵.۵ به ۵.۶ مهاجرت می‌کنید، اولویت اول شما باید تست کنترل‌پذیری Terra یا توانایی‌های UI مدل Sol باشد. قدرت واقعی در تعادل بین سطوح تفکر نهفته است؛ استفاده از Luna در سطح xhigh برای بهره‌وری روزمره و رزرو Sol در سطح Max برای نویسندگی‌های حساس، استراتژی بهینه فعلی است.

کاربران باید اکنون شمارنده‌های مصرف خود را به‌دقت زیر نظر داشته باشند، به‌ویژه هنگام آزمایش زیر-عامل‌های حالت Ultra، زیرا هزینه «تفکر» به یک محدودیت ملموس در تجربه کاربری تبدیل شده است.

گام بعدی شما

  • مدل Sol را در حالت Medium روی اپلیکیشن Codex تست کنید تا سرعت اجرای تسک‌های بصری را بسنجید.
  • برای کارهای روتین اداری، تنظیمات Luna xhigh را جایگزین مدل‌های سنگین‌تر کنید تا سهمیه هفتگی شما دیرتر تمام شود.
  • اگر وب‌سایت ساده‌ای دارید، قابلیت Login with ChatGPT را برای تحلیل رفتار کاربران در دسترس قرار دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار OpenAI در مدل‌های بنیادی، مفهوم «دستیار» را به «عامل اجرایی» ارتقا می‌دهد. انتقال از محیط چت به کنترل مستقیم OS، پتانسیل حذف ده‌ها مرحله دستی در گردش‌های کاری پیچیده نرم‌افزاری را دارد.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای OpenAI و تحریم‌های نرم‌افزاری، استفاده از قابلیت‌های کنترل رایانه برای توسعه‌دهندگان ایرانی نیازمند زیرساخت‌های میزبانی خارجی (Proxy/VPN) است.

·نگاه ما
تحریریه دات‌هوش

ترکیب سطوح تفکر متغیر با لایه کنترل سیستم‌عامل نشان می‌دهد که OpenAI دیگر به دنبال پاسخ‌های سریع نیست، بلکه به دنبال «دقت در اجرا»ست. این رویکرد پارادایم تعامل را از «پرسش و پاسخ» به «تفویض اختیار» تغییر می‌دهد. ریسک اصلی در اینجا، تبدیل شدن سهمیه توکن به یک سد اقتصادی است که کاربران را مجبور می‌کند بین کیفیت تفکر و هزینه استنتاج دست به انتخاب بزنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.