پرش به محتوای اصلی
پرش به محتوای مقاله

Codex: حافظه پایدار مانع از فراموشی محدودیت‌های پروژه شد

·۱۸ شهریور ۱۴۰۵۵ دقیقه مطالعه
تست ۹۰ دقیقه‌ای Codex در مخزن کد: تغییرات GPT-6 Astra برای توسعه‌دهندگان
تست ۹۰ دقیقه‌ای Codex در مخزن کد: تغییرات GPT-6 Astra برای توسعه‌دهندگان
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین پیاده‌سازی حافظه پایدار (Persistence Layer) در Codex که مانع از تخریب اطلاعات در هنگام بازنشانی پنجره متنی می‌شود و سرعت تعامل با سیستم‌عامل را ۲ برابر کرده است.

اگر ساعت‌ها روی یک پروژه کدنویسی کار می‌کنید، احتمالاً با لحظه‌ای مواجه شده‌اید که هوش مصنوعی ناگهان محدودیت‌های ابتدای جلسه را فراموش کرده و دوباره همان باگ قدیمی را تکرار می‌کند. این «آمنزیا یا فراموشی زمینه» اکنون با عرضه GPT-6 Astra توسط OpenAI در تاریخ ۳ و ۴ سپتامبر ۲۰۲۶ به پایان رسید. این مدل یک تغییر بنیادین در نحوه مدیریت حافظه بلندمدت توسط Codex در طول جلسات عامل‌محور (Agentic Sessions) ایجاد کرده است.

دسترسی به این مدل بسیار گسترده است: Astra برای کاربران Plus، Pro، Business و Enterprise و همچنین از طریق API و در بستر AWS در دسترس است. این مدل با کسب امتیاز خیره‌کننده ۹۹.۹٪ در محک ARC-AGI-3، اکنون در دسترس کاربران Amazon Bedrock نیز قرار گرفته است. برای کاربران رده‌بالا، یک سطح دسترسی ویژه به نام Astra Pro در نظر گرفته شده است. طبق اعلام OpenAI، ساختار قیمت‌گذاری تغییری نکرده و مصرف مدل از اعتبار موجود کاربران کسر می‌شود و برای مصرف بیش از حد، اعتباراتی (Credits) ارائه می‌گردد. نکته قابل توجه این است که در لحظه عرضه، در صفحه API هیچ قیمت مشخصی به ازای هر توکن ذکر نشده بود.

سال‌هاست که توسعه‌دهندگان با سدی مواجه‌اند که در آن عامل‌های هوش مصنوعی (AI Agents) — شبیه دستیاری که هر چند ساعت حافظه‌اش پاک می‌شود و باید همه چیز را از اول به او یاد داد — وقتی پنجرهٔ زمینه (Context Window) — یعنی میز کاری مدل که فقط جای چند ورق کاغذ دارد — پر می‌شود، دستورات قبلی را به خلاصه‌های ناقص و دارای فقدان اطلاعات (Lossy Summaries) تبدیل می‌کنند. این اتفاق اغلب منجر به این می‌شود که عامل هوش مصنوعی دوباره باگی را معرفی کند یا محدودیتی را که شما دو ساعت پیش تعیین کرده بودید، نقض کند. همان‌طور که در تحلیل قبلی ما درباره‌ی اینکه چگونه GPT-5.6 Sol آزمایش‌های کوانتومی را خودکار کرد اشاره کردیم، هدف Astra عبور از اتوماسیون ساده و رسیدن به مدیریت قابل‌اعتماد و بلندمدت پروژه‌ها است.

پایان خلاصه‌های ناقص

مرکز ثقل این به‌روزرسانی، لایه حافظه پایدار (Persistence Layer) جدید برای Codex است. به نقل از مستندات OpenAI، مدل دیگر تاریخچه را در هر چرخه بازنشانی (Rollover) به‌طور کامل بازنویسی و خلاصه نمی‌کند، بلکه یادداشت‌ها و الزامات خاص را به‌صورت مجزا حفظ می‌کند:

  • جزئیات انباشته‌شده در طول جابه‌جایی‌های پنجره زمینه به‌طور پایدار باقی می‌مانند.
  • الزامات اولیه به‌جای تبدیل شدن به یک خلاصه کلی، به‌صورت قابل جست‌وجو ذخیره می‌شوند.
  • عامل می‌تواند یک نتیجه تست خاص از گذشته را بدون نیاز به بازسازی آن از روی یک خلاصه ناقص، به‌طور دقیق بازیابی کند.

OpenAI این قابلیت را به‌عنوان یک ویژگی آزمایشی عرضه کرده است، هرچند انتظار می‌رود در هفته‌های آینده به پیش‌فرض تمام کاربران تبدیل شود. این یک راهکار دقیق برای مشکلی دقیق است: تمایل مدل‌ها به فراموش کردن اینکه چرا یک رویکرد خاص رد شده بود یا اینکه کدام تست در مرحله سوم با شکست مواجه شد.

تست ۹۰ دقیقه‌ای Codex در ریپوی شما: تغییرات GPT-6 Astra برای توسعه‌دهندگان

تست دیوار حافظه

برای تأیید اینکه Astra واقعاً مشکل فراموشی را حل کرده، مهندسان می‌توانند یک تست استرس ۹۰ دقیقه‌ای اجرا کنند. هدف این است که یک تیکت واقعی — و نه یک مثال ساده و اسباب‌بازی — انتخاب شود که دارای محدودیتی باشد که بیان آن ساده اما رعایت آن در طول زمان دشوار است؛ مثلاً «به فایل‌های مهاجرت (Migration Files) دست نزن» یا «این نقطه انتهایی (Endpoint) باید با کلاینت‌های نسخه v2 سازگار باقی بماند».

  • دقیقه ۰ تا ۱۰: محدودیت را فقط یک‌بار در ابتدا بیان کنید. آن را تکرار نکنید. عبارت دقیق را در جایی یادداشت کنید که عامل هوش مصنوعی به آن دسترسی نداشته باشد.
  • دقیقه ۱۰ تا ۶۰: تیکت را به مدل بدهید. اجازه دهید مدل به اندازه کافی کار کند تا حداقل یک‌بار پنجره زمینه پر شده و چرخه بازنشانی (Rollover) تحریک شود. وقتی مدل دچار سردرگمی یا «پرسه زدن» (Wandering) شد، مداخله نکنید؛ زیرا همین پرسه زدن بخشی از تست است.
  • دقیقه ۶۰ تا ۸۰: تغییرات (diff) را به‌طور خاص برای بررسی آن محدودیت بخوانید. در یک پیام جدید از عامل بپرسید چرا تصمیمی گرفت که به آن قانون وابسته بود تا ببینید آیا استدلال اصلی را بازیابی می‌کند یا یک دلیل جدید از خودش اختراع می‌کند.
  • دقیقه ۸۰ تا ۹۰: همین تیکت را با خاموش کردن قابلیت یادداشت‌ها (یا با استفاده از مدل قبلی) اجرا کرده و نتایج را مقایسه کنید.

اگر محدودیت پس از بازنشانی پنجره زمینه حفظ شود، یعنی این ویژگی دقیقاً همان کاری را می‌کند که ادعا شده است. این روش یک اندازه‌گیری واقعی در دنیای واقعی ارائه می‌دهد که بنچمارک‌های سنتی اغلب از آن غافل می‌شوند.

سرعت و تعامل با کامپیوتر

علاوه بر حافظه، GPT-6 Astra جریان‌های کاری مبتنی بر رابط کاربری (UI-driven workflows) را به‌طور قابل توجهی بهینه کرده است. طبق گزارش OpenAI، سرعت انجام کارهای مربوط به استفاده از کامپیوتر (Computer-use tasks) اکنون تقریباً ۲ برابر سرعت قبلی است.

این بهینه‌سازی حتی مدل قبلی یعنی GPT-5.6 Sol را نیز تحت تأثیر قرار داده و عملکرد آن را در این بخش حدود ۶۰٪ افزایش داده است. برای توسعه‌دهندگانی که گردش‌های کاری ۱۵ مرحله‌ای در اکسل یا پاورپوینت دارند، این افزایش سرعت باعث می‌شود کارهای خسته‌کننده از حالت «بیش از حد کند برای واگذاری» به «اتوماسیون کارآمد» تغییر کنند. هدف نهایی این است که گردش‌های کاری چندمرحله‌ای به‌جای تولید پیش‌نویس‌های اولیه، مستقیماً به اسناد نهایی ختم شوند.

امنیت سایبری و برنامه Daybreak Blue

مدل Astra نخستین مدلی است که در چارچوب آمادگی OpenAI به‌عنوان مدل «بحرانی» (Critical) برای امنیت سایبری شناخته شده است. این مدل در محک ExploitBench نمره ۱۰۰٪ کسب کرد؛ به این معنا که می‌تواند بدون دخالت انسان، نقاط ضعف سیستم‌های مستحکم را بیابد و آن‌ها را استخراج (Exploit) کند.

برای مدیریت این ریسک، OpenAI قدرتمندترین نسخه را فقط برای تسترهای تأییدشده باز کرده است. آن‌ها همچنین برنامه Daybreak Blue را راه‌اندازی کردند که یک کانال رسمی برای گسترش دسترسی‌های دفاعی به متخصصان امنیت است. دانشمند ارشد شرکت اشاره کرد که محافظت در برابر آسیب‌های ناخواسته ممکن است به عامل محدودکننده پیشرفت در این مسیر تبدیل شود.

برای کد شما، این یعنی یافتن حفره‌های امنیتی در استک شما برای همه ارزان‌تر شده است، چه دعوت شده باشند و چه نباشند. چون مدل عمومی به اندازه کافی برای کاربردی بودن قوی است، شما باید فوراً آن را در چرخه بررسی امنیتی خود قرار دهید.

معماری فنی: عمق بازگشتی

در لایه زیرین، Astra از رویکردی به نام عمق بازگشتی (Recurrent Depth) یا ترنسفورمرهای حلقه‌ای (Looped Transformers) استفاده می‌کند. این سازوکار به مدل اجازه می‌دهد بدون افزایش اندازه کلی مدل، محاسبات اضافی را روی مسائل دشوار صرف کند.

یک نقطه ضعف یا Trade-off این است که Astra بخش زیادی از استدلال‌های خود را داخلی نگه می‌دارد. توسعه‌دهندگان متوجه می‌شوند که ردپاهای استدلالی (Traces) کمتری برای بررسی وجود دارد و باید بیشتر به تایید خروجی‌های نهایی تکیه کنند. بنابراین، تست‌های خود را بر این اساس طراحی کنید.

ادعاهای تأییدنشده

با وجود بنچمارک‌های خیره‌کننده، برخی ادعاها گمانه‌زنانه هستند و باید با احتیاط پذیرفته شوند. سه عبارت خاص باید به‌عنوان تأییدنشده برچسب بخورند:

  • ادعای اینکه این مدل «هوشمندترین و همراستاترین مدل در هر جای دنیا» است.
  • ادعای اینکه «قوی‌ترین مدلی است که برای کارهای نرم‌افزاری ساخته است».
  • پیشنهاد گرگ بروکمن مبنی بر اینکه Astra ممکن است نماینده AGI (هوش مصنوعی عمومی) باشد.

در مقابل، اندازه‌گیری‌های ملموسی وجود دارد: ۹۹.۹٪ در ARC-AGI-3 و ۹۸٪ در FrontierMath Tier 4. با این حال، OpenAI این نتایج را «اشباع‌شده» (Saturating) می‌نامد؛ به این معنا که بنچمارک‌ها دیگر چیزی برای اندازه‌گیری ندارند؛ یعنی مدل با کمبود توانایی مواجه نشد، بلکه تست‌ها به سقف خود رسیدند.

برای یک مهندس معمولی، ارزش واقعی در چرخه امنیتی و حافظه Codex نهفته است. در کنار این پیشرفت‌ها، OpenAI با ارائه راهنمای جدید پرامپت‌نویسی و ممنوعیت کلمات زائد، تلاش کرده تا تردید و عدم قطعیت را در پاسخ‌های عامل‌های Astra کاهش دهد. منتظر عرضه کامل قابلیت حافظه باشید تا ببینید آیا نیاز به تکرار دستی پرامپت‌ها در مخازن (Repositories) پیچیده را از بین می‌برد یا خیر.

گام بعدی شما

  • اگر از Codex استفاده می‌کنید، قابلیت یادداشت‌های پایدار را در پروژه‌های بالای ۱۰۰۰ خط تست کنید تا نیاز به تکرار پرامپت‌ها را بسنجید.
  • مدل Astra را در خط لوله (Pipeline) تست‌های امنیتی کد خود بگنجانید تا حفره‌های احتمالی را پیش از مهاجمان بیابید.
  • برای تسریع گردش‌های کاری اداری، تسک‌های چندمرحله‌ای UI را به این مدل واگذار کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار بنچمارک‌های سخت‌گیرانه، عامل‌های کدنویسی را از ابزارهای کمکی به مدیران پروژه تبدیل می‌کند که حافظه بلندمدت دارند. حذف فراموشی در جلسات طولانی، نرخ خطای بازگشتی در پروژه‌های نرم‌افزاری بزرگ را به‌شدت کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به لایه‌های پیشرفته Astra محدود است و استفاده از آن نیازمند زیرساخت‌های واسط است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی خلاصه‌سازی‌های دستوری با لایه حافظه پایدار، پارادایم تعامل با عامل‌ها را از «مدیریت پنجره متنی» به «مدیریت دانش پروژه» تغییر می‌دهد. این یعنی توسعه‌دهنده دیگر نیازی ندارد نگران لبه‌ی پنجره متنی باشد و می‌تواند روی معماری تمرکز کند. با این حال، کاهش شفافیت در ردپاهای استدلالی (Reasoning Traces) به قیمت افزایش وابستگی به تست‌های خروجی تمام می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.