تصور کنید یک عامل هوش مصنوعی بهجای چند ثانیه، ۳۱ ساعت بهطور مداوم روی یک پروژه پیچیده کار کند بدون آنکه رشتهٔ کلام را گم کند یا دادهها را فراموش کند. این اتفاق در ۲۳ سپتامبر ۲۰۲۶ رخ داد؛ جایی که توسعهدهندهای به نام kfind نشان داد چگونه میتوان یک چارچوب ریاضی دشوار را به یک بسته آموزشی کامل و قابلحسابرسی تبدیل کرد.
طبق گزارش منتشرشده در dev.to، این سیستم که توسط مدل GPT-5.6 Sol قدرت گرفته بود، توانست تداوم کار را حتی پس از ریاستارتهای سختافزاری کامپیوتر حفظ کند. راز این موفقیت در تغییر رویکرد به حافظه بود؛ بهجای تکیه بر پنجرهٔ زمینه (Context Window) — که مثل میز کاری است که جا برای چند ورق دارد و با بسته شدن جلسه پاک میشود — بار حافظه به «آرتیفکتهای نسخهبندیشده» منتقل شد. در واقع، این پروژه بار حافظه را از تاریخچهٔ چت به مصنوعات (Artifacts) دارای نسخه منتقل کرد تا کار بتواند حتی در صورت شکست کامل سیستم، زنده بماند.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، جداسازی دادههای پایدار از حافظهٔ موقت، کلید مقیاسپذیری است. در این پروژه، مرز بین انسان و عامل (Agent) — شبیه به رابطهای بین یک مدیر پروژه و یک مجری دقیق — بهشدت تعریف شده بود. کاربر کنترل تعاریف، تبدیلهای مجاز، مسیر پژوهش و معیارهای پذیرش را در دست داشت و Codex وظیفهٔ ساخت بلندمدت، پیادهسازی، تایید، حسابرسی و مستندسازی را بر عهده گرفت. این تفکیک دقیق تضمین کرد که عامل هوش مصنوعی صرفاً ابزاری برای اجرا باشد، نه کارگردان پژوهش. این رویکرد به مدیریت دقیق خروجیها کمک میکند تا از مشکلاتی نظیر تولید کد تکراری و معیوب توسط عاملهای AI جلوگیری شود.
بر اساس مستندات این پروژه، خروجی نهایی یک سند ساده نبود، بلکه یک گراف از آرتیفکتهای متصل بود که شامل موارد زیر میشد:
- نسخههای محتوایی: نسخههای مجزای منبع/اصلی (Master)، دانشآموز و مدرس برای هر فصل.
- مسیرهای تمرینی: تمرینات دستی سنتی و یک مسیر مجزا با کمک هوش مصنوعی که در آن دانشآموزان باید از یک سیستم AI برای تولید، بازرسی، تست یا حسابرسی اشیاء ریاضی تحت قوانین صریح استفاده کنند.
- ابزارهای اعتبارسنجی: پنج مولد داده و تمرین قطعی (Deterministic)، پاسخهای کلیدی با درجه سختی متفاوت و اسکریپتهای بازتولید.
- ردپای حسابرسی: مانیفستها، هشها (Hashes)، گزارشهای حسابرسی و نقاط بازرسی (Checkpoints) برای شروع مجدد.
مقیاس این اجرا خیرهکننده بود. لاگهای بازیابیشده از جلسه محلی به ۳۳۸.۵۵ مگابایت رسید که شامل ۲۱,۹۹۱ رکورد مرتبط و ۴۷ رویداد فشردهسازی زمینه بود. در یکی از نقاط بازرسی رابط کاربری (UI)، ۵۱۲ فایل تغییر کرده بود که منجر به اضافه شدن ۸۴,۴۰۱ خط کد و حذف ۷۲۰ خط کد شد.
به نقل از توسعهدهنده، تایید نتایج بسیار سختگیرانه بود؛ ۶۷ مورد از ۶۷ بررسی آزمایش و ۳۶ مورد از ۳۶ بررسی متقاطع مدرس-دانشآموز بهطور کامل پاس شدند. همچنین بازپخشهای قطعی در مقیاس ۱۰۰ هزار، ۲۵۰ هزار و حتی یک اعتبارسنجی مجزا با ۵ میلیون ردیف داده اجرا شد. این سطح از دقت در بازرسی ضروری است، چرا که بسیاری از گزارشهای خطای هوش مصنوعی در بازرسیهای حفاظی اغلب مثبت کاذب هستند و نیاز به اعتبارسنجی سختگیرانه دارند.
موفقیت این مدل بر هفت تصمیم معماری استوار بود. کاربر پیش از اجرا، تعاریف و مرزهای اختیار را «منجمد» کرد و از مولدهای قطعی برای تبدیل نیازهای کیفی به چکهای قابل اجرا استفاده نمود. خروجیهای دانشآموز و مدرس بهطور مستقل بررسی شدند و نتایج منفی یا مسیرهای ردشده نیز برای تحلیل حفظ گردیدند. مهمترین آنها این بود که شروع مجدد کار بهجای «حدس زدن» پیشرفت قبلی بر اساس روایت متن، از روی آرتیفکتهای تاییدشده انجام میشد.
این رویکرد ثابت میکند که قابلیت اطمینان در تسکهای بلندمدت، به توانایی مدل در «ادامه دادن صحبت» نیست، بلکه به توانایی پروژه در تعریف متغیرهای ثابت (Invariant) بستگی دارد. ارزشمندترین سهم هوش مصنوعی در اینجا، نوشتن متن نبود، بلکه تبدیل یک طراحی پژوهشی به یک سیستم تولیدی قابل بازرسی بود. این فلسفه با دیدگاهی همسو است که معتقد است عاملهای هوش مصنوعی برای قابلاعتماد بودن باید در چارچوب حفاظهای سختافزاری مدیریت شوند تا شکستهای احتمالی قابل پیشبینی باشند.
با این حال، این تجربه یک شکاف بزرگ در ابزارهای فعلی را افشا کرد: نبود قابلیت مشاهدهپذیری (Observability). توسعهدهنده اشاره کرد که پیمایش در تاریخچههای بسیار طولانی دشوار است و قابلیتهای بومی برای خروجی گرفتن از نقاط بازرسی، ترکیب توکنها و مانیفست فایلها وجود ندارد. پس از یک ریاستارت، بخش زیادی از تاریخچه قابل مشاهده در کلاینت ناپدید شد، هرچند دادههای جلسه محلی قابل بازیابی بودند.
برای کسانی که در حال ساخت عاملهای خودکار هستند، درس این است: برای مقیاسپذیری فراتر از تسکهای ساده، باید سیستمی بسازید که در آن کار بتواند بدون از دست دادن هویت خود، از فقدان حافظه جان سالم به در ببرد.
سازندگان علاقهمند میتوانند شواهد زمانبندیشده و آرتیفکتهای فصل اول را از طریق Zenodo با شناسه DOI 10.5281/zenodo.22900578 بررسی کنند.
با این حال، این تجربه یک شکاف بزرگ در ابزارهای فعلی را افشا کرد: نبود قابلیت مشاهدهپذیری (Observability). توسعهدهنده اشاره کرد که پیمایش در تاریخچههای بسیار طولانی دشوار است و قابلیتهای بومی برای خروجی گرفتن از نقاط بازرسی، ترکیب توکنها و مانیفست فایلها وجود ندارد. پس از یک ریاستارت، بخش زیادی از تاریخچه قابل مشاهده در کلاینت ناپدید شد، هرچند دادههای جلسه محلی قابل بازیابی بودند.
برای کسانی که در حال ساخت عاملهای خودکار هستند، درس این است: برای مقیاسپذیری فراتر از تسکهای ساده، باید سیستمی بسازید که در آن کار بتواند بدون از دست دادن هویت خود، از فقدان حافظه جان سالم به در ببرد.
سازندگان علاقهمند میتوانند شواهد زمانبندیشده و آرتیفکتهای فصل اول را از طریق Zenodo با شناسه DOI 10.5281/zenodo.22900578 بررسی کنند.
گام بعدی شما
- اگر در حال ساخت عاملهای خودکار هستید، بهجای تکیه بر حافظهٔ مدل، سیستمی طراحی کنید که خروجیهای هر مرحله را در فایلهای نسخهبندیشده ذخیره کند.
- برای تسکهای پیچیده، تعاریف و مرزهای اختیار را پیش از شروع اجرا «منجمد» کنید تا مدل در طول زمان دچار توهم نشود.
- از مولدهای دادهٔ قطعی برای تبدیل نیازهای کیفی به تستهای قابل اجرا استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو