پرش به محتوای اصلی
پرش به محتوای مقاله

تولید بسته آموزشی ریاضی با Codex در یک اجرای ۳۱ ساعته و قابل‌حسابرسی

·۱ مهر ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
اجرای یک وظیفه Codex به مدت ۳۱ ساعت: بازماندن از راه‌اندازی مجدد و ساخت خط تولید کتاب درسی قابل‌حسابرسی
اجرای یک وظیفه Codex به مدت ۳۱ ساعت: بازماندن از راه‌اندازی مجدد و ساخت خط تولید کتاب درسی قابل‌حسابرسی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل حافظهٔ موقت مدل با یک گراف از آرتیفکت‌های نسخه‌بندی‌شده برای اجرای یک تسک ۳۱ ساعته بدون از دست رفتن پیشرفت کار.

تصور کنید یک عامل هوش مصنوعی به‌جای چند ثانیه، ۳۱ ساعت به‌طور مداوم روی یک پروژه پیچیده کار کند بدون آنکه رشتهٔ کلام را گم کند یا داده‌ها را فراموش کند. این اتفاق در ۲۳ سپتامبر ۲۰۲۶ رخ داد؛ جایی که توسعه‌دهنده‌ای به نام kfind نشان داد چگونه می‌توان یک چارچوب ریاضی دشوار را به یک بسته آموزشی کامل و قابل‌حسابرسی تبدیل کرد.

طبق گزارش منتشرشده در dev.to، این سیستم که توسط مدل GPT-5.6 Sol قدرت گرفته بود، توانست تداوم کار را حتی پس از ری‌استارت‌های سخت‌افزاری کامپیوتر حفظ کند. راز این موفقیت در تغییر رویکرد به حافظه بود؛ به‌جای تکیه بر پنجرهٔ زمینه (Context Window) — که مثل میز کاری است که جا برای چند ورق دارد و با بسته شدن جلسه پاک می‌شود — بار حافظه به «آرتیفکت‌های نسخه‌بندی‌شده» منتقل شد. در واقع، این پروژه بار حافظه را از تاریخچهٔ چت به مصنوعات (Artifacts) دارای نسخه منتقل کرد تا کار بتواند حتی در صورت شکست کامل سیستم، زنده بماند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، جداسازی داده‌های پایدار از حافظهٔ موقت، کلید مقیاس‌پذیری است. در این پروژه، مرز بین انسان و عامل (Agent) — شبیه به رابطه‌ای بین یک مدیر پروژه و یک مجری دقیق — به‌شدت تعریف شده بود. کاربر کنترل تعاریف، تبدیل‌های مجاز، مسیر پژوهش و معیارهای پذیرش را در دست داشت و Codex وظیفهٔ ساخت بلندمدت، پیاده‌سازی، تایید، حسابرسی و مستندسازی را بر عهده گرفت. این تفکیک دقیق تضمین کرد که عامل هوش مصنوعی صرفاً ابزاری برای اجرا باشد، نه کارگردان پژوهش. این رویکرد به مدیریت دقیق خروجی‌ها کمک می‌کند تا از مشکلاتی نظیر تولید کد تکراری و معیوب توسط عامل‌های AI جلوگیری شود.

بر اساس مستندات این پروژه، خروجی نهایی یک سند ساده نبود، بلکه یک گراف از آرتیفکت‌های متصل بود که شامل موارد زیر می‌شد:

  • نسخه‌های محتوایی: نسخه‌های مجزای منبع/اصلی (Master)، دانش‌آموز و مدرس برای هر فصل.
  • مسیرهای تمرینی: تمرینات دستی سنتی و یک مسیر مجزا با کمک هوش مصنوعی که در آن دانش‌آموزان باید از یک سیستم AI برای تولید، بازرسی، تست یا حسابرسی اشیاء ریاضی تحت قوانین صریح استفاده کنند.
  • ابزارهای اعتبارسنجی: پنج مولد داده و تمرین قطعی (Deterministic)، پاسخ‌های کلیدی با درجه سختی متفاوت و اسکریپت‌های بازتولید.
  • ردپای حسابرسی: مانیفست‌ها، هش‌ها (Hashes)، گزارش‌های حسابرسی و نقاط بازرسی (Checkpoints) برای شروع مجدد.

مقیاس این اجرا خیره‌کننده بود. لاگ‌های بازیابی‌شده از جلسه محلی به ۳۳۸.۵۵ مگابایت رسید که شامل ۲۱,۹۹۱ رکورد مرتبط و ۴۷ رویداد فشرده‌سازی زمینه بود. در یکی از نقاط بازرسی رابط کاربری (UI)، ۵۱۲ فایل تغییر کرده بود که منجر به اضافه شدن ۸۴,۴۰۱ خط کد و حذف ۷۲۰ خط کد شد.

به نقل از توسعه‌دهنده، تایید نتایج بسیار سخت‌گیرانه بود؛ ۶۷ مورد از ۶۷ بررسی آزمایش و ۳۶ مورد از ۳۶ بررسی متقاطع مدرس-دانش‌آموز به‌طور کامل پاس شدند. همچنین بازپخش‌های قطعی در مقیاس ۱۰۰ هزار، ۲۵۰ هزار و حتی یک اعتبارسنجی مجزا با ۵ میلیون ردیف داده اجرا شد. این سطح از دقت در بازرسی ضروری است، چرا که بسیاری از گزارش‌های خطای هوش مصنوعی در بازرسی‌های حفاظی اغلب مثبت کاذب هستند و نیاز به اعتبارسنجی سخت‌گیرانه دارند.

موفقیت این مدل بر هفت تصمیم معماری استوار بود. کاربر پیش از اجرا، تعاریف و مرزهای اختیار را «منجمد» کرد و از مولدهای قطعی برای تبدیل نیازهای کیفی به چک‌های قابل اجرا استفاده نمود. خروجی‌های دانش‌آموز و مدرس به‌طور مستقل بررسی شدند و نتایج منفی یا مسیرهای ردشده نیز برای تحلیل حفظ گردیدند. مهم‌ترین آن‌ها این بود که شروع مجدد کار به‌جای «حدس زدن» پیشرفت قبلی بر اساس روایت متن، از روی آرتیفکت‌های تاییدشده انجام می‌شد.

این رویکرد ثابت می‌کند که قابلیت اطمینان در تسک‌های بلندمدت، به توانایی مدل در «ادامه دادن صحبت» نیست، بلکه به توانایی پروژه در تعریف متغیرهای ثابت (Invariant) بستگی دارد. ارزشمندترین سهم هوش مصنوعی در اینجا، نوشتن متن نبود، بلکه تبدیل یک طراحی پژوهشی به یک سیستم تولیدی قابل بازرسی بود. این فلسفه با دیدگاهی همسو است که معتقد است عامل‌های هوش مصنوعی برای قابل‌اعتماد بودن باید در چارچوب حفاظ‌های سخت‌افزاری مدیریت شوند تا شکست‌های احتمالی قابل پیش‌بینی باشند.

با این حال، این تجربه یک شکاف بزرگ در ابزارهای فعلی را افشا کرد: نبود قابلیت مشاهده‌پذیری (Observability). توسعه‌دهنده اشاره کرد که پیمایش در تاریخچه‌های بسیار طولانی دشوار است و قابلیت‌های بومی برای خروجی گرفتن از نقاط بازرسی، ترکیب توکن‌ها و مانیفست فایل‌ها وجود ندارد. پس از یک ری‌استارت، بخش زیادی از تاریخچه قابل مشاهده در کلاینت ناپدید شد، هرچند داده‌های جلسه محلی قابل بازیابی بودند.

برای کسانی که در حال ساخت عامل‌های خودکار هستند، درس این است: برای مقیاس‌پذیری فراتر از تسک‌های ساده، باید سیستمی بسازید که در آن کار بتواند بدون از دست دادن هویت خود، از فقدان حافظه جان سالم به در ببرد.

سازندگان علاقه‌مند می‌توانند شواهد زمان‌بندی‌شده و آرتیفکت‌های فصل اول را از طریق Zenodo با شناسه DOI 10.5281/zenodo.22900578 بررسی کنند.

با این حال، این تجربه یک شکاف بزرگ در ابزارهای فعلی را افشا کرد: نبود قابلیت مشاهده‌پذیری (Observability). توسعه‌دهنده اشاره کرد که پیمایش در تاریخچه‌های بسیار طولانی دشوار است و قابلیت‌های بومی برای خروجی گرفتن از نقاط بازرسی، ترکیب توکن‌ها و مانیفست فایل‌ها وجود ندارد. پس از یک ری‌استارت، بخش زیادی از تاریخچه قابل مشاهده در کلاینت ناپدید شد، هرچند داده‌های جلسه محلی قابل بازیابی بودند.

برای کسانی که در حال ساخت عامل‌های خودکار هستند، درس این است: برای مقیاس‌پذیری فراتر از تسک‌های ساده، باید سیستمی بسازید که در آن کار بتواند بدون از دست دادن هویت خود، از فقدان حافظه جان سالم به در ببرد.

سازندگان علاقه‌مند می‌توانند شواهد زمان‌بندی‌شده و آرتیفکت‌های فصل اول را از طریق Zenodo با شناسه DOI 10.5281/zenodo.22900578 بررسی کنند.

گام بعدی شما

  • اگر در حال ساخت عامل‌های خودکار هستید، به‌جای تکیه بر حافظهٔ مدل، سیستمی طراحی کنید که خروجی‌های هر مرحله را در فایل‌های نسخه‌بندی‌شده ذخیره کند.
  • برای تسک‌های پیچیده، تعاریف و مرزهای اختیار را پیش از شروع اجرا «منجمد» کنید تا مدل در طول زمان دچار توهم نشود.
  • از مولدهای دادهٔ قطعی برای تبدیل نیازهای کیفی به تست‌های قابل اجرا استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد ثابت می‌کند که برای اجرای پروژه‌های صنعتی با هوش مصنوعی، باید حافظه را از مدل خارج و به ساختار داده‌های نسخه‌بندی‌شده منتقل کرد. این تغییر، اعتبار و قابلیت تکرار (Reproducibility) را در خروجی‌های مدل‌های زاینده تضمین می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های سخت‌افزاری یا قطع و وصل شدن سرویس‌های ابری مواجه‌اند، این متدولوژیِ ذخیره‌سازی آرتیفکت‌ها برای جلوگیری از اتلاف محاسبات بسیار کاربردی است.

·نگاه ما
تحریریه دات‌هوش

این پروژه پارادایم «چت» را به نفع «ساخت» کنار می‌زند. ارزش واقعی هوش مصنوعی در اینجا نه در تولید متن، بلکه در تبدیل یک طراحی پژوهشی به یک سیستم تولیدی قابل‌حسابرسی است. این یعنی آیندهٔ عامل‌های هوشمند در مدیریت آرتیفکت‌هاست، نه در گسترش بی‌پایان پنجره‌های متنی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.