پرش به محتوای اصلی
پرش به محتوای مقاله

درون سامانه بهبود خودکار Ornith-1.5 برای جایگزینی داده‌های انسانی

·۲۸ مرداد ۱۴۰۵۵ دقیقه مطالعه
نمودار ساختار خودپایه‌ریزی و خودبهبودی مدل Ornith-1.5 در فرآیند یادگیری چندمرحله‌ای.
نمودار ساختار خودپایه‌ریزی و خودبهبودی مدل Ornith-1.5 در فرآیند یادگیری چندمرحله‌ای.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

حذف نیاز به مدل معلم برای تولید داده‌های مصنوعی؛ Ornith-1.5 با استفاده از یک محیط ارزیابی بسته، خودش تکالیف را طراحی و تصحیح می‌کند تا به سطح مدل‌های پیشرو برسد.

تصور کنید مدلی که برای یادگیری، دیگر منتظر کتاب‌های درسی یا معلم انسانی نیست و خودش تصمیم می‌گیرد چه سوالاتی را بپرسد تا باهوش‌تر شود. این دقیقاً همان اتفاقی است که در Ornith-1.5 رخ داده تا سقف توانمندی‌های استدلالی را جابه‌جا کند.

طبق تحلیل فنی منتشر شده توسط تیم Ornith در ۱۹ اوت ۲۰۲۶، مدل پرچمدار این خانواده توانسته است در محک‌های حیاتی عامل‌محور (Agentic)، عملکردی مشابه با Claude Opus 4.8 داشته باشد. این دستاورد در حالی رخ می‌دهد که اکثر مدل‌های بنیادی (Foundation Model) هنوز به مجموعه‌داده‌های ایستا و منتخب انسانی متکی هستند و به‌زودی به یک سقف رشد می‌رسند.

همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، وابستگی به داده‌های انسانی همواره یک گلوگاه بوده است. توسعه‌دهندگان Ornith-1.5 برای شکستن این سقف، از «داربست‌بندی ساده» در نسخه ۱.۰ فاصله گرفته و به یک حلقه کامل بهبود خودکار رسیدند؛ یعنی مدل اکنون تعیین می‌کند کدام مسائل ارزش حل کردن دارند تا سطح هوشی‌اش ارتقا یابد. این رویکرد یادگیری بازگشتی یادآور مفاهیم مدل‌های زبانی بازگشتی در Prime Agent است که امکان تبدیل مهارت‌ها به پایگاه‌داده‌ای قابل ویرایش را فراهم می‌کرد.

سازوکار بهبود خودکار

به نقل از گزارش ornith.ai، این سامانه در یک چرخه سه مرحله‌ای عمل می‌کند. ابتدا مدل بر اساس تاریخچه خود، تکالیفی با دشواری فزاینده پیشنهاد می‌دهد تا شکاف‌های توانمندی‌اش را شناسایی کند. در مرحله دوم، یک «داربست» (Scaffold) شامل دستورالعمل‌ها، ابزارها و استراتژی‌های تجزیه مسئله ایجاد می‌کند و در نهایت، یک راهکار برای حل آن تولید می‌کند.

نمودار بهبود تدریجی مدل اورنیت-۱.۵ از خودپایه‌گذاری به خودبهبودی

این فرآیند با استفاده از بهینه‌سازی سیاست نسبی گروهی (GRPO) بهینه شده است. در این روش، پاداش تنها به پاسخ نهایی تعلق نمی‌گیرد، بلکه به مراحل تولید تکلیف و ساخت داربست نیز بازمی‌گردد. این یعنی مدل یاد می‌گیرد که چگونه تجربه‌های آموزشی مفیدتری برای خودش خلق کند.

جزئیات دینامیک حلقه

در Ornith-1.5، تولید تکلیف، ساخت داربست و اجرای راهکار به‌طور هم‌زمان بهینه می‌شوند. این حلقه به شرح زیر عمل می‌کند:

  • پیشنهاد تکلیف: مدل با بررسی یک محیط یا کدبیس، تکالیفی را پیشنهاد می‌دهد که فراتر از توان فعلی‌اش باشد.

  • اصلاح داربست: ابزارها و سازمان‌دهی لازم برای مواجهه با آن مسئله خاص تولید می‌شود.

  • تولید راهکار: سیاست مدل، پاسخی را بر اساس تکلیف و داربست ایجاد می‌کند.

این ساختار باعث می‌شود سیاست‌های قوی‌تر، تکالیف سخت‌تری تولید کنند و داربست‌های تکامل‌یافته، روش‌های بهتری برای استخراج توانمندی‌های مدل بیابند.

سنجش کیفیت تکالیف

برای جلوگیری از تولید تکالیف بی‌معنی یا بیش از حد ساده، Ornith-1.5 از یک تابع پاداش ضربی ($R_{task}$) بر اساس سه سیگنال استفاده می‌کند:

  • اعتبار (Validity): یک گیت سخت‌گیرانه که تضمین می‌کند تکلیف منسجم است و داربست به‌درستی اجرا می‌شود.
  • دشواری مرزی (Frontier Difficulty): تکالیفی پاداش می‌گیرند که نرخ موفقیت مدل در آن‌ها نزدیک به ۲۰٪ باشد؛ یعنی چالش‌برانگیز باشند اما غیرممکن نباشند.
  • نوآوری (Novelty): جریمه برای تکالیفی که بیش از حد به داده‌های موجود در حافظه آموزشی شبیه هستند.

پاداش‌های محیط ارزیابی

علاوه بر خودِ تکلیف، سامانه «هارنس» (Harness) یا همان محیط ارزیابی را نیز بهینه می‌کند. پاداش هارنس بر اساس سه معیار تعیین می‌شود:

  • همراستایی با تکلیف: آیا محیط ارزیابی واقعاً همان چیزی است که در تکلیف تعریف شده؟
  • دقت پاداش: آیا پاداش‌ها واقعاً کیفیت راهکارها را منعکس می‌کنند؟
  • مقاومت در برابر سوءاستفاده: جلوگیری از رفتارهای «هک پاداش» (Reward Hacking) که در آن مدل بدون حل مسئله، راهی برای فریب ارزیاب پیدا می‌کند.

عملکرد در مقیاس‌های مختلف

مدل Ornith-1.5 در سه اندازه عرضه شده است تا از رایانش ابری تا دستگاه‌های لبه را پوشش دهد. مدل پرچمدار Ornith-1.5-397B با معماری ترکیب خبره‌ها (MoE)، امتیاز ۸۶.۱ را در Terminal-Bench 2.1 و ۵۶.۰ را در DeepSWE کسب کرد که آن را در رده Claude Opus 4.8 قرار می‌دهد.

نمودار ساختار مدل Ornith-1.5 با معماری خودپایه‌گذاری و بهبود خودکار.

این مدل به‌طور قابل‌توجهی از مدل‌های بازمتن مشابه مانند GLM-5.2 و DeepSeek-V4-Flash پیشی گرفته است. در این میان، قابلیت‌های جدید GLM-5.2 پیش‌تر به عنوان جایگزینی عملی برای توسعه‌دهندگان معرفی شده بود. همچنین، جهش توانایی‌های کدنویسی در DeepSeek-V4 نشان داد که رقابت در حوزه مدل‌های عامل‌محور با چه شدتی در حال پیشروی است. در رده متوسط، مدل Ornith-1.5-35B با فعال‌سازی تنها ۳ میلیارد پارامتر به ازای هر توکن، کارایی خیره‌کننده‌ای داشت و در کدنویسی عامل‌محور، مدل‌های متراکمی مثل Gemma 4-31B را شکست داد.

نمودار مقایسه عملکرد مدل Ornith-1.5 در وظایف مختلف پردازش زبان طبیعی

در لبه، مدل متراکم Ornith-1.5-9B و نسخه کوانتیده (Quantized) آن روی آیفون و اندروید قابل اجراست. این مدل در SWE-Bench Verified امتیاز ۷۰.۶ را کسب کرد و حتی از مدل‌های بسیار بزرگ‌تری مثل Qwen 3.6-35B بهتر عمل کرد.

نمودار مقایسه عملکرد مدل Ornith-1.5 با مدل‌های پیشین در وظایف مختلف پردازش زبان طبیعی

تحلیل فنی

این معماری فرض بنیادین این را که داده‌های مصنوعی باکیفیت حتماً به یک مدل «معلم» (مثل GPT-4) نیاز دارند، تغییر می‌دهد. Ornith-1.5 ثابت کرد که یک مدل می‌تواند هم‌زمان معلم، شاگرد و ممتحن خودش باشد، به شرطی که یک محیط ارزیابی قابل‌تأیید داشته باشد.

برای حوزه یادگیری ماشین، این یعنی گلوگاه هوش مصنوعی عامل‌محور، حجم داده‌ها نیست، بلکه «بهره‌وری برنامه آموزشی» است. توانایی کشف خودکار مرزهای جهل، منحنی یادگیری بسیار تندتری نسبت به تنظیم نظارت‌شده (SFT) سنتی ایجاد می‌کند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، بررسی کنید که آیا محیط‌های ارزیابی (Harness) شما قابلیت ارائه پاداش‌های باینری و دقیق را دارند یا خیر.
  • روی مدل‌های کوچک‌تر (۹ میلیاردی) تمرکز کنید تا ببینید آیا در کارهای تخصصی کدنویسی روی دستگاه، جایگزین مدل‌های ابری می‌شوند یا نه.
  • متدهای GRPO را برای بهینه‌سازی زنجیره‌های استدلالی در پروژه‌های خود مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در بهینه‌سازی سیاست‌های یادگیری، ثابت می‌کند که مدل‌های کوچک‌تر می‌توانند با برنامه آموزشی هوشمند، رقیبی برای غول‌های ابری باشند. این تغییر پارادایم، هزینه تولید مدل‌های سطح بالا را به‌شدت کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل وزن‌های باز مدل‌های کوچک‌تر (۹ و ۳۵ میلیاردی)، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای گران‌قیمت، مدل‌های عامل‌محور قدرتمندی را روی سخت‌افزارهای داخلی یا لبه مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های معلم با محیط‌های ارزیابی قابل‌تأیید، وابستگی صنعت به OpenAI و Anthropic را برای تولید داده‌های مصنوعی کاهش می‌دهد. این رویکرد نشان می‌دهد که «خود-بهبودی» (Self-improvement) دیگر یک تئوری نیست و می‌تواند منجر به رشد نمایی توانمندی‌ها بدون نیاز به داده‌های انسانی جدید شود. نقطه حساس این معماری، پایداری حلقه در برابر هک پاداش است که اگر مهار نشود، مدل را به سمت پاسخ‌های ظاهراً درست اما توخالی می‌برد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.