پرش به محتوای اصلی
پرش به محتوای مقاله

کاهش نرخ خطای هوش مصنوعی از ۴۰٪ به ۱۲٪ با حلقه‌ی بازخورد داده‌ها

·۳۱ خرداد ۱۴۰۵۵ دقیقه مطالعه
راهنما
مکالمه‌ای که ماشین مرا تیز می‌کند، مبارک باد.
مکالمه‌ای که ماشین مرا تیز می‌کند، مبارک باد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل یک پرچم ساده‌ی دیتابیسی (Boolean Flag) از ابزار حفاظتی به سیگنال فعال برای اتوماسیون تنظیم دقیق (Fine-tuning) در مقیاس کوچک.

تصور کنید هر بار که اشتباه یک مدل هوش مصنوعی را اصلاح می‌کنید، مدل در لحظه یاد بگیرد که دیگر آن خطا را تکرار نکند. کیپرونو نگتیچ (Kiprono Ngetich)، توسعه‌دهنده ابزارهای همکاری مبتنی بر AI، دقیقاً همین سازوکار را با تبدیل نشانگرهای منشأ داده به سیگنال‌های آموزشی پیوسته پیاده کرد. او نشان داد که چگونه یک پرچم بولین (Boolean flag) ساده که برای ردیابی ویرایش‌های انسانی استفاده می‌شود، می‌تواند یک AI محلی راکد را به سیستمی تبدیل کند که به طور خودکار بهبود می‌یابد.

بسیاری از استقرارهای محلی هوش مصنوعی از یک «شکاف حافظه» رنج می‌برند؛ جایی که مدل با وجود اصلاحات مکرر انسانی، همان اشتباهات را تکرار می‌کند. این اتفاق به این دلیل می‌افتد که هیچ مکانیسمی وجود ندارد تا یک اصلاحیه را به نسل بعدی تولیدات مدل پیوند دهد. در واقع ماشین نه به دلیل کمبود داده، بلکه به دلیل نبود مکانیسمی برای دریافت بازخورد محدود شده است. طبق گزارش نگتیچ در وب‌سایت dev.to که در ۲۱ ژوئن ۲۰۲۶ منتشر شد، او این حلقه را با تبدیل مداخلات دستی به سیگنال‌های آموزشی طلایی بست.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت و حاکمیت داده در مدل‌های محلی اشاره کردیم، کنترل دقیق بر روی جریان داده، کلید دستیابی به دقت بالا در محیط‌های سازمانی است.

ماشین من را تیز می‌کند: گفتگویی پربرکت

نقش متغیر تغییریافته

این سامانه بر پایه یک نشانگر خاص به نام isManuallyEdited عمل می‌کند. در ابتدا، این پرچم تنها به عنوان یک «ناوردا» یا لایه حفاظتی (Invariant) عمل می‌کرد؛ به طور دقیق‌تر، این «ناوردای دوم» از کارهای قبلی نگتیچ درباره قانون «مقدس بودن بازنویسی» (override-is-sacred) بود تا از بازنویسی محتوای تأییدشده توسط انسان توسط AI جلوگیری کند. در آن ساختار، وقتی پرچم به حالت «درست» (True) تغییر می‌کرد، دسترسی AI به آن ردیف از داده‌ها کاملاً مسدود می‌شد.

اما نگتیچ متوجه شد هر بار که مقدار isManuallyEdited برابر با True شود، یک جفت آموزشی برچسب‌دار کامل ایجاد شده است: خروجی اولیه AI و نسخه اصلاح‌شده توسط انسان. با تبدیل این موارد به سیگنال‌های آموزشی، اکنون انسان از طریق اصلاحات «سخن می‌گوید» و مدل از طریق بازآموزی «گوش می‌دهد».

خط لوله پیاده‌سازی

نگتیچ برای اتوماسیون این روند، از دسته‌های بازآموزی ماهانه و دستی فاصله گرفت و به سمت یک حلقه پیوسته حرکت کرد. او یک رویکرد مبتنی بر پایتون طراحی کرد که از یک کلاس AIGeneratedContent استفاده می‌کند. این کلاس وظیفه ردیابی originalContent (محتوای اولیه)، editedContent (محتوای ویرایش شده) و یک لیست editHistory شامل اشیائی از نوع Edit است که دارای برچسب‌های زمانی (timestamps) هستند.

او یک خط لوله چهار مرحله‌ای برای عملیاتی کردن این ایده ساخت:

  • برچسب‌گذاری: به‌روزرسانی طرح پایگاه‌داده با استفاده از دستور ALTER TABLE ai_outputs برای افزودن ستون‌های is_manually_edited (از نوع BOOLEAN)، original_text (TEXT) و edited_text (TEXT).
  • ثبت وقایع: استفاده از کلاس EditHistory برای ضبط متن «قبل» و «بعد» از ویرایش، در کنار شناسه کاربر (user_id) و یک برچسب زمانی به وقت UTC.
  • بازآموزی: اجرای تابع retrain_on_edits() که تمام خروجی‌های ویرایش‌شده را استخراج کرده و تنظیم دقیق نظارت‌شده (Supervised Fine-Tuning) را روی جفت‌های (ورودی $ o$ خروجی مورد انتظار) اجرا می‌کند. این فرآیند شبیه وقتی است که به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود.
  • اندازه‌گیری: ردیابی نرخ ویرایش در طول زمان. اگر نرخ ویرایش دیگر کاهش نیابد، این نشان‌دهنده یک نقص در خط لوله یا رسیدن مدل به سقف یادگیری است.

این روش نتایج عددی قابل‌توجهی در طول چندین ماه داشت. بر اساس گزارش منتشر شده، نرخ خروجی‌هایی که نیاز به اصلاح دستی داشتند از حدود ۴۰٪ به ۱۲٪ کاهش یافت. علاوه بر این، دقت مدل در حوزه تخصصی او از ۶۲٪ به ۸۹٪ رسید.

محدوده و محدودیت‌ها

نگتیچ به طور حیاتی تأکید می‌کند که این روش، یادگیری تقویتی از بازخوردهای انسانی یا همان RLHF نیست. او در حال آموزش یک مدل پاداش (Reward Model) پیچیده یا انجام یادگیری تقویتی نیست؛ بلکه صرفاً تنظیم دقیق نظارت‌شده روی جفت‌های اصلاحیه انجام می‌دهد. این روش ساده‌تر و در برابر خطا شکننده‌تر است، اما برای مقیاس کاری او کاملاً مناسب است.

همچنین او اشاره می‌کند که این سیستم جایگزین مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — نمی‌شود. برخی اشتباهات را می‌توان با بهینه کردن پرامپت، بسیار کارآمدتر از بازآموزی مدل حل کرد. وقتی نگتیچ الگویی در اصلاحات شناسایی می‌کند، ترتیب عملیات خاصی را دنبال می‌کند: ابتدا پرامپت را اصلاح می‌کند و در مرحله دوم مدل را بازآموزی می‌نماید.

این معماری برای عملیات‌های مقیاس کوچک شامل صدها اصلاحیه برچسب‌دار، یک مدل محلی و یک حوزه تخصصی واحد طراحی شده است. نگتیچ خاطرنشان می‌کند که سیستم‌های در مقیاس تولیدی با میلیون‌ها کاربر، به زیرساخت‌های بسیار مقاوم‌تر و پالایش دقیق‌تر داده‌ها نیاز دارند.

برای یک توسعه‌دهنده یا تیم کوچک، این shift یا تغییر رویکرد به این معناست که AI بر روی اشتباهاتی بهبود می‌یابد که واقعاً در جریان کاری خاص آن‌ها اهمیت دارند. تنظیم دقیق عمومی روی مجموعه‌داده‌های عمومی نمی‌تواند با دقتِ اصلاحاتی که روی داده‌های شخصی در یک دامنه خصوصی انجام می‌شود، رقابت کند.

این مدل «تیز کردن پیوسته» نشان می‌دهد ارزشمندترین داده‌های بهبود AI در حال حاضر در قالب لاگ‌های ویرایش در پایگاه‌داده‌های ما نهفته است. در اینجا هوش مصنوعی به طور آگاهانه یاد نمی‌گیرد و «نمی‌داند» که در حال اصلاح شدن است؛ یادگیری از طریق به‌روزرسانی گرادیان‌ها رخ می‌دهد، نه درک مفهومی.

نشانگر isManuallyEdited نخستین بار در ۲۷ آوریل ۲۰۲۶ نوشته شد. در حالی که خودِ پرچم بدون تغییر مانده است، اما نحوه استفاده نگتیچ از آن تکامل یافته است. اگر شما هم در حال حاضر ویرایش‌های دستی را در سیستم خود ردیابی می‌کنید، سیگنال لازم در حال حاضر در دیتابیس شما وجود دارد. تنها گام بعدی، انتقال از دسته‌های دستی به یک خط لوله بازآموزی خودکار است که هر اصلاحیه انسانی را به عنوان یک درس تلقی کند.

گام بعدی شما

  • بررسی دیتابیس‌های فعلی برای شناسایی ستون‌های «ویرایش توسط کاربر» و تبدیل آن‌ها به جفت‌های آموزشی.
  • پیاده‌سازی یک تابع ساده برای استخراج نمونه‌های اصلاح‌شده و اجرای SFT در دوره‌های کوتاه.
  • اولویت‌بندی اصلاحات: ابتدا الگوهای تکراری را از طریق پرامپت اصلاح کنید و سپس موارد استثنائی را به مدل آموزش دهید.

اما داستان سخت‌افزاری این تحول و نحوه بهینه‌سازی حافظه برای بازآموزی‌های سریع، حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی نشان می‌دهد که بازخوردهای انسانی در محیط عملیاتی، قدرتمندترین ابزار برای کاهش توهمات مدل در حوزه‌های خاص هستند. تخصص در مدیریت این چرخه بازخورد، تفاوت بین یک ابزار AI متوسط و یک دستیار تخصصی با دقت ۸۹٪ است.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که از مدل‌های محلی (Local LLMs) برای کاربردهای سازمانی استفاده می‌کنند، می‌توانند بدون نیاز به GPUهای عظیم، با این متد دقت مدل را روی داده‌های فارسی تخصصی بالا ببرند.

·نگاه ما
تحریریه دات‌هوش

رویکرد نگتیچ ثابت می‌کند که برای رسیدن به دقت بالا در حوزه‌های تخصصی، نیاز به میلیون‌ها داده نیست، بلکه «داده‌های اصلاحی» (Correction Data) ارزش بسیار بیشتری نسبت به داده‌های خام دارند. این تغییر پارادایم از آموزش گسترده به سمت «صیقل دادن» (Refining) مدل، مسیر را برای استقرار مدل‌های زبانی کوچک (SLM) در سازمان‌ها هموار می‌کند، زیرا هزینه آموزش بر روی نمونه‌های هدفمند بسیار کمتر از پیش‌آموزش است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.