پرش به محتوای اصلی
پرش به محتوای مقاله

«بازیابی دانش بدون RL»؛ راهکار جدید Liquid AI برای توقف تکرارها

·۱۶ تیر ۱۴۰۵۷ دقیقه مطالعه
روش بهینه‌سازی ترجیح توکن نهایی برای کاهش حلقه‌های شکست در مدل‌های استدلال
روش بهینه‌سازی ترجیح توکن نهایی برای کاهش حلقه‌های شکست در مدل‌های استدلال
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی الگوریتم FTPO که برخلاف DPO، تنها توکن‌های لبهٔ تکرار را هدف قرار می‌دهد تا بدون تخریب دانش کلی مدل، نرخ حلقه‌های مرگ را در مدل‌های کوچک تا ۹۵٪ کاهش دهد.

مدل‌های استدلالی که در یک عبارت گیر می‌کنند و آن را تا بی‌نهایت تکرار می‌کنند، تمام پنجرهٔ زمینه خود را می‌بلعند و در نهایت در انجام تکلیف شکست می‌خورند. Liquid AI با انتشار Antidoom، متدی متن‌باز را معرفی کرده است که این «حلقه‌های مرگ» (Doom Loops) را در مدل‌هایی مانند LFM2.5-2.6B و Qwen3.5-4B با هدف‌گذاری دقیق روی اولین توکنِ آغازگرِ تکرار، به‌طور کامل مهار می‌کند.

حلقه‌های مرگ یک بلای دائمی برای مدل‌های استدلالی کوچک هستند، به‌ویژه زمانی که با زنجیره‌های تفکر (Chain-of-Thought) طولانی یا اثبات‌های پیچیدهٔ ریاضی مواجه می‌شوند. طبق گزارش فنی Liquid AI، وقتی یک مدل گیر می‌کند، اغلب عبارتی مثل «صبر کنید، اجازه دهید تجدیدنظر کنم» (Wait, let me reconsider) را تولید کرده و آن را تا زمان اتمام پنجرهٔ زمینه (Context Window) تکرار می‌کند. این رفتار اغلب به اشتباه به عنوان کمبود دانش تفسیر می‌شود، اما در واقع ناشی از شکست در نمونه‌گیری (Sampling) و توزیع احتمالات است. بر اساس داده‌های این شرکت، در یک نقطه بازرسی (Checkpoint) اولیه از مدل LFM2.5-2.6B، حدود ۱۰.۲٪ از پاسخ‌ها در پرامپت‌های سخت ریاضی و کدنویسی به این حلقه‌های تکراری منجر می‌شد.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی پایداری مدل‌های بازمتن اشاره کردیم، مقابله با این خطاها معمولاً پیچیده است. تا پیش از این، استاندارد صنعت برای رفع این مشکل در زمان استنتاج (Inference)، استفاده از «جریمهٔ تکرار» (Repetition Penalty) بود. با این حال، Liquid AI تأکید می‌کند که این راهکار صرفاً یک «وصله» (Band-aid) است که با تغییر کورکورانهٔ وزن توزیع خروجی، می‌تواند عملکرد کلی مدل را کاهش دهد. راهکارهای دیگر مانند یادگیری تقویتی (RL) نیز نیازمند اجرای آنلاین هزینه‌بر و کالیبراسیون پیچیدهٔ پاداش هستند.

کالبدشکافی یک حلقهٔ مرگ

این شرکت ظهور این حلقه‌ها را به تلاقی سه مکانیزم نسبت می‌دهد که به‌طور هم‌زمان عمل می‌کنند:

مکانیزم اول: توکن‌های بیش‌ازحد آموزش‌دیده و عدم قطعیت. برخی توکن‌ها به‌دلیل وجود در داده‌های مصنوعی (Synthetic Data) در مجموعه آموزشی، احتمال انتخاب بالایی دارند. مثال‌های رایج در متون عمومی شامل کلماتی مثل "delve" و "testament" است. در ردپای‌های استدلالی، توالی‌هایی با احتمال پیشین بالا شامل نشانگرهای گفتاری مثل «Wait» یا «Alternatively» هستند. در حالی که این کلمات می‌توانند نشان‌دهنده تغییر استراتژی مفید یا مراحل تأیید باشند، اما زمانی که مدل دچار تردید یا گیر افتادن می‌شود، به جذاب‌ترین نقطه برای بازگشت (Fallback) تبدیل می‌شوند.

در یک نقطهٔ بازرسی اولیه از LFM2.5-2.6B، رایج‌ترین توکن‌های آغازگر حلقه عبارت بودند از:

  • "the": ۱۱.۳۹٪
  • "So": ۴.۵۱٪
  • "Alternatively": ۳.۲۲٪
  • "Wait": ۲.۵۶٪
  • "But": ۲.۴۶٪

مکانیزم دوم: تقویت زمینهٔ پیشین. هر تکرار، هر توکن موجود در آن عبارت را به سمت احتمال بالاتری هل می‌دهد. «دوان و همکاران» این وضعیت را به عنوان استدلال دوری (Circular Reasoning) مطالعه کرده و آن را به یک الگوی توجه «V-شکل» مرتبط می‌دانند. تحقیقات آن‌ها نشان می‌دهد که تکرار معنایی (Semantic Repetition) معمولاً پیش از تکرار متنی (Textual Repetition) رخ می‌دهد.

مکانیزم سوم: نمونه‌گیری حریصانه. مدل‌های استدلالی معمولاً با دما (Temperature) پایین اجرا می‌شوند تا ردپاهای تفکر پایدار و بازتولیدپذیر باشند. در دما = ۰، همیشه محتمل‌ترین توکن انتخاب می‌شود. در این حالت، یک حلقه که به‌صورت محلی تقویت شده باشد، هیچ راه خروجی ندارد. طبق گزارش Liquid AI، حتی در دمای ۰.۶۷ نیز تکرارهای قابل‌توجهی دیده می‌شود، اما دماهای پایین‌تر مشکل را به‌شدت تشدید می‌کنند.

سازوکار Antidoom و الگوریتم FTPO

ابزار Antidoom به‌جای تغییر گسترده در نمونه‌گیری، یک اصلاح هدفمند است. این روش سعی نمی‌کند ریاضیات یا کدنویسی جدید به مدل بیاموزد، بلکه از یک مجموعه دادهٔ تخصصی به نام antidoom-mix-v1.0 استفاده می‌کند که به‌طور خاص برای تحریک حلقه‌ها در دمای پایین طراحی شده است.

تشخیص و هدف‌گذاری:
یک حلقه زمانی شناسایی می‌شود که بخشی از متن حداقل ۴ بار تکرار شود و دست‌کم ۶۰ کاراکتر را شامل گردد. متد Antidoom اولین توکن از اولین تکرار را هدف قرار می‌دهد. برای یافتن جایگزین‌ها، سیستم top-k احتمالات log-prob مدل پایه را بررسی کرده، نویزهای کوتاه یا غیر-الفبایی را فیلتر می‌کند و تا ۲۰ جایگزین معقول را به عنوان توکن‌های «انتخابی» (Chosen) نگه می‌دارد.

این منطق در یک قانون تشخیص ساده پیاده شده است:

# A loop = a unit repeating >=4 times, spanning >=60 characters.
# Returns the index of the first token of the first repeat (the target), else None.
def find_loop(text, min_repeats=4, min_chars=60):
    n = len(text)
    for span in range(1, n // min_repeats + 1):
        start = 0
        while start + span * min_repeats <= n:
            unit = text[start:start + span]
            repeats = 1
            pos = start + span
            while text[pos:pos + span] == unit:
                repeats += 1
                pos += span
            if repeats >= min_repeats and span * repeats >= min_chars:
                return start + span # first token of the first repeat
            start += 1
    return None

الگوریتم FTPO:
هر حلقهٔ شناسایی‌شده به یک ردیف آموزشی به شکل یک تاپل تبدیل می‌شود: [prefix, rejected, chosen]. برای مثال، یک ردیف شامل پیشوند پرامپتی است که منجر به حلقه شده، توکن ردشده مانند " Wait" و لیستی از جایگزین‌های انتخابی مثل [" So", " Since", " The", " Therefore"].

شرکت Liquid AI از بهینه‌سازی ترجیح توکن نهایی (Final Token Preference Optimization یا FTPO) استفاده می‌کند. این الگوریتم که مشابه DPO است اما برای تغییر تعداد اندکی از توکن‌ها با کمترین اختلال در مدل بهینه شده، چهار تفاوت کلیدی دارد:

  • آموزش توکن نهایی: برخلاف روش‌های دیگر، فقط توکن انتهاییِ توالی را که در میانهٔ تولید قرار دارد، آموزش می‌دهد.
  • تعدد توکن‌های انتخابی: احتمال را بین گروهی از جایگزین‌ها پخش می‌کند تا از این پیش بیاید که یک توکنِ بیش‌ازحد آموزش‌دیده، صرفاً با یک توکنِ بیش‌ازحد آموزش‌دیدهٔ دیگر جایگزین شود.
  • زیان در فضای لاجیت: با حذف لایه سافت‌مکس (Softmax) و محاسبه واگرایی از یک مرجع در سطح لاجیت‌ها (Logits)، از وارد شدن فشار به توکن‌های نامرتبط جلوگیری می‌کند.
  • منظم‌سازی دوگانه: لاجیت‌های انتخابی و ردشده آزادتر حرکت می‌کنند، در حالی که باقی واژگان (Vocabulary) به‌شدت محدود نگه داشته می‌شوند.

نتایج کمی و بهره‌وری

به نقل از گزارش‌های منتشر شده، نتایج خیره‌کننده است. در یک نقطه بازرسی اولیه از LFM2.5-2.6B، نرخ حلقه‌های مرگ از ۱۰.۲٪ به ۱.۴٪ سقوط کرد. در مدل Qwen3.5-4B که به تکرار در زمان استدلال معروف است، این نرخ در حالت نمونه‌گیری حریصانه از ۲۲.۹٪ به ۱٪ رسید. نکته مهم این است که امتیازات ارزیابی در تمام شاخص‌ها بهبود یافت، که Liquid AI این موفقیت را صرفاً نتیجهٔ حذف تکرارها می‌داند.

هزینه محاسباتی این اصلاح بسیار پایین است. برای مدل LFM2.5-2.6B، تولید مجموعه داده هدف (با توقف پس از ۲۰ هزار جفت) تنها یک ساعت روی ۸ عدد GPU مدل MI325 زمان برد. آموزش متعاقب آن نیز فقط ۱ تا ۲ ساعت روی یک عدد GPU مدل MI325 طول کشید.

جزئیات آموزش:

  • روش: یک Epoch آموزش با استفاده از لورا (LoRA).
  • رتبه (Rank): رتبه‌های بالای ۱۲۸-۲۵۶ بهترین نتیجه را دادند.
  • دامنه: آموزش تمام پروژکشن‌های Attention و MLP به همراه lm_head را پوشش می‌دهد.
  • نرخ یادگیری: در بازه 4e-6 تا 2e-5.
  • شرط توقف: توقف زودهنگام زمانی رخ می‌دهد که chosen_win (سهم نمونه‌هایی که در آن‌ها توکن‌های انتخابی بر توکن‌های ردشده غلبه کردند) به ۰.۳۵ برسد؛ آموزش طولانی‌تر از این مقدار معمولاً منجر به تخریب عملکرد مدل می‌شود.

پیامدهای راهبردی برای استقرار مدل

این پیشرفت، این فرض را که برای استدلال حتماً به دمای بالاتر نیاز است، تغییر می‌دهد. Liquid AI دریافت که پس از حذف حلقه‌ها، نمونه‌گیری نزدیک به حریصانه (دمای پایین) در واقع قوی‌ترین نتایج را می‌دهد. باور قبلی مبنی بر کمکِ دما به استدلال، احتمالاً ناشی از خلط اثر دما با اثر «شکستن حلقه‌های مرگ» بود. پس از آموزش، هر دو مدل در دمای نزدیک به ۱.۰ افت عملکرد داشتند، زیرا نمونه‌گیری با دمای بالا توکن‌های کمتر-محبوب را ترجیح می‌دهد.

موارد کاربرد:

  • مدل‌های استدلالی روی دستگاه: مدل‌های زیر ۱ گیگابایت مثل خانواده LFM2.5 می‌توانند در میانه اثبات‌های سخت گیر کنند؛ Antidoom دقتی را که این حلقه‌ها می‌دزدیدند، بازیابی می‌کند. این رویکرد تکمیلی بر استراتژی گذار از مدل‌های عمومی به هوش مصنوعی عمودی است که بر بهینه‌سازی مدل برای کاربردهای خاص تأکید دارد.
  • عامل‌های کدنویسی کوچک: یک مدل ۴ میلیارد پارامتری که در یک ردپای عیب‌یابی سخت گیر می‌کند، پنجره زمینه را می‌سوزاند. حذف حلقه باعث می‌شود مدل به راهکاری برسد که پیش‌تر بلد بود اما در تکرار گم شده بود.
  • کنترل هزینه خط لوله عامل‌ها: چون حلقه‌ها توکن مصرف می‌کنند تا پنجره زمینه پر شود، حذف آن‌ها باعث کاهش توکن‌های هدررفته و کاهش تأخیر (Latency) در اجرای طولانی عامل‌ها می‌شود. در واقع، بهینه‌سازی این لایه‌ها می‌تواند از ریسک‌های تجاری ناشی از زیرساخت‌های مدل‌محور جلوگیری کرده و انعطاف‌پذیری عملیاتی را افزایش دهد.
  • ترمیم پس از آموزش: تیم‌هایی که نسخه‌های تنظیم‌دقیق شده (Fine-tuned) را عرضه می‌کنند، می‌توانند Antidoom را به عنوان یک مرحله پاک‌سازی سریع (Cleanup pass) اجرا کنند.

نقاط قوت و چالش‌ها

نقاط قوت:

  • هدفمند: صرفاً اولین توکن حلقه را ویرایش کرده و بقیه توزیع احتمالات را دست‌نخورده باقی می‌گذارد.
  • سریع: کل خط لوله در عرض چند ساعت اجرا می‌شود.
  • سنجیده: کاهش چشمگیر نرخ تکرار در LFM2.5-2.6B (۱۰.۲٪ به ۱.۴٪) و Qwen3.5-4B (۲۲.۹٪ به ۱٪).
  • بازیابی، نه آموزش: پاسخ‌هایی را که مدل پیش‌تر قادر به تولید آن‌ها بود اما در حلقه گم می‌شد، بازمی‌گرداند.
  • متن‌باز: تمام مراحل تولید داده، تشخیص و آموزش FTPO منتشر شده است.

چالش‌ها:

  • نقاط شکست جدید: حذف یک حلقه ممکن است حلقه‌های جدیدی را آشکار کند که گاهی نیاز به چندین دور آموزش دارد.
  • ریسک بیش‌برازش: نیاز به توقف زودهنگام سخت‌گیرانه بر اساس chosen_win برای جلوگیری از تخریب مدل.
  • حساسیت به دما: افت عملکرد در دمای نزدیک به ۱.۰ پس از آموزش.
  • وابستگی به داده: هر مدل به مجموعه داده تکرارهای تولید شده مخصوص به خودش نیاز دارد.

با حرکت صنعت به سمت مدل‌های عامل‌محور (Agentic) با زنجیره‌های استدلالی طولانی، توانایی اجرای «پاک‌سازی» در عرض چند ساعت برای عرضه نسخه‌های پایدار ضروری است. توسعه‌دهندگان اکنون می‌توانند کاهش تکرار را به عنوان یک مرحله ترمیم پس از آموزش ببینند، نه یک چالش معماری بنیادین.

توسعه‌دهندگانی که علاقه‌مند به پیاده‌سازی این خط لوله هستند، می‌توانند به تمام ابزارها، از جمله قوانین تشخیص و آموزش‌دهنده FTPO، از طریق مخزن رسمی گیت‌هاب دسترسی پیدا کنند.

گام بعدی شما

  • اگر مدل‌های کوچک (SLM) را برای کارهای تخصصی استقرار داده‌اید، نرخ تکرار آن‌ها را در دمای پایین پایش کنید.
  • مخزن گیت‌هاب Antidoom را برای پیاده‌سازی قوانین تشخیص حلقه در خط لوله استنتاج خود بررسی کنید.
  • در صورت استفاده از LoRA برای تنظیم دقیق، رتبه‌های بالا (بالای ۱۲۸) را برای اصلاحات توکنی امتحان کنید.

اما تأثیر این متد بر مدل‌های بسیار بزرگ‌تر که حافظه وسیع‌تری دارند هنوز ناشناخته است — در گزارش بعدی، اثر Antidoom بر مدل‌های ۷۰ میلیارد پارامتری را بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این متد بر اساس تخصص در بهینه‌سازی توکن‌ها، هزینه‌ی استقرار مدل‌های استدلالی کوچک را به شدت کاهش می‌دهد. با حذف توکن‌های هدررفته در حلقه‌های تکرار، تأخیر سیستم‌های عامل‌محور به طور محسوس کمتر می‌شود.

تأثیر برای ایران

به دلیل متن‌باز بودن ابزار و هزینه محاسباتی بسیار پایین (آموزش در ۱ تا ۲ ساعت)، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به خوشه‌های GPU عظیم، مدل‌های لبه (Edge) خود را بهینه کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «جریمه تکرار» با یک اصلاح ساختاری در لایه لاجیت‌ها، نشان می‌دهد که مشکل تکرار در مدل‌های استدلالی، یک نقص در توزیع احتمالات است و نه کمبود دانش. این رویکرد، پارادایم «دمای بالا برای خلاقیت/استدلال» را به چالش می‌کشد و ثابت می‌کند که بسیاری از موفقیت‌های مدل‌ها در دمای بالا، صرفاً نتیجهٔ فرار تصادفی از حلقه‌های مرگ بوده است، نه لزوماً استدلال بهتر.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.