پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف واژگانی: دلیل شکست ModernBERT در بازیابی متون پراکنده

·۳ مرداد ۱۴۰۵۱۲ دقیقه مطالعه۱ بازدید
«برت نورونت» زنده است: ModernBERT در بازیابی تنک به BERT-base قدیمی باخت
«برت نورونت» زنده است: ModernBERT در بازیابی تنک به BERT-base قدیمی باخت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مکانیزم «شکاف واژگانی» و رابطه مستقیم نرم L2 لایه MLM با کیفیت بازیابی پراکنده؛ موضوعی که توضیح می‌دهد چرا یک مدل مدرن‌تر در یک وظیفه قدیمی شکست می‌خورد.

تصور کنید ابزاری ساخته‌اید که قرار است سریع‌ترین و دقیق‌ترین جست‌وجوگر دنیای متون باشد، اما ناگهان متوجه می‌شوید مدل سال ۲۰۱۸ میلادی تمام محاسبات شما را شکست می‌دهد. این سناریوی واقعی است که پژوهشگران در ژوئن ۲۰۲۶ با بررسی مدل ModernBERT تجربه کردند.

طبق گزارش منتشرشده در arXiv (کد: 2606.18811)، مدل ModernBERT در محک BEIR-13 برای بازیابی پراکنده (Sparse Retrieval) به میانگین nDCG@10 معادل ۰.۱۲۷ رسید؛ عددی که به‌شدت پایین‌تر از بازه ۰.۳۶۱ تا ۰.۴۰۳ است که توسط مدل قدیمی و سالخورده BERT-base حفظ شده بود.

این یافته در حالی به دست آمده که صنعت به‌سوی تولید بازیابی‌افزا (RAG) حرکت می‌کند. سیستم‌های جست‌وجو به مدل‌های رمزگذار (Encoder) وابسته هستند تا متن را به اعداد تبدیل کنند. در حالی که مدل‌های زاینده مانند GPT وظیفه «سخن گفتن» را بر عهده دارند، رمزگذارها مانند BERT به عنوان «اندام‌های حسی» عمل می‌کنند و کوهی از اسناد را به‌صورت ارزان و کارآمد پردازش می‌کنند.

برای اکثر کاربران، تفاوت ساده است: BERT یک جمله را از هر دو جهت می‌خواند تا بافت و زمینه را درک کند. اما GPT از چپ به راست می‌خواند تا کلمه بعدی را پیش‌بینی کند. همین ویژگی باعث شده مدل‌های خانواده BERT حتی پس از هشت سال از زمان عرضه، استاندارد طلایی برای طبقه‌بندی و نمایه‌سازی متون باقی بمانند.

زمینه: میراث BERT

مدل BERT (نمایش‌های رمزگذار دوطرفه از ترنسفورمرها) در ۱۱ اکتبر ۲۰۱۸ توسط دولین، چانگ، لی و توتانووا در گوگل منتشر شد (arXiv:1810.04805). نسخه BERT-base دارای ۱۱۰ میلیون پارامتر، ۱۲ لایه و ۱۲ سر توجه (Attention Head) است. این مدل روی ۳.۳ میلیارد کلمه با استفاده از مجموعه‌های BooksCorpus و ویکی‌پدیا انگلیسی آموزش دید.

پیش‌آموزش این مدل از روش مدل‌سازی زبان ماسک‌شده (MLM) استفاده کرد؛ جایی که مدل ۱۵٪ از توکن‌ها را ماسک (پنهان) می‌کند و سعی می‌کند کلمات گم‌شده را با استفاده از زمینه هر دو طرف حدس بزند. این رویکرد دوطرفه اجازه داد تا BERT برای سال‌ها بر تکالیف درک زبان مسلط باشد.

تأثیر صنعتی BERT در ۲۵ اکتبر ۲۰۱۹ تثبیت شد، زمانی که گوگل آن را در رتبه‌بندی جست‌وجو و قطعات برجسته (Featured Snippets) ادغام کرد. طبق وبلاگ رسمی گوگل، BERT به درک هر دهمین پرس‌وجوی انگلیسی در ایالات متحده کمک کرد که بزرگ‌ترین جهش در درک پرس‌وجوها طی پنج سال اخیر بود.

علیرغم سن زیاد، BERT همچنان یک غول است. تا دسامبر ۲۰۲۴، این مدل دومین مدل پراستفاده در Hugging Face Hub بود و ماهانه بیش از ۶۸ میلیون بار دانلود می‌شد (طبق داده‌های Answer.AI). اگرچه آمار رسمی Hub برای ژوئیه ۲۰۲۶ در دسترس نیست، اما ردپای این مدل همچنان در سراسر صنعت گسترده است.

تفاوت هزینه: رمزگذار در برابر رمزگشا

تمایز بین BERT (رمزگذار) و GPT (رمزگشا) فقط آکادمیک نیست، بلکه مالی است. رمزگذارها برای ادراک طراحی شده‌اند تا اسناد را ارزان به اعداد تبدیل کنند. رمزگشاها برای سخن گفتند طراحی شده‌اند و تولید متن در آن‌ها گران است.

موردی را از وبلاگ Answer.AI (۱۹ دسامبر ۲۰۲۴) در نظر بگیرید: فیلتر کردن ۱۵ تریلیون توکن با استفاده از یک مدل BERT تنظیم‌شده (Fine-tuned)، ۶,۰۰۰ ساعت کار با H100 زمان برد که با نرخ ۱۰ دلار در ساعت، تقریباً ۶۰,۰۰۰ دلار هزینه داشت. پردازش همین ۱۵ تریلیون توکن توسط یک رمزگشای ارزان مانند Gemini Flash (با نرخ ۰.۰۷۵ دلار به ازای هر میلیون توکن)، بیش از یک میلیون دلار هزینه می‌آورد.

مکانیسم: چرا ModernBERT فروپاشید؟

دو مطالعه مستقل علت این شکست را «شکاف واژگانی» (Vocabulary Gap) شناسایی کردند. BERT-base از دیکشنری با ۳۰,۵۲۲ توکن WordPiece استفاده می‌کند که به حروف کوچک و بزرگ حساس نیست. در دنیای BERT، کلمات "search"، "Search" و "SEARCH" همگی یک توکن واحد و یک ردیف در ایندکس هستند.

در مقابل، ModernBERT که در ۱۹ دسامبر ۲۰۲۴ توسط Answer.AI و LightOn عرضه شد، به عنوان جایگزینی مستقیم طراحی شده بود. این مدل پنجره متنی ۸,۱۹۲ توکنی (در مقابل ۵۱۲ توکن در BERT) ارائه می‌دهد و روی ۲ تریلیون توکن، شامل مقدار زیادی کد، آموزش دیده است. با این حال، ModernBERT از یک دیکشنری BPE بزرگ‌تر با ۵۰,۳۶۸ توکن استفاده می‌کند که به حروف کوچک و بزرگ حساس است.

در حالی که حساسیت به حروف در بازسازی دقیق متن کمک می‌کند، اما برای جست‌وجوی پراکنده «نویز ریخت‌شناختی» ایجاد می‌کند. یک کلمه به مجموعه‌ای از اشکال ظاهری مختلف تقسیم می‌شود و در نتیجه ظرفیت مدل روی نویز تلف شده و وزن آن عبارت در میان فرم‌های تکراری رقیق می‌شود. این حجم واژگان در پیکربندی‌های رسمی Hugging Face تا ۱۹ ژوئیه ۲۰۲۶ تأیید شده است.

BERT قدیمی در بازیابی پراکنده از ModernBERT پیشی گرفت

جزئیات: بازیابی پراکنده و اثر SPLADE

برای درک این شکست، باید مفهوم بازیابی پراکنده (Sparse Retrieval) را دانست. برخلاف بردارهای متراکم، یک بازیاب پراکنده، سند را به صورت برداری پراکنده به اندازه کل دیکشنری نمایش می‌دهد.

  • مکانیسم: به هر عبارت یک وزن اهمیت غیرمنفی اختصاص می‌یابد. این بردار در یک ایندکس وارونه کلاسیک (مشابه BM25) جای می‌گیرد، اما وزن‌ها توسط یک شبکه عصبی تعیین می‌شوند.
  • SPLADE: این مدل که توسط Formal و همکاران در SIGIR 2021 (arXiv:2107.05720) پیشنهاد شد، از لایه MLM رمزگذار برای اختصاص وزن به ده‌ها هزار عبارت، حتی مترادف‌هایی که در متن اصلی نیستند، استفاده می‌کند.
  • محدودیت‌ها: طبق مقاله «یک چارچوب یکپارچه برای بازیابی پراکنده آموخته‌شده» (مارس ۲۰۲۳، arXiv:2303.13416)، وزن‌ها باید غیرمنفی باشند تا الزامات پشته‌های ایندکس وارونه را برآورده کنند. در نتیجه، بردار دقیقاً در مختصات دیکشنری قرار می‌گیرد.
  • ارزیابی: هر دو مطالعه سال ۲۰۲۶ از BEIR (تاکور و همکاران، NeurIPS 2021) استفاده کردند که یک بنچمارک Zero-shot شامل ۱۸ مجموعه داده و استاندارد صنعت برای ارزیابی بازیاب‌هاست.

این فرآیند به شدت به لایه مدل‌سازی زبان ماسک‌شده (MLM) وابسته است؛ لایه نهایی که حالت‌های پنهانی را به توزیع واژگان تبدیل می‌کند. مقاله ژوئن ۲۰۲۶ (arXiv:2606.18811) یک همبستگی حیاتی در مورد نرم L2 این ماتریس یافت.

مدل‌هایی با نرم L2 کمتر از ۲ — شامل BERT، DistilBERT، ALBERT و GTE-MLM — منجر به بازیاب‌های پراکنده قدرتمندی شدند. ModernBERT دارای نرم بسیار بزرگ‌تری است که باعث شد کیفیت آن در BEIR-13 به ۰.۱۲۷ سقوط کند. شکاف بین خانواده BERT و ModernBERT تقریباً سه برابر است؛ نتیجه‌ای که در ۱۳ مجموعه داده مختلف تکرار شد و احتمال تصادفی بودن آن را رد کرد.

نتایج BEIR-13 (میانگین nDCG@10 طبق arXiv:2606.18811):

  • BERT, DistilBERT, ALBERT, GTE-MLM: ۰.۳۶۱–۰.۴۰۳
  • RoBERTa: ۰.۳۳۱
  • Ettin: ۰.۲۲۱
  • ModernBERT: ۰.۱۲۷

راهکار: بازتنظیم مقیاس و انتقال واژگان

پژوهشگران دو راه برای نجات رمزگذار مدرن یافتند. روش اول یک «اصلاح سریع» به نام بازتنظیم مقیاس (Rescaling) است. با ضرب ماتریس لایه MLM در یک ثابت ($k=16$) قبل از آموزش، مقدار nDCG@10 مدل ModernBERT در BEIR-13 از ۰.۱۲۷ به ۰.۴۰۵ جهش کرد (افزایش نسبی ۲۱۵ درصدی).

سایر دستاوردهای بازتنظیم مقیاس عبارت بودند از:

  • MS MARCO MRR@10: از ۰.۰۴۵ به ۰.۲۵۰
  • TREC-DL 2019 nDCG@10: از ۰.۲۶۶ به ۰.۶۰۹
  • Ettin: از ۰.۲۲۱ به ۰.۳۹۱

هشدار: مقدار بهینه $k$ به ستون فقرات مدل بستگی دارد. برای مثال RoBERTa در $k=2$ به اوج می‌رسد و در $k=16$ فرو می‌پاشد. این ثابت باید برای هر مدل به‌صورت جداگانه تنظیم شود و نباید صرفاً کپی شود.

روش دوم و مستحکم‌تر، «انتقال واژگان» (Vocabulary Transfer) است که در مقاله‌ای پذیرفته شده برای SIGIR 2026 (arXiv:2607.00004) توسط Zhichao Geng و Yang Yang شرح داده شده است. این چارچوب رمزگذارهای پیشرفته را به دیکشنری‌های سازگار با بازیابی پراکنده منتقل می‌کند و از دو مرحله استفاده می‌کند:
۱. مقداردهی اولیه معنایی: نقشه‌برداری بر اساس توپولوژی فضای برداری.
۲. کالیبراسیون پتانسیل فعال‌سازی: برای جلوگیری از نورون‌های مرده و فروپاشی متراکم.

با انتقال رمزگذار به یک دیکشنری نرمال‌شده، ModernBERT نه تنها بازیابی شد، بلکه رکورد جدید SOTA با ۵۲.۴ nDCG در BEIR ثبت کرد که ۴.۷ امتیاز بیشتر از پیشروهای قبلی بود. همین تکنیک باعث احیای مدل ضعیف RoBERTa-large شد و نویسندگان کدها و مدل‌ها را به‌صورت عمومی منتشر کرده‌اند.

مقایسه فنی: BERT-base در برابر ModernBERT-base

طبق پیکربندی‌های رسمی Hugging Face تأیید شده در ۱۹ ژوئیه ۲۰۲۶ و مستندات Answer.AI، تفاوت‌های معماری به شرح زیر است:

ویژگی BERT-base ModernBERT-base
سال عرضه ۲۰۱۸ ۲۰۲۴ (۱۹ دسامبر)
پارامترها ۱۱۰ میلیون ۱۴۹ میلیون
واژگان ۳۰,۵۲۲ (WordPiece، غیرحساس به حروف) ۵۰,۳۶۸ (BPE، حساس به حروف)
پنجره متنی ۵۱۲ توکن ۸,۱۹۲ توکن
رمزگذاری موقعیت مطلق RoPE
توجه (Attention) کامل محلی (۱۲۸) + سراسری (هر لایه سوم)
لایه‌ها ۱۲ ۲۲
قوی‌ترین کاربرد تنظیم دقیق پراکنده آماده (Out-of-the-box) بازیابی متراکم، بافت طولانی، کد

استراتژی پیاده‌سازی عملی

اگر در حال ساخت یک سیستم جست‌وجو یا RAG هستید، انتخاب مدل به هدف شما بستگی دارد. برای تنظیم دقیق پراکنده «از جعبه»، خانواده BERT سال ۲۰۱۸ همچنان شرط تکه امن‌تری است. برای بازیابی متراکم، طبقه‌بندی یا تکالیف با بافت طولانی، ModernBERT به‌طور قابل‌توجهی قوی‌تر است. طبق گفته Answer.AI، مدل ModernBERT اولین رمزگذار با اندازه base است که در بنچمارک GLUE مدل DeBERTaV3 را شکست داده، در حالی که کمتر از یک‌پنجم حافظه مصرف کرده و سرعت آن دو برابر است.

برای اعتبارسنجی روی داده‌های خود، این خط لوله ۵ مرحله‌ای را دنبال کنید:
۱. ۲۰۰ تا ۵۰۰ پرس‌وجوی واقعی و اسناد مرتبط را برای ایجاد یک بنچمارک کوچک جمع‌آوری کنید.
۲. یک مدل SPLADE را روی هر دو مدل BERT-base و ModernBERT آموزش دهید.
۳. مقدار nDCG@10 را روی مجموعه داده خاص خود اندازه بگیرید.
۴. اگر ModernBERT شکست خورد، نرم L2 لایه MLM آن را بررسی کنید؛ اگر بالای ۲ بود، بازتنظیم مقیاس را با ضرایب $k = 2, 4, 8, 16$ تست کنید.
۵. این نتایج را با مدل‌های جاسازی (Embedding) آماده از طریق API مقایسه کنید.

BERT قدیمی در بازیابی پراکنده از ModernBERT پیشی گرفت

برای کسانی که در روسیه هستند، سرویس provod.ai یک API یکپارچه برای تست این مدل‌های جاسازی مدرن فراهم می‌کند تا نیاز به حساب‌های متعدد فروشنده نباشد. این سرویس با OpenAI SDK سازگار است، به این معنی که شما فقط base_url و کلید API را تغییر می‌دهید. این امر امکان بنچمارک سریع به روبل با نرخ‌های رسمی را فراهم می‌کند، پیش از آنکه هزینه‌های سنگین تنظیم دقیق روی GPU را بپذیرید. شما می‌توانید یک موجودی واحد برای آزمایش‌ها و تولید داشته باشید و میزان هزینه هر مدل را رصد کنید.

تحلیل: درس‌هایی برای معماری هوش مصنوعی

این پرونده ثابت می‌کند که «جدیدتر» بودن همیشه برای وظایف ریاضی خاص به معنای «بهتر» بودن نیست. ModernBERT به عنوان جایگزینی برای BERT طراحی شد تا سرعت و طول بافت را بهینه کند. اما در این مسیر، نرمال‌سازی زبانی خاصی را که بازیابی پراکنده به آن وابسته است، تخریب کرد.

برای توسعه‌دهندگان، این موضوع خطر پیش‌فرض گرفتن این نکته را برجسته می‌کند که هوش کلی یک مدل لزوماً به تمام وظایف بازیابی منتقل می‌شود. «شکاف واژگانی» یادآور این است که نحوه توکن‌بندی جهان توسط یک مدل، تعریف می‌کند که او واقعاً چه چیزی را می‌تواند پیدا کند.

باید توجه داشت که این نتایج بر اساس داده‌های انگلیسی (MS MARCO, BEIR) بود. برای تکالیف زبان روسی، توسعه‌دهندگان معمولاً از رمزگذارهای چندزبانه استفاده می‌کنند و نرم L2 لایه MLM باید به‌طور جداگانه برای آن موارد بررسی شود. علاوه بر این، انتقال واژگان و بازتنظیم مقیاس پیش‌چاپ‌های ژوئن/ژوئیه ۲۰۲۶ هستند و هنوز به استانداردهای تولیدی تبدیل نشده‌اند.

زمانی که یک تجمیع‌کننده API کافی نیست

لازم است شفاف‌سازی شود که اگرچه provod.ai دسترسی به مدل‌های آماده را تسهیل می‌کند، اما جایگزینی برای زیرساخت‌های مورد نیاز برای آموزش سفارشی نیست. اگر در حال آموزش رمزگذار خود روی سخت‌افزار شخصی هستید، انتقال واژگان را انجام می‌دهید یا یک ایندکس وارونه شخصی را میزبانی می‌کنید، این کار همچنان بر عهده تیم مهندسی شما روی GPUهای خودتان است. همچنین، این ابزار برای محیط‌های On-premise که نیاز به صفر درصد فراخوانی خارجی دارند، مناسب نیست. با این حال، برای مرحله حیاتی مقایسه مدل‌های جاسازی موجود روی متون شما قبل از هزینه برای آموزش، ایده‌آل است.

درک نویز: BERT در برابر سایر اصطلاحات AI

در فضای جست‌وجوی «شبکه عصبی BERT»، پرس‌وجوها اغلب با خوشه‌ای از اصطلاحات نامرتبط برخورد می‌کنند. برای جلوگیری از سردرگمی، شفاف‌سازی مفاهیمی که اغلب اشتباه گرفته می‌شوند در اینجا آمده است:

  • اشتباهات تکنیکی: «Tree» به Tree of Thoughts (پرامپت‌نویسی LLM) اشاره دارد، نه BERT. «GPTQ» یک فرمت کوانتش وزن برای LLMهای محلی است. «GPTZero.me» یک شناسگر متن AI است.
  • ابزارهای توسعه: «Cursorrules» قوانینی برای ویرایشگر Cursor AI هستند. «Gym» به OpenAI Gym برای یادگیری تقویت‌شده اشاره دارد.
  • هوش مصنوعی خلاق: «Regional Prompter» و «Material» مربوط به Stable Diffusion و خطاهای Suno هستند. «Try-on» به Kolors Virtual Try-On اشاره دارد. «Sora» و «Veo» در روند تولید ویدئو هستند.
  • صوت/گفتار: «SaluteSpeech» پشته صوتی Sber است. اصطلاحاتی مانند «DAW»، «XLN» و «LHY» مربوط به پلاگین‌های صوتی هستند که اغلب با Suno استفاده می‌شوند.
  • غلط‌های املایی: خطاهای رایج در آدرس ChatGPT شامل «gptcom»، «gptchatcom» و نسخه‌های مختلف «chatgptapp» است.
  • ویژگی‌های بات: «DiplomGPT» برای مقالات آکادمیک و «GirlfriendGPT» برای همراهان، برنامه‌های کاربردی هستند، نه رمزگذارهای معماری.

در ادامه، نظاره‌گر باشید که آیا تکنیک‌های انتقال واژگان در وزن‌های رسمی ModernBERT ادغام می‌شوند یا خیر، زیرا این اتفاق می‌تواند به‌طور مؤثر «عصر BERT-base» را برای جست‌وجوی پراکنده به پایان برساند. نتیجه‌گیری عملی من این است که برای جست‌وجوی پراکنده در سال ۲۰۲۶، با BERT-base شروع کنید، اما تنها زمانی به ModernBERT مهاجرت کنید که یک دیکشنری منتقل‌شده داشته باشید.

چرا این موضوع مهم است؟

این یافته بر اعتبار تخصص در انتخاب معماری تأکید می‌کند؛ چراکه حتی مدل‌های پیشرفته‌تر هم ممکن است در کاربردهای عملیاتی (به‌خصوص بازیابی متون) شکست بخورند. این موضوع باعث می‌شود تیم‌های مهندسی به‌جای اعتماد کورکورانه به نسخه‌های جدید، روی اعتبارسنجی لایه‌های توکن‌سازی متمرکز شوند.

تأثیر برای ایران

این خبر برای پژوهشگران مدل‌های زبانی در ایران که روی سیستم‌های بازیابی فارسی کار می‌کنند اهمیت دارد، زیرا نشان می‌دهد تغییر در توکن‌ساز (Tokenizer) می‌تواند دقت بازیابی را به‌کل تغییر دهد.

·نگاه ما
تحریریه دات‌هوش

این مورد نشان می‌دهد که بهینه‌سازی برای یک معیار (مثل سرعت یا پنجره متنی) می‌تواند به‌طور ناخواسته قابلیت‌های بنیادی در لایه‌های پایین‌تر را تخریب کند. شکاف واژگانی در ModernBERT هشدار می‌دهد که در عصر مدل‌های غول‌پیکر، هنوز جزئیات ساده‌ای مثل «حساسیت به حروف» در توکن‌سازی می‌تواند تفاوت بین یک سیستم بازیابی دقیق و یک شکست کامل باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.