تصور کنید ابزاری ساختهاید که قرار است سریعترین و دقیقترین جستوجوگر دنیای متون باشد، اما ناگهان متوجه میشوید مدل سال ۲۰۱۸ میلادی تمام محاسبات شما را شکست میدهد. این سناریوی واقعی است که پژوهشگران در ژوئن ۲۰۲۶ با بررسی مدل ModernBERT تجربه کردند.
طبق گزارش منتشرشده در arXiv (کد: 2606.18811)، مدل ModernBERT در محک BEIR-13 برای بازیابی پراکنده (Sparse Retrieval) به میانگین nDCG@10 معادل ۰.۱۲۷ رسید؛ عددی که بهشدت پایینتر از بازه ۰.۳۶۱ تا ۰.۴۰۳ است که توسط مدل قدیمی و سالخورده BERT-base حفظ شده بود.
این یافته در حالی به دست آمده که صنعت بهسوی تولید بازیابیافزا (RAG) حرکت میکند. سیستمهای جستوجو به مدلهای رمزگذار (Encoder) وابسته هستند تا متن را به اعداد تبدیل کنند. در حالی که مدلهای زاینده مانند GPT وظیفه «سخن گفتن» را بر عهده دارند، رمزگذارها مانند BERT به عنوان «اندامهای حسی» عمل میکنند و کوهی از اسناد را بهصورت ارزان و کارآمد پردازش میکنند.
برای اکثر کاربران، تفاوت ساده است: BERT یک جمله را از هر دو جهت میخواند تا بافت و زمینه را درک کند. اما GPT از چپ به راست میخواند تا کلمه بعدی را پیشبینی کند. همین ویژگی باعث شده مدلهای خانواده BERT حتی پس از هشت سال از زمان عرضه، استاندارد طلایی برای طبقهبندی و نمایهسازی متون باقی بمانند.
زمینه: میراث BERT
مدل BERT (نمایشهای رمزگذار دوطرفه از ترنسفورمرها) در ۱۱ اکتبر ۲۰۱۸ توسط دولین، چانگ، لی و توتانووا در گوگل منتشر شد (arXiv:1810.04805). نسخه BERT-base دارای ۱۱۰ میلیون پارامتر، ۱۲ لایه و ۱۲ سر توجه (Attention Head) است. این مدل روی ۳.۳ میلیارد کلمه با استفاده از مجموعههای BooksCorpus و ویکیپدیا انگلیسی آموزش دید.
پیشآموزش این مدل از روش مدلسازی زبان ماسکشده (MLM) استفاده کرد؛ جایی که مدل ۱۵٪ از توکنها را ماسک (پنهان) میکند و سعی میکند کلمات گمشده را با استفاده از زمینه هر دو طرف حدس بزند. این رویکرد دوطرفه اجازه داد تا BERT برای سالها بر تکالیف درک زبان مسلط باشد.
تأثیر صنعتی BERT در ۲۵ اکتبر ۲۰۱۹ تثبیت شد، زمانی که گوگل آن را در رتبهبندی جستوجو و قطعات برجسته (Featured Snippets) ادغام کرد. طبق وبلاگ رسمی گوگل، BERT به درک هر دهمین پرسوجوی انگلیسی در ایالات متحده کمک کرد که بزرگترین جهش در درک پرسوجوها طی پنج سال اخیر بود.
علیرغم سن زیاد، BERT همچنان یک غول است. تا دسامبر ۲۰۲۴، این مدل دومین مدل پراستفاده در Hugging Face Hub بود و ماهانه بیش از ۶۸ میلیون بار دانلود میشد (طبق دادههای Answer.AI). اگرچه آمار رسمی Hub برای ژوئیه ۲۰۲۶ در دسترس نیست، اما ردپای این مدل همچنان در سراسر صنعت گسترده است.
تفاوت هزینه: رمزگذار در برابر رمزگشا
تمایز بین BERT (رمزگذار) و GPT (رمزگشا) فقط آکادمیک نیست، بلکه مالی است. رمزگذارها برای ادراک طراحی شدهاند تا اسناد را ارزان به اعداد تبدیل کنند. رمزگشاها برای سخن گفتند طراحی شدهاند و تولید متن در آنها گران است.
موردی را از وبلاگ Answer.AI (۱۹ دسامبر ۲۰۲۴) در نظر بگیرید: فیلتر کردن ۱۵ تریلیون توکن با استفاده از یک مدل BERT تنظیمشده (Fine-tuned)، ۶,۰۰۰ ساعت کار با H100 زمان برد که با نرخ ۱۰ دلار در ساعت، تقریباً ۶۰,۰۰۰ دلار هزینه داشت. پردازش همین ۱۵ تریلیون توکن توسط یک رمزگشای ارزان مانند Gemini Flash (با نرخ ۰.۰۷۵ دلار به ازای هر میلیون توکن)، بیش از یک میلیون دلار هزینه میآورد.
مکانیسم: چرا ModernBERT فروپاشید؟
دو مطالعه مستقل علت این شکست را «شکاف واژگانی» (Vocabulary Gap) شناسایی کردند. BERT-base از دیکشنری با ۳۰,۵۲۲ توکن WordPiece استفاده میکند که به حروف کوچک و بزرگ حساس نیست. در دنیای BERT، کلمات "search"، "Search" و "SEARCH" همگی یک توکن واحد و یک ردیف در ایندکس هستند.
در مقابل، ModernBERT که در ۱۹ دسامبر ۲۰۲۴ توسط Answer.AI و LightOn عرضه شد، به عنوان جایگزینی مستقیم طراحی شده بود. این مدل پنجره متنی ۸,۱۹۲ توکنی (در مقابل ۵۱۲ توکن در BERT) ارائه میدهد و روی ۲ تریلیون توکن، شامل مقدار زیادی کد، آموزش دیده است. با این حال، ModernBERT از یک دیکشنری BPE بزرگتر با ۵۰,۳۶۸ توکن استفاده میکند که به حروف کوچک و بزرگ حساس است.
در حالی که حساسیت به حروف در بازسازی دقیق متن کمک میکند، اما برای جستوجوی پراکنده «نویز ریختشناختی» ایجاد میکند. یک کلمه به مجموعهای از اشکال ظاهری مختلف تقسیم میشود و در نتیجه ظرفیت مدل روی نویز تلف شده و وزن آن عبارت در میان فرمهای تکراری رقیق میشود. این حجم واژگان در پیکربندیهای رسمی Hugging Face تا ۱۹ ژوئیه ۲۰۲۶ تأیید شده است.

جزئیات: بازیابی پراکنده و اثر SPLADE
برای درک این شکست، باید مفهوم بازیابی پراکنده (Sparse Retrieval) را دانست. برخلاف بردارهای متراکم، یک بازیاب پراکنده، سند را به صورت برداری پراکنده به اندازه کل دیکشنری نمایش میدهد.
- مکانیسم: به هر عبارت یک وزن اهمیت غیرمنفی اختصاص مییابد. این بردار در یک ایندکس وارونه کلاسیک (مشابه BM25) جای میگیرد، اما وزنها توسط یک شبکه عصبی تعیین میشوند.
- SPLADE: این مدل که توسط Formal و همکاران در SIGIR 2021 (arXiv:2107.05720) پیشنهاد شد، از لایه MLM رمزگذار برای اختصاص وزن به دهها هزار عبارت، حتی مترادفهایی که در متن اصلی نیستند، استفاده میکند.
- محدودیتها: طبق مقاله «یک چارچوب یکپارچه برای بازیابی پراکنده آموختهشده» (مارس ۲۰۲۳، arXiv:2303.13416)، وزنها باید غیرمنفی باشند تا الزامات پشتههای ایندکس وارونه را برآورده کنند. در نتیجه، بردار دقیقاً در مختصات دیکشنری قرار میگیرد.
- ارزیابی: هر دو مطالعه سال ۲۰۲۶ از BEIR (تاکور و همکاران، NeurIPS 2021) استفاده کردند که یک بنچمارک Zero-shot شامل ۱۸ مجموعه داده و استاندارد صنعت برای ارزیابی بازیابهاست.
این فرآیند به شدت به لایه مدلسازی زبان ماسکشده (MLM) وابسته است؛ لایه نهایی که حالتهای پنهانی را به توزیع واژگان تبدیل میکند. مقاله ژوئن ۲۰۲۶ (arXiv:2606.18811) یک همبستگی حیاتی در مورد نرم L2 این ماتریس یافت.
مدلهایی با نرم L2 کمتر از ۲ — شامل BERT، DistilBERT، ALBERT و GTE-MLM — منجر به بازیابهای پراکنده قدرتمندی شدند. ModernBERT دارای نرم بسیار بزرگتری است که باعث شد کیفیت آن در BEIR-13 به ۰.۱۲۷ سقوط کند. شکاف بین خانواده BERT و ModernBERT تقریباً سه برابر است؛ نتیجهای که در ۱۳ مجموعه داده مختلف تکرار شد و احتمال تصادفی بودن آن را رد کرد.
نتایج BEIR-13 (میانگین nDCG@10 طبق arXiv:2606.18811):
- BERT, DistilBERT, ALBERT, GTE-MLM: ۰.۳۶۱–۰.۴۰۳
- RoBERTa: ۰.۳۳۱
- Ettin: ۰.۲۲۱
- ModernBERT: ۰.۱۲۷
راهکار: بازتنظیم مقیاس و انتقال واژگان
پژوهشگران دو راه برای نجات رمزگذار مدرن یافتند. روش اول یک «اصلاح سریع» به نام بازتنظیم مقیاس (Rescaling) است. با ضرب ماتریس لایه MLM در یک ثابت ($k=16$) قبل از آموزش، مقدار nDCG@10 مدل ModernBERT در BEIR-13 از ۰.۱۲۷ به ۰.۴۰۵ جهش کرد (افزایش نسبی ۲۱۵ درصدی).
سایر دستاوردهای بازتنظیم مقیاس عبارت بودند از:
- MS MARCO MRR@10: از ۰.۰۴۵ به ۰.۲۵۰
- TREC-DL 2019 nDCG@10: از ۰.۲۶۶ به ۰.۶۰۹
- Ettin: از ۰.۲۲۱ به ۰.۳۹۱
هشدار: مقدار بهینه $k$ به ستون فقرات مدل بستگی دارد. برای مثال RoBERTa در $k=2$ به اوج میرسد و در $k=16$ فرو میپاشد. این ثابت باید برای هر مدل بهصورت جداگانه تنظیم شود و نباید صرفاً کپی شود.
روش دوم و مستحکمتر، «انتقال واژگان» (Vocabulary Transfer) است که در مقالهای پذیرفته شده برای SIGIR 2026 (arXiv:2607.00004) توسط Zhichao Geng و Yang Yang شرح داده شده است. این چارچوب رمزگذارهای پیشرفته را به دیکشنریهای سازگار با بازیابی پراکنده منتقل میکند و از دو مرحله استفاده میکند:
۱. مقداردهی اولیه معنایی: نقشهبرداری بر اساس توپولوژی فضای برداری.
۲. کالیبراسیون پتانسیل فعالسازی: برای جلوگیری از نورونهای مرده و فروپاشی متراکم.
با انتقال رمزگذار به یک دیکشنری نرمالشده، ModernBERT نه تنها بازیابی شد، بلکه رکورد جدید SOTA با ۵۲.۴ nDCG در BEIR ثبت کرد که ۴.۷ امتیاز بیشتر از پیشروهای قبلی بود. همین تکنیک باعث احیای مدل ضعیف RoBERTa-large شد و نویسندگان کدها و مدلها را بهصورت عمومی منتشر کردهاند.
مقایسه فنی: BERT-base در برابر ModernBERT-base
طبق پیکربندیهای رسمی Hugging Face تأیید شده در ۱۹ ژوئیه ۲۰۲۶ و مستندات Answer.AI، تفاوتهای معماری به شرح زیر است:
| ویژگی | BERT-base | ModernBERT-base |
|---|---|---|
| سال عرضه | ۲۰۱۸ | ۲۰۲۴ (۱۹ دسامبر) |
| پارامترها | ۱۱۰ میلیون | ۱۴۹ میلیون |
| واژگان | ۳۰,۵۲۲ (WordPiece، غیرحساس به حروف) | ۵۰,۳۶۸ (BPE، حساس به حروف) |
| پنجره متنی | ۵۱۲ توکن | ۸,۱۹۲ توکن |
| رمزگذاری موقعیت | مطلق | RoPE |
| توجه (Attention) | کامل | محلی (۱۲۸) + سراسری (هر لایه سوم) |
| لایهها | ۱۲ | ۲۲ |
| قویترین کاربرد | تنظیم دقیق پراکنده آماده (Out-of-the-box) | بازیابی متراکم، بافت طولانی، کد |
استراتژی پیادهسازی عملی
اگر در حال ساخت یک سیستم جستوجو یا RAG هستید، انتخاب مدل به هدف شما بستگی دارد. برای تنظیم دقیق پراکنده «از جعبه»، خانواده BERT سال ۲۰۱۸ همچنان شرط تکه امنتری است. برای بازیابی متراکم، طبقهبندی یا تکالیف با بافت طولانی، ModernBERT بهطور قابلتوجهی قویتر است. طبق گفته Answer.AI، مدل ModernBERT اولین رمزگذار با اندازه base است که در بنچمارک GLUE مدل DeBERTaV3 را شکست داده، در حالی که کمتر از یکپنجم حافظه مصرف کرده و سرعت آن دو برابر است.
برای اعتبارسنجی روی دادههای خود، این خط لوله ۵ مرحلهای را دنبال کنید:
۱. ۲۰۰ تا ۵۰۰ پرسوجوی واقعی و اسناد مرتبط را برای ایجاد یک بنچمارک کوچک جمعآوری کنید.
۲. یک مدل SPLADE را روی هر دو مدل BERT-base و ModernBERT آموزش دهید.
۳. مقدار nDCG@10 را روی مجموعه داده خاص خود اندازه بگیرید.
۴. اگر ModernBERT شکست خورد، نرم L2 لایه MLM آن را بررسی کنید؛ اگر بالای ۲ بود، بازتنظیم مقیاس را با ضرایب $k = 2, 4, 8, 16$ تست کنید.
۵. این نتایج را با مدلهای جاسازی (Embedding) آماده از طریق API مقایسه کنید.

برای کسانی که در روسیه هستند، سرویس provod.ai یک API یکپارچه برای تست این مدلهای جاسازی مدرن فراهم میکند تا نیاز به حسابهای متعدد فروشنده نباشد. این سرویس با OpenAI SDK سازگار است، به این معنی که شما فقط base_url و کلید API را تغییر میدهید. این امر امکان بنچمارک سریع به روبل با نرخهای رسمی را فراهم میکند، پیش از آنکه هزینههای سنگین تنظیم دقیق روی GPU را بپذیرید. شما میتوانید یک موجودی واحد برای آزمایشها و تولید داشته باشید و میزان هزینه هر مدل را رصد کنید.
تحلیل: درسهایی برای معماری هوش مصنوعی
این پرونده ثابت میکند که «جدیدتر» بودن همیشه برای وظایف ریاضی خاص به معنای «بهتر» بودن نیست. ModernBERT به عنوان جایگزینی برای BERT طراحی شد تا سرعت و طول بافت را بهینه کند. اما در این مسیر، نرمالسازی زبانی خاصی را که بازیابی پراکنده به آن وابسته است، تخریب کرد.
برای توسعهدهندگان، این موضوع خطر پیشفرض گرفتن این نکته را برجسته میکند که هوش کلی یک مدل لزوماً به تمام وظایف بازیابی منتقل میشود. «شکاف واژگانی» یادآور این است که نحوه توکنبندی جهان توسط یک مدل، تعریف میکند که او واقعاً چه چیزی را میتواند پیدا کند.
باید توجه داشت که این نتایج بر اساس دادههای انگلیسی (MS MARCO, BEIR) بود. برای تکالیف زبان روسی، توسعهدهندگان معمولاً از رمزگذارهای چندزبانه استفاده میکنند و نرم L2 لایه MLM باید بهطور جداگانه برای آن موارد بررسی شود. علاوه بر این، انتقال واژگان و بازتنظیم مقیاس پیشچاپهای ژوئن/ژوئیه ۲۰۲۶ هستند و هنوز به استانداردهای تولیدی تبدیل نشدهاند.
زمانی که یک تجمیعکننده API کافی نیست
لازم است شفافسازی شود که اگرچه provod.ai دسترسی به مدلهای آماده را تسهیل میکند، اما جایگزینی برای زیرساختهای مورد نیاز برای آموزش سفارشی نیست. اگر در حال آموزش رمزگذار خود روی سختافزار شخصی هستید، انتقال واژگان را انجام میدهید یا یک ایندکس وارونه شخصی را میزبانی میکنید، این کار همچنان بر عهده تیم مهندسی شما روی GPUهای خودتان است. همچنین، این ابزار برای محیطهای On-premise که نیاز به صفر درصد فراخوانی خارجی دارند، مناسب نیست. با این حال، برای مرحله حیاتی مقایسه مدلهای جاسازی موجود روی متون شما قبل از هزینه برای آموزش، ایدهآل است.
درک نویز: BERT در برابر سایر اصطلاحات AI
در فضای جستوجوی «شبکه عصبی BERT»، پرسوجوها اغلب با خوشهای از اصطلاحات نامرتبط برخورد میکنند. برای جلوگیری از سردرگمی، شفافسازی مفاهیمی که اغلب اشتباه گرفته میشوند در اینجا آمده است:
- اشتباهات تکنیکی: «Tree» به Tree of Thoughts (پرامپتنویسی LLM) اشاره دارد، نه BERT. «GPTQ» یک فرمت کوانتش وزن برای LLMهای محلی است. «GPTZero.me» یک شناسگر متن AI است.
- ابزارهای توسعه: «Cursorrules» قوانینی برای ویرایشگر Cursor AI هستند. «Gym» به OpenAI Gym برای یادگیری تقویتشده اشاره دارد.
- هوش مصنوعی خلاق: «Regional Prompter» و «Material» مربوط به Stable Diffusion و خطاهای Suno هستند. «Try-on» به Kolors Virtual Try-On اشاره دارد. «Sora» و «Veo» در روند تولید ویدئو هستند.
- صوت/گفتار: «SaluteSpeech» پشته صوتی Sber است. اصطلاحاتی مانند «DAW»، «XLN» و «LHY» مربوط به پلاگینهای صوتی هستند که اغلب با Suno استفاده میشوند.
- غلطهای املایی: خطاهای رایج در آدرس ChatGPT شامل «gptcom»، «gptchatcom» و نسخههای مختلف «chatgptapp» است.
- ویژگیهای بات: «DiplomGPT» برای مقالات آکادمیک و «GirlfriendGPT» برای همراهان، برنامههای کاربردی هستند، نه رمزگذارهای معماری.
در ادامه، نظارهگر باشید که آیا تکنیکهای انتقال واژگان در وزنهای رسمی ModernBERT ادغام میشوند یا خیر، زیرا این اتفاق میتواند بهطور مؤثر «عصر BERT-base» را برای جستوجوی پراکنده به پایان برساند. نتیجهگیری عملی من این است که برای جستوجوی پراکنده در سال ۲۰۲۶، با BERT-base شروع کنید، اما تنها زمانی به ModernBERT مهاجرت کنید که یک دیکشنری منتقلشده داشته باشید.




گفتگو