تصور کنید سیستمی میسازید که باید میان هزاران سند، دقیقترین پاسخ را پیدا کند، اما مدلهای غولپیکر در تشخیص تفاوتهای ساده شکست میخورند و یک مدل کوچک و ارزان، نتایجی بینقص میگیرد. در مجموعهای از آزمایشهای منتشرشده تحت عنوان «از توهم تا دقت»، مدل distiluse-base-multilingual-cased-v2 با کسب صحت ۱۰۰٪ در پرسوجوهای آلمانی، فرانسوی و اسپانیایی، برترین مدل کلاس خود شد.
انتخاب یک مدل «چندزبانه» برای تولید بازیابیافزا (RAG) — شبیه دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — اغلب شبیه به قمار است. توسعهدهندگان معمولاً تصور میکنند پارامترهای بیشتر یا تاریخ انتشار جدیدتر به معنای دقت بالاتر است. اما واقعیت در فضای برداری بسیار متلاطمتر است؛ برچسب «چندزبانه» طیف وسیعی از مدلها با اندازهها، سنین و روشهای آموزش کاملاً متفاوت را پوشش میدهد و لزوماً تضمینی برای عملکرد روی یک مجموعه داده خاص نیست.
سیستم RAG شما را مثل یک کتابدار تصور کنید. شما کتابخانهای از اسناد انگلیسی دارید، اما کاربران به زبان اسپانیایی یا آلمانی سؤال میپرسند. بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که میگوید این کلمه «همسایهی» چه کلمات دیگری است — در واقع همان فهرست راهنمایی است که به کتابدار میگوید دقیقاً کدام صفحه را باز کند. اگر این فهرست کمی خطا داشته باشد، کتابدار صفحه اشتباهی را به مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — میدهد. نتیجه یک «شکست خاموش» است؛ هوش مصنوعی با اطمینان کامل، پاسخی کاملاً غلط میدهد بدون اینکه خطایی در سیستم رخ داده باشد یا پیام خطایی نمایش داده شود. فقط یک زمینه غلط منجر به یک پاسخ غلط میشود.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی بازیابی در مدلهای بازمتن اشاره کردیم، تکیه بر معیارهای کلی بدون تست روی دادههای واقعی، ریسک توهم را افزایش میدهد.
چارچوب آزمایش
برای افشای این شکستها، پژوهشگر یک پایگاه دانش کنترلشده شامل ۱۰ جمله انگلیسی درباره یک موضوع واحد (یک گربه) ساخت. این ساختار بهگونهای طراحی شد تا عمداً دشوار باشد و دشواریهای دنیای واقعی را شبیهسازی کند؛ جایی که بسیاری از ورودیها، یک محصول یا ویژگی واحد را با تفاوتهای لفظی بسیار اندک توصیف میکنند.
ترکیب مجموعه داده
این ۱۰ جمله به دو سطح دشواری تقسیم شدند:
- ۶ مورد تقریباً مشابه: این جملات «خوشههای متراکم» ایجاد کردند تا دقت مدل در جزئیات ریز سنجیده شود. این بخش شامل دو جفت بسیار نزدیک بود: «گربه روی فرش نشست» در مقابل «گربه روی لبه پنجره نشست»، و «گربه گلدان را انداخت» در مقابل «گربه آباژور را انداخت».
- ۴ مورد با زمینه متمایز: اینها موارد سادهتری بودند که موضوعات متفاوتی را پوشش میدادند: برنده شدن در یک نمایشگاه حیوانات خانگی، نیاز به معاینه دامپزشکی، پذیرفته شدن از یک پناهگاه و خالی بودن ظرف غذا.
طراحی پرسوجوها
به جای جملات کامل، پرسوجوها بهصورت کلمات کلیدی کوتاه به زبانهای آلمانی، فرانسوی و اسپانیایی (و انگلیسی برای کنترل زبان مشابه) ارسال شدند. این روش دقیقاً مشابه نحوه جستوجوی واقعی مردم است. برای هر زبان، چهار پرسوجوی کلیدواژهای استفاده شد. چندین مورد بهگونهای طراحی شده بودند که دقیقاً نیمی از یک جفت مشابه را هدف قرار دهند (مثلاً «انداختن آباژور» و نه «گلدان») تا مشخص شود آیا مدل توان تفکیک میان «دوقلوهای معنایی» را دارد یا خیر.
رویارویی مدلها
پنج مدل از طریق کتابخانه sentence-transformers بهصورت محلی تست شدند تا متغیرهای API و کلیدهای دسترسی از معادله حذف شوند. لیست مدلها به شرح زیر بود:
- distiluse-base-multilingual-cased-v2: مدلی کوچک و سریع با ۵۱۲ بُعد که بیش از ۵۰ زبان را پوشش میدهد.
- paraphrase-multilingual-mpnet-base-v2: بزرگترین مدل مجموعه با ۷۶۸ بُعد.
- intfloat/multilingual-e5-base: مدلی جدیدتر و رقابتی از خانواده E5 با ۷۶۸ بُعد.
- intfloat/multilingual-e5-small: نسخه کوچکتر خانواده E5 با ۳۸۴ بُعد.
- paraphrase-multilingual-MiniLM-L12-v2: مدلی قدیمیتر (محصول ۲۰۲۱) با ۳۸۴ بُعد که بیش از ۵۰ زبان را پوشش میدهد.
نتایج: اندازه به معنای مهارت نیست
نتایج بهدستآمده، باور رایج «بزرگتر بهتر است» را وارونه کرد. رتبهبندی صحت کلی در سه زبان آلمانی، فرانسوی و اسپانیایی به این ترتیب بود:
- distiluse-base-multilingual-cased-v2: صحت ۱۰۰٪. تنها مدلی که در هیچ زبانی هیچ خطایی نداشت.
- MiniLM-L12-v2 و e5-base: صحت ۷۵٪ در آلمانی و ۱۰۰٪ در سایر زبانها. هر دو مدل در پرسوجوهای متفاوتی یک بار خطا داشتند.
- mpnet-base-v2: صحت ۷۵٪ در آلمانی، ۷۵٪ در فرانسوی و ۱۰۰٪ در اسپانیایی و انگلیسی.
- e5-small: صحت ۵۰٪ در آلمانی، که ضعیفترین عملکرد در میان هر پنج مدل بود.
مدل distiluse-base-multilingual-cased-v2 تنها مدلی بود که نمره کامل گرفت. این مدل توانست تکتک پرسوجوها، از جمله سختترین جفتهای تقریباً مشابه را بهدرستی شناسایی کند.
در مقابل، مدل paraphrase-multilingual-mpnet-base-v2 که بزرگترین مدل تست شده بود، در بحرانیترین تست شکست خورد. این مدل عبارت «chat assis tapis» (گربه روی فرش نشست) را با «گربه روی لبه پنجره نشست» اشتباه گرفت. این موضوع ثابت میکند که ابعاد بالاتر (High Dimensionality) بهطور خودکار به معنای دقت معنایی در جزئیات نیست.
مدل intfloat/multilingual-e5-small بیشترین مشکل را با زبان آلمانی داشت و تنها ۲ مورد از ۴ مورد را درست پاسخ داد. در یک مورد، این مدل عبارت «Katze Fensterbank gesessen» (گربه روی لبه پنجره نشست) را با امتیاز شباهت بالای ۹۲٪ به جمله «گربه گلدان را انداخت» متصل کرد.
ناهنجاری «ظرف خالی»
یک پرسوجوی خاص به زبان آلمانی («Katze Napf leer» به معنای ظرف غذای گربه خالی است)، که باید با جمله «The cat's food bowl was empty» مطابقت میداشت، بهعنوان یک تست استرس جهانی عمل کرد. ۴ مدل از ۵ مدل در این مورد شکست خوردند:
- MiniLM-L12-v2 آن را به «پذیرفته شدن از پناهگاه» متصل کرد (امتیاز ۸۳٪).
- mpnet-base-v2 آن را به «نشستن روی فرش» متصل کرد (امتیاز ۸۴٪).
- e5-small و e5-base هر دو آن را به «نیاز به معاینه دامپزشکی» متصل کردند (امتیاز ۹۰٪).
تنها مدل distiluse-base-multilingual-cased-v2 با امتیاز ۸۶٪ پاسخ درست را داد. این موضوع یک حالت شکست نگرانکننده را آشکار میکند: مدلها فقط یک نقطه کور مشترک نداشتند، بلکه در مواجهه با یک پرسوجوی یکسان، در جهتهای کاملاً متفاوت و غیرقابل پیشبینی خطا دادند. این امر نشاندهنده رفتاری ناسازگار است، نه یک نقطه کور قابل پیشبینی.
تلهٔ اطمینان
حیاتیترین یافته برای توسعهدهندگان، گسست میان امتیاز شباهت و صحت است. پژوهشگر برای خوانایی بیشتر، شباهت کسینوسی (Cosine Similarity) را که بازهای بین ۱- تا ۱ دارد، با استفاده از فرمول (top_match_score + 1) / 2 * 100 به مقیاس ۰ تا ۱۰۰ درصد تبدیل کرد.
مشاهده شد مدل distiluse-base-multilingual-cased-v2 بهطور مداوم پایینترین امتیازات خام را برای پاسخهای درست میداد و گاهی برای یک تطابق صحیح، امتیاز آن تا ۷۱٪ پایین میآمد. در همین حال، مدلهای دیگر برای پاسخهای کاملاً غلط، امتیازاتی در محدوده ۹۰٪ ثبت میکردند.
این ثابت میکند که شباهت کسینوسی روی یک مقیاس جهانی نیست. یک تطابق ۹۰٪ در یک مدل ممکن است یک توهم (Hallucination) — شبیه دوستی که خاطرهای را اشتباه تعریف میکند — باشد، در حالی که ۷۰٪ در مدلی دیگر یک هدف دقیق است. مقدار امتیاز و صحت، بهسادگی یک چیز نیستند.
تحلیل: پایان عصر مدلهای پیشفرض
این آزمایش این فرض را میشکند که توسعهدهندگان میتوانند مدلی را از صدر جدولهای رتبهبندی (Leaderboards) انتخاب کرده و یک آستانه شباهت جهانی برای آن تعریف کنند. چون مقیاس امتیازات بین مدلها بهشدت متفاوت است، هر آستانهای که برای یک مدل تنظیم شود، برای مدل دیگر قابل انتقال نیست.
نکات فنی کلیدی
- تعداد ابعاد معیار کیفیت نیست: مدل اقتصادی ۵۱۲ بُعدی، مدل ۷۶۸ بُعدی را شکست داد. تعداد پارامترها و تاریخ انتشار نمیتوانند رتبهبندی را پیشبینی کنند.
- ناپایداری، خود یک داده است: در یک اجرای کوچکتر، مدل mpnet-base-v2 برنده شده بود. این حقیقت که برنده تنها با تغییر ۴ پرسوجو در هر زبان عوض میشود، نشان میدهد هیچ مدلی بهطور قاطع برای تمام موارد سخت برتر نیست.
- کالیبراسیون اجباری است: شما باید آستانه شباهت (Similarity Cutoffs) را برای هر مدل بهصورت جداگانه و روی دادههای خودتان کالیبره کنید.
برای یک توسعهدهنده، این یعنی گزینههای «کمحجم» یا «اقتصادی» فقط برای کاهش هزینه نیستند، بلکه ممکن است برای جفتزبانهای خاص، ابزاری دقیقتر باشند.
جزئیات عملکرد مدلها
برای درک دلیل این نتایج، میتوان به الگوهای دقیق موفقیت و شکست هر مدل نگاه کرد:
paraphrase-multilingual-MiniLM-L12-v2 (۳۸۴ بُعد)
- آلمانی: ۷۵٪ (۳ از ۴). خطا در مورد «ظرف خالی» (تطبیق با «پذیرفته شدن از پناهگاه» با امتیاز ۸۳٪).
- فرانسوی: ۱۰۰٪ (۴ از ۴). دقت بالا، از جمله «chat renversé vase» با امتیاز ۹۳٪.
- اسپانیایی: ۱۰۰٪ (۴ از ۴). عملکرد قوی، از جمله «gato arañó sofá» با امتیاز ۹۵٪.
- انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.
paraphrase-multilingual-mpnet-base-v2 (۷۶۸ بُعد)
- آلمانی: ۷۵٪ (۳ از ۴). خطا در مورد «ظرف خالی» (تطبیق با «نشستن روی فرش» با امتیاز ۸۴٪).
- فرانسوی: ۷۵٪ (۳ از ۴). خطا در مورد «chat assis tapis» (تطبیق با «نشستن روی لبه پنجره» با امتیاز ۶۱٪).
- اسپانیایی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
- انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.
intfloat/multilingual-e5-small (۳۸۴ بُعد)
- آلمانی: ۵۰٪ (۲ از ۴). ضعیفترین عملکرد کلی. خطا در مورد «Katze Fensterbank gesessen» (تطبیق با «انداختن گلدان» با امتیاز ۹۲٪) و «ظرف خالی» (تطبیق با «نیاز به دامپزشک» با امتیاز ۹۰٪).
- فرانسوی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
- اسپانیایی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
- انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.
intfloat/multilingual-e5-base (۷۶۸ بُعد)
- آلمانی: ۷۵٪ (۳ از ۴). خطا در مورد «ظرف خالی» (تطبیق با «نیاز به دامپزشک» با امتیاز ۹۰٪).
- فرانسوی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
- اسپانیایی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
- انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.
distiluse-base-multilingual-cased-v2 (۵۱۲ بُعد)
- آلمانی: ۱۰۰٪ (۴ از ۴). تنها مدلی که «ظرف خالی» را درست تشخیص داد (امتیاز ۸۶٪).
- فرانسوی: ۱۰۰٪ (۴ از ۴). تطبیق درست «chat prix concours» با امتیاز ۷۴٪.
- اسپانیایی: ۱۰۰٪ (۴ از ۴). تطبیق درست «plato comida vacío» با امتیاز ۷۹٪.
- انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.
جزئیات پیادهسازی فنی
برای کسانی که میخواهند این سیستم را محلی اجرا کنند، فرآیند از یک خط لوله مکانیکی خاص با استفاده از کتابخانه sentence-transformers پیروی میکند:
- بردارسازی بدنه (Corpus Embedding): ۱۰ جمله یکبار برای هر مدل با استفاده از
model.encode(CORPUS, convert_to_tensor=True)بردارسازی میشوند. این مرحله، فاز ورود دادهها به یک پایگاه داده برداری را شبیهسازی میکند. - پردازش پرسوجو: هر پرسوجوی کلیدواژهای بردارسازی شده و با استفاده از
cos_simبا کل بدنه مقایسه میشود. - مکانیزم انتخاب: سیستم از
scores.argmax()برای شناسایی ایندکس بالاترین امتیاز شباهت استفاده میکند. این دقیقاً همان جملهای است که یک خط لوله RAG بهعنوان زمینه به LLM ارائه میدهد. - تأیید: صحت بهصورت یک بررسی باینری انجام میشود:
(top_match_index == query["answer_index"]).
گام بعدی شما
پیش از استقرار یک خط لوله RAG چندزبانه، باید حداقل سه مدل را روی مجموعه دادههای خاص خودتان با استفاده از یک مجموعه تست «تقریباً مشابه» (Near-duplicate) بنچمارک کنید تا برنده واقعی خود را بیابید. هرگز بر اساس ایمان به برچسبهای کارت مدل، مدلی را انتخاب نکنید. شما میتوانید اسکریپت کامل بازتولید — که از SentenceTransformer و cos_sim برای شناسایی argmax() امتیازات شباهت استفاده میکند — را در پست اصلی بیابید تا این تستها را بهصورت محلی اجرا کنید.
اما داستان سختافزاری این تحول و نحوه کاهش هزینه استنتاج در مدلهای کوچک حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو