پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های کوچک بردار معنایی در بازی بازیابی متنی برنده شدند

·۲۹ مرداد ۱۴۰۵۱۷ دقیقه مطالعه
آزمایش ۵ مدل چندزبانه جاسازی: همه یکسان نیستند
آزمایش ۵ مدل چندزبانه جاسازی: همه یکسان نیستند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات تجربی اینکه مدل‌های بردار معنایی کوچک‌تر (۵۱۲ بُعد) می‌توانند در تفکیک مفاهیم بسیار نزدیک، از مدل‌های بزرگ‌تر (۷۶۸ بُعد) پیشی بگیرند و اینکه امتیاز شباهت (Cosine Similarity) معیار قابل‌اعتمادی برای صحت در مدل‌های مختلف نیست.

تصور کنید سیستمی می‌سازید که باید میان هزاران سند، دقیق‌ترین پاسخ را پیدا کند، اما مدل‌های غول‌پیکر در تشخیص تفاوت‌های ساده شکست می‌خورند و یک مدل کوچک و ارزان، نتایجی بی‌نقص می‌گیرد. در مجموعه‌ای از آزمایش‌های منتشرشده تحت عنوان «از توهم تا دقت»، مدل distiluse-base-multilingual-cased-v2 با کسب صحت ۱۰۰٪ در پرس‌وجوهای آلمانی، فرانسوی و اسپانیایی، برترین مدل کلاس خود شد.

انتخاب یک مدل «چندزبانه» برای تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — اغلب شبیه به قمار است. توسعه‌دهندگان معمولاً تصور می‌کنند پارامترهای بیشتر یا تاریخ انتشار جدیدتر به معنای دقت بالاتر است. اما واقعیت در فضای برداری بسیار متلاطم‌تر است؛ برچسب «چندزبانه» طیف وسیعی از مدل‌ها با اندازه‌ها، سنین و روش‌های آموزش کاملاً متفاوت را پوشش می‌دهد و لزوماً تضمینی برای عملکرد روی یک مجموعه داده خاص نیست.

سیستم RAG شما را مثل یک کتابدار تصور کنید. شما کتابخانه‌ای از اسناد انگلیسی دارید، اما کاربران به زبان اسپانیایی یا آلمانی سؤال می‌پرسند. بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که می‌گوید این کلمه «همسایه‌ی» چه کلمات دیگری است — در واقع همان فهرست راهنمایی است که به کتابدار می‌گوید دقیقاً کدام صفحه را باز کند. اگر این فهرست کمی خطا داشته باشد، کتابدار صفحه اشتباهی را به مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — می‌دهد. نتیجه یک «شکست خاموش» است؛ هوش مصنوعی با اطمینان کامل، پاسخی کاملاً غلط می‌دهد بدون اینکه خطایی در سیستم رخ داده باشد یا پیام خطایی نمایش داده شود. فقط یک زمینه غلط منجر به یک پاسخ غلط می‌شود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی بازیابی در مدل‌های بازمتن اشاره کردیم، تکیه بر معیارهای کلی بدون تست روی داده‌های واقعی، ریسک توهم را افزایش می‌دهد.

چارچوب آزمایش

برای افشای این شکست‌ها، پژوهشگر یک پایگاه دانش کنترل‌شده شامل ۱۰ جمله انگلیسی درباره یک موضوع واحد (یک گربه) ساخت. این ساختار به‌گونه‌ای طراحی شد تا عمداً دشوار باشد و دشواری‌های دنیای واقعی را شبیه‌سازی کند؛ جایی که بسیاری از ورودی‌ها، یک محصول یا ویژگی واحد را با تفاوت‌های لفظی بسیار اندک توصیف می‌کنند.

ترکیب مجموعه داده

این ۱۰ جمله به دو سطح دشواری تقسیم شدند:

  • ۶ مورد تقریباً مشابه: این جملات «خوشه‌های متراکم» ایجاد کردند تا دقت مدل در جزئیات ریز سنجیده شود. این بخش شامل دو جفت بسیار نزدیک بود: «گربه روی فرش نشست» در مقابل «گربه روی لبه پنجره نشست»، و «گربه گلدان را انداخت» در مقابل «گربه آباژور را انداخت».
  • ۴ مورد با زمینه متمایز: این‌ها موارد ساده‌تری بودند که موضوعات متفاوتی را پوشش می‌دادند: برنده شدن در یک نمایشگاه حیوانات خانگی، نیاز به معاینه دامپزشکی، پذیرفته شدن از یک پناهگاه و خالی بودن ظرف غذا.

طراحی پرس‌وجوها

به جای جملات کامل، پرس‌وجوها به‌صورت کلمات کلیدی کوتاه به زبان‌های آلمانی، فرانسوی و اسپانیایی (و انگلیسی برای کنترل زبان مشابه) ارسال شدند. این روش دقیقاً مشابه نحوه جست‌وجوی واقعی مردم است. برای هر زبان، چهار پرس‌وجوی کلیدواژه‌ای استفاده شد. چندین مورد به‌گونه‌ای طراحی شده بودند که دقیقاً نیمی از یک جفت مشابه را هدف قرار دهند (مثلاً «انداختن آباژور» و نه «گلدان») تا مشخص شود آیا مدل توان تفکیک میان «دوقلوهای معنایی» را دارد یا خیر.

رویارویی مدل‌ها

پنج مدل از طریق کتابخانه sentence-transformers به‌صورت محلی تست شدند تا متغیرهای API و کلیدهای دسترسی از معادله حذف شوند. لیست مدل‌ها به شرح زیر بود:

  • distiluse-base-multilingual-cased-v2: مدلی کوچک و سریع با ۵۱۲ بُعد که بیش از ۵۰ زبان را پوشش می‌دهد.
  • paraphrase-multilingual-mpnet-base-v2: بزرگ‌ترین مدل مجموعه با ۷۶۸ بُعد.
  • intfloat/multilingual-e5-base: مدلی جدیدتر و رقابتی از خانواده E5 با ۷۶۸ بُعد.
  • intfloat/multilingual-e5-small: نسخه کوچک‌تر خانواده E5 با ۳۸۴ بُعد.
  • paraphrase-multilingual-MiniLM-L12-v2: مدلی قدیمی‌تر (محصول ۲۰۲۱) با ۳۸۴ بُعد که بیش از ۵۰ زبان را پوشش می‌دهد.

نتایج: اندازه به معنای مهارت نیست

نتایج به‌دست‌آمده، باور رایج «بزرگ‌تر بهتر است» را وارونه کرد. رتبه‌بندی صحت کلی در سه زبان آلمانی، فرانسوی و اسپانیایی به این ترتیب بود:

  • distiluse-base-multilingual-cased-v2: صحت ۱۰۰٪. تنها مدلی که در هیچ زبانی هیچ خطایی نداشت.
  • MiniLM-L12-v2 و e5-base: صحت ۷۵٪ در آلمانی و ۱۰۰٪ در سایر زبان‌ها. هر دو مدل در پرس‌وجوهای متفاوتی یک بار خطا داشتند.
  • mpnet-base-v2: صحت ۷۵٪ در آلمانی، ۷۵٪ در فرانسوی و ۱۰۰٪ در اسپانیایی و انگلیسی.
  • e5-small: صحت ۵۰٪ در آلمانی، که ضعیف‌ترین عملکرد در میان هر پنج مدل بود.

مدل distiluse-base-multilingual-cased-v2 تنها مدلی بود که نمره کامل گرفت. این مدل توانست تک‌تک پرس‌وجوها، از جمله سخت‌ترین جفت‌های تقریباً مشابه را به‌درستی شناسایی کند.

در مقابل، مدل paraphrase-multilingual-mpnet-base-v2 که بزرگ‌ترین مدل تست شده بود، در بحرانی‌ترین تست شکست خورد. این مدل عبارت «chat assis tapis» (گربه روی فرش نشست) را با «گربه روی لبه پنجره نشست» اشتباه گرفت. این موضوع ثابت می‌کند که ابعاد بالاتر (High Dimensionality) به‌طور خودکار به معنای دقت معنایی در جزئیات نیست.

مدل intfloat/multilingual-e5-small بیشترین مشکل را با زبان آلمانی داشت و تنها ۲ مورد از ۴ مورد را درست پاسخ داد. در یک مورد، این مدل عبارت «Katze Fensterbank gesessen» (گربه روی لبه پنجره نشست) را با امتیاز شباهت بالای ۹۲٪ به جمله «گربه گلدان را انداخت» متصل کرد.

ناهنجاری «ظرف خالی»

یک پرس‌وجوی خاص به زبان آلمانی («Katze Napf leer» به معنای ظرف غذای گربه خالی است)، که باید با جمله «The cat's food bowl was empty» مطابقت می‌داشت، به‌عنوان یک تست استرس جهانی عمل کرد. ۴ مدل از ۵ مدل در این مورد شکست خوردند:

  • MiniLM-L12-v2 آن را به «پذیرفته شدن از پناهگاه» متصل کرد (امتیاز ۸۳٪).
  • mpnet-base-v2 آن را به «نشستن روی فرش» متصل کرد (امتیاز ۸۴٪).
  • e5-small و e5-base هر دو آن را به «نیاز به معاینه دامپزشکی» متصل کردند (امتیاز ۹۰٪).

تنها مدل distiluse-base-multilingual-cased-v2 با امتیاز ۸۶٪ پاسخ درست را داد. این موضوع یک حالت شکست نگران‌کننده را آشکار می‌کند: مدل‌ها فقط یک نقطه کور مشترک نداشتند، بلکه در مواجهه با یک پرس‌وجوی یکسان، در جهت‌های کاملاً متفاوت و غیرقابل پیش‌بینی خطا دادند. این امر نشان‌دهنده رفتاری ناسازگار است، نه یک نقطه کور قابل پیش‌بینی.

تلهٔ اطمینان

حیاتی‌ترین یافته برای توسعه‌دهندگان، گسست میان امتیاز شباهت و صحت است. پژوهشگر برای خوانایی بیشتر، شباهت کسینوسی (Cosine Similarity) را که بازه‌ای بین ۱- تا ۱ دارد، با استفاده از فرمول (top_match_score + 1) / 2 * 100 به مقیاس ۰ تا ۱۰۰ درصد تبدیل کرد.

مشاهده شد مدل distiluse-base-multilingual-cased-v2 به‌طور مداوم پایین‌ترین امتیازات خام را برای پاسخ‌های درست می‌داد و گاهی برای یک تطابق صحیح، امتیاز آن تا ۷۱٪ پایین می‌آمد. در همین حال، مدل‌های دیگر برای پاسخ‌های کاملاً غلط، امتیازاتی در محدوده ۹۰٪ ثبت می‌کردند.

این ثابت می‌کند که شباهت کسینوسی روی یک مقیاس جهانی نیست. یک تطابق ۹۰٪ در یک مدل ممکن است یک توهم (Hallucination) — شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — باشد، در حالی که ۷۰٪ در مدلی دیگر یک هدف دقیق است. مقدار امتیاز و صحت، به‌سادگی یک چیز نیستند.

تحلیل: پایان عصر مدل‌های پیش‌فرض

این آزمایش این فرض را می‌شکند که توسعه‌دهندگان می‌توانند مدلی را از صدر جدول‌های رتبه‌بندی (Leaderboards) انتخاب کرده و یک آستانه شباهت جهانی برای آن تعریف کنند. چون مقیاس امتیازات بین مدل‌ها به‌شدت متفاوت است، هر آستانه‌ای که برای یک مدل تنظیم شود، برای مدل دیگر قابل انتقال نیست.

نکات فنی کلیدی

  • تعداد ابعاد معیار کیفیت نیست: مدل اقتصادی ۵۱۲ بُعدی، مدل ۷۶۸ بُعدی را شکست داد. تعداد پارامترها و تاریخ انتشار نمی‌توانند رتبه‌بندی را پیش‌بینی کنند.
  • ناپایداری، خود یک داده است: در یک اجرای کوچک‌تر، مدل mpnet-base-v2 برنده شده بود. این حقیقت که برنده تنها با تغییر ۴ پرس‌وجو در هر زبان عوض می‌شود، نشان می‌دهد هیچ مدلی به‌طور قاطع برای تمام موارد سخت برتر نیست.
  • کالیبراسیون اجباری است: شما باید آستانه شباهت (Similarity Cutoffs) را برای هر مدل به‌صورت جداگانه و روی داده‌های خودتان کالیبره کنید.

برای یک توسعه‌دهنده، این یعنی گزینه‌های «کم‌حجم» یا «اقتصادی» فقط برای کاهش هزینه نیستند، بلکه ممکن است برای جفت‌زبان‌های خاص، ابزاری دقیق‌تر باشند.

جزئیات عملکرد مدل‌ها

برای درک دلیل این نتایج، می‌توان به الگوهای دقیق موفقیت و شکست هر مدل نگاه کرد:

paraphrase-multilingual-MiniLM-L12-v2 (۳۸۴ بُعد)

  • آلمانی: ۷۵٪ (۳ از ۴). خطا در مورد «ظرف خالی» (تطبیق با «پذیرفته شدن از پناهگاه» با امتیاز ۸۳٪).
  • فرانسوی: ۱۰۰٪ (۴ از ۴). دقت بالا، از جمله «chat renversé vase» با امتیاز ۹۳٪.
  • اسپانیایی: ۱۰۰٪ (۴ از ۴). عملکرد قوی، از جمله «gato arañó sofá» با امتیاز ۹۵٪.
  • انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.

paraphrase-multilingual-mpnet-base-v2 (۷۶۸ بُعد)

  • آلمانی: ۷۵٪ (۳ از ۴). خطا در مورد «ظرف خالی» (تطبیق با «نشستن روی فرش» با امتیاز ۸۴٪).
  • فرانسوی: ۷۵٪ (۳ از ۴). خطا در مورد «chat assis tapis» (تطبیق با «نشستن روی لبه پنجره» با امتیاز ۶۱٪).
  • اسپانیایی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
  • انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.

intfloat/multilingual-e5-small (۳۸۴ بُعد)

  • آلمانی: ۵۰٪ (۲ از ۴). ضعیف‌ترین عملکرد کلی. خطا در مورد «Katze Fensterbank gesessen» (تطبیق با «انداختن گلدان» با امتیاز ۹۲٪) و «ظرف خالی» (تطبیق با «نیاز به دامپزشک» با امتیاز ۹۰٪).
  • فرانسوی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
  • اسپانیایی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
  • انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.

intfloat/multilingual-e5-base (۷۶۸ بُعد)

  • آلمانی: ۷۵٪ (۳ از ۴). خطا در مورد «ظرف خالی» (تطبیق با «نیاز به دامپزشک» با امتیاز ۹۰٪).
  • فرانسوی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
  • اسپانیایی: ۱۰۰٪ (۴ از ۴). عملکرد کامل.
  • انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.

distiluse-base-multilingual-cased-v2 (۵۱۲ بُعد)

  • آلمانی: ۱۰۰٪ (۴ از ۴). تنها مدلی که «ظرف خالی» را درست تشخیص داد (امتیاز ۸۶٪).
  • فرانسوی: ۱۰۰٪ (۴ از ۴). تطبیق درست «chat prix concours» با امتیاز ۷۴٪.
  • اسپانیایی: ۱۰۰٪ (۴ از ۴). تطبیق درست «plato comida vacío» با امتیاز ۷۹٪.
  • انگلیسی: ۱۰۰٪ (۴ از ۴). نمره کنترل کامل.

جزئیات پیاده‌سازی فنی

برای کسانی که می‌خواهند این سیستم را محلی اجرا کنند، فرآیند از یک خط لوله مکانیکی خاص با استفاده از کتابخانه sentence-transformers پیروی می‌کند:

  • بردارسازی بدنه (Corpus Embedding): ۱۰ جمله یک‌بار برای هر مدل با استفاده از model.encode(CORPUS, convert_to_tensor=True) بردارسازی می‌شوند. این مرحله، فاز ورود داده‌ها به یک پایگاه داده برداری را شبیه‌سازی می‌کند.
  • پردازش پرس‌وجو: هر پرس‌وجوی کلیدواژه‌ای بردارسازی شده و با استفاده از cos_sim با کل بدنه مقایسه می‌شود.
  • مکانیزم انتخاب: سیستم از scores.argmax() برای شناسایی ایندکس بالاترین امتیاز شباهت استفاده می‌کند. این دقیقاً همان جمله‌ای است که یک خط لوله RAG به‌عنوان زمینه به LLM ارائه می‌دهد.
  • تأیید: صحت به‌صورت یک بررسی باینری انجام می‌شود: (top_match_index == query["answer_index"]).

گام بعدی شما

پیش از استقرار یک خط لوله RAG چندزبانه، باید حداقل سه مدل را روی مجموعه داده‌های خاص خودتان با استفاده از یک مجموعه تست «تقریباً مشابه» (Near-duplicate) بنچ‌مارک کنید تا برنده واقعی خود را بیابید. هرگز بر اساس ایمان به برچسب‌های کارت مدل، مدلی را انتخاب نکنید. شما می‌توانید اسکریپت کامل بازتولید — که از SentenceTransformer و cos_sim برای شناسایی argmax() امتیازات شباهت استفاده می‌کند — را در پست اصلی بیابید تا این تست‌ها را به‌صورت محلی اجرا کنید.

اما داستان سخت‌افزاری این تحول و نحوه کاهش هزینه استنتاج در مدل‌های کوچک حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته بر اساس تجربه عملی نشان می‌دهد که مدل‌های کوچک‌تر می‌توانند در بازیابی معنایی دقیق‌تر باشند. این موضوع باعث می‌شود هزینه‌های زیرساختی کاهش یابد و اعتماد به خروجی‌های RAG از طریق کالیبراسیون دقیق‌تر افزایش یابد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت منابع GPU یا هزینه‌های بالای API مواجه‌اند، این خبر نویدبخش است؛ چراکه مدل‌های کوچک‌تر و محلی (Open Weights) می‌توانند دقتی برابر یا بیشتر از مدل‌های گران‌قیمت ارائه دهند.

·نگاه ما
تحریریه دات‌هوش

این نتایج نشان می‌دهد که در دنیای بردار معنایی، «بیشتر» لزوماً به معنای «بهتر» نیست و حتی می‌تواند باعث ایجاد اطمینان کاذب شود. تضاد میان امتیاز شباهت بالا و پاسخ غلط، خطرناک‌ترین بخش این یافته است؛ زیرا سیستم‌های RAG بر اساس همین اعداد تصمیم می‌گیرند. توسعه‌دهندگان باید از رویکرد «انتخاب مدل بر اساس بنچمارک» به سمت «کالیبراسیون مدل بر اساس داده» حرکت کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.