تصور کنید میخواهید در یک سامانه پشتیبانی، عبارت «چطور رمز عبورم را عوض کنم» را جستوجو کنید، اما سیستم شما را به صفحهای با عنوان «بازیابی حساب کاربری» میبرد، در حالی که هیچ کلمهای بین دو جمله مشترک نیست. این اتفاق زمانی رخ میدهد که سیستم بهجای تطبیق کلمات، فاصله بین نقاط را در یک فضای ریاضی محاسبه میکند تا بفهمد هر دو جمله یک معنا را میرسانند.
این فرآیند که بردار معنایی (Embedding) نام دارد — شبیه کارت معرفی عددی برای هر واژه است که میگوید این کلمه «همسایهی» چه کلمات دیگری است — موتور محرک تقریباً تمام قابلیتهای جستوجوی هوش مصنوعی تا تاریخ ۱۸ سپتامبر ۲۰۲۶ است. برای توسعهدهندگان، مفاهیمی مثل «جستوجوی برداری» یا «پایگاهداده برداری» پیچیدهتر از آن چیزی هستند که در واقعیت میباشند؛ در حقیقت، همه اینها درباره یک ایده سادهاند: تبدیل معنا به عدد.
همانطور که در تحلیلهای قبلی ما دربارهی زیرساختهای بازیابی داده اشاره کردیم، این سیستمها مانند نقشهای عمل میکنند که مفاهیم مشابه در نقاط نزدیک به هم قرار میگیرند. در حالی که یک نقشه معمولی از دو مختصات استفاده میکند، یک مدل هوش مصنوعی از صدها یا هزاران عدد استفاده میکند تا تکهای از متن را در یک «فضای معنایی» جای دهد.
به نقل از راهنمای فنی dev.to، این فرآیند یک خط لوله (Pipeline) سختگیرانه دارد: شما متن را وارد میکنید و مدل لیستی از اعداد را برمیگرداند. برای مثال، مدل text-embedding-3-small متعلق به OpenAI، لیستی شامل ۱,۵۳۶ عدد تولید میکند. هر عدد در واقع مختصاتی در فضایی است که تجسم آن برای انسان غیرممکن است، اما از نظر ریاضی دقیقاً مانند یک نقشه دوبعدی عمل میکند.
مکانیسم تولید معنا
این مختصات توسط انسان تعیین نمیشوند. در عوض، مدل «فرضیه توزیعی» را یاد میگیرد؛ یعنی این ایده زبانی که معنای یک کلمه بر اساس کلماتی که معمولاً در کنارش میآیند شکل میگیرد. مدل حجم عظیمی از متن را میخواند و میبیند کدام کلمات همواره با هم ظاهر میشوند:
- خوشهبندی (Clustering): کلماتی مثل «گربه» و «سگ» چون در بسترهای مشابهی میآیند، به هم نزدیک میشوند.
- جداسازی: کلمات بیربط، مثل «ماشین»، به فاصله دوری رانده میشوند.
- ثبات: یک متن خاص در یک مدل مشخص، همیشه اعداد یکسانی تولید میکند.
- موقعیت نسبی: معنا صرفاً بر اساس جایگاه شما نسبت به بقیه نقاط در آن فضا تعریف میشود.
اندازهگیری شباهت
برای تشخیص رابطه بین دو متن، سیستم از شباهت کسینوسی (Cosine Similarity) استفاده میکند. بهجای اندازهگیری خط مستقیم بین دو نقطه، سیستم یک فلش از مرکز فضا به سمت هر نقطه رسم میکند.
اگر فلشها در یک جهت باشند، زاویه کوچک و مقدار کسینوس نزدیک به ۱ است که نشاندهنده شباهت زیاد است. اگر جهتها متفاوت باشد، مقدار به سمت ۰ میرود. بر اساس مستندات فنی، این فرآیند در کدنویسی تنها سه مرحله است: تبدیل سند به بردار، تبدیل پرسوجو به بردار و محاسبه امتیاز. برای مثال، عبارت «مراحل بازیابی حساب» و «چطور رمز عبورم را عوض کنم» ممکن است امتیازی حدود ۰.۸۶ بگیرند.
تلههای پیادهسازی
توسعهدهندگان هنگام ساخت این سیستمها با دو چالش اصلی روبرو هستند. اول اینکه بردارها مختص به هر مدل هستند؛ برداری که از مدل A میآید برای مدل B بیمعنی است چون هر کدام نقشههای متفاوتی دارند. بنابراین با تغییر مدل، باید کل پایگاهداده را دوباره برداری کنید. در این مسیر، دقت در انتخاب ابزارها حیاتی است تا دچار مهندسی بیشازحد در توسعه اپلیکیشنهای هوش مصنوعی نشوید و پیچیدگیهای غیرضروری به سیستم تحمیل نکنید.
دوم اینکه بردارها با رشتههایی که معنای مفهومی ندارند، مشکل دارند. این موارد عبارتند از:
- کدهای خطا: رشتههای فنی که جایگاهی روی نقشه معنایی ندارند.
- شناسههای محصول: کدهایی مثل «SKU-4417».
- شمارههای سریال: رشتههای دقیقی که جستوجوی برداری خالص معمولاً در یافتن آنها شکست میخورد.
به همین دلیل، سیستمهای حرفهای معمولاً جستوجوی کلیدواژهای (برای رشتههای دقیق) را با جستوجوی برداری (برای مفاهیم) ترکیب میکنند. این رویکرد ترکیبی مانع از آن میشود که سیستمهای تولید بازیابیافزا (RAG) — شبیه دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — شناسههای فنی واضح را نادیده بگیرند. برای مثال، در پروژههایی مانند معماری CannyCart، از مدلهای زبانی برای نرمالسازی دادههای سخت مانند بارکدها استفاده شده تا نقصهای دادههای خام برطرف شود.
درک این منطق «فاصله روی نقشه»، جستوجوی هوش مصنوعی را از یک «جعبه سیاه» به سیستمی تبدیل میکند که میتوان آن را عیبیابی کرد. وقتی نتیجهای غلط است، جادویی در کار نیست؛ فقط مختصاتی است که بیش از حد به همسایه اشتباهش نزدیک شده است.
گام بعدی شما
- اگر از RAG استفاده میکنید، حتماً از جستوجوی ترکیبی (Hybrid Search) برای شناسههای فنی استفاده کنید.
- هنگام تغییر مدل Embedding، تمام دادههای ذخیره شده در پایگاهداده برداری خود را بازسازی کنید.
- برای تحلیل خطاهای جستوجو، امتیاز شباهت کسینوسی را مانیتور کنید تا نقاط کور مدل را بیابید.
اما داستان سختافزاری این تحول و نحوه ذخیرهسازی این میلیاردها عدد حتی شگفتانگیزتر است — به تحلیل ما دربارهی پایگاهدادههای برداری مقیاسپذیر مراجعه کنید.




گفتگو