پرش به محتوای اصلی
پرش به محتوای مقاله

روش جدید استخراج متن: حذف خودکار بنرهای رضایت در سیستم‌های RAG

·۱۳ مهر ۱۴۰۵۲ دقیقه مطالعه
راهنما
روش جدید استخراج متن: حذف خودکار بنرهای رضایت در سیستم‌های RAG
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی رویکرد «بیشترین حجم متن» با «تحلیل تراکم لینک و ساختار HTML» برای شناسایی محتوای اصلی وب‌سایت‌ها.

تصور کنید یک عامل هوش مصنوعی را برای تحلیل اخبار تنظیم کرده‌اید، اما به‌جای محتوای مقاله، ۶۰۰ کلمه متن حقوقیِ خشکِ «پذیرش کوکی‌ها» را در حافظه‌اش ذخیره می‌کند. این شکستِ عملیاتی که در ۴ اکتبر ۲۰۲۶ گزارش شد، یک نقص بحرانی در نحوه شناسایی «محتوای اصلی» توسط سیستم‌های تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — را افشا کرد.

بسیاری از مبدل‌های سند بر این فرض ساده استوارند که بزرگ‌ترین بلوک متنی در یک صفحه، همان داستان اصلی است. طبق گزارش این توسعه‌دهنده، این رویکرد «تراکم متنی» در وب‌سایت‌های مدرن شکست می‌خورد؛ زیرا بنرهای قانونی و فوترها اغلب متنی طولانی‌تر از خودِ مقاله دارند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی داده‌های ورودی مدل‌ها اشاره کردیم، کیفیت خروجی مستقیماً به پاک‌سازی داده‌ها وابسته است. این چالش‌ها در مدیریت اسناد پیچیده مشابه موانعی است که ابزار Docling شرکت IBM برای تبدیل داده‌های ساختاریافته و پاک‌سازی PDFها هدف قرار داده است.

برای حل این مشکل، سه فیلتر تخصصی پیاده‌سازی شد:

  • جریمهٔ تراکم لینک: بلوک‌هایی که در آن‌ها متنِ لینک‌ها بیش از ۳۰٪ کل متن باشد، حذف می‌شوند؛ زیرا بنرها و فوترها معمولاً سرشار از لینک هستند.
  • لنگرهای معنایی: سیستم محتوای موجود در تگ‌های HTML مانند <article> یا <main> را بر هرگونه امتیاز تخمینی اولویت می‌دهد.
  • لیست سیاه زیررشته‌ها: هر بلوکی که شامل کلماتی مثل «consent»، «cookie» یا «paywall» باشد، به‌طور خودکار رد می‌شود.

این تغییر، صنعت را از امتیازدهی کمیِ کورکورانه به سمت تحلیل ساختاریِ کیفی سوق می‌دهد. برای توسعه‌دهندگانی که خط لوله‌های RAG می‌سازند، این یعنی مرحلهٔ «پاک‌سازی» به اندازه مرحلهٔ بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی کلمات را مشخص می‌کند — اهمیت دارد. بدون این فیلترها، پایگاه‌داده برداری (Vector Database) شما به گورستانی از متون تکراری و زائد تبدیل می‌شود.

به نقل از مستندات این پروژه، تنها چالش باقی‌مانده، اپلیکیشن‌های تک‌صفحه‌ای (SPA) هستند. از آنجا که درخواست‌های سادهٔ HTTP در این صفحات، Divهای خالی برمی‌گردانند، سیستم اکنون یک پرچم «عدم وجود محتوای قابل استخراج» صادر می‌کند تا یک مرحلهٔ رندرینگ کامل فعال شود.

گام بعدی شما

  • اگر از استخراج‌کننده‌های ساده استفاده می‌کنید، فیلتر تراکم لینک (Link Density) را به کد خود اضافه کنید.
  • تگ‌های <main> و <article> را به عنوان اولویت اول در اولویت‌بندی محتوا قرار دهید.
  • خروجی‌های خود را با ابزار x402.freeq.one/tools/markdown.html تست کنید تا متوجه شوید چه بخش‌هایی از URLهای هدف شما به اشتباه استخراج می‌شوند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی با کاهش نویز در داده‌های بازیابی‌شده، دقت پاسخ‌دهی عامل‌های AI را بالا می‌برد. اعتبار این روش از تجربه عملی در مواجهه با استانداردهای GDPR نشأت می‌گیرد.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که در حال ساخت دستیارهای AI برای وب‌سایت‌های فارسی هستند، می‌توانند از این فیلترها برای حذف متون تکراری فوتر و بنرهای تبلیغاتی استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر ساختار HTML به‌جای حجم متن، نشان می‌دهد که مدل‌های زبانی هرچه پیشرفته‌تر شوند، نیاز ما به «مهندسی داده‌های ورودی» دقیق‌تر می‌شود. این رویکرد ثابت می‌کند که برای کاهش توهمات، نباید فقط به مدل تکیه کرد، بلکه باید لایه‌ی استخراج داده را هوشمندتر کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.