تصور کنید یک عامل هوش مصنوعی را برای تحلیل اخبار تنظیم کردهاید، اما بهجای محتوای مقاله، ۶۰۰ کلمه متن حقوقیِ خشکِ «پذیرش کوکیها» را در حافظهاش ذخیره میکند. این شکستِ عملیاتی که در ۴ اکتبر ۲۰۲۶ گزارش شد، یک نقص بحرانی در نحوه شناسایی «محتوای اصلی» توسط سیستمهای تولید بازیابیافزا (RAG) — شبیه دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — را افشا کرد.
بسیاری از مبدلهای سند بر این فرض ساده استوارند که بزرگترین بلوک متنی در یک صفحه، همان داستان اصلی است. طبق گزارش این توسعهدهنده، این رویکرد «تراکم متنی» در وبسایتهای مدرن شکست میخورد؛ زیرا بنرهای قانونی و فوترها اغلب متنی طولانیتر از خودِ مقاله دارند. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی دادههای ورودی مدلها اشاره کردیم، کیفیت خروجی مستقیماً به پاکسازی دادهها وابسته است. این چالشها در مدیریت اسناد پیچیده مشابه موانعی است که ابزار Docling شرکت IBM برای تبدیل دادههای ساختاریافته و پاکسازی PDFها هدف قرار داده است.
برای حل این مشکل، سه فیلتر تخصصی پیادهسازی شد:
- جریمهٔ تراکم لینک: بلوکهایی که در آنها متنِ لینکها بیش از ۳۰٪ کل متن باشد، حذف میشوند؛ زیرا بنرها و فوترها معمولاً سرشار از لینک هستند.
- لنگرهای معنایی: سیستم محتوای موجود در تگهای HTML مانند
<article>یا<main>را بر هرگونه امتیاز تخمینی اولویت میدهد. - لیست سیاه زیررشتهها: هر بلوکی که شامل کلماتی مثل «consent»، «cookie» یا «paywall» باشد، بهطور خودکار رد میشود.
این تغییر، صنعت را از امتیازدهی کمیِ کورکورانه به سمت تحلیل ساختاریِ کیفی سوق میدهد. برای توسعهدهندگانی که خط لولههای RAG میسازند، این یعنی مرحلهٔ «پاکسازی» به اندازه مرحلهٔ بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی کلمات را مشخص میکند — اهمیت دارد. بدون این فیلترها، پایگاهداده برداری (Vector Database) شما به گورستانی از متون تکراری و زائد تبدیل میشود.
به نقل از مستندات این پروژه، تنها چالش باقیمانده، اپلیکیشنهای تکصفحهای (SPA) هستند. از آنجا که درخواستهای سادهٔ HTTP در این صفحات، Divهای خالی برمیگردانند، سیستم اکنون یک پرچم «عدم وجود محتوای قابل استخراج» صادر میکند تا یک مرحلهٔ رندرینگ کامل فعال شود.
گام بعدی شما
- اگر از استخراجکنندههای ساده استفاده میکنید، فیلتر تراکم لینک (Link Density) را به کد خود اضافه کنید.
- تگهای
<main>و<article>را به عنوان اولویت اول در اولویتبندی محتوا قرار دهید. - خروجیهای خود را با ابزار x402.freeq.one/tools/markdown.html تست کنید تا متوجه شوید چه بخشهایی از URLهای هدف شما به اشتباه استخراج میشوند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو