اگر وبسایت شما توسط هوش مصنوعی ساخته شده، احتمالاً با شبکهای از صفحات تکراری و لینکهای کور دستوپنجه نرم میکنید که رتبه شما را در گوگل میکشد. این رشد سریع محتوا معمولاً سریعتر از توان معماری سایت پیش میرود و منجر به ایجاد «بدهی سئو» میشود. این چالش در واقع نتیجهی نبرد میان نظم نقشهراههای دستی و هرجومرج تولید خودکار صفحات است که ساختار سایت را به مخاطره میاندازد. در واقع، وقتی یک سایت با سرعت بالای AI رشد میکند، اغلب یک شبکه پنهان از URLهای رقیب و صفحات «یتیم» ایجاد میشود که ساختار سایت را تخریب میکند.
به نقل از مستندات پروژه، توسعهدهندهای به نام patrick33 در ۹ اکتبر ۲۰۲۶ ابزار internal-links-export را منتشر کرد تا گراف خام لینکهای یک سایت را بصریسازی و استخراج کند. این ابزار یک راهکار متنباز برای مقابله با شکستهای ساختاری در سایتهای مقیاسبزرگ است.
مشکل اینجاست که اکثر تولیدکنندگان محتوای هوش مصنوعی، صفحات را تکتک و بدون دید کلی به کل سایت میسازند. آنها فاقد یک دفتر کل (Global Ledger) از وضعیت سایت هستند، به این معنی که هر صفحه در انزوای کامل و فقط با بستر محلی خود ایجاد میشود. در حالی که ممکن است هر صفحه بهتنهایی خوشساخت به نظر برسد — مثلاً دارای لینکهای مرتبط منطقی، Breadcrumbs و منوی ناوبری باشد — اما کل سایت اغلب از پدیدهای به نام «دوقلوهای موضوعی» رنج میبرد. اینها صفحاتی تقریباً یکسان هستند که اعتبار لینکهای ورودی (Inbound Link Equity) را بین خود تقسیم میکنند و تکههایی از لینکهایی را میبلعند که باید به یک صفحه اصلی و کانونی (Canonical) میرسیدند.
این انزوا منجر به سه شکست بحرانی میشود: اول، صفحات یتیم (Orphans) که هیچ لینک ورودی محتوایی ندارند و هم برای مالک سایت و هم برای الگوریتمهای رتبهبندی نامرئی میمانند. دوم، بنبستهایی (Dead Ends) که به هیچجا لینک نمیدهند و اعتبار صفحه را هدر میدهند. و سوم، ناتوانی کلی در پاسخ به این سؤال که کدام صفحه باید تقویت شود و این لینکها دقیقاً باید از کجا منشأ بگیرند.
بر اساس گزارش توسعهدهنده، خزندههای تجاری فعلی بیشتر گزارشهای سطح بالا و کلی میدهند تا دادههای خام. توسعهدهنده به دنبال گرافی خام بود که بتوان پس از هر تغییر، آن را با نسخه قبلی مقایسه (Diff) کرد، با دادههای Search Console ترکیب نمود یا به یک مدل زبانی بزرگ (LLM) داد. اسکریپتهای دستساز هم معمولاً شکست میخورند زیرا لینکهای هدر و فوتر را در هر صفحه میشمارند و یک «کلاف سردرگم» ایجاد میکنند که در آن هر صفحه به نظر میرسد به همه صفحات لینک داده است. این نویز باعث میشود آن ۵٪ از لینکهای حیاتی که واقعاً اعتبار موضوعی (Topical Authority) ایجاد میکنند، گم شوند.
سازوکار internal-links-export
ابزار internal-links-export برای حل این مشکل از یک قانون دادهمحور استفاده میکند تا ناوبری کلی سایت را از لینکهای محتوایی معنادار جدا کند. به جای استفاده از لیستهای ناوبری سختافزاری (Hardcoded)، هر هدفی که از ۹۰٪ یا بیشتر صفحات خزششده لینک شده باشد، بهطور خودکار به عنوان «پوسته» (Chrome) شناخته شده و فیلتر میشود. این ابزار از طریق نقشه سایت (Sitemap) یا در صورت نبود آن، از طریق جستوجوی اول-پهنا (BFS) عمل کرده و نتایج را در یک گزارش HTML آفلاین و فایلهای خروجی ارائه میدهد. این پروژه تحت لایسنس MIT و بدون هیچ وابستگی خارجی (Zero Dependencies) منتشر شده است.
برای تست محدودیتهای این ابزار، توسعهدهنده آن را روی یک سایت تجارت الکترونیک متخاصم شخص ثالث با ۴۸۶۸ صفحه اجرا کرد. این سایت دارای ۳۹۳۱ URL محصول تخت در مسیر /products/{slug} بود که هیچ دستهبندی در مسیر آنها وجود نداشت و هیچ معیاری برای گروهبندی نبود. در حالت جدولی، این دادهها کاملاً بیمعنی بودند. با این حال، ابزار توانست تاکسونومی (Taxonomy) دوفاکتو را از خودِ ساختار لینکها بازیابی کند؛ این کار را با گروهبندی هر صفحه غیر-هاب تحت قویترین منبع لینک ورودی محتواییاش انجام داد. این فرآیند ۲۶۸ گروه دستهبندی را بازسازی کرد که ۹۲٪ محصولات را پوشش میداد. این نتیجه ثابت میکند که معماری واقعی اطلاعات یک سایت در لینکهای آن نهفته است، حتی زمانی که در هیچ جای دیگر تعریف نشده باشد.
نماهای تشخیصی و گردش کار
این ابزار سه نمای اصلی برای ممیزی سلامت سایت ارائه میدهد:
- توزیع درجه ورودی (In-degree distribution): شناسایی صفحاتی که اعتبار را میبلعند و به عنوان هابهایی عمل میکنند که از همه جا لینک میگیرند، و همچنین شناسایی صفحاتی که «گرسنه» و یتیم ماندهاند. صفحات یتیم و نزدیک به یتیم بلافاصله از این لیست بیرون میافتند.
- گرافهای گروه دستهبندی: به کاربر اجازه میدهد با دوبار کلیک روی هر گروه، صفحه دستهبندی، صفحات عضو آن و دقیقاً کدام اعضا لینک بازگشتی دارند را ببیند. لینکهای بازگشتی گمشده در اینجا به عنوان ارزانترین و سریعترین بردها در ممیزی شناسایی میشوند.
- جریانهای بینخوشهای (Cross-cluster flows): تشخیص نقاطی که سیلوهای موضوعی بهطور تصادفی به یکدیگر لینک دادهاند یا در مقابل، هرگز ارتباطی با هم برقرار نکردهاند.
پس از استخراج دادهها در قالب دو فایل CSV (یکی برای لیست صفحات و یکی برای لیست یالها یا Edge List)، توسعهدهنده یک گردش کار پنجمرحلهای برای ادغام پیشنهاد میکند:
۱. تطبیق با Search Console: ترکیب لیست صفحات با میزان Impression (نمایش) و رتبه متوسط هر URL. این کار صفحات را به سه دسته تقسیم میکند: صفحاتی که «ترافیک کسب میکنند»، صفحاتی که «وجود دارند اما گرسنه هستند» و صفحاتی که «با یک همکلاسی رقابت میکنند».
۲. یافتن کاندیداهای ادغام: شناسایی صفحاتی با موضوع یکسان که لینکهای ورودیشان تقسیم شده است. سپس صفحه ضعیفتر ادغام شده، ریدایرکت میشود و با استفاده از لیست یالها به عنوان یک لیست ویرایش مکانیکی، تمام لینکهای ورودی به صفحه بازمانده تغییر مسیر مییابند.
۳. تغییر مسیر به سمت صفحات رتبهدار: برای صفحات قوی، همسایگی موضوعی در گراف تحلیل میشود تا صفحاتی که بهطور کلی (فقط ناوبری) یا به sibling اشتباه لینک دادهاند پیدا شوند و سپس لینکهای خاصی از صفحات مرتبط ایجاد شود.
۴. اصلاح کف سایت: اطمینان از اینکه هر صفحه یتیم حداقل یک لینک ورودی محتوایی از هاب موضوعی خود دارد و هر بنبست به اعضای همرده خود لینک میدهد.
۵. خزش مجدد و مقایسه (Diff): اجرای دوباره خزنده و مقایسه فایل CSV یالها. این کار به عنوان یک تست رگرسیون برای معماری اطلاعات عمل میکند؛ ادغام صحیح باید منجر به تمرکز لینکهای ورودی روی تعداد کمتر اما صفحات قویتر شود.
پاکسازی با کمک هوش مصنوعی
تناقض جالبی در استفاده از هوش مصنوعی برای رفع آشفتگیهای ایجاد شده توسط همین فناوری وجود دارد. مشکل اصلی، نبودِ زمینه کلی (Global Context) در مدل بود. راهکار این است که لیست یالهای استخراجشده (هر ردیف شامل: از کجا، به کجا، تعداد و نوع لینک) و جدول Search Console را دوباره به یک مدل زبانی بزرگ (LLM) بدهیم. با ارائه وضعیت کلی سایت به عنوان بستر، مدل میتواند کاندیداهای دقیق برای ادغام و پیشنهاداتی برای تغییر مسیر لینکها ارائه دهد. برای کسانی که بصریسازی خارجی میخواهند، خروجیهای GEXF و GraphML برای استفاده در نرمافزار Gephi فراهم شده است.
یادداشتهای فنی از میدان نبرد
توسعه این ابزار با چالشهای فنی متعددی همراه بود:
- موانع Cloudflare: سایتهای پشت Cloudflare بهدلیل عدم تطابق اثر انگشت TLS توسط Node.js قابل خزش نبودند و کوکی
cf_clearanceبه تنهایی کافی نبود. راهکار این بود که چالش در یک مرورگر واقعی پاس داده شود و سپس Fetch آن صفحه به جمعکننده تزریق شود؛ این روش ۹۳۰ صفحه از ۹۳۱ صفحه نقشه سایت را در یک سایت تست بازیابی کرد (تنها شکست مربوط به یک صفحه بود که فقط با لاگین در دسترس بود). - خوشههای متراکم: در یک مورد، خوشهای با ۱۰۴ گره، ۱۹۳۰ لینک Breadcrumb داشت. چون چیدمانهای نیرومحور (Force-directed) اینها را به یک توپ تبدیل میکنند، ابزار بهطور خودکار به چیدمان قطعی (Deterministic) تغییر وضعیت داد و خوشه را در ۲۶۵ میلیثانیه رندر کرد.
- وضعیت رابط کاربری: در حال حاضر متون رابط کاربری گزارش به زبان چینی ساده است، هرچند مسیرها و گرافها مستقل از زبان هستند و نسخه انگلیسی در نقشه راه قرار دارد.
مخزن این پروژه در partick33/internal-links-export در دسترس است و شامل خزنده، یک گزارش تکفایلی، خروجیهای متنوع (CSV/GEXF/GraphML/JSON) و ۱۲ تست است. تغییر رویکرد از «گزارشهای زیبا» به «گرافهای قابل مقایسه»، نحوه مدیریت مقیاس در سایتهای هوش مصنوعی را تغییر میدهد. گرافی که بتوان آن را Diff کرد، ابزاری برای تست رگرسیون معماری اطلاعات است تا اطمینان حاصل شود که با رشد سایت، اعتبار متمرکز میشود، نه پراکنده.
گام بعدی شما
- اگر از ابزارهای تولید محتوای انبوه استفاده میکنید، همین امروز گراف لینکهای داخلی خود را استخراج کنید تا صفحات یتیم را بیابید.
- لیست لینکهای استخراجشده را به همراه دادههای Search Console به یک LLM بدهید تا استراتژی ادغام صفحات تکراری را برایتان بنویسد.
- از خروجی GEXF برای بصریسازی سیلوهای محتوایی در نرمافزار Gephi استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو