پرش به محتوای اصلی
پرش به محتوای مقاله

«پایان صفحات یتیم»؛ ابزار متن‌باز جدید برای بهینه‌سازی ساختار وب

·۱۷ مهر ۱۴۰۵۵ دقیقه مطالعه
راهنما
پیوندهای داخلی سایت AIسازم غیرقابل مدیریت بود — پس کل گراف را قبل از هر تغییری ترسیم کردم.
پیوندهای داخلی سایت AIسازم غیرقابل مدیریت بود — پس کل گراف را قبل از هر تغییری ترسیم کردم.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزمی برای فیلتر خودکار «پوسته» سایت (لینک‌های تکراری در ۹۰٪ صفحات) جهت استخراج گراف خالص محتوا، که در خزنده‌های تجاری معمولاً نادیده گرفته می‌شود.

اگر وب‌سایت شما توسط هوش مصنوعی ساخته شده، احتمالاً با شبکه‌ای از صفحات تکراری و لینک‌های کور دست‌وپنجه نرم می‌کنید که رتبه شما را در گوگل می‌کشد. این رشد سریع محتوا معمولاً سریع‌تر از توان معماری سایت پیش می‌رود و منجر به ایجاد «بدهی سئو» می‌شود. این چالش در واقع نتیجه‌ی نبرد میان نظم نقشه‌راه‌های دستی و هرج‌ومرج تولید خودکار صفحات است که ساختار سایت را به مخاطره می‌اندازد. در واقع، وقتی یک سایت با سرعت بالای AI رشد می‌کند، اغلب یک شبکه پنهان از URLهای رقیب و صفحات «یتیم» ایجاد می‌شود که ساختار سایت را تخریب می‌کند.

به نقل از مستندات پروژه، توسعه‌دهنده‌ای به نام patrick33 در ۹ اکتبر ۲۰۲۶ ابزار internal-links-export را منتشر کرد تا گراف خام لینک‌های یک سایت را بصری‌سازی و استخراج کند. این ابزار یک راهکار متن‌باز برای مقابله با شکست‌های ساختاری در سایت‌های مقیاس‌بزرگ است.

مشکل اینجاست که اکثر تولیدکنندگان محتوای هوش مصنوعی، صفحات را تک‌تک و بدون دید کلی به کل سایت می‌سازند. آن‌ها فاقد یک دفتر کل (Global Ledger) از وضعیت سایت هستند، به این معنی که هر صفحه در انزوای کامل و فقط با بستر محلی خود ایجاد می‌شود. در حالی که ممکن است هر صفحه به‌تنهایی خوش‌ساخت به نظر برسد — مثلاً دارای لینک‌های مرتبط منطقی، Breadcrumbs و منوی ناوبری باشد — اما کل سایت اغلب از پدیده‌ای به نام «دوقلوهای موضوعی» رنج می‌برد. این‌ها صفحاتی تقریباً یکسان هستند که اعتبار لینک‌های ورودی (Inbound Link Equity) را بین خود تقسیم می‌کنند و تکه‌هایی از لینک‌هایی را می‌بلعند که باید به یک صفحه اصلی و کانونی (Canonical) می‌رسیدند.

این انزوا منجر به سه شکست بحرانی می‌شود: اول، صفحات یتیم (Orphans) که هیچ لینک ورودی محتوایی ندارند و هم برای مالک سایت و هم برای الگوریتم‌های رتبه‌بندی نامرئی می‌مانند. دوم، بن‌بست‌هایی (Dead Ends) که به هیچ‌جا لینک نمی‌دهند و اعتبار صفحه را هدر می‌دهند. و سوم، ناتوانی کلی در پاسخ به این سؤال که کدام صفحه باید تقویت شود و این لینک‌ها دقیقاً باید از کجا منشأ بگیرند.

بر اساس گزارش توسعه‌دهنده، خزنده‌های تجاری فعلی بیشتر گزارش‌های سطح بالا و کلی می‌دهند تا داده‌های خام. توسعه‌دهنده به دنبال گرافی خام بود که بتوان پس از هر تغییر، آن را با نسخه قبلی مقایسه (Diff) کرد، با داده‌های Search Console ترکیب نمود یا به یک مدل زبانی بزرگ (LLM) داد. اسکریپت‌های دست‌ساز هم معمولاً شکست می‌خورند زیرا لینک‌های هدر و فوتر را در هر صفحه می‌شمارند و یک «کلاف سردرگم» ایجاد می‌کنند که در آن هر صفحه به نظر می‌رسد به همه صفحات لینک داده است. این نویز باعث می‌شود آن ۵٪ از لینک‌های حیاتی که واقعاً اعتبار موضوعی (Topical Authority) ایجاد می‌کنند، گم شوند.

سازوکار internal-links-export

ابزار internal-links-export برای حل این مشکل از یک قانون داده‌محور استفاده می‌کند تا ناوبری کلی سایت را از لینک‌های محتوایی معنادار جدا کند. به جای استفاده از لیست‌های ناوبری سخت‌افزاری (Hardcoded)، هر هدفی که از ۹۰٪ یا بیشتر صفحات خزش‌شده لینک شده باشد، به‌طور خودکار به عنوان «پوسته» (Chrome) شناخته شده و فیلتر می‌شود. این ابزار از طریق نقشه سایت (Sitemap) یا در صورت نبود آن، از طریق جست‌وجوی اول-پهنا (BFS) عمل کرده و نتایج را در یک گزارش HTML آفلاین و فایل‌های خروجی ارائه می‌دهد. این پروژه تحت لایسنس MIT و بدون هیچ وابستگی خارجی (Zero Dependencies) منتشر شده است.

برای تست محدودیت‌های این ابزار، توسعه‌دهنده آن را روی یک سایت تجارت الکترونیک متخاصم شخص ثالث با ۴۸۶۸ صفحه اجرا کرد. این سایت دارای ۳۹۳۱ URL محصول تخت در مسیر /products/{slug} بود که هیچ دسته‌بندی در مسیر آن‌ها وجود نداشت و هیچ معیاری برای گروه‌بندی نبود. در حالت جدولی، این داده‌ها کاملاً بی‌معنی بودند. با این حال، ابزار توانست تاکسونومی (Taxonomy) دوفاکتو را از خودِ ساختار لینک‌ها بازیابی کند؛ این کار را با گروه‌بندی هر صفحه غیر-هاب تحت قوی‌ترین منبع لینک ورودی محتوایی‌اش انجام داد. این فرآیند ۲۶۸ گروه دسته‌بندی را بازسازی کرد که ۹۲٪ محصولات را پوشش می‌داد. این نتیجه ثابت می‌کند که معماری واقعی اطلاعات یک سایت در لینک‌های آن نهفته است، حتی زمانی که در هیچ جای دیگر تعریف نشده باشد.

نماهای تشخیصی و گردش کار

این ابزار سه نمای اصلی برای ممیزی سلامت سایت ارائه می‌دهد:

  • توزیع درجه ورودی (In-degree distribution): شناسایی صفحاتی که اعتبار را می‌بلعند و به عنوان هاب‌هایی عمل می‌کنند که از همه جا لینک می‌گیرند، و همچنین شناسایی صفحاتی که «گرسنه» و یتیم مانده‌اند. صفحات یتیم و نزدیک به یتیم بلافاصله از این لیست بیرون می‌افتند.
  • گراف‌های گروه دسته‌بندی: به کاربر اجازه می‌دهد با دوبار کلیک روی هر گروه، صفحه دسته‌بندی، صفحات عضو آن و دقیقاً کدام اعضا لینک بازگشتی دارند را ببیند. لینک‌های بازگشتی گم‌شده در اینجا به عنوان ارزان‌ترین و سریع‌ترین بردها در ممیزی شناسایی می‌شوند.
  • جریان‌های بین‌خوشه‌ای (Cross-cluster flows): تشخیص نقاطی که سیلوهای موضوعی به‌طور تصادفی به یکدیگر لینک داده‌اند یا در مقابل، هرگز ارتباطی با هم برقرار نکرده‌اند.

پس از استخراج داده‌ها در قالب دو فایل CSV (یکی برای لیست صفحات و یکی برای لیست یال‌ها یا Edge List)، توسعه‌دهنده یک گردش کار پنج‌مرحله‌ای برای ادغام پیشنهاد می‌کند:

۱. تطبیق با Search Console: ترکیب لیست صفحات با میزان Impression (نمایش) و رتبه متوسط هر URL. این کار صفحات را به سه دسته تقسیم می‌کند: صفحاتی که «ترافیک کسب می‌کنند»، صفحاتی که «وجود دارند اما گرسنه هستند» و صفحاتی که «با یک هم‌کلاسی رقابت می‌کنند».
۲. یافتن کاندیداهای ادغام: شناسایی صفحاتی با موضوع یکسان که لینک‌های ورودی‌شان تقسیم شده است. سپس صفحه ضعیف‌تر ادغام شده، ریدایرکت می‌شود و با استفاده از لیست یال‌ها به عنوان یک لیست ویرایش مکانیکی، تمام لینک‌های ورودی به صفحه بازمانده تغییر مسیر می‌یابند.
۳. تغییر مسیر به سمت صفحات رتبه‌دار: برای صفحات قوی، همسایگی موضوعی در گراف تحلیل می‌شود تا صفحاتی که به‌طور کلی (فقط ناوبری) یا به sibling اشتباه لینک داده‌اند پیدا شوند و سپس لینک‌های خاصی از صفحات مرتبط ایجاد شود.
۴. اصلاح کف سایت: اطمینان از اینکه هر صفحه یتیم حداقل یک لینک ورودی محتوایی از هاب موضوعی خود دارد و هر بن‌بست به اعضای هم‌رده خود لینک می‌دهد.
۵. خزش مجدد و مقایسه (Diff): اجرای دوباره خزنده و مقایسه فایل CSV یال‌ها. این کار به عنوان یک تست رگرسیون برای معماری اطلاعات عمل می‌کند؛ ادغام صحیح باید منجر به تمرکز لینک‌های ورودی روی تعداد کمتر اما صفحات قوی‌تر شود.

پاک‌سازی با کمک هوش مصنوعی

تناقض جالبی در استفاده از هوش مصنوعی برای رفع آشفتگی‌های ایجاد شده توسط همین فناوری وجود دارد. مشکل اصلی، نبودِ زمینه کلی (Global Context) در مدل بود. راهکار این است که لیست یال‌های استخراج‌شده (هر ردیف شامل: از کجا، به کجا، تعداد و نوع لینک) و جدول Search Console را دوباره به یک مدل زبانی بزرگ (LLM) بدهیم. با ارائه وضعیت کلی سایت به عنوان بستر، مدل می‌تواند کاندیداهای دقیق برای ادغام و پیشنهاداتی برای تغییر مسیر لینک‌ها ارائه دهد. برای کسانی که بصری‌سازی خارجی می‌خواهند، خروجی‌های GEXF و GraphML برای استفاده در نرم‌افزار Gephi فراهم شده است.

یادداشت‌های فنی از میدان نبرد

توسعه این ابزار با چالش‌های فنی متعددی همراه بود:

  • موانع Cloudflare: سایت‌های پشت Cloudflare به‌دلیل عدم تطابق اثر انگشت TLS توسط Node.js قابل خزش نبودند و کوکی cf_clearance به تنهایی کافی نبود. راهکار این بود که چالش در یک مرورگر واقعی پاس داده شود و سپس Fetch آن صفحه به جمع‌کننده تزریق شود؛ این روش ۹۳۰ صفحه از ۹۳۱ صفحه نقشه سایت را در یک سایت تست بازیابی کرد (تنها شکست مربوط به یک صفحه بود که فقط با لاگین در دسترس بود).
  • خوشه‌های متراکم: در یک مورد، خوشه‌ای با ۱۰۴ گره، ۱۹۳۰ لینک Breadcrumb داشت. چون چیدمان‌های نیرومحور (Force-directed) این‌ها را به یک توپ تبدیل می‌کنند، ابزار به‌طور خودکار به چیدمان قطعی (Deterministic) تغییر وضعیت داد و خوشه را در ۲۶۵ میلی‌ثانیه رندر کرد.
  • وضعیت رابط کاربری: در حال حاضر متون رابط کاربری گزارش به زبان چینی ساده است، هرچند مسیرها و گراف‌ها مستقل از زبان هستند و نسخه انگلیسی در نقشه راه قرار دارد.

مخزن این پروژه در partick33/internal-links-export در دسترس است و شامل خزنده، یک گزارش تک‌فایلی، خروجی‌های متنوع (CSV/GEXF/GraphML/JSON) و ۱۲ تست است. تغییر رویکرد از «گزارش‌های زیبا» به «گراف‌های قابل مقایسه»، نحوه مدیریت مقیاس در سایت‌های هوش مصنوعی را تغییر می‌دهد. گرافی که بتوان آن را Diff کرد، ابزاری برای تست رگرسیون معماری اطلاعات است تا اطمینان حاصل شود که با رشد سایت، اعتبار متمرکز می‌شود، نه پراکنده.

گام بعدی شما

  • اگر از ابزارهای تولید محتوای انبوه استفاده می‌کنید، همین امروز گراف لینک‌های داخلی خود را استخراج کنید تا صفحات یتیم را بیابید.
  • لیست لینک‌های استخراج‌شده را به همراه داده‌های Search Console به یک LLM بدهید تا استراتژی ادغام صفحات تکراری را برایتان بنویسد.
  • از خروجی GEXF برای بصری‌سازی سیلوهای محتوایی در نرم‌افزار Gephi استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تبدیل ساختار سایت به داده‌های خام، امکان ممیزی دقیق معماری اطلاعات را فراهم می‌کند که برای حفظ اعتبار سایت‌های مقیاس‌بزرگ حیاتی است. تخصص توسعه‌دهنده در جداسازی نویز ناوبری از سیگنال‌های محتوایی، دقت شناسایی صفحات یتیم را به‌شدت افزایش می‌دهد.

تأثیر برای ایران

برای متخصصان سئو و توسعه‌دهندگان ایرانی که سایت‌های محتوایی بزرگ را مدیریت می‌کنند، این ابزار رایگان جایگزینی قدرتمند برای ابزارهای گران‌قیمت خارجی است که دسترسی به آن‌ها با محدودیت‌های پرداخت همراه است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی گزارش‌های توصیفی با گراف‌های قابل مقایسه (Diffable)، مدیریت سئو را از یک هنر حدسی به یک فرآیند مهندسی تبدیل می‌کند. این ابزار نشان می‌دهد که در عصر تولید انبوه محتوا، ارزش واقعی نه در تعداد صفحات، بلکه در «ساختار ارتباطات» بین آن‌هاست. در واقع، معماری اطلاعات اکنون به یک متغیر قابل تست تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.