پرش به محتوای اصلی
پرش به محتوای مقاله

فایل llms.txt؛ نقشه‌ی راه دستی برای کاهش اتلاف توکن در عامل‌های AI

·۲ شهریور ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
راهنما
راهنمای llms.txt: چیست، آیا موتورهای جستجوی هوش مصنوعی آن را می‌خوانند و چگونه بنویسیم
راهنمای llms.txt: چیست، آیا موتورهای جستجوی هوش مصنوعی آن را می‌خوانند و چگونه بنویسیم
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک قرارداد جدید (Convention) برای ایجاد فهرست مطالب منتخب مخصوص AI که برخلاف ابزارهای کنترلی، بر روی «بهینه‌سازی مصرف توکن» و «هدایت مدل به داده‌های با سیگنال بالا» تمرکز دارد.

تصور کنید یک فایل Markdown واحد در ریشه دامنه خود داشته باشید که به یک عامل هوش مصنوعی دقیقاً می‌گوید کدام صفحات سایت شما واقعاً اهمیت دارند. این همان llms.txt است؛ نه یک دروازه امنیتی و نه ابزاری برای مسدود کردن خزنده‌ها، بلکه یک فهرست مطالب منتخب که طراحی شده تا مدل‌های زبانی بزرگ (LLMs) پنجره متنی (Context Window) محدود خود را روی منوهای ناوبری، فوترها و بنرهای کوکی تلف نکنند.

بسیاری از مالکان وب‌سایت در حال حاضر برای مدیریت ربات‌های هوش مصنوعی به robots.txt تکیه می‌کنند، اما آن فایل فقط کنترل دسترسی (Access Control) را بر عهده دارد. در اواخر سال ۲۰۲۴، جامعه‌ی توسعه‌دهندگان از طریق llmstxt.org قرارداد جدیدی را برای حل مشکلی متفاوت پیشنهاد دادند: «خوانایی» (Legibility). در حالی که یک موتور جست‌وجوی سنتی می‌خواهد هر URL موجود در سایت را ایندکس کند، یک عامل هوش مصنوعی نیاز دارد سریع‌ترین مسیر را برای یافتن سه یا چهار صفحه‌ای که واقعاً پاسخ سؤال کاربر است پیدا کند، بدون اینکه مجبور باشد کل ساختار پیچیده HTML شما را مهندسی معکوس کند.

تصور کنید به جای اینکه یک کارمند جدید را مجبور کنید تمام ویکی حجیم شرکت را بخواند، یک صفحه‌ی راهنمای سریع (README) تک‌صفحه‌ای به او بدهید تا دقیقاً بداند کجا را بخواند. این فلسفه اصلی پشت llms.txt است. این فایل به عنوان لایه‌ی سوم آمادگی برای هوش مصنوعی عمل می‌کند؛ لایه‌ای که پس از قابلیت دسترسی پایه در robots.txt و معنای معنایی در داده‌های ساختاریافته‌ی JSON-LD قرار می‌گیرد.

درک تفاوت‌های ساختاری و زمینه

برای درک ضرورت llms.txt باید آن را از سایر فایل‌های رایج تفکیک کرد. این فایل اغلب به دلیل اینکه در همان مکان (Root) قرار دارد و نامی مشابه دارد، با robots.txt یکی پنداشته می‌شود و این منجر به این تصور غلط می‌شود که llms.txt یک فایل دیگر برای کنترل دسترسی است. اما اینطور نیست.

در حالی که robots.txt مانند یک دروازه‌بان عمل می‌کند و به خزنده‌ها می‌گوید چه کسی اجازه دارد چه چیزی را واکشی (Fetch) کند، llms.txt مانند یک فهرست مطالب عمل می‌کند. افزودن llms.txt هیچ دسترسی جدیدی اعطا نمی‌کند و هیچ‌چیز را مسدود نمی‌کند. خزنده‌ای که در حال حاضر توسط یک دیواره آتش اپلیکیشن وب (WAF) یا یک قانون در robots.txt مسدود شده است، هرگز فایل llms.txt را نخواهد دید. در مقابل، خزنده‌ای که اجازه ورود دارد، برای خواندن این فایل نیازی به اجازه اضافی ندارد.

این فایل همچنین تفاوت بنیادینی با sitemap.xml دارد. یک نقشه سایت (Sitemap) فهرستی جامع، ماشینی و تولید شده توسط سیستم از تمام URLهای سایت برای کشف محتواست. در مقابل، llms.txt کوتاه است، توسط انسان انتخاب شده، به صورت دستی نوشته شده و دارای دیدگاه (Opinionated) است. اگر sitemap بگوید «اینجا همه چیز است»، llms.txt می‌گوید «این ۶ مورد، مهم‌ترین‌ها هستند».

در نهایت، این فایل با داده‌های ساختاریافته‌ی JSON-LD متفاوت است. JSON-LD معنای یک صفحه‌ی واحد را به صورت درون‌خطی (Inline) مشخص می‌کند؛ مثلاً شناسایی می‌کند که این صفحه یک «مقاله» یا یک «محصول» است. اما llms.txt در سطح کل سایت عمل کرده و با اشاره به چندین صفحه، یک نقشه‌ی سطح بالا از کل دامنه ارائه می‌دهد.

نقشه‌ی فنی و استانداردهای اجرا

فرمت این فایل به‌طور عمدی مینیمال و انسان‌خوان طراحی شده است. طبق راهنمای Merlonix، یک فایل معتبر باید از ساختار Markdown خاصی در مسیر https://example.com/llms.txt پیروی کند:

  • تیتر H1: نام پروژه یا سایت. این تنها المانی است که در مشخصات فنی (Spec) واقعاً اجباری است.
  • نقل‌قول (Blockquote): یک خلاصه‌ی تک‌خطی (با استفاده از علامت >) که بلافاصله بعد از H1 می‌آید. به عامل‌های هوش مصنوعی دستور داده شده که با این بخش به عنوان «ارائه‌ی سریع» (Elevator Pitch) برخورد کنند تا فوراً مفهوم کلی سایت را درک کنند.
  • متن Markdown اختیاری: متن‌های آزاد، مانند یک پاراگراف زمینه یا حقایق کلیدی که مدل زبانی باید در ابتدا بداند.
  • بخش‌های H2: لینک‌های گروه‌بندی شده (مانند ## Docs یا ## API یا ## About) که محتوا را دسته‌بندی می‌کنند.
  • لینک‌های Markdown: هر مورد از لیست یک لینک Markdown است که می‌تواند به دنبال آن یک دو نقطه (:) و توصیفی کوتاه از محتوای آن صفحه بیاید.

یک ویژگی حیاتی در این استاندارد، بخش ## Optional است. هر محتوایی که زیر این تیتر قرار بگیرد، به عنوان «قابل چشم‌پوشی» علامت‌گذاری می‌شود. اگر یک عامل هوش مصنوعی با محدودیت شدید توکن در پنجره متنی خود مواجه شود، می‌تواند این لینک‌ها را کاملاً حذف کند بدون اینکه اطلاعات ضروری را از دست بدهد. این قابلیت به مالکان سایت اجازه می‌دهد لینک‌های «خوب است بدانید» را در اولویت پایین‌تر قرار دهند.

برای سایت‌هایی با مستندات بسیار حجیم، فایلی مکمل به نام llms-full.txt تعریف شده است. در حالی که llms.txt فقط لینک‌ها را ارائه می‌دهد، llms-full.txt محتوای واقعی صفحات کلیدی را به صورت درون‌خطی در یک سند Markdown عظیم ادغام می‌کند. این برای سایت‌های مستنداتی که می‌خواهند یک عامل هوش مصنوعی تمام داده‌های ضروری را در یک درخواست (Fetch) دریافت کند (به جای چندین درخواست متوالی)، بسیار مفید است.

استراتژی پیاده‌سازی مؤثر

رایج‌ترین حالت شکست در اجرای این استاندارد، ایجاد فایلی است که از نظر فنی معتبر اما از نظر کاربردی بی‌فایده باشد. لیست کردن ۴۰ پست اخیر وبلاگ یا کپی کردن عیناً منوی ناوبری سایت، هدف این ابزار را نابود می‌کند. برای اینکه یک سایت واقعاً «خوانا» شود، مالکان باید این فایل را مانند یک بریف (Brief) برای یک غریبه‌ی باهوش تنظیم کنند.

فایل‌های با سیگنال بالا روی صفحاتی تمرکز می‌کنند که پاسخ سؤالات واقعی را می‌دهند؛ مانند سطوح قیمت‌گذاری، مراجع API و راهنمای «چگونه کار می‌کند». مالکان سایت باید از گنجاندن لینک‌های مربوط به «کیت رسانه‌ای» (Press Kit) یا صفحات اداری بی‌ربط خودداری کنند.

نکات کلیدی برای مدیریت محتوا:

  • خلاصه‌ی تک‌جمله‌ای: در بخش نقل‌قول دقیقاً بیان کنید که محصول چه کاری انجام می‌دهد. یک جمله‌ی شفاف و صریح برای یک عامل هوش مصنوعی بسیار مفیدتر از یک بخش Hero پیچیده و پر از کلمات بازاریابی در صفحه اصلی است.
  • لینک‌های توصیفی: حقایق را در توضیحات بگنجانید. به عنوان مثال، به جای یک لینک ساده به صفحه قیمت، توصیفی مانند «چهار سطح از رایگان تا ۶۹۹ دلار در ماه، بدون هزینه برای هر کاربر» ارائه دهید. این یک حقیقت قابل استناد است که مدل می‌تواند فوراً در پاسخ خود به کاربر استفاده کند.
  • ایجاز شدید: فایل را کوتاه نگه دارید. اگر llms.txt به اندازه sitemap طولانی شود، کارایی خود را به عنوان یک راهنمای منتخب از دست می‌دهد.

واقعیت پذیرش در صنعت

در حال حاضر شکاف بزرگی بین انتشار این فایل و مصرف آن توسط مدل‌ها وجود دارد. در حالی که پذیرش آن در میان ابزارهای توسعه‌دهندگان و سایت‌های مستنداتی در حال رشد است، موتورهای پاسخ‌دهنده‌ی بزرگی مانند OpenAI، Anthropic، Google و Perplexity هنوز به‌طور رسمی متعهد نشده‌اند که در زمان بازیابی (Retrieval) اطلاعات، مانند robots.txt از llms.txt پیروی کنند.

اکثر موتورهای AI مصرف‌کننده هنوز HTML رندر شده را مستقیماً خزش و تجزیه می‌کنند. با این حال، افزودن این فایل یک حرکت کم‌ریسک و پربازده است به سه دلیل:
۱. مالکیت روی سازماندهی: این فایل به عنوان یک بیانیه‌ی رسمی، کانونی و نسخه‌بندی شده از مهم‌ترین صفحات سایت شما عمل می‌کند که برای عامل‌های داخلی و هر ابزاری که از آن پشتیبانی می‌کند، مفید است.
۲. بدون ضرر: به عنوان یک فایل استاتیک Markdown، نه سرعت سایت را کاهش می‌دهد، نه رندرینگ را می‌شکند و نه روی رتبه‌ی سئو اثر منفی می‌گذارد. نسبت ریسک به پاداش به‌شدت به نفع افزودن آن است.
۳. آمادگی برای آینده: این یک قرارداد در مسیر استاندارد شدن است. شرط‌بندی روی یک تنظیمات ۵ دقیقه‌ای برای روندی که توسط پلتفرم‌های مستنداتی پذیرفته شده، یک گزینه ارزان برای آینده‌ای محتمل است.

اعتبارسنجی آمادگی برای AI

صرفاً داشتن فایل کافی نیست؛ فایل باید «معتبر» باشد. «موجود بودن» و «معتبر بودن» دو مفهوم متفاوت هستند. فایلی که کد ۲۰۰ OK برمی‌گرداند اما یک صفحه‌ی خطای HTML (مانند مسیرهای catch-all در SPAها) یا دیواری از متن بدون تیتر نمایش می‌دهد، برای یک پارسر بی‌فایده است.

اعتبارسنجی مستلزم یک بررسی دستی یا خودکار برای ساختار است. یک llms.txt واقعی باید حداقل یک تیتر (#) یا یک لینک Markdown ([text](url)) داشته باشد. بدون این‌ها، پارسر نمی‌تواند هیچ ساختاری را استخراج کند.

Merlonix یک بررسی سه‌لایه را برای هر دامنه پیشنهاد می‌کند تا اطمینان حاصل شود که واقعاً توسط یک عامل قابل یافتن است:

  • لایه ۱: قابلیت دسترسی (Reachability): آیا خزنده می‌تواند به شما برسد؟ این شامل بررسی robots.txt و لایه‌ی Edge است. یک WAF یا دکمه‌ی «مسدود کردن ربات‌های AI» می‌تواند خزنده‌ای را که robots.txt صراحتاً اجازه داده است، با خطای ۴۰۳ مسدود کند. (نکته: خزنده‌های موتورهای پاسخ‌دهنده اغلب از User-Agentهای متفاوتی نسبت به خزنده‌های آموزشی استفاده می‌کنند، به همین دلیل مسدود کردن GPTBot لزوماً شما را از ChatGPT حذف نمی‌کند).
  • لایه ۲: قابلیت تجزیه (Parseability): آیا مدل می‌تواند صفحه را بفهمد؟ این مورد توسط داده‌های ساختاریافته‌ی JSON-LD مدیریت می‌شود که به موتور می‌گوید آیا صفحه یک مقاله، محصول یا FAQ است.
  • لایه ۳: خوانایی (Legibility): آیا مدل می‌تواند صفحات مهم را سریع پیدا کند؟ اینجاست که llms.txt با ارائه فهرست مطالب منتخب وارد عمل می‌شود.

اگر دو لایه‌ی اول شکست بخورند، لایه‌ی سوم بی‌معنی است. اگر یک موتور پاسخ‌دهنده اصلاً نتواند صفحات را واکشی کند، یک llms.txt بی‌نقص هیچ تغییری ایجاد نمی‌کند.

این تغییر رویکرد، نشان‌دهنده‌ی حرکتی به سمت «سئو برای هوش مصنوعی» (AI SEO) است؛ جایی که هدف دیگر فقط ایندکس شدن نیست، بلکه تبدیل شدن به محتوایی است که برای عامل‌هایی با محدودیت شدید توکن، به‌سادگی قابل هضم باشد. این تلاش برای بهینه‌سازی ارتباطات ماشینی مشابه رویکردی است که در استانداردهای نگارشی تخصصی هوانوردی برای کاهش خطاهای AI دیده شده است. با کاهش نویز HTMLهای بازاریابی رندر شده، مالکان سایت می‌توانند احتمال استناد دقیق موتورهای پاسخ‌دهنده‌ی AI به محتوای خود را افزایش دهند.

برای کسانی که می‌خواهند وضعیت فعلی خود را آزمایش کنند، اسکنرهای رایگان «آمادگی عامل» (Agent-Readiness) اکنون می‌توانند بررسی کنند که آیا فایل /llms.txt موجود است و آیا ساختاری شبیه به Markdown واقعی دارد یا خیر. این ابزارها دامنه را از ۰ تا ۱۰۰ امتیاز می‌دهند؛ این امتیاز بر اساس حضور فایل و وضعیت دو لایه‌ی دیگر (دسترسی robots.txt و داده‌های JSON-LD) محاسبه می‌شود تا دقیقاً مشخص شود کدام لایه نقطه ضعف سایت است.

گام بعدی شما

  • اگر مستندات فنی یا وب‌سایت شرکتی دارید، یک فایل llms.txt ساده با ساختار H1 و Blockquote ایجاد کنید.
  • صفحات «قیمت» و «راهنمای شروع» را با توصیفات عددی و دقیق در این فایل قرار دهید تا مدل‌ها در استنتاج دچار توهم نشوند.
  • از ابزارهای رایگان اسکنر آمادگی عامل‌ها برای بررسی لایه‌های دسترسی و خوانایی دامنه خود استفاده کنید.

اما داستان سخت‌افزاری این تحول و نحوه پردازش این توکن‌ها در لایه‌های پایین‌تر حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید. این موضوع در کنار نقش مدل‌های زبانی در ترجمه سخت‌افزار نشان می‌دهد که LLMها در حال تبدیل شدن به لایه‌ای حیاتی بین انسان و ماشین هستند.

چرا این موضوع مهم است؟

این موضوع با تکیه بر اعتبار استانداردهای جامعه‌ی متن‌باز، هزینه‌ی استنتاج را برای توسعه‌دهندگان کاهش و دقت پاسخ‌ها را برای کاربران افزایش می‌دهد. در واقع، بهینه‌سازی لایه‌ی خوانایی، احتمال ارجاع دقیق مدل‌ها به منابع معتبر را بالا می‌برد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که سرویس‌های SaaS یا مستندات فنی دارند، پیاده‌سازی این فایل راهی رایگان برای بهبود نمایش محصولاتشان در موتورهای پاسخ‌دهنده جهانی است.

·نگاه ما
تحریریه دات‌هوش

این استاندارد نشان می‌دهد که ما از عصر «کشف محتوا» توسط ربات‌ها به عصر «هدایت محتوا» برای مدل‌ها می‌رویم. در واقع، llms.txt تلاشی است برای بازگرداندن کنترل محتوا به دست مالکان سایت در برابر خزنده‌هایی که با بلعیدن حجم عظیمی از نویز، کیفیت پاسخ‌های نهایی را کاهش می‌دهند. این اولین قدم به سوی یک پروتکل ارتباطی مستقیم بین وب‌سایت‌ها و مدل‌های استدلالی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.