پرش به محتوای اصلی
پرش به محتوای مقاله

استاندارد llms.txt: بازنویسی مستندات وب برای مصرف بهینه توسط هوش مصنوعی

·۱۷ تیر ۱۴۰۵۱۰ دقیقه مطالعه
نمونه‌های جالب از وب‌سایت‌های فهرست‌شده در دایرکتوری llms.txt
نمونه‌های جالب از وب‌سایت‌های فهرست‌شده در دایرکتوری llms.txt
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ایجاد یک استاندارد غیررسمی اما پذیرفته‌شده (llms.txt) که وب را از یک محیط بصری به یک محیط داده‌محور برای عامل‌های هوش مصنوعی تبدیل می‌کند و مفهوم «سئو برای ماشین» را معرفی می‌کند.

اگر توسعه‌دهنده‌ای هستید که از توهمات مدل‌های زبانی در هنگام خواندن مستندات فنی خسته شده‌اید، باید بدانید که وب در حال تغییر است تا برای ماشین‌ها قابل‌فهم‌تر شود. اکنون وب‌سایت‌ها به جای تکیه بر صفحات بصری، فایل‌های متنی ساده‌ای را در ریشه مسیر خود قرار می‌دهند تا دقیقاً به هوش مصنوعی بگویند چه چیزی را بخواند و چه چیزی را نادیده بگیرد. این فایل‌ها با نام llms.txt شناخته می‌شوند و هدف آن‌ها این است که نبود چنین فایلی برای توسعه‌دهندگان به یک نقطه ضعف یا ریسک تبدیل نشود.

این تغییر در حالی رخ می‌دهد که عامل‌های هوش مصنوعی (AI Agents) — شبیه دستیارهای دیجیتالی که می‌توانند به‌طور مستقل در وب بچرخند و کارهای پیچیده را انجام دهند — از چت‌های ساده به ابزارهای خودکاری تبدیل شده‌اند که برای حل مسائل کدنویسی، وب را می‌خزند. برای سال‌ها، مدل‌های زبانی بزرگ با «توهماتی» دست‌وپنجه نرم می‌کردند که نتیجه‌ی تجزیه و تحلیل نادرست کدهای HTML یا داده‌های قدیمی ذخیره شده در حافظه پنه (Cache) بود. طبق اعلام جرمی هوارد از Answer.AI، استاندارد llms.txt یک نقطه ورود اختصاصی برای AI ایجاد می‌کند تا به جای کلنجار رفتن با کدهای پیچیده، مستقیماً به نسخه‌ای ساختاریافته، دقیق و به‌روز از حقیقت دسترسی داشته باشند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی داده‌ها برای مدل‌های زبانی اشاره کردیم، نویزهای بصری وب برای انسان‌ها جذاب اما برای ماشین‌ها گمراه‌کننده است. در واقع، HTML و CSS برای تجربه بصری انسان طراحی شده‌اند، اما برای یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — این کدها تنها باعث ایجاد «توهم» (Hallucination) می‌شوند؛ یعنی حالتی که مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد، شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند.

اکوسیستم دایرکتوری‌ها

در حال حاضر دو دایرکتوری شخص ثالث و مستقل برای ردیابی پذیرش این استاندارد وجود دارد که هر دو بدون هیچ اقتدار مرکزی فعالیت می‌کنند:

  • directory.llmstxt.cloud: توسط @ifox و @joyceverheije ایجاد شده است. این دایرکتوری یک تیم بررسی (Review Team) دارد و تمرکز آن روی شرکت‌ها و محصولات با تأثیر بالا است. آن‌ها استاندارد کیفی سخت‌گیرانه‌تری دارند و برندهای سطح اولی مانند Anthropic، Cursor، Cloudflare و Next.js را فهرست کرده‌اند. آمار فعلی این دایرکتوری شامل ۸۴۹ وب‌سایت، ۴۴۷ محصول، ۳۵۸ ابزار توسعه‌دهنده، ۱۸۷ ورودی AI و ۱۶۷ ورودی حوزه مالی است.
  • llmstxt.site: دایرکتوری‌ای است که به‌طور مستقل اداره می‌شود و سد ورود به آن پایین‌تر است. این سایت حجم بسیار بیشتری از وب‌سایت‌ها (بیش از ۱۶۰۰ مورد) را میزبانی می‌کند، هرچند نسبت سایت‌های مبتنی بر SEO و بازاریابی در آن بسیار بیشتر است.

این اکوسیستم نشان‌دهنده‌ی شکاف عمیقی در دیدگاه شرکت‌ها نسبت به «خوانایی برای AI» است؛ دیدگاهی که از تخلیه انبوه داده‌ها تا نقشه‌های ناوبری بسیار کم‌حجم متغیر است.

استراتژی «غول‌ها»: تغذیه کامل بستر متنی

برخی شرکت‌ها از llms.txt به عنوان یک مخزن عظیم داده استفاده می‌کنند تا عامل هوش مصنوعی تمام جزئیات را در یک درخواست دریافت کند. این روش «غول‌آسا» برای مدل‌هایی با پنجره متنی (Context Window) بسیار بزرگ طراحی شده است تا امکان خواندن یک‌باره‌ی کل سایت فراهم شود.

  • Sourcegraph: پیشتاز این روند است و با ۱.۲ میلیون توکن (Token) در فایل llms.txt خود، حجم عظیمی از داده را ارائه می‌دهد. آن‌ها با جاسازی کامل مستندات API و راهنمای استفاده، یک «تغذیه مستقیم» برای ابزارهای کدنویسی AI مثل Cursor یا GitHub Copilot ایجاد کرده‌اند.
  • Cloudflare: رویکردی دو لایه دارد؛ فایل llms.txt آن ۳۴ هزار توکن است، اما فایل llms-full.txt آن ۳.۸ میلیون توکن دارد که یکی از بزرگ‌ترین‌ها در کل دایرکتوری است. این حجم از داده، تمام مجموعه محصولات آن‌ها از جمله Workers، Pages، R2، D1 و KV را پوشش می‌دهد.
  • Hugging Face: پیاده‌سازی چندپروژه‌ای دارد. آن‌ها برای هر بخش از جمله Transformers، Diffusers، Accelerate و کتابخانه پایتون Hub، فایل‌های llms.txt جداگانه‌ای نگه می‌دارند. تنها مستندات Transformers به ۸۰۹ هزار توکن می‌رسد که شامل APIهای مدل، راهنمای آموزش و مثال‌های استنتاج است.
  • Bitcoin.com: با استفاده از استراتژی حجم بالا و ۷۲۲ هزار توکن، این فایل را به مکانیسمی برای تغذیه محتوای اخبار کریپتو، کیف پول‌ها و داده‌های صرافی تبدیل کرده است.
  • Chainspect: با ۹۳۸ هزار توکن، بزرگ‌ترین ورودی در دسته‌بندی مالی است تا اطمینان حاصل شود روش‌های پیچیده تحلیل داده‌های On-chain و مراجع API به‌طور کامل توسط مدل جذب می‌شوند.
  • Mangopay: یک فایل llms-full.txt عظیم با ۱.۷ میلیون توکن ارائه می‌دهد که شامل APIهای کامل پرداخت، گردش‌های کاری مربوط به تطبیق قوانین (Compliance) و راهنمای تست‌های Sandbox است.
  • FinFeedAPI: فایلی با ۱.۱ میلیون توکن برای داده‌های بازار مالی ارائه می‌دهد تا AI به جای حدس زدن، تعاریف دقیق رابط‌ها برای سهام، معاملات آتی (Futures) و فارکس را دریافت کند.

استراتژی «مینیمالیست‌ها»: ناوبری دقیق

در مقابل، برخی تیم‌ها llms.txt را به جای کتابخانه، شبیه یک نقشه می‌بینند. آن‌ها فهرستی کوتاه ارائه می‌دهند تا مدل بداند برای هر پاسخ دقیقاً به کدام صفحه مراجعه کند و بدین ترتیب مصرف اولیه توکن‌ها را کاهش دهند.

  • Svelte: با فایلی فوق‌مینیمالیست و ۲۸۱ توکنی، مستندات را ذخیره نمی‌کند؛ بلکه صرفاً به LLM می‌گوید مستندات رسمی فریم‌ورک در کجا قرار دارد.

  • Meilisearch: مسیر مشابهی را با ۳۳۱ توکن طی کرده است. به عنوان یک پروژه موتور جست‌وجو، ورودی جست‌وجویی برای AI فراهم کرده که یک دینامیک بازگشتی «موتور جست‌وجویی که توسط AI جست‌وجو می‌شود» ایجاد می‌کند.

  • CircleCI: تنها ۱.۲ هزار توکن ارائه می‌دهد. این مقدار کافی است تا AI بداند مستندات CI/CD وجود دارد، اما مدل همچنان باید برای جزئیات عمیق پیکربندی، صفحات خاص را بخزد.

  • Terminal Trove: تنها از ۳۶۰ توکن (و ۱.۴ هزار توکن در llms-full.txt) برای دسته‌بندی ابزارهای CLI/TUI استفاده می‌کند. این ثابت می‌کند که برای سایت‌های ناوبری، دقت ارزشمندتر از حجم است.

  • deepset: فروشنده فریم‌ورک Haystack از فایلی با ۱.۶ هزار توکن استفاده می‌کند. این سبک مینیمالیست، مدل را مجبور می‌کند صفحات خاص را بر اساس نیاز بخواند، به جای اینکه تمام محتوای RAG و جست‌وجو را در یک فایل بچپاند.

پیشتازان: آزمایشگاه‌های هوش مصنوعی

جالب است که منظم‌ترین و اولین پذیرندگان این استاندارد، خودِ آزمایشگاه‌های AI هستند. Anthropic، Cursor و Fireworks AI چون دردسرهای تجزیه HTML را بهتر از هر کسی می‌شناسند، این مسیر را پیش گرفتند.

Anthropic (شرکت مادر Claude و یک آزمایشگاه ایمنی AI) از فایل llms.txt (۸ هزار توکن) و llms-full.txt (۴۸۱ هزار توکن) برای ارائه دسترسی ساختاریافته به فلسفه شرکت، جهت‌گیری‌های پژوهشی و مشخصات مدل Claude استفاده می‌کند. Fireworks AI، یک پلتفرم استنتاج بدون سرور (Serverless Inference) که تمرکز آن بر اجرای مدل‌های متن‌باز با یک‌دهم هزینه است، از فایل llms.txt با ۴ هزار توکن و llms-full.txt با ۸۸ هزار توکن بهره می‌برد. پیاده‌سازی آن‌ها از سبک استاندارد مستندات API پیروی می‌کند تا LLMها بتوانند سریعاً لیست مدل‌ها، قیمت‌گذاری و نقاط انتهایی (Endpoints) استنتاج را پیدا کنند.

این یک حلقه بازگشتی ایجاد می‌کند: شرکت‌های AI زیرساختی را می‌سازند که به AIهای دیگر اجازه می‌دهد آن‌ها را بفهمند؛ یک حلقه بسته از «شرکت‌های AI که برای خدمات‌رسانی به AI از llms.txt استفاده می‌کنند».

پیاده‌سازی‌های تخصصی در حوزه‌های مختلف

این استاندارد اکنون برای حل چالش‌های فنی خاص در بخش‌های مختلف به کار می‌رود:

ابزارهای توسعه و SaaS

  • Next.js: یک مورد مطالعاتی پرتکرار است. با ۱۴ هزار توکن در llms.txt و ۶۷۶ هزار توکن در llms-full.txt، به AI کمک می‌کند تا پیچیدگی‌های پیکربندی App Router را مدیریت کند و کیفیت کد React تولید شده را مستقیماً بهبود ببخشد.
  • Retool: رویکردی استاندارد با ۳۲ هزار توکن (llms.txt) و ۳۹۹ هزار توکن (llms-full.txt) برای پلتفرم ساخت اپلیکیشن داخلی خود پیاده کرده است.
  • Better Auth: یک فریم‌ورک متن‌باز احراز هویت با ۱۷۴ هزار توکن است. این کار تضمین می‌کند که AI منطق احراز هویت را به‌درستی درک کند، که برای امنیت کدهای تولید شده حیاتی است.
  • Axiom: پلتفرمی برای لاگ‌گیری و نظارت (Observability) که هم یک ورودی کم‌حجم ۱۰ هزار توکنی و هم یک نسخه کامل ۳۹۸ هزار توکنی ارائه می‌دهد.
  • Activepieces: جایگزین متن‌باز Zapier است. فایل ۴.۶ هزار توکنی آن به AI کمک می‌کند تا نحوه پیکربندی گره‌های ادغام برای گردش‌های کاری خودکارسازی را بفهمد.
  • Bun: این محیط اجرای (Runtime) نوظهور جاوااسکریپت نیز در دایرکتوری حضور دارد و مراجع API ضروری را برای توسعه‌دهندگانی که با کمک AI کد می‌زنند فراهم کرده است.

فریم‌ورک‌ها و کتابخانه‌ها

  • Angular: فریم‌ورک گوگل یک ورودی بسیار استاندارد با ۱.۵ هزار توکن و نسخه کامل ۱۵۲ هزار توکنی ارائه می‌دهد.
  • Astro: فریم‌ورکی محتوا-محور با ۵۵۶ توکن (llms.txt) و ۵۹۱ هزار توکن (llms-full.txt) است که حلقه‌ای عجیب ایجاد کرده: فریم‌ورکی برای وبلاگ‌ها، توسط AI از طریق یک فایل شبیه وبلاگ خوانده می‌شود.
  • ZenML: فریم‌ورک متن‌باز خط لوله ML (که به «Terraform مهندسی ML» معروف است). این پروژه یک نمونه از بهترین روش‌هاست: یک خلاصه ۹۸ هزار توکنی برای یافتن سریع اطلاعات و یک نسخه کامل ۵۷۵ هزار توکنی برای خواندن جزئیات.
  • Maxim AI: پلتفرمی برای نظارت بر LLM با ۴۶ هزار توکن (llms.txt) و ۴۱۰ هزار توکن (llms-full.txt) که سناریویی بازگشتی ایجاد کرده: ابزاری برای مانیتورینگ AI، خودش توسط AI مانیتور می‌شود.

مالی و کریپتو

  • Stripe: از فایلی با ۱۷ هزار توکن استفاده می‌کند تا از حدس زدن پارامترهای API توسط AI جلوگیری کند. این کار مشکل خطاهای AI در استخراج پارامترها از HTML خام را حل می‌کند که برای دقت پرداخت‌ها حیاتی است.
  • KuCoin API: از ۱۵ هزار توکن برای مستندسازی پارامترهای پیچیده صرافی مانند امضاها (Signatures)، برچسب‌های زمانی (Timestamps) و محدودیت‌های نرخ (Rate Limits) استفاده می‌کند تا AI کدهای معاملاتی کاربردی تولید کند.

سایت‌های شخصی و تخصصی

  • Huberman Lab: وب‌سایت پادکست اندرو هیوبرمن (عصب‌شناس استنفورد) از ۱۴ هزار توکن برای ایندکس کردن اپیزودها استفاده می‌کند تا AI بتواند دقیقاً اپیزودهای مربوط به موضوعاتی مثل «خواب» را پیدا کند.
  • Readwise: اپلیکیشن مطالعه و یادداشت‌برداری با ۹۶ هزار توکن، به AI کمک می‌کند تا مستندات ابزاری را بخواند که خودش به انسان‌ها در مطالعه کمک می‌کند.
  • Light Pollution Map: ابزاری غیرفنی برای بصری‌سازی داده‌ها با ۵۴۴ توکن (llms.txt) و ۱.۹ هزار توکن (llms-full.txt) که نشان‌دهنده گسترش این استاندارد به خدمات داده‌های عمومی است.
  • Rasul Kireev: نمونه‌ای نادر از پیاده‌سازی عمیق شخصی. این توسعه‌دهنده از ۱۲۷ هزار توکن برای ساختاردهی به وبلاگ، پروژه‌ها و یادداشت‌های خود استفاده کرده است، در حالی که اکثر سایت‌های شخصی یا این استاندارد را نادیده می‌گیرند یا ورودی‌های حداقلی دارند.
  • Listen Notes: موتور جست‌وجوی پادکست با ورودی ۱ هزار توکنی که صرفاً AI را به سمت API خود هدایت می‌کند.

همگرایی با MCP

ما شاهد همگرایی بین llms.txt و پروتکل زمینهٔ مدل (Model Context Protocol - MCP) هستیم. دایرکتوری‌هایی مانند MCP Server Space (۱.۲ هزار توکن) و uminai MCP Directory (۱ هزار توکن) اکنون در لیست‌های llms.txt ظاهر شده‌اند.

این بدان معناست که عامل‌های AI می‌توانند ابتدا از طریق llms.txt محتوای یک وب‌سایت را کشف کنند و سپس از MCP برای فراخوانی مستقیم ابزارهای آن سایت استفاده کنند. ظهور دایرکتوری‌های MCP در لیست‌های llms.txt نشان می‌دهد که این دو استاندارد در حال ادغام هستند: کشف محتوا از طریق llms.txt و کشف ابزارهای قابل فراخوانی از طریق MCP.

تحلیل توزیع توکن‌ها

بررسی دایرکتوری‌ها نشان می‌دهد توزیع تعداد توکن‌ها «دوقطبی» (Bimodal) است: یک کمپ «غول» (Sourcegraph, Cloudflare, Hugging Face) و یک کمپ «مینیمالیست» (Svelte, Meilisearch, Terminal Trove). جای خالی یک «حد وسط» کاملاً محسوس است؛ به‌ویژه وبلاگ‌های فنی کوچک تا متوسط و پایگاه‌های دانش شخصی در این لیست غایب هستند. اکثر سایت‌ها یا برندهای سطح اول با پیاده‌سازی‌های عمیق هستند یا صفحات بازاریابی که فقط سعی دارند ترند شوند.

این تکامل نشان می‌دهد که «وب برای AI» در حال تبدیل شدن به لایه‌ای مجزا از «وب برای انسان» است. در حالی که ما دکمه‌ها و تصاویر را می‌بینیم، AI مجموعه‌ای از فایل‌های Markdown بهینه و نقاط انتهایی JSON را می‌بیند.

برای توسعه‌دهندگان، SEO آینده دیگر درباره کلمات کلیدی برای گوگل نیست، بلکه درباره «بهینگی توکن» (Token-efficiency) برای Claude و GPT است. اگر مستندات شما در فرمتی نباشد که AI بتواند در یک مرحله آن را ببلعد، محصول شما سخت‌تر از رقیب‌تان ادغام خواهد شد.

پیاده‌سازی عملی: افزونه PDC

برای پر کردن شکاف «وسط گم‌شده»، این سایت استاندارد llms.txt را از طریق پروتکل PDC (Parallel Data Channel) پیاده کرده است. این افزونه سه حوزه‌ای را پوشش می‌دهد که استاندارد اصلی به آن‌ها نمی‌پردازد:

  1. محافظت از مقالات رمزنگاری شده: مقالاتی که رمزنگاری شده‌اند، مقدار encrypted: true و محتوای خالی را در API برمی‌گردانند تا از نشت متن اصلی جلوگیری شود.
  2. نقاط انتهایی تجمیع دسته‌بندی: به‌طور خودکار مسیرهای /api/categories/<slug>.json و .md را برای تجمیع متن کامل بر اساس دسته‌بندی ایجاد می‌کند.
  3. لایه تطبیق MCP: یک مانیفست /api/mcp.json تولید می‌کند که به سایت اجازه می‌دهد از طریق یک آداپتور سبک به Claude Desktop و Cursor متصل شود.

برای رقابتی ماندن، باید دایرکتوری ریشه سایت خود را بازرسی کنید. اگر فایل llms.txt ندارید، در واقع مدل‌ها را مجبور می‌کنید عملکرد محصول شما را از تکه‌های پراکنده HTML حدس بزنند.

  • اگر مستندات حجیمی دارید، استراتژی دو لایه (یک فایل خلاصه و یک فایل full.txt) را برای مدیریت هزینه توکن‌ها پیاده کنید.
  • برای اتصال مستقیم مستندات به ابزارهایی مثل Cursor یا Claude Desktop، همگرایی با پروتکل MCP را بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این استاندارد با کاهش نویز داده‌ها، نرخ توهم مدل‌ها را در کدنویسی کاهش می‌دهد و سرعت ادغام ابزارهای AI در محیط‌های توسعه را افزایش می‌دهد. اعتبار این حرکت با پذیرش توسط آزمایشگاه‌های پیشرو مثل Anthropic تأیید شده است.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که ابزارهای SaaS یا کتابخانه‌های متن‌باز تولید می‌کنند، می‌توانند با افزودن این فایل، احتمال استفاده و ادغام محصولشان توسط عامل‌های AI جهانی را به‌شدت افزایش دهند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی HTML با Markdown برای مدل‌ها، در واقع اعتراف به شکست معماری وب فعلی در برابر نیازهای استنتاجی AI است. ما به سمتی می‌رویم که وب‌سایت‌ها دو چهره خواهند داشت: یکی برای جذب کاربر انسانی و دیگری برای تغذیه مدل‌های زبانی. برنده این بازی، کسانی هستند که «سئو توکنی» را زودتر از بقیه در استراتژی محصول خود بگنجانند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.