پرش به محتوای اصلی
پرش به محتوای مقاله

«جایگزینی اسکرپینگ کند»؛ رویکرد Scry در دسترسی به وب

·۲۷ شهریور ۱۴۰۵۲۷ دقیقه مطالعه
نقشه‌ای کهن با نمادهای رمزآلود و خطوط درخشان در تاریکی، نمادی از دیدن آینده و رازگشایی سرنوشت.
نقشه‌ای کهن با نمادهای رمزآلود و خطوط درخشان در تاریکی، نمادی از دیدن آینده و رازگشایی سرنوشت.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل وب عمومی به یک پایگاه‌داده SQL-like از طریق پروتکل MCP؛ این اولین بار است که دسترسی برنامه‌ریزی‌شده به این حجم از داده‌های متنی (۱۵۸ میلیارد سطر) با تأخیر میلی‌ثانیه‌ای برای عامل‌های AI فراهم می‌شود.

تصور کنید به جای اینکه یک عامل هوش مصنوعی برای یافتن یک الگو، صدها صفحه وب را یکی‌یکی بخواند، بتواند در چند میلی‌ثانیه روی میلیاردها سطر دادهٔ اینترنت جست‌وجو کند. این دقیقاً همان چیزی است که Scry با معرفی سرور پروتکل زمینهٔ مدل (Model Context Protocol یا MCP) — که شبیه به یک مترجم استاندارد است و اجازه می‌دهد مدل‌های مختلف بدون تغییر در زبان، با ابزارهای مختلف حرف بزنند — به دست آورده است. Scry به عامل‌های موجود در ChatGPT، Claude و Cursor اجازه می‌دهد تا وب عمومی را به جای مجموعه‌ای از صفحات پراکنده، به عنوان یک پایگاه‌داده ساختاریافته و قابل کوئری زدن در نظر بگیرند.

اکثر عامل‌های هوش مصنوعی در حال حاضر به موتورهای جست‌وجو متکی هستند تا تعدادی لینک را برگردانند و سپس عامل هر لینک را یکی‌یکی می‌خواند. این فرآیند کند است و اغلب الگوهای گسترده‌تر را که در هزاران سند پراکنده شده‌اند، نادیده می‌گیرد. این چالش در مقایسه‌ی عملکرد عامل‌های هوش مصنوعی در برابر موتورهای جست‌وجوی سنتی در پردازش الگوها به وضوح بررسی شده است. Scry این پارادایم را تغییر داده است و به عامل‌ها اجازه می‌دهد برنامه‌های دلخواه — به‌ویژه دستورات شبیه به SQL — را روی یک مجموعه عظیم از اسناد اینترنتی اجرا کنند.

به نقل از مستندات scry.io، این پلتفرم در حال حاضر (در ساعت ۱۶:۴۰ UTC اندازه‌گیری شده) دسترسی کوئری‌محور به حدود ۱۵۸,۷۲۷,۵۹۰,۶۵۷ سطر داده از ۴۳ منبع مختلف را فراهم کرده است. کل دارایی داده‌ای این سیستم حتی بزرگ‌تر است و به ۴۱۳,۳۲۵,۶۱۱,۲۲۶ سطر می‌رسد. نرخ جذب داده‌ها خیره‌کننده است: ۲۶.۲ میلیون سطر در دقیقه، که به این معناست که تنها در ۲۴ ساعت گذشته، بیش از ۳۷.۷ میلیارد سطر داده جدید وارد سیستم شده است.

این زیرساخت به عنوان یک زیرساخت با هدف منافع عمومی طراحی شده است؛ به این معنا که برای تحقیقات غیرتجاری یارانه‌ای است و در عین حال لایه‌های تجاری را برای ارزیابی‌های در مقیاس بزرگ ارائه می‌دهد. مأموریت Scry این است که برای نیروهای جامعه‌پسند، اجرای برنامه‌های «تخت‌زدایی از جهان» (world-unflattening) را آسان کند، جایی که هر نتیجه به طور دقیق به منبع اصلی خود قابل ردیابی باشد.

گنجینهٔ داده‌ای Scry

دارایی‌های Scry به چندین دسته با تراکم بالا تقسیم شده‌اند که آرشیو اجتماعی هسته مرکزی آن است. این بخش شامل یک آرشیو تاریخی تقریباً جامع از کامنت‌های Reddit (۲۷,۰۶۵,۴۲۶,۰۲۸ سطر) و پست‌های آن (۳,۷۴۵,۰۷۴,۴۴۵ سطر) از سال ۲۰۰۵ تا به امروز است که از طریق آینه Arctic Shift تامین شده است. همچنین آیتم‌های Hacker News از سال ۲۰۰۶ را پوشش می‌دهد و یک جریان زنده دارد که داده‌ها را در کمتر از ۱۵ دقیقه جذب می‌کند.

فراتر از Reddit و HN، دارایی‌های اجتماعی شامل پست‌های عمومی Bluesky (۲.۴ میلیارد سطر) و Mastodon (۱۵۷ میلیون سطر) است. همچنین یک مجموعه بدنه (Corpus) از تالارهای گفتگو شامل ۴۸ میلیون پست از هزاران سایت، از جمله LessWrong، انجمن EA، بردهای 4chan و انجمن‌های حاکمیت کریپتو را در بر می‌گیرد. در این تالارها، از site_key به عنوان شناسه جامعه استفاده می‌شود، زیرا بسیاری از سطرها برچسب عمومی source = 'manual' دارند.

برای پژوهش‌های آکادمیک و فنی، Scry یک لایه تخصصی دانش (Scholarship layer) با ۹.۳ میلیارد سطر ادغام کرده است. این لایه شامل گراف آثار OpenAlex با یال‌های استنادی، arXiv، PubMed، PMC و یک مجموعه متن کامل مجلات با کلید DOI است. این قابلیت به عامل‌ها اجازه می‌دهد تحلیل‌های استنادی پیچیده‌ای انجام دهند؛ مثلاً یافتن تمام مقالاتی که به طور هم‌زمان به دو اثر بنیادی خاص ارجاع داده‌اند.

سایر منابع کلیدی عبارت‌اند از:

  • Common Crawl: یک شاخص عظیم از کپچرهای وب (۴۵.۴ میلیارد سطر) و یک لایه «تقطیری» شامل ۶۴.۹ میلیون صفحه پاک‌سازی‌شده و بدون محتوای تکراری (boilerplate-free) که بر اساس مرکزیت گراف لینک‌ها انتخاب شده‌اند. لایه تقطیری به طور متوسط ۴.۳ کیلوبایت در هر صفحه است، در حالی که فایل‌های خام WET حدود ۸.۲ کیلوبایت هستند. سطر‌های Tier A شامل HTML خام، Tier B فقط متن و Tier C فقط منشأ داده هستند.
  • آرشیو کد: ۴۳.۹ میلیارد سطر داده کد، شامل رویدادهای آرشیو GitHub (۱۱.۱ میلیارد سطر)، بازبینی‌های Software Heritage (۵.۹ میلیارد سطر) و رجیستری‌های بسته‌ها (npm, PyPI, Go و غیره) از طریق Libraries.io. این بخش شامل گراف وابستگی deps.dev با ۲۵.۱ میلیارد یال بسته-به-بسته است.
  • داده‌های مالی و قانونی: پرونده‌های SEC EDGAR از سال ۱۹۹۳ به بعد (۲۳۴ میلیون سطر)، تراکنش‌های مالی کمپین‌های FEC (۴۳۴ میلیون سطر) و اسناد منتشر شده توسط وزارت دادگستری (DOJ) درباره اپستین. همچنین شامل اصطلاحات جست‌وجوی برتر و رو به رشد گوگل ترندز بر اساس شهرها و کشورهای آمریکا (۱.۰۴ میلیارد سطر) است.
  • بازارهای پیش‌بینی: یک کاتالوگ یکپارچه از ۲.۱ میلیارد سطر از Kalshi, Polymarket و Manifold، شامل جریان‌های معاملاتی و احتمالات بازار. این شامل ۵۸۶ میلیون اجرای Kalshi و ۳۰۵ میلیون معامله Polymarket است.
  • وب و نوشتار: ۶۷.۹ میلیارد سطر شامل لیست‌های پستی عمومی (مانند extropians و هسته لینوکس) با ۱.۶ میلیارد پیام، یک کاتالوگ کتابشناختی از OCLC/WorldCat و Google Books، و مجموعه کامل ۶.۲ میلیون صفحه ویکی‌پدیای انگلیسی (بارگذاری شده در مارس ۲۰۲۶). همچنین پست‌های Substack (۳۰.۷ میلیون) و کامنت‌های آن (۸۶.۹ میلیون) را شامل می‌شود.

مکانیزم فنی و ادغام با MCP

سرویس Scry به عنوان یک سرور MCP عمل می‌کند؛ یعنی روی دستگاه کاربر اجرا نمی‌شود، بلکه از طریق یک URL واحد به کلاینت‌هایی مثل Claude Desktop، ChatGPT (از طریق حالت Developer) یا Cursor متصل می‌شود: https://mcp.scry.io.

برای توسعه‌دهندگان، ادغام بسیار ساده است. Claude Code می‌تواند از طریق دستور claude mcp add --transport http scry https://mcp.scry.io متصل شود. این نوع ادغام با رویکرد عامل‌های Claude در مواجهه با ابزارهای سئو و GEO شباهت دارد، جایی که قابلیت‌های عامل برای پیمایش بهینه وب گسترش می‌یابد. عامل‌هایی که کلاینت MCP ندارند، می‌توانند از HTTP API با یک توکن Bearer استفاده کنند. سیستم یک مرجع اکتشاف زنده در مسیر /v1/scry/schema ارائه می‌دهد که دامنه مشاهده شده و میزان تأخیر (lag) هر رابطه را نشان می‌دهد.

عامل‌ها با خواندن این طرحواره (Schema) زنده با سیستم تعامل می‌کنند. سپس کوئری‌های محدودی برای تطبیق عبارات، بازه‌های زمانی یا Joinها می‌نویسند. برای جلوگیری از مصرف بیش از حد منابع محاسباتی، هر دستور فقط در حالت خواندنی (read-only) است و تحت یک ضرب‌الاجل زمانی سخت‌گیرانه، سقف حافظه و سقف تعداد سطرها عمل می‌کند. سیستم از WITH RECURSIVE برای پیمایش‌های پیچیده گراف پشتیبانی می‌کند؛ برای مثال، یک حلقه ۱۱۱ تکراری در تاریخ ۱۵ سپتامبر ۲۰۲۶ در حدود ۱۰۰ میلی‌ثانیه پاسخ داده است.

یکی از پیشرفته‌ترین قابلیت‌های این سیستم، برخورد با بردار معنایی (Embedding) — که مثل یک کارت معرفی عددی برای هر واژه است و می‌گوید این کلمه همسایه‌ی چه کلمات دیگری است — به عنوان مقادیر درجه اول است. برخلاف APIهای معمولی که Embeddingها را پنهان می‌کنند، Scry اجازه می‌دهد عامل‌ها عملیات ریاضی روی بردارها انجام دهند. یک عامل می‌تواند برای یک مفهوم (مثلاً @achievable در مقابل @unreachable) یک بردار بسازد، یکی را از دیگری تفریق کند تا یک محور تضاد ایجاد شود و سپس کل مجموعه داده را در راستای آن جهت رتبه‌بندی کند تا انحراف ایدئولوژیک را اندازه‌گیری نماید.

جزئیات پیاده‌سازی و بهینه‌سازی

برای تضمین دقت و سرعت، Scry مکانیزم‌های خاصی را به کار گرفته است:

  • فیلتر توکن: فیلترها با سرعت نایاب‌ترین توکن (Token) — تکه‌های کوچکی از متن شبیه برش‌های کیک — اجرا می‌شوند. گنجاندن یک شناسه متمایز یا یک کلمه غیرمعمول، از اسکن‌های ۳۰ تا ۶۰ ثانیه‌ای که مربوط به مجموعه‌های کلمات رایج است، جلوگیری می‌کند.
  • حالت Explain: با ارسال هدر x-scry-explain: 1 کاربران می‌توانند برنامه اجرا، تحلیل ایندکس و پیش‌بینی تعداد سطرها، بایت‌ها و حافظه را قبل از اجرای دستور مشاهده کنند. برای دستورات ANN (جست‌وجوی نزدیک‌ترین همسایه)، جست‌وجوی Lane در حین حالت explain اجرا می‌شود تا کاندیداهای بازرتبه‌بندی پیدا شوند.
  • بازرتبه‌بندی (Reranking): دستور x-scry-rerank به کاربران اجازه می‌دهد اسناد را بر اساس یک دستورالعمل خاص با استفاده از مدل‌های محلی و بدون هزینه مرتب کنند.
  • ردیابی تازگی: تازگی داده‌ها برای هر رابطه اعلام می‌شود. داده‌های Hacker News و LessWrong معمولاً در کمتر از ۱۵ دقیقه وارد می‌شوند. مقالات آکادمیک در لایه‌ها حرکت می‌کنند و academic.catalog زمانی پیش می‌رود که Fold ثبت شده آن دوباره اجرا شود.
  • ردیابی منشأ (Provenance): سیستم تفکیک دقیقی بین زمان منبع (source timestamp)، زمان مشاهده (observation time)، زمان بارگذاری (load time) و وضعیت پردازش قائل می‌شود تا بارگذاری اخیر داده‌ها با یک رویداد اخیر در منبع اشتباه گرفته نشود.
  • اکتشاف طرحواره: اکتشاف از طریق فراخوانی‌های SQL به scry.relations و scry.columns در دسترس است و به عامل‌ها اجازه می‌دهد کاتالوگ را فیلتر کرده یا Join کنند تا ستون‌های خاصی مانند author_id را بیابند.
  • دستور زبان جست‌وجو: اپراتور scry_lex از یک گرامر کامل شامل عبارات دقیق، استثنائات، Regex، تطبیق فازی و نزدیکی (مثلاً a NEAR/50 b) پشتیبانی می‌کند.

عملکرد و بنچمارک‌ها

در ۱۷ سپتامبر ۲۰۲۶، Scry داده‌های عملکردی منتشر کرد که نشان می‌دهد کوئری‌ها روی ده‌ها میلیارد سطر معمولاً بین ۱۰ میلی‌ثانیه تا چند ثانیه زمان می‌برند. هزینه هر کوئری بر اساس مقدار داده‌ای که باید لمس شود تعیین می‌شود. برای مثال، شمارش ۳۰.۶ میلیون پست حاوی یک توکن خاص تنها ۷ میلی‌ثانیه طول کشید، در حالی که واکشی بیست مورد از آن پست‌ها ۳۹ میلی‌ثانیه زمان برد.

سایر بنچمارک‌ها عبارت‌اند از:

  • توان عملیاتی (Throughput): خواندن هر بایت از متن‌های ذخیره شده Hacker News (۱۵.۵ میلیارد کاراکتر) با سرعت ۱۸ گیگابایت بر ثانیه در ۰.۸۶ ثانیه.
  • تأخیر (Latency): یک کوئری برای داده‌های Hacker News در ChatGPT، ۹۰ دقیقه قبل از پست انتشار رسمی، در ۲۹ میلی‌ثانیه پاسخ داده شد.
  • ثبات: در آزمونی با ۷۱ کوئری در ۸ محور مختلف (شامل توابع پنجره‌ای و فازی)، ۶۵ کوئری از ۷۱ مورد در کمتر از یک ثانیه پاسخ دادند. کندترین کوئری ۲.۶ ثانیه زمان برد.

در یک مقایسه مستقیم با استفاده از بنچمارک DeepSearchQA گوگل، عاملی که از Scry استفاده می‌کرد به ۷۱.۸٪ از ۹۰۰ سوال پژوهشی پاسخ کاملاً صحیح داد. این نتیجه از Gemini Deep Research Agent گوگل که نرخ موفقیت ۶۶.۱٪ را با همان مدل داور و دستور ارزیابی ثبت کرده بود، پیشی گرفت.

کاربردهای عملی

به دلیل اینکه Scry اجازه Joinها و تجمیع‌های (Aggregations) پیچیده را می‌دهد، کوئری‌هایی را ممکن می‌کند که در پلتفرم‌های اجتماعی استاندارد غیرممکن است. یک مثال ارائه شده توسط توسعه‌دهندگان، شناسایی «آلفای مدل‌های زبانی» (LLM alpha) است؛ این کار با جست‌وجوی توییت‌هایی با نسبت بالای بوک‌مارک به لایک از حساب‌هایی با کمتر از ۲۰ هزار دنبال‌کننده انجام می‌شود. این کوئری ۲۰۴ میلیون بازبینی را در ۴.۹ ثانیه خواند تا پست‌های با سیگنال بالا از حساب‌های کوچک را پیدا کند.

کاربرد دیگر، ردیابی سرعت روندهای فنی است. با کوئری زدن آیتم‌های Hacker News با استفاده از گرامر scry_lex، کاربران می‌توانند ظهور اصطلاحاتی مانند "vibe coding" را دقیقاً ترسیم کنند؛ به طوری که جهش از صفر اشاره در ژانویه ۲۰۲۵ به ۳۴ مورد در فوریه، ۴۹۴ مورد در مارس و ۵۹۰ مورد در آوریل ۲۰۲۵ مشاهده شد.

سایر موارد استفاده عبارت‌اند از:

  • تحلیل شبکه‌ای: یافتن اشتراک دنبال‌کنندگان بین ایلان ماسک، سام آلتمن و الیزر یودکوفسکی در ۱۷۱ میلی‌ثانیه روی ۲.۹ میلیون سطر. نتیجه نشان داد که ویتالیک بوتیرین و جی‌دی ونس در صدر این لیست هستند.
  • سنتز آکادمیک: شناسایی مقالاتی که هم‌زمان به "Scaling Laws" و "Chinchilla" ارجاع داده‌اند در ۰.۱ ثانیه بر روی اسنپ‌شات ۲۶ ژوئن ۲۰۲۶ از OpenAlex. این جست‌وجو ۱۹۵ ارجاع مشترک را شناسایی کرد.
  • نقشه‌برداری تضادها: استفاده از self-join روی parent_hn_id برای شناسایی «دعواها» در Hacker News، جایی که دو کاربر حداقل سه بار به یکدیگر پاسخ داده‌اند. یکی از این کوئری‌ها ۴۶.۷ میلیون سطر را در ۱.۶ ثانیه خواند.
  • هوش بازار: تحلیل شرط‌بندی‌های Manifold برای دیدن اینکه پیش‌بینان درباره چه چیزی نظرشان تغییر کرده است؛ مثلاً بازاری درباره تلاش برای ترور مدیرعامل یک آزمایشگاه AI که احتمال آن از ۳۰٪ به ۹۹٪ در میان ۶۹ پیش‌بین تغییر کرد.

تحلیل: تغییر به سمت پژوهش برنامه‌نویسی‌شده

این تحول نشان‌دهنده یک تغییر بنیادین در نحوه مصرف وب توسط عامل‌های هوش مصنوعی است. ما در حال حرکت از مدل «جست‌وجو و خواندن» (Search and Read) به سمت مدل «کوئری و محاسبه» (Query and Compute) هستیم. وقتی یک عامل می‌تواند با اینترنت مانند یک پایگاه‌داده رفتار کند، دیگر یک کتابدار نیست، بلکه به یک دانشمند داده تبدیل می‌شود.

برای کاربر نهایی، این بدان معناست که مشکل «توهم» (Hallucination) در پژوهش‌ها از طریق منشأ قابل ردیابی کاهش می‌یابد. هر نتیجه در Scry به شناسه بومی منبع خود لینک شده است. سیستم صراحتاً بین زمان منبع، زمان مشاهده و زمان بارگذاری تمایز می‌گذارد تا یکپارچگی داده‌ها تضمین شود.

اثر مرتبه دوم این فناوری احتمالاً موجی از جامعه‌شناسی خودکار و هوش بازار با دقت بالا خواهد بود، زیرا عامل‌ها اکنون می‌توانند تغییرات ظریف در گفتمان عمومی را در میلیون‌ها سند به صورت آنی تشخیص دهند. چه اندازه‌گیری انحراف تئوری‌های هم‌سویی (Alignment) در LessWrong باشد و چه ردیابی احتمال لحظه‌ای رویدادهای جهانی، سوابق عمومی اکنون به یک دارایی برنامه‌نویسی‌پذیر تبدیل شده‌اند.

برای شروع استفاده از این ابزار، توسعه‌دهندگان می‌توانند سرور MCP را به کلاینت مورد علاقه خود اضافه کنند یا از HTTP API برای محیط‌های بدون رابط کاربری استفاده کنند. شما می‌توانید طرحواره زنده را در https://api.scry.io/v1/scry/schema بررسی کنید تا ببینید کدام منابع در حال حاضر برای گردش‌کار عامل شما در دسترس هستند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف وابستگی به اسکرپینگ‌های کند، سرعت پژوهش‌های خودکار را هزاران برابر می‌کند. اعتبار نتایج به دلیل اتصال مستقیم هر داده به شناسه منبع (Provenance)، اعتماد به خروجی‌های عامل‌های پژوهشی را افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به این سرویس برای توسعه‌دهندگان ایرانی دشوار است، اما مدل پیاده‌سازی آن برای ساخت پایگاه‌های داده برداری محلی الگوبرداری می‌کند.

·نگاه ما
تحریریه دات‌هوش

انتقال از مدل «جست‌وجو و خواندن» به «کوئری و محاسبه»، نقش عامل‌های هوش مصنوعی را از یک کتابدار به یک دانشمند داده تغییر می‌دهد. این قابلیت به عامل‌ها اجازه می‌دهد الگوهای کلان را در مقیاس میلیاردها سطر شناسایی کنند، کاری که پیش از این نیازمند تیم‌های مهندسی داده و هفته‌ها زمان بود. در واقع، وب اکنون به یک دارایی برنامه‌ریزی‌پذیر تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.