تصور کنید به جای اینکه یک عامل هوش مصنوعی برای یافتن یک الگو، صدها صفحه وب را یکییکی بخواند، بتواند در چند میلیثانیه روی میلیاردها سطر دادهٔ اینترنت جستوجو کند. این دقیقاً همان چیزی است که Scry با معرفی سرور پروتکل زمینهٔ مدل (Model Context Protocol یا MCP) — که شبیه به یک مترجم استاندارد است و اجازه میدهد مدلهای مختلف بدون تغییر در زبان، با ابزارهای مختلف حرف بزنند — به دست آورده است. Scry به عاملهای موجود در ChatGPT، Claude و Cursor اجازه میدهد تا وب عمومی را به جای مجموعهای از صفحات پراکنده، به عنوان یک پایگاهداده ساختاریافته و قابل کوئری زدن در نظر بگیرند.
اکثر عاملهای هوش مصنوعی در حال حاضر به موتورهای جستوجو متکی هستند تا تعدادی لینک را برگردانند و سپس عامل هر لینک را یکییکی میخواند. این فرآیند کند است و اغلب الگوهای گستردهتر را که در هزاران سند پراکنده شدهاند، نادیده میگیرد. این چالش در مقایسهی عملکرد عاملهای هوش مصنوعی در برابر موتورهای جستوجوی سنتی در پردازش الگوها به وضوح بررسی شده است. Scry این پارادایم را تغییر داده است و به عاملها اجازه میدهد برنامههای دلخواه — بهویژه دستورات شبیه به SQL — را روی یک مجموعه عظیم از اسناد اینترنتی اجرا کنند.
به نقل از مستندات scry.io، این پلتفرم در حال حاضر (در ساعت ۱۶:۴۰ UTC اندازهگیری شده) دسترسی کوئریمحور به حدود ۱۵۸,۷۲۷,۵۹۰,۶۵۷ سطر داده از ۴۳ منبع مختلف را فراهم کرده است. کل دارایی دادهای این سیستم حتی بزرگتر است و به ۴۱۳,۳۲۵,۶۱۱,۲۲۶ سطر میرسد. نرخ جذب دادهها خیرهکننده است: ۲۶.۲ میلیون سطر در دقیقه، که به این معناست که تنها در ۲۴ ساعت گذشته، بیش از ۳۷.۷ میلیارد سطر داده جدید وارد سیستم شده است.
این زیرساخت به عنوان یک زیرساخت با هدف منافع عمومی طراحی شده است؛ به این معنا که برای تحقیقات غیرتجاری یارانهای است و در عین حال لایههای تجاری را برای ارزیابیهای در مقیاس بزرگ ارائه میدهد. مأموریت Scry این است که برای نیروهای جامعهپسند، اجرای برنامههای «تختزدایی از جهان» (world-unflattening) را آسان کند، جایی که هر نتیجه به طور دقیق به منبع اصلی خود قابل ردیابی باشد.
گنجینهٔ دادهای Scry
داراییهای Scry به چندین دسته با تراکم بالا تقسیم شدهاند که آرشیو اجتماعی هسته مرکزی آن است. این بخش شامل یک آرشیو تاریخی تقریباً جامع از کامنتهای Reddit (۲۷,۰۶۵,۴۲۶,۰۲۸ سطر) و پستهای آن (۳,۷۴۵,۰۷۴,۴۴۵ سطر) از سال ۲۰۰۵ تا به امروز است که از طریق آینه Arctic Shift تامین شده است. همچنین آیتمهای Hacker News از سال ۲۰۰۶ را پوشش میدهد و یک جریان زنده دارد که دادهها را در کمتر از ۱۵ دقیقه جذب میکند.
فراتر از Reddit و HN، داراییهای اجتماعی شامل پستهای عمومی Bluesky (۲.۴ میلیارد سطر) و Mastodon (۱۵۷ میلیون سطر) است. همچنین یک مجموعه بدنه (Corpus) از تالارهای گفتگو شامل ۴۸ میلیون پست از هزاران سایت، از جمله LessWrong، انجمن EA، بردهای 4chan و انجمنهای حاکمیت کریپتو را در بر میگیرد. در این تالارها، از site_key به عنوان شناسه جامعه استفاده میشود، زیرا بسیاری از سطرها برچسب عمومی source = 'manual' دارند.
برای پژوهشهای آکادمیک و فنی، Scry یک لایه تخصصی دانش (Scholarship layer) با ۹.۳ میلیارد سطر ادغام کرده است. این لایه شامل گراف آثار OpenAlex با یالهای استنادی، arXiv، PubMed، PMC و یک مجموعه متن کامل مجلات با کلید DOI است. این قابلیت به عاملها اجازه میدهد تحلیلهای استنادی پیچیدهای انجام دهند؛ مثلاً یافتن تمام مقالاتی که به طور همزمان به دو اثر بنیادی خاص ارجاع دادهاند.
سایر منابع کلیدی عبارتاند از:
- Common Crawl: یک شاخص عظیم از کپچرهای وب (۴۵.۴ میلیارد سطر) و یک لایه «تقطیری» شامل ۶۴.۹ میلیون صفحه پاکسازیشده و بدون محتوای تکراری (boilerplate-free) که بر اساس مرکزیت گراف لینکها انتخاب شدهاند. لایه تقطیری به طور متوسط ۴.۳ کیلوبایت در هر صفحه است، در حالی که فایلهای خام WET حدود ۸.۲ کیلوبایت هستند. سطرهای Tier A شامل HTML خام، Tier B فقط متن و Tier C فقط منشأ داده هستند.
- آرشیو کد: ۴۳.۹ میلیارد سطر داده کد، شامل رویدادهای آرشیو GitHub (۱۱.۱ میلیارد سطر)، بازبینیهای Software Heritage (۵.۹ میلیارد سطر) و رجیستریهای بستهها (npm, PyPI, Go و غیره) از طریق Libraries.io. این بخش شامل گراف وابستگی deps.dev با ۲۵.۱ میلیارد یال بسته-به-بسته است.
- دادههای مالی و قانونی: پروندههای SEC EDGAR از سال ۱۹۹۳ به بعد (۲۳۴ میلیون سطر)، تراکنشهای مالی کمپینهای FEC (۴۳۴ میلیون سطر) و اسناد منتشر شده توسط وزارت دادگستری (DOJ) درباره اپستین. همچنین شامل اصطلاحات جستوجوی برتر و رو به رشد گوگل ترندز بر اساس شهرها و کشورهای آمریکا (۱.۰۴ میلیارد سطر) است.
- بازارهای پیشبینی: یک کاتالوگ یکپارچه از ۲.۱ میلیارد سطر از Kalshi, Polymarket و Manifold، شامل جریانهای معاملاتی و احتمالات بازار. این شامل ۵۸۶ میلیون اجرای Kalshi و ۳۰۵ میلیون معامله Polymarket است.
- وب و نوشتار: ۶۷.۹ میلیارد سطر شامل لیستهای پستی عمومی (مانند extropians و هسته لینوکس) با ۱.۶ میلیارد پیام، یک کاتالوگ کتابشناختی از OCLC/WorldCat و Google Books، و مجموعه کامل ۶.۲ میلیون صفحه ویکیپدیای انگلیسی (بارگذاری شده در مارس ۲۰۲۶). همچنین پستهای Substack (۳۰.۷ میلیون) و کامنتهای آن (۸۶.۹ میلیون) را شامل میشود.
مکانیزم فنی و ادغام با MCP
سرویس Scry به عنوان یک سرور MCP عمل میکند؛ یعنی روی دستگاه کاربر اجرا نمیشود، بلکه از طریق یک URL واحد به کلاینتهایی مثل Claude Desktop، ChatGPT (از طریق حالت Developer) یا Cursor متصل میشود: https://mcp.scry.io.
برای توسعهدهندگان، ادغام بسیار ساده است. Claude Code میتواند از طریق دستور claude mcp add --transport http scry https://mcp.scry.io متصل شود. این نوع ادغام با رویکرد عاملهای Claude در مواجهه با ابزارهای سئو و GEO شباهت دارد، جایی که قابلیتهای عامل برای پیمایش بهینه وب گسترش مییابد. عاملهایی که کلاینت MCP ندارند، میتوانند از HTTP API با یک توکن Bearer استفاده کنند. سیستم یک مرجع اکتشاف زنده در مسیر /v1/scry/schema ارائه میدهد که دامنه مشاهده شده و میزان تأخیر (lag) هر رابطه را نشان میدهد.
عاملها با خواندن این طرحواره (Schema) زنده با سیستم تعامل میکنند. سپس کوئریهای محدودی برای تطبیق عبارات، بازههای زمانی یا Joinها مینویسند. برای جلوگیری از مصرف بیش از حد منابع محاسباتی، هر دستور فقط در حالت خواندنی (read-only) است و تحت یک ضربالاجل زمانی سختگیرانه، سقف حافظه و سقف تعداد سطرها عمل میکند. سیستم از WITH RECURSIVE برای پیمایشهای پیچیده گراف پشتیبانی میکند؛ برای مثال، یک حلقه ۱۱۱ تکراری در تاریخ ۱۵ سپتامبر ۲۰۲۶ در حدود ۱۰۰ میلیثانیه پاسخ داده است.
یکی از پیشرفتهترین قابلیتهای این سیستم، برخورد با بردار معنایی (Embedding) — که مثل یک کارت معرفی عددی برای هر واژه است و میگوید این کلمه همسایهی چه کلمات دیگری است — به عنوان مقادیر درجه اول است. برخلاف APIهای معمولی که Embeddingها را پنهان میکنند، Scry اجازه میدهد عاملها عملیات ریاضی روی بردارها انجام دهند. یک عامل میتواند برای یک مفهوم (مثلاً @achievable در مقابل @unreachable) یک بردار بسازد، یکی را از دیگری تفریق کند تا یک محور تضاد ایجاد شود و سپس کل مجموعه داده را در راستای آن جهت رتبهبندی کند تا انحراف ایدئولوژیک را اندازهگیری نماید.
جزئیات پیادهسازی و بهینهسازی
برای تضمین دقت و سرعت، Scry مکانیزمهای خاصی را به کار گرفته است:
- فیلتر توکن: فیلترها با سرعت نایابترین توکن (Token) — تکههای کوچکی از متن شبیه برشهای کیک — اجرا میشوند. گنجاندن یک شناسه متمایز یا یک کلمه غیرمعمول، از اسکنهای ۳۰ تا ۶۰ ثانیهای که مربوط به مجموعههای کلمات رایج است، جلوگیری میکند.
- حالت Explain: با ارسال هدر
x-scry-explain: 1کاربران میتوانند برنامه اجرا، تحلیل ایندکس و پیشبینی تعداد سطرها، بایتها و حافظه را قبل از اجرای دستور مشاهده کنند. برای دستورات ANN (جستوجوی نزدیکترین همسایه)، جستوجوی Lane در حین حالت explain اجرا میشود تا کاندیداهای بازرتبهبندی پیدا شوند. - بازرتبهبندی (Reranking): دستور
x-scry-rerankبه کاربران اجازه میدهد اسناد را بر اساس یک دستورالعمل خاص با استفاده از مدلهای محلی و بدون هزینه مرتب کنند. - ردیابی تازگی: تازگی دادهها برای هر رابطه اعلام میشود. دادههای Hacker News و LessWrong معمولاً در کمتر از ۱۵ دقیقه وارد میشوند. مقالات آکادمیک در لایهها حرکت میکنند و
academic.catalogزمانی پیش میرود که Fold ثبت شده آن دوباره اجرا شود. - ردیابی منشأ (Provenance): سیستم تفکیک دقیقی بین زمان منبع (source timestamp)، زمان مشاهده (observation time)، زمان بارگذاری (load time) و وضعیت پردازش قائل میشود تا بارگذاری اخیر دادهها با یک رویداد اخیر در منبع اشتباه گرفته نشود.
- اکتشاف طرحواره: اکتشاف از طریق فراخوانیهای SQL به
scry.relationsوscry.columnsدر دسترس است و به عاملها اجازه میدهد کاتالوگ را فیلتر کرده یا Join کنند تا ستونهای خاصی مانندauthor_idرا بیابند. - دستور زبان جستوجو: اپراتور
scry_lexاز یک گرامر کامل شامل عبارات دقیق، استثنائات، Regex، تطبیق فازی و نزدیکی (مثلاًa NEAR/50 b) پشتیبانی میکند.
عملکرد و بنچمارکها
در ۱۷ سپتامبر ۲۰۲۶، Scry دادههای عملکردی منتشر کرد که نشان میدهد کوئریها روی دهها میلیارد سطر معمولاً بین ۱۰ میلیثانیه تا چند ثانیه زمان میبرند. هزینه هر کوئری بر اساس مقدار دادهای که باید لمس شود تعیین میشود. برای مثال، شمارش ۳۰.۶ میلیون پست حاوی یک توکن خاص تنها ۷ میلیثانیه طول کشید، در حالی که واکشی بیست مورد از آن پستها ۳۹ میلیثانیه زمان برد.
سایر بنچمارکها عبارتاند از:
- توان عملیاتی (Throughput): خواندن هر بایت از متنهای ذخیره شده Hacker News (۱۵.۵ میلیارد کاراکتر) با سرعت ۱۸ گیگابایت بر ثانیه در ۰.۸۶ ثانیه.
- تأخیر (Latency): یک کوئری برای دادههای Hacker News در ChatGPT، ۹۰ دقیقه قبل از پست انتشار رسمی، در ۲۹ میلیثانیه پاسخ داده شد.
- ثبات: در آزمونی با ۷۱ کوئری در ۸ محور مختلف (شامل توابع پنجرهای و فازی)، ۶۵ کوئری از ۷۱ مورد در کمتر از یک ثانیه پاسخ دادند. کندترین کوئری ۲.۶ ثانیه زمان برد.
در یک مقایسه مستقیم با استفاده از بنچمارک DeepSearchQA گوگل، عاملی که از Scry استفاده میکرد به ۷۱.۸٪ از ۹۰۰ سوال پژوهشی پاسخ کاملاً صحیح داد. این نتیجه از Gemini Deep Research Agent گوگل که نرخ موفقیت ۶۶.۱٪ را با همان مدل داور و دستور ارزیابی ثبت کرده بود، پیشی گرفت.
کاربردهای عملی
به دلیل اینکه Scry اجازه Joinها و تجمیعهای (Aggregations) پیچیده را میدهد، کوئریهایی را ممکن میکند که در پلتفرمهای اجتماعی استاندارد غیرممکن است. یک مثال ارائه شده توسط توسعهدهندگان، شناسایی «آلفای مدلهای زبانی» (LLM alpha) است؛ این کار با جستوجوی توییتهایی با نسبت بالای بوکمارک به لایک از حسابهایی با کمتر از ۲۰ هزار دنبالکننده انجام میشود. این کوئری ۲۰۴ میلیون بازبینی را در ۴.۹ ثانیه خواند تا پستهای با سیگنال بالا از حسابهای کوچک را پیدا کند.
کاربرد دیگر، ردیابی سرعت روندهای فنی است. با کوئری زدن آیتمهای Hacker News با استفاده از گرامر scry_lex، کاربران میتوانند ظهور اصطلاحاتی مانند "vibe coding" را دقیقاً ترسیم کنند؛ به طوری که جهش از صفر اشاره در ژانویه ۲۰۲۵ به ۳۴ مورد در فوریه، ۴۹۴ مورد در مارس و ۵۹۰ مورد در آوریل ۲۰۲۵ مشاهده شد.
سایر موارد استفاده عبارتاند از:
- تحلیل شبکهای: یافتن اشتراک دنبالکنندگان بین ایلان ماسک، سام آلتمن و الیزر یودکوفسکی در ۱۷۱ میلیثانیه روی ۲.۹ میلیون سطر. نتیجه نشان داد که ویتالیک بوتیرین و جیدی ونس در صدر این لیست هستند.
- سنتز آکادمیک: شناسایی مقالاتی که همزمان به "Scaling Laws" و "Chinchilla" ارجاع دادهاند در ۰.۱ ثانیه بر روی اسنپشات ۲۶ ژوئن ۲۰۲۶ از OpenAlex. این جستوجو ۱۹۵ ارجاع مشترک را شناسایی کرد.
- نقشهبرداری تضادها: استفاده از self-join روی
parent_hn_idبرای شناسایی «دعواها» در Hacker News، جایی که دو کاربر حداقل سه بار به یکدیگر پاسخ دادهاند. یکی از این کوئریها ۴۶.۷ میلیون سطر را در ۱.۶ ثانیه خواند. - هوش بازار: تحلیل شرطبندیهای Manifold برای دیدن اینکه پیشبینان درباره چه چیزی نظرشان تغییر کرده است؛ مثلاً بازاری درباره تلاش برای ترور مدیرعامل یک آزمایشگاه AI که احتمال آن از ۳۰٪ به ۹۹٪ در میان ۶۹ پیشبین تغییر کرد.
تحلیل: تغییر به سمت پژوهش برنامهنویسیشده
این تحول نشاندهنده یک تغییر بنیادین در نحوه مصرف وب توسط عاملهای هوش مصنوعی است. ما در حال حرکت از مدل «جستوجو و خواندن» (Search and Read) به سمت مدل «کوئری و محاسبه» (Query and Compute) هستیم. وقتی یک عامل میتواند با اینترنت مانند یک پایگاهداده رفتار کند، دیگر یک کتابدار نیست، بلکه به یک دانشمند داده تبدیل میشود.
برای کاربر نهایی، این بدان معناست که مشکل «توهم» (Hallucination) در پژوهشها از طریق منشأ قابل ردیابی کاهش مییابد. هر نتیجه در Scry به شناسه بومی منبع خود لینک شده است. سیستم صراحتاً بین زمان منبع، زمان مشاهده و زمان بارگذاری تمایز میگذارد تا یکپارچگی دادهها تضمین شود.
اثر مرتبه دوم این فناوری احتمالاً موجی از جامعهشناسی خودکار و هوش بازار با دقت بالا خواهد بود، زیرا عاملها اکنون میتوانند تغییرات ظریف در گفتمان عمومی را در میلیونها سند به صورت آنی تشخیص دهند. چه اندازهگیری انحراف تئوریهای همسویی (Alignment) در LessWrong باشد و چه ردیابی احتمال لحظهای رویدادهای جهانی، سوابق عمومی اکنون به یک دارایی برنامهنویسیپذیر تبدیل شدهاند.
برای شروع استفاده از این ابزار، توسعهدهندگان میتوانند سرور MCP را به کلاینت مورد علاقه خود اضافه کنند یا از HTTP API برای محیطهای بدون رابط کاربری استفاده کنند. شما میتوانید طرحواره زنده را در https://api.scry.io/v1/scry/schema بررسی کنید تا ببینید کدام منابع در حال حاضر برای گردشکار عامل شما در دسترس هستند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو