پرش به محتوای اصلی
پرش به محتوای مقاله

Common Crawl: دسترسی به داده‌های وب بدون دانلود کامل

·۲۶ شهریور ۱۴۰۵۵ دقیقه مطالعه
راهنما
شروع کار با داده‌های Common Crawl در Hugging Face
شروع کار با داده‌های Common Crawl در Hugging Face
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر مدل دسترسی از «دانلود و پردازش» به «اتصال محلی و کوئری مستقیم» روی داده‌های وب در مقیاس پتابایت؛ Common Crawl عملاً وب را به یک پایگاه‌داده مدیریت‌شده تبدیل کرد.

دسترسی به پتابایت‌ها داده‌های وب برای یک توسعه‌دهنده معمولی، حالا بسیار ساده‌تر از همیشه شده است. Common Crawl آرشیوهای خود را روی Storage Buckets پلتفرم Hugging Face (HF) آینه کرد تا وابستگی سنتی خود به AWS S3 را کاهش داده و با اکوسیستم گسترده‌تر HF ادغام شود.

این تغییر در حالی رخ می‌دهد که تقاضا برای داده‌های آموزشی باکیفیت و در مقیاس بزرگ برای مدل‌های زبانی بزرگ (LLM) — که شبیه کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — به اوج خود رسیده است. اگرچه داده‌های وب در مقیاس وسیع همیشه در دسترس بوده‌اند، اما اصطکاک و پیچیدگی‌های مدیریت باکت‌های S3 اغلب سدی برای تیم‌های کوچک پژوهشی بود. با تکیه بر پوشش قبلی ما درباره‌ی ریسک‌های امنیتی در اکوسیستم HF — مانند حادثه مه ۲۰۲۶ که در آن عوامل OpenAI از حساب‌های به خطر افتاده استفاده کردند — این حرکت جایگاه Hugging Face را به عنوان زیرساخت مرکزی، هم برای وزن‌های مدل و هم برای داده‌های خام ورودی که تغذیه کننده این مدل‌ها هستند، تثبیت می‌کند.

مکانیزم‌های جدید دسترسی

به نقل از پست وبلاگی در ۱۶ سپتامبر ۲۰۲۶ در سایت commoncrawl.org، آرشیوهای مربوط به ماه‌های آوریل، مه و ژوئن ۲۰۲۶ اکنون در Storage Buckets پلتفرم HF در دسترس هستند. این آینه‌ها از همان ساختار دایرکتوری S3 استفاده می‌کنند، برای مثال مسیرهایی مانند crawl-data/CC-MAIN-2026-17/ در این سیستم قابل مشاهده است.

این Storage Buckets ذخیره‌سازی شیء (Object Storage) مشابه S3 را روی هاب Hugging Face فراهم می‌کنند. برای افزایش توان عملیاتی خواندن (Read Throughput)، قابلیت CDN pre-warming در چندین منطقه فعال شده است که به‌ویژه زمانی که منابع محاسباتی در نزدیکی این مناطق اجرا می‌شوند، بسیار مفید است. کاربران اکنون از سه مسیر جدید می‌توانند با داده‌ها تعامل کنند:

  • HF CLI: توسعه‌دهندگان می‌توانند با استفاده از دستورات hf buckets list برای لیست کردن فایل‌ها یا hf buckets cp برای کپی کردن داده‌ها از مسیر hf://buckets/commoncrawl/commoncrawl/ به یک مسیر محلی، فایل‌های خاصی را دانلود کنند.
  • اتصال محلی (Local Mounting): با استفاده از ابزار hf-mount می‌توان این باکت را مانند یک سیستم فایل محلی (مثلاً در مسیر /mnt/commoncrawl) متصل کرد. این قابلیت به ابزارها اجازه می‌دهد فایل‌ها را در لحظه خواندن (on-read) فراخوانی کنند و دیگر نیازی به دانلود آرشیوهای غول‌آسا پیش از پردازش نیست.
  • سازگاری با S3: خط لوله‌های (Pipelines) موجود می‌توانند به‌سادگی APIهای سازگار با S3 خود را به درگاه (Gateway) Hugging Face متصل کنند تا بدون نیاز به بازنویسی کد، منبع داده‌های خود را تغییر دهند.

پردازش بهینه فایل‌های WARC

خواندن فایل‌های WARC (Web ARChive) اکنون با زبان پایتون سازگارتر (Pythonic) شده است. Hugging Face دسترسی به این باکت‌ها را از طریق پروتکل hf:// فراهم کرده که به عنوان یک رابط فایل سازگار با fsspec عمل می‌کند.

ابزار warcio به‌طور کامل از fsspec پشتیبانی می‌کند. با نصب بسته huggingface_hub و وابستگی‌های اختیاری warcio توسعه‌دهندگان می‌توانند رکوردها را مستقیماً از هاب استریم کنند. این یعنی پیمایش در پاسخ‌های وب و متاداده‌ها بدون اشغال فضای ذخیره‌سازی محلی ممکن است. برای مثال، یک اسکریپت می‌تواند فایلی خاص از بخش CC-MAIN-2026-17 را باز کرده و مقدار WARC-Target-URI را برای رکوردهای پاسخ چاپ کند.

توسعه‌دهندگان همچنین می‌توانند از CLI ابزار warcio مستقیماً برای خواندن از باکت HF استفاده کنند. با استفاده از دستور index و فلگ‌های خاص برای offset، content-type و target-URI، استخراج متاداده‌ها بدون دانلود کامل فایل امکان‌پذیر است؛ هرچند باید توجه داشت که استفاده از دستور head -n 10 ممکن است پس از رسیدن به حد مجاز، منجر به خطای broken pipe شود.

ایندکس‌گذاری سریع با DuckDB

یکی از مهم‌ترین اضافات، در دسترس بودن URL Index (که پیش‌تر با نام Columnar Index شناخته می‌شد) در قالب Apache Parquet روی باکت HF است. این ایندکس، فایل‌های WARC و URLها را در مجموعه داده Common Crawl در قالبی ستونی قرار می‌دهد که برای کوئری‌های تحلیلی یا استخراج‌های حجیم بسیار بهینه است.

با استفاده از DuckDB، کاربران می‌توانند کوئری‌های SQL را مستقیماً روی فایل‌های Parquet راه دور اجرا کنند، بدون اینکه کل مجموعه داده را دانلود کنند. اسکیمای این ایندکس شامل فیلدهای دقیقی است، از جمله:

  • url_surtkey و url
  • url_host_name و url_host_tld
  • تفکیک دقیق میزبان: از url_host_2nd_last_part تا url_host_5th_last_part
  • url_host_registry_suffix ، url_host_registered_domain و url_host_private_suffix

به عنوان مثال، یک توسعه‌دهنده می‌تواند با استفاده از کلاینت پایتون DuckDB، افزونه httpfs را نصب کرده و ایندکس را از طریق HTTP کوئری کند. با استفاده از hffs.glob برای یافتن فایل‌های ایندکس (مانند part-00000-*.parquet)، می‌توان تعداد صفحات هر دامنه را در یک TLD خاص محاسبه کرد. یک کوئری برای دامنه .ru (روسیه) نشان می‌دهد که سایت‌هایی مثل yandex.ru با ۱۶۶,۳۸۱ رکورد، zr.ru با ۲۸,۰۶۷ رکورد و zin.ru با ۲۳,۹۶۸ رکورد در صدر هستند.

بنچمارک‌های عملکرد

Common Crawl تست‌های اولیه‌ای را روی سرعت دانلود رکوردهای تکی انجام داده است. این ارزیابی شامل ارسال تعداد زیادی درخواست‌های Range کوچک برای دریافت URLهای صفحه اصلی با استفاده از CDX Toolkit در ترکیب‌های مختلف کلاینت-سرور بود.

نتایج نشان‌دهنده یک موازنه (Trade-off) عملکردی بسته به محیط اجرا است:

  • S3 به S3 (منطقه us-east-1): بیشترین سرعت با ۳,۵۰۰ رکورد در ثانیه.
  • HF به HF: تا ۱,۵۰۰ رکورد در ثانیه.
  • HF به کلاینت لبه (Edge Client): به‌شدت کندتر (کمتر از ۱۰۰ رکورد در ثانیه) به دلیل محدودیت‌های نرخ درخواست (Rate Limiting) و ماهیت درخواست‌های Range کوچک.

این داده‌ها نشان می‌دهد که اگرچه HF در دسترس‌تر است، اما برای کارهای سنگین محاسباتی، پردازش باید در محیط ابری HF انجام شود تا توان عملیاتی (Throughput) به حداکثر برسد. Common Crawl اشاره می‌کند که این‌ها یافته‌های اولیه هستند و توصیه می‌کند کاربران پیش از شروع انتقال‌های حجیم، اندازه‌گیری‌های خود را انجام دهند.

برای کسانی که قصد پیاده‌سازی این جریان‌های کاری را دارند، Common Crawl مجموعه‌ای از نوت‌بوک‌های آماده Jupyter را در مخزن cc-notebooks گیت‌هاب منتشر کرده است. این مجموعه شامل cc-index-hf.ipynb برای کوئری ایندکس، 3-hf.ipynb برای درگاه سازگار با S3 و warcio-hf.ipynb برای خواندن فایل‌های WARC است.

این ادغام، گلوگاه هوش مصنوعی در مقیاس وب را از «چگونه داده را به دست آورم» به «چگونه آن را فیلتر کنم» تغییر می‌دهد. Common Crawl با فراهم کردن یک سیستم فایل قابل اتصال و ایندکس قابل کوئری، وب آزاد را عملاً به یک مجموعه داده مدیریت‌شده تبدیل کرده است. این موضوع سد ورود پژوهشگران مستقل را برای به چالش کشیدن انحصار داده‌های غول‌های فناوری می‌شکند.

توسعه‌دهندگان اکنون باید بررسی کنند که آیا خط لوله‌های S3 فعلی آن‌ها می‌تواند به HF منتقل شود تا از مزایای CDN pre-warming در مناطق مختلف برای بهبود سرعت خواندن برای کلاسترهای محاسباتی نزدیک بهره‌مند شوند.

گام بعدی شما

  • اگر روی مجموعه‌داده‌های وب کار می‌کنید، نوت‌بوک‌های cc-notebooks را برای تست کوئری‌های DuckDB بررسی کنید.
  • برای کاهش هزینه‌های ذخیره‌سازی محلی، از hf-mount برای دسترسی مستقیم به آرشیوها استفاده کنید.
  • در صورت استفاده از کلاسترهای محاسباتی، منطقه (Region) اجرای کد خود را با نزدیک‌ترین CDN پلتفرم HF تطبیق دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ادغام با تکیه بر اعتبار زیرساختی Hugging Face، دموکراتیزه کردن دسترسی به داده‌های وب را تسریع می‌کند. اکنون تیم‌های کوچک می‌توانند بدون سرمایه‌گذاری روی زیرساخت‌های ذخیره‌سازی ابری گران‌قیمت، مدل‌های خود را روی داده‌های واقعی وب آموزش دهند.

تأثیر برای ایران

این ابزار برای پژوهشگران ایرانی که با محدودیت‌های پرداخت در AWS S3 مواجه‌اند، مسیری جایگزین و راحت‌تر برای دسترسی به داده‌های عظیم وب فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این حرکت Common Crawl نشان می‌دهد که مدل‌های زبانی دیگر به دنبال «بیشتر» بودن داده‌ها نیستند، بلکه به دنبال «دسترسی سریع‌تر» به داده‌های موجود برای فیلتراسیون دقیق‌ترند. تبدیل وب به یک دیتابیس قابل کوئری با DuckDB، یعنی پایان عصر دانلودهای حجیم و شروع عصر استخراج هدفمند داده. این تغییر، قدرت را از کسانی که فضای ذخیره‌سازی عظیمی دارند به کسانی منتقل می‌کند که مهارت کوئری‌نویسی و فیلتراسیون بهتری دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.