دسترسی به پتابایتها دادههای وب برای یک توسعهدهنده معمولی، حالا بسیار سادهتر از همیشه شده است. Common Crawl آرشیوهای خود را روی Storage Buckets پلتفرم Hugging Face (HF) آینه کرد تا وابستگی سنتی خود به AWS S3 را کاهش داده و با اکوسیستم گستردهتر HF ادغام شود.
این تغییر در حالی رخ میدهد که تقاضا برای دادههای آموزشی باکیفیت و در مقیاس بزرگ برای مدلهای زبانی بزرگ (LLM) — که شبیه کتابخانهداری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — به اوج خود رسیده است. اگرچه دادههای وب در مقیاس وسیع همیشه در دسترس بودهاند، اما اصطکاک و پیچیدگیهای مدیریت باکتهای S3 اغلب سدی برای تیمهای کوچک پژوهشی بود. با تکیه بر پوشش قبلی ما دربارهی ریسکهای امنیتی در اکوسیستم HF — مانند حادثه مه ۲۰۲۶ که در آن عوامل OpenAI از حسابهای به خطر افتاده استفاده کردند — این حرکت جایگاه Hugging Face را به عنوان زیرساخت مرکزی، هم برای وزنهای مدل و هم برای دادههای خام ورودی که تغذیه کننده این مدلها هستند، تثبیت میکند.
مکانیزمهای جدید دسترسی
به نقل از پست وبلاگی در ۱۶ سپتامبر ۲۰۲۶ در سایت commoncrawl.org، آرشیوهای مربوط به ماههای آوریل، مه و ژوئن ۲۰۲۶ اکنون در Storage Buckets پلتفرم HF در دسترس هستند. این آینهها از همان ساختار دایرکتوری S3 استفاده میکنند، برای مثال مسیرهایی مانند crawl-data/CC-MAIN-2026-17/ در این سیستم قابل مشاهده است.
این Storage Buckets ذخیرهسازی شیء (Object Storage) مشابه S3 را روی هاب Hugging Face فراهم میکنند. برای افزایش توان عملیاتی خواندن (Read Throughput)، قابلیت CDN pre-warming در چندین منطقه فعال شده است که بهویژه زمانی که منابع محاسباتی در نزدیکی این مناطق اجرا میشوند، بسیار مفید است. کاربران اکنون از سه مسیر جدید میتوانند با دادهها تعامل کنند:
- HF CLI: توسعهدهندگان میتوانند با استفاده از دستورات
hf buckets listبرای لیست کردن فایلها یاhf buckets cpبرای کپی کردن دادهها از مسیرhf://buckets/commoncrawl/commoncrawl/به یک مسیر محلی، فایلهای خاصی را دانلود کنند. - اتصال محلی (Local Mounting): با استفاده از ابزار
hf-mountمیتوان این باکت را مانند یک سیستم فایل محلی (مثلاً در مسیر/mnt/commoncrawl) متصل کرد. این قابلیت به ابزارها اجازه میدهد فایلها را در لحظه خواندن (on-read) فراخوانی کنند و دیگر نیازی به دانلود آرشیوهای غولآسا پیش از پردازش نیست. - سازگاری با S3: خط لولههای (Pipelines) موجود میتوانند بهسادگی APIهای سازگار با S3 خود را به درگاه (Gateway) Hugging Face متصل کنند تا بدون نیاز به بازنویسی کد، منبع دادههای خود را تغییر دهند.
پردازش بهینه فایلهای WARC
خواندن فایلهای WARC (Web ARChive) اکنون با زبان پایتون سازگارتر (Pythonic) شده است. Hugging Face دسترسی به این باکتها را از طریق پروتکل hf:// فراهم کرده که به عنوان یک رابط فایل سازگار با fsspec عمل میکند.
ابزار warcio بهطور کامل از fsspec پشتیبانی میکند. با نصب بسته huggingface_hub و وابستگیهای اختیاری warcio توسعهدهندگان میتوانند رکوردها را مستقیماً از هاب استریم کنند. این یعنی پیمایش در پاسخهای وب و متادادهها بدون اشغال فضای ذخیرهسازی محلی ممکن است. برای مثال، یک اسکریپت میتواند فایلی خاص از بخش CC-MAIN-2026-17 را باز کرده و مقدار WARC-Target-URI را برای رکوردهای پاسخ چاپ کند.
توسعهدهندگان همچنین میتوانند از CLI ابزار warcio مستقیماً برای خواندن از باکت HF استفاده کنند. با استفاده از دستور index و فلگهای خاص برای offset، content-type و target-URI، استخراج متادادهها بدون دانلود کامل فایل امکانپذیر است؛ هرچند باید توجه داشت که استفاده از دستور head -n 10 ممکن است پس از رسیدن به حد مجاز، منجر به خطای broken pipe شود.
ایندکسگذاری سریع با DuckDB
یکی از مهمترین اضافات، در دسترس بودن URL Index (که پیشتر با نام Columnar Index شناخته میشد) در قالب Apache Parquet روی باکت HF است. این ایندکس، فایلهای WARC و URLها را در مجموعه داده Common Crawl در قالبی ستونی قرار میدهد که برای کوئریهای تحلیلی یا استخراجهای حجیم بسیار بهینه است.
با استفاده از DuckDB، کاربران میتوانند کوئریهای SQL را مستقیماً روی فایلهای Parquet راه دور اجرا کنند، بدون اینکه کل مجموعه داده را دانلود کنند. اسکیمای این ایندکس شامل فیلدهای دقیقی است، از جمله:
url_surtkeyوurlurl_host_nameوurl_host_tld- تفکیک دقیق میزبان: از
url_host_2nd_last_partتاurl_host_5th_last_part url_host_registry_suffix،url_host_registered_domainوurl_host_private_suffix
به عنوان مثال، یک توسعهدهنده میتواند با استفاده از کلاینت پایتون DuckDB، افزونه httpfs را نصب کرده و ایندکس را از طریق HTTP کوئری کند. با استفاده از hffs.glob برای یافتن فایلهای ایندکس (مانند part-00000-*.parquet)، میتوان تعداد صفحات هر دامنه را در یک TLD خاص محاسبه کرد. یک کوئری برای دامنه .ru (روسیه) نشان میدهد که سایتهایی مثل yandex.ru با ۱۶۶,۳۸۱ رکورد، zr.ru با ۲۸,۰۶۷ رکورد و zin.ru با ۲۳,۹۶۸ رکورد در صدر هستند.
بنچمارکهای عملکرد
Common Crawl تستهای اولیهای را روی سرعت دانلود رکوردهای تکی انجام داده است. این ارزیابی شامل ارسال تعداد زیادی درخواستهای Range کوچک برای دریافت URLهای صفحه اصلی با استفاده از CDX Toolkit در ترکیبهای مختلف کلاینت-سرور بود.
نتایج نشاندهنده یک موازنه (Trade-off) عملکردی بسته به محیط اجرا است:
- S3 به S3 (منطقه us-east-1): بیشترین سرعت با ۳,۵۰۰ رکورد در ثانیه.
- HF به HF: تا ۱,۵۰۰ رکورد در ثانیه.
- HF به کلاینت لبه (Edge Client): بهشدت کندتر (کمتر از ۱۰۰ رکورد در ثانیه) به دلیل محدودیتهای نرخ درخواست (Rate Limiting) و ماهیت درخواستهای Range کوچک.
این دادهها نشان میدهد که اگرچه HF در دسترستر است، اما برای کارهای سنگین محاسباتی، پردازش باید در محیط ابری HF انجام شود تا توان عملیاتی (Throughput) به حداکثر برسد. Common Crawl اشاره میکند که اینها یافتههای اولیه هستند و توصیه میکند کاربران پیش از شروع انتقالهای حجیم، اندازهگیریهای خود را انجام دهند.
برای کسانی که قصد پیادهسازی این جریانهای کاری را دارند، Common Crawl مجموعهای از نوتبوکهای آماده Jupyter را در مخزن cc-notebooks گیتهاب منتشر کرده است. این مجموعه شامل cc-index-hf.ipynb برای کوئری ایندکس، 3-hf.ipynb برای درگاه سازگار با S3 و warcio-hf.ipynb برای خواندن فایلهای WARC است.
این ادغام، گلوگاه هوش مصنوعی در مقیاس وب را از «چگونه داده را به دست آورم» به «چگونه آن را فیلتر کنم» تغییر میدهد. Common Crawl با فراهم کردن یک سیستم فایل قابل اتصال و ایندکس قابل کوئری، وب آزاد را عملاً به یک مجموعه داده مدیریتشده تبدیل کرده است. این موضوع سد ورود پژوهشگران مستقل را برای به چالش کشیدن انحصار دادههای غولهای فناوری میشکند.
توسعهدهندگان اکنون باید بررسی کنند که آیا خط لولههای S3 فعلی آنها میتواند به HF منتقل شود تا از مزایای CDN pre-warming در مناطق مختلف برای بهبود سرعت خواندن برای کلاسترهای محاسباتی نزدیک بهرهمند شوند.
گام بعدی شما
- اگر روی مجموعهدادههای وب کار میکنید، نوتبوکهای
cc-notebooksرا برای تست کوئریهای DuckDB بررسی کنید. - برای کاهش هزینههای ذخیرهسازی محلی، از
hf-mountبرای دسترسی مستقیم به آرشیوها استفاده کنید. - در صورت استفاده از کلاسترهای محاسباتی، منطقه (Region) اجرای کد خود را با نزدیکترین CDN پلتفرم HF تطبیق دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو