اگر یک مهندس داده هستید که بین سرعت پایگاهدادههای محلی و مقیاسپذیری دریاچههای داده (Data Lakes) گیر کردهاید، ابزاری برای پایان این تضاد arrived. حالا میتوانید بدون ترک محیط محلی خود، مجموعهدادههای عظیم را با استانداردهای سازمانی مدیریت کنید.
DuckLake در واقع یک افزونه برای DuckDB است که آن را از یک ابزار تحلیلی ساده به یک موتور کامل لیکهوس (Lakehouse) — شبیه به یک کتابخانه دیجیتال که هم سرعت دسترسی به کتابها را دارد و هم سیستمی برای فهرستبندی میلیونها جلد اثر — تبدیل میکند. طبق مستندات منتشرشده در گیتهاب این پروژه در ۷ اکتبر ۲۰۲۶، این سیستم با جداسازی متادیتا (Metadata) در یک کاتالوگ اختصاصی و نگهداری دادهها در فایلهای قابل حمل پارکه (Parquet)، مشکل مدیریت نسخهها در ذخیرهسازیهای حجیم را حل کرده است.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی استنتاج و مدیریت دادهها اشاره کردیم، حذف لایههای میانی زیرساختی، سرعت توسعه را بهشدت افزایش میدهد. DuckLake دقیقاً همین مسیر را میرود و قابلیتهای زیر را ارائه میدهد:
- سفر در زمان (Time Travel): امکان پرسوجو از نسخههای قدیمی جدول با استفاده از دستور
AT (VERSION => X). - تکامل طرح (Schema Evolution): افزودن ستونهای جدید به جداول بدون نیاز به بازنویسی کل مجموعهداده.
- جریان تغییرات داده (Change Data Feed): ردیابی دقیق درجها و بهروزرسانیها بین دو نقطه زمانی.
- کاتالوگهای منعطف: پشتیبانی از PostgreSQL، SQLite و فایلهای بومی DuckDB برای مدیریت متادیتا.
برای نصب این ابزار، دستور FORCE INSTALL ducklake FROM core_nightly; اجرا میشود. پس از آن، کاربر با دستور ATTACH یک لیکهوس را متصل میکند تا عملیات SQL را مستقیماً روی فایلهای زیرساختی اجرا کند.
به نظر ما، این تغییر DuckDB را به قابلیتهای Delta Lake یا Apache Iceberg نزدیک میکند، اما فلسفه «وابستگی صفر» را حفظ میکند. این یعنی کاربر میتواند روی فرمت Parquet که بهطور سنتی تغییرناپذیر است، عملیات UPDATE و DELETE را اجرا کند.
به گزارش توسعهدهندگان، این رویکرد نیاز به خوشههای سنگین اسپارک (Spark) را برای تیمهای کوچک و متوسط حذف میکند و یک نمونه DuckDB برای مدیریت یک دریاچه داده نسخهمند کافی است.
گام بعدی شما
- اگر از DuckDB برای تحلیلهای محلی استفاده میکنید، نسخههای
core_nightlyرا برای تست پایداری DuckLake بررسی کنید. - ساختار ذخیرهسازی دادههای خود را از فایلهای پراکنده Parquet به مدل کاتالوگمحور تغییر دهید تا قابلیت سفر در زمان را داشته باشید.
- مستندات گیتهاب پروژه را برای مشارکت در توسعه این موتور دنبال کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو