پرش به محتوای اصلی
پرش به محتوای مقاله

GeoAI: تبدیل خودکار تصاویر NAIP به چندضلعی‌های دقیق ساختمان

·۱۲ مرداد ۱۴۰۵۱۰ دقیقه مطالعه۱ بازدید
راهنما
آموزش جیو‌هوش مصنوعی: استخراج اثر ساختمان از تصاویر NAIP با U-Net، Grounding DINO، SAM و Mask R-CNN
آموزش جیو‌هوش مصنوعی: استخراج اثر ساختمان از تصاویر NAIP با U-Net، Grounding DINO، SAM و Mask R-CNN
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک خط‌لوله کامل که مدل‌های قطعه‌بندی سنتی را با مدل‌های Zero-shot (مثل SAM) ترکیب کرده و خروجی‌های «لکه‌ای» AI را به برداری‌های مهندسی‌شده و تعامد تبدیل می‌کند.

تصور کنید می‌خواهید تمام سقف‌های یک شهر را با دست روی نقشه مشخص کنید؛ این کار سال‌ها زمان می‌برد. اما اکنون می‌توان با یک خط‌لوله هوشمند، تصاویر خام هوایی را مستقیماً به نقشه‌های برداری تبدیل کرد که برای متخصصان GIS کاملاً قابل استفاده است. این گردش کار، تصاویر هوایی با رزولوشن بالای NAIP را از طریق ترکیب یادگیری نظارت‌شده (Supervised Learning) و مدل‌های بنیادی Zero-shot، به ردپاهای ساختمانی آماده تحلیل تبدیل می‌کند. این خط‌لوله کامل GeoAI، بار دستی دیجیتالی‌سازی زیرساخت‌های شهری را حذف کرده و کل انتقال از پیکسل‌های خام به چندضلعی‌های برداری متعامد را خودکار می‌کند.

حوزه هوش مصنوعی مکان‌محور (GeoAI) همیشه در «مایل آخر» پردازش داده‌ها مشکل داشته است: تبدیل یک نقشه حرارتی تار به یک مرز قانونی و دقیق. بسیاری از متخصصان به پاک‌سازی دستی یا مدل‌های بیش از حد بزرگ تکیه می‌کنند که در تعمیم به شهرهای مختلف شکست می‌خورند. طبق راهنمای منتشر شده توسط Marktechpost، کلید حل این مشکل در ادغام قطعه‌بندی (Segmentation)، منظم‌سازی (Regularization) و پالایش مبتنی بر نمونه (Instance-based Refining) در یک زنجیره بازتولیدپذیر است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های بینایی اشاره کردیم، چالش اصلی همواره تعمیم‌پذیری مدل‌ها در شهرهای مختلف بوده است.

این سیستم برای پردازش کاشی‌های عظیم داده بدون کرش کردن حافظه، از روش استنتاج پنجره لغزان (Sliding-window Inference) — شبیه به حرکت یک ذره‌بین روی یک نقشه بزرگ برای بررسی تک‌تک بخش‌ها — استفاده می‌کند. این متد در واقع منظره را «اسکن» کرده و الگوهای شبیه به ساختمان را شناسایی کرده و آن‌ها را به مختصاتی تبدیل می‌کند که یک متخصص GIS بتواند عملاً از آن‌ها استفاده کند. این رویکرد برای پردازش حجم عظیمی از داده‌های مکانی بهینه شده است، مشابه آنچه در تحلیل سازوکار OlmoEarth برای پردازش سریع داده‌های ماهواره‌ای مشاهده کردیم.

ستون‌های فنی معماری

هسته این معماری بر پایه یک مدل قطعه‌بندی معنایی (Semantic Segmentation) از نوع U-Net است. برای استخراج پایدار ویژگی‌ها، این خط‌لوله از رمزگذار ResNet-34 بهره می‌برد که پیش‌تر روی ImageNet آموزش دیده است. کل این فرآیند توسط کتابخانه geoai-py مدیریت می‌شود و روی طبقه‌بندی دوتایی «ساختمان در برابر پس‌زمینه» تمرکز دارد.

برای شروع و مقداردهی اولیه محیط، سیستم کتابخانه‌های geoai-py ،segmentation-models-pytorch و buildingregulariser را نصب می‌کند. همچنین در دسترس بودن GPU را بررسی کرده و به‌طور خاص GPUهای T4 در محیط‌های Colab را برای عملکرد بهینه هدف قرار می‌دهد. کل خط‌لوله توسط یک پیکربندی مرکزی (CFG) هدایت می‌شود که پارامترهای دقیق برای تمام چرخه حیات مدل را تعریف می‌کند:

  • آماده‌سازی داده‌ها: سیستم تصاویر رستر و برچسب‌های برداری را از Hugging Face (مجموعه giswqs/geospatial) دانلود می‌کند. سپس تراشه‌های تصویری زمین‌مرجع با ابعاد ۵۱۲x۵۱۲ پیکسل تولید می‌نماید.
  • کاشی‌کشی (Tiling): برای مدیریت صحنه‌های مقیاس‌بزرگ، این گردش کار از گام (Stride) ۲۵۶ پیکسلی و شعاع بافر ۰ استفاده می‌کند تا مصنوعات لبه‌ای (Edge Artifacts) به حداقل برسد. تابع export_geotiff_tiles برای ایجاد این ماسک‌های رستر و تراشه‌های تصویری متناظر به کار می‌رود.
  • بهینه‌سازی: آموزش شامل ۱۲ دوره ([Epoch]) با نرخ یادگیری 1e-3 و تقسیم‌بندی اعتبارسنجی ۲۰٪ برای نظارت بر بیش‌برازش است. سیستم از توقف زودهنگام ([Early Stopping]) با صبر ۵ دوره استفاده می‌کند تا از تخریب مدل جلوگیری شود.
  • مشخصات استنتاج: برای صحنه‌های تست، اندازه پنجره ۵۱۲ و همپوشانی ۲۵۶ استفاده می‌شود تا پیش‌بینی‌های بدون درز در سراسر رستر حفظ شوند.

مکانیزم‌های پردازش داده

پیش از آموزش، خط‌لوله یک بازرسی دقیق از داده‌های مکان‌محور انجام می‌دهد. این شامل استفاده از geoai.get_raster_info و geoai.get_raster_stats برای درک ویژگی‌های مکانی تصویر و توزیع باندهای طیفی است. برچسب‌های برداری از طریق GeoPandas پردازش می‌شوند تا سیستم مختصات مرجع (CRS) تأیید شده و تعداد کل ساختمان‌های آموزشی شمرده شود.

در مرحله بازرسی داده‌های مکانی، فرآیند با یک حسابرسی سخت‌گیرانه از فایل‌های خام آغاز می‌شود. این کار تضمین می‌کند که داده‌های رستر و بردار از نظر جغرافیایی تراز هستند. خط‌لوله آمارهای هر باند را برای بررسی ناهنجاری‌ها در تصاویر NAIP چاپ می‌کند. اطلاعات برداری استخراج می‌شوند تا اطمینان حاصل شود که ردپاهای ساختمان در فرمتی سازگار برای رستری‌سازی هستند.

به‌طور مشخص، توابع geoai.view_vector و geoai.view_vector_interactive برای بصری‌سازی برچسب‌ها روی تصویر، با استفاده از خطوط محیطی زرد رنگ با ضخامت ۰.۸ استفاده می‌شوند. این امر به کاربر اجازه می‌دهد تا پیش از رفتن به مرحله خروج تراشه‌ها، صحت داده‌های مرجع (Ground Truth) را به‌صورت کیفی تأیید کند.

تبدیل TIFهای با رزولوشن بالا به تراشه‌های آماده مدل، یک مرحله حیاتی است. تابع export_geotiff_tiles تراشه‌های تصویری و ماسک‌های قطعه‌بندی متناظر آن‌ها را تولید می‌کند. سیستم ردیابی می‌کند که چه تعداد از کاشی‌ها واقعاً شامل ساختمان هستند و درصد کاشی‌های دارای ویژگی را محاسبه می‌کند تا سطح پراکندگی (Sparsity) در مجموعه داده ارزیابی شود.

این فرآیند به‌طور دقیق از طریق یک دیکشنری stats ردیابی می‌شود. این دیکشنری تعداد کل تراشه‌ها، تعداد کاشی‌های حاوی ویژگی و تعداد مطلق پیکسل‌های پیش‌زمینه را ثبت می‌کند. این متریک‌ها به محقق کمک می‌کند تا تصمیم بگیرد آیا مجموعه داده برای همگرایی کارآمد U-Net به اندازه کافی متوازن است یا خیر.

تبدیل ماسک‌ها به چندضلعی

پیش‌بینی‌های خام هوش مصنوعی اغلب به‌صورت «لکه‌های نامنظم» و غیردقیق هستند. خط‌لوله این مشکل را از طریق یک فرآیند منظم‌سازی چندمرحله‌ای حل می‌کند که یک رستر احتمالی را به یک فایل برداری GeoJSON تمیز تبدیل می‌کند:

  • حذف نویز: نواحی کوچک و جدا از هم (زیر ۵۰ پیکسل) با استفاده از geoai.region_groups با اتصال ۲ پاک‌سازی می‌شوند تا مثبت‌های کاذب حذف شوند. این کار یک ماسک پیش‌بینی «پاک‌شده» ایجاد می‌کند.
  • برداری‌سازی: ماسک پاک‌شده توسط geoai.raster_to_vector با آستانه ۰ و حداقل مساحت ۱۵ پیکسل و تلورانس ساده‌سازی ۰.۵ به چندضلعی‌های خام تبدیل می‌شود.
  • تعامدسازی (Orthogonalization): اشکال خام از طریق تابع geoai.orthogonalize با اپسیلون ۱.۵ و حداقل مساحت ۱۵ به زاویه‌های قائمه مجبور می‌شوند. این کار بازتاب‌دهنده معماری واقعی اکثر ساختمان‌هاست و لبه‌های گرد و ارگانیک تولید شده توسط شبکه‌های عصبی را حذف می‌کند.
  • پالایش هندسی: چندضلعی‌های نهایی از طریق geoai.regularization با تلورانس زاویه‌ای ۱۲ و تلورانس ساده‌سازی ۰.۴ پردازش می‌شوند.
  • تحلیل هندسی: سیستم ویژگی‌هایی مانند مساحت، محیط، Solidity (صلبیت)، کشیدگی و جهت‌گیری را با استفاده از geoai.add_geometric_properties به فایل‌های GeoJSON خروجی اضافه می‌کند.

جایگزین‌های Zero-Shot و نمونه‌محور

این راهنما مقایسه‌ای مستقیم بین مدل‌های آموزش‌دیده سفارشی و مدل‌های بنیادی ارائه می‌دهد. برای کسانی که داده‌های آموزشی ندارند، خط‌لوله از Grounding DINO (به عنوان آشکارساز) و SAM (مدل Segment Anything) از طریق کلاس geoai.GroundedSAM بهره می‌برد.

با استفاده از پرامپت‌های متنی مانند «building, house, rooftop»، سیستم می‌تواند سازه‌ها را در یک صحنه دیده‌نشده، بدون نیاز به حتی یک تصویر آموزشی شناسایی کند (Zero-shot). این قابلیت تبدیل توصیفات متنی به ناحیه‌های دقیق بصری، یادآور رویکرد استارت-آپ Oxlo.ai در اتوماسیون قطعه‌بندی تصاویر از طریق زبان طبیعی است. این تنظیمات از آشکارساز IDEA-Research/grounding-dino-tiny و قطعه‌بند facebook/sam-vit-base استفاده کرده و آستانه ۰.۳ و همپوشانی ۱۲۸ پیکسل را روی اندازه کاشی ۱۰۲۴ پیکسل اعمال می‌کند. به‌طور خاص از متد segment_image با پالایش چندضلعی فعال و حداقل مساحت چندضلعی ۳۰، با تلورانس ساده‌سازی ۱.۵ استفاده می‌شود.

علاوه بر این، گردش کار یک مدل پیش‌آموزش‌دیده Mask R-CNN (فایل building_footprints_usa.pth) را ادغام می‌کند. با استفاده از کلاس BuildingFootprintExtractor سیستم آستانه اطمینان ۰.۵ و آستانه ماسک ۰.۵ را با همپوشانی ۰.۲۵ و حداقل مساحت شیء ۱۰۰ اعمال می‌کند. همچنین از پرچم filter_edges=True برای حذف مصنوعات در مرزهای تصویر استفاده می‌کند.

برخلاف U-Net که ممکن است یک ردیف خانه‌های شهری را به صورت یک لکه بزرگ ترکیب کند (قطعه‌بندی معنایی)، Mask R-CNN با هر ساختمان به عنوان یک نمونه مجزا برخورد می‌کند (قطعه‌بندی نمونه یا Instance Segmentation). این به کاربران اجازه می‌دهد بین نقشه‌برداری معنایی (پوشش زمین) و نقشه‌برداری نمونه (شمارش دارایی‌های فردی) انتخاب کنند. پس از استخراج، متد regularize_buildings با حداقل مساحت ۲۰ و آستانه زاویه‌ای ۱۵ استفاده می‌شود.

مقیاس‌پذیری در دنیای واقعی و ادغام AOI

برای اثبات کاربرد سیستم فراتر از مجموعه‌های داده نمونه، این راهنما یکپارچگی با Microsoft Planetary Computer را نشان می‌دهد. این امکان را به کاربران می‌دهد تا خط‌لوله را برای هر منطقه مورد نظر (AOI) در دنیای واقعی مقیاس‌بندی کنند:

  • جستجوی STAC: سیستم از geoai.pc_stac_search برای یافتن تصاویر NAIP در یک باکس محدودکننده مشخص (مثلاً -83.9400, 35.9500, -83.9250, 35.9600) و بازه زمانی (از ۲۰۲۱-۰۱-۰۱ تا ۲۰۲۳-۱۲-۳۱) استفاده می‌کند. جستجو معمولاً به حداکثر ۳ مورد محدود می‌شود تا اندازه داده‌ها مدیریت شود.
  • کسب تصاویر: تابع geoai.download_naip باکیفیت‌ترین کاشی‌های رستر موجود برای AOI هدف را بازیابی کرده و در یک دایرکتوری اختصاصی ذخیره می‌کند.
  • یکپارچه‌سازی برچسب‌ها: سیستم تصاویر را با برچسب‌های ساختمانی از Overture Maps با استفاده از geoai.download_overture_buildings و فیلتر overture_type="building" جفت می‌کند تا حقیقت زمینی با دقت بالا برای آموزش سفارشی سایت فراهم شود.
  • کاشی‌کشی سفارشی: این AOI واقعی سپس از طریق export_geotiff_tiles با اندازه ۵۱۲ پیکسل و گام ۲۵۶ پیکسل پردازش می‌شود تا آماده تغذیه به تابع train_segmentation_model() گردد.

تشخیص عملکرد و متریک‌ها

سیستم موفقیت را با استفاده از IoU (اتحاد روی تقاطع) پیکسل‌به-پیکسل و متریک‌های F1 ارزیابی می‌کند. این موارد با مقایسه یک رستر پیش‌بینی شده در مقابل یک ماسک حقیقت-زمینی که از برچسب‌های برداری اصلی از طریق vector_to_raster با تنظیم all_touched=True و dtype=np.uint8 تولید شده، محاسبه می‌شوند.

در حالی که IoU پس‌زمینه معمولاً به دلیل حجم زیاد پیکسل‌های غیرساختمانی متورم (بالا) است، IoU کلاس ساختمان به عنوان معیار اصلی دقت عمل می‌کند. خط‌لوله منحنی‌های آموزش را با استفاده از geoai.plot_performance_metrics رسم می‌کند تا رفتار مدل را تشخیص دهد: اگر زیان اعتبارسنجی (Validation Loss) افزایش یابد در حالی که زیان آموزش کاهش می‌یابد، مدل دچار بیش‌برازش شده است. اگر هر دو تخت و بالا بمانند، نشان‌دهنده کم‌برازش (Underfitting) است که نیاز به دوره‌های بیشتر، رمزگذار بزرگتر یا تراشه‌های تصویری بیشتر را پیشنهاد می‌دهد.

برای یک صحنه تست دیده‌نشده، خط‌لوله با بررسی تبدیل رستر (مقادیر a و e) برای تعیین اندازه پیکسل و سپس جمع تمام پیکسل‌هایی که ماسک آن‌ها بیشتر از ۰ است، مساحت کل ساختمان‌های پیش‌بینی شده را محاسبه می‌کند. این کار یک اندازه‌گیری فیزیکی به متر مربع به عنوان یک بررسی نهایی منطقی (Sanity Check) ارائه می‌دهد.

استقرار و توسعه‌پذیری

این تغییر به سمت خط‌لوله‌های یکپارچه GeoAI به این معنی است که برنامه‌ریزان شهری و تحلیلگران محیطی اکنون می‌توانند نقشه‌های پایه را در عرض چند ساعت تولید کنند، نه چند ماه. نتایج در یک بسته فشرده (geoai_results.zip) شامل تمام خروجی‌های GeoJSON، رسترهای احتمالی، نمودارهای ارزیابی و وزن‌های آموزش‌دیده (best_model.pth) جمع‌آوری می‌شوند.

معماری سیستم بسیار منعطف است. کاربران می‌توانند سرِ U-Net را با DeepLabV3+ جایگزین کنند یا رمزگذار را با EfficientNet-B3 از طریق کتابخانه timm عوض نمایند.

برای وظایف پیچیده‌تر، سیستم می‌تواند به موارد زیر گسترش یابد:

  • تحلیل چندطیفی: استفاده از تصاویر ۴ بانده NAIP (RGB + NIR) با تنظیم num_channels=4. اولین لایه کانولوشن به‌طور خودکار برای باند اضافی سازگار می‌شود.
  • نقشه‌برداری پوشش زمین: بهره‌گیری از geoai.train_segmentation_landcover() و geoai.export_landcover_tiles() با استفاده از توابع زیان پیشرفته مانند DiceLoss، FocalLoss یا TverskyLoss برای مدیریت عدم توازن کلاس‌ها.
  • استنتاج مدل‌های بنیادی: ادغام Prithvi ناسا/IBM از طریق geoai.prithvi_inference یا Universat از طریق geoai.universat_inference یا geoai.DINOv3GeoProcessor برای جاسازی‌های (Embeddings) پیشرفته و نقشه‌های شباهت.
  • تشخیص تغییرات: به‌کارگیری geoai.change_detection با استفاده از بک‌اندهای torchange برای شناسایی رشد شهری در طول زمان.
  • آشکارسازی اشیاء: استفاده از geoai.train.object_detection() برای باکس‌های زمین‌مرجع یا Grounding DINO با لغت‌باز (geoai.object_detection(text="cars")) برای جداسازی دارایی‌های شهری خاص.

کاربران اکنون می‌توانند این مدل‌ها را از طریق ONNX با استفاده از geoai.export_to_onnx() و geoai.onnx_semantic_segmentation() یا مستقیماً در افزونه‌های QGIS مستقر کنند و هوش مصنوعی را از دفترچه یادداشت (Notebook) به میدان عملیاتی منتقل کنند. گام بعدی برای متخصصان، آزمایش با داده‌های چندطیفی برای بهبود تشخیص در مناطق جنگلی یا ابری است.

در نتیجه، ما یک خط‌لوله یادگیری عمیق مکان‌محور کامل را تکمیل کردیم که تصاویر هوایی خام را به داده‌های ردپای ساختمانی ساختاریافته و آماده تحلیل تبدیل می‌کند. ما نمونه‌های آموزشی را آماده کردیم، یک مدل قطعه‌بندی معنایی را آموزش دادیم و ارزیابی کردیم، پیش‌بینی‌های یکپارچه تولید کردیم و خروجی‌های رستر را به هندسه‌های برداری متعامد با ویژگی‌های مکانی مفید تبدیل کردیم. همچنین رویکردهای جایگزین استخراج از طریق مدل‌های بنیادی Zero-shot و قطعه‌بندی نمونه پیش‌آموزش‌دیده را بررسی کردیم که به ما کمک می‌کند توازن بین آموزش سفارشی، تشخیص مبتنی بر پرامپت و مدل‌های آماده مصرف را درک کنیم. با بسته‌بندی ماسک‌های تولید شده، رسترهای احتمالی، نمودارهای ارزیابی، وزن‌های آموزش‌دیده و خروجی‌های GeoJSON، ما یک زیربنای قابل استفاده ایجاد کردیم که می‌توانیم آن را برای نقشه‌برداری پوشش زمین، تشخیص زیرساخت‌ها، تحلیل تغییرات و کاربردهای مقیاس‌بزرگ GeoAI تطبیق دهیم.

چرا این موضوع مهم است؟

این رویکرد زمان تولید نقشه‌های پایه شهری را از چندین ماه به چند ساعت کاهش می‌دهد. با اتکا به اعتبار مدل‌های بنیادی فیس‌بوک و معماری‌های اثبات‌شده U-Net، تحلیلگران محیط‌زیستی اکنون به ابزاری دقیق برای مدیریت دارایی‌های شهری دسترسی دارند.

تأثیر برای ایران

این راهکار برای سازمان‌های نقشه‌برداری و شهرداری‌های ایران که با کمبود داده‌های برچسب‌دار مواجه‌اند، فرصتی برای استفاده از مدل‌های بنیادی (Zero-shot) جهت استخراج سریع نقشه‌های شهری است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های تخصصی آموزش‌دیده با مدل‌های بنیادی مثل SAM در GeoAI، پارادایم «جمع‌آوری داده‌های برچسب‌دار» را به «مهندسی پرامپت بصری» تغییر می‌دهد. نکته کلیدی این است که دقت U-Net در لبه‌ها هنوز با متدهای تعامدسازی (Orthogonalization) ترکیب می‌شود، یعنی هوش مصنوعی تنها بخشی از مسیر است و دانش هندسی سنتی همچنان برای خروجی‌های قانونی و نقشه‌برداری ضروری است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.