تصور کنید یک مدیر محصول برای استخراج قیمتها از وبسایت رقیب، به هوش مصنوعی تکیه کند و پاسخی کاملاً متقاعدکننده اما ۱۰۰٪ غلط دریافت کند. این کابوس زمانی رخ میدهد که ساختار بصری جداول در مسیر تبدیل به متن، فرو میپاشد.
بسیاری از توسعهدهندگان از مارکداون (Markdown) — شبیه به یک پیشنویس ساده که فقط ساختارهای ابتدایی متن را میفهمد — بهعنوان فرمت استاندارد تبادل داده برای مدلهای زبانی بزرگ (LLM) استفاده میکنند. اما طبق گزارش یک توسعهدهنده در ۳ اکتبر ۲۰۲۶، تبدیل جداول پیچیده HTML به Markdown باعث تخریب دادههای حساس میشود. همانطور که در تحلیلهای قبلی ما دربارهی امنیت دادههای ورودی اشاره کردیم، هرگونه نقص در مرحلهی پیشپردازش، مستقیماً روی کیفیت خروجی اثر میگذارد.
مشکل اصلی در سلولهای ادغامشده (colspan و rowspan) است. Markdown بهصورت ذاتی نمیتواند این ادغامها را نمایش دهد. به نقل از مستندات فنی این مورد، وقتی یک مبدل با این سلولها مواجه میشود، ردیفها را بهصورت مستقل پردازش میکند و در نتیجه، دادههای ستونهای بعدی جابهجا میشوند.

برای حل این بحران، سه راهکار فنی در سطح API پیادهسازی شد:
- باز کردن ادغامها (Colspan Unrolling): تکرار مقدار سلول ادغامشده در تمام خانههای تحت پوشش برای حفظ تراز دادهها.
- عبور مستقیم HTML: ارسال تگهای
<table>بهصورت خام برای موارد rowspan؛ چراکه اکثر مدلها HTML را بهتر از Markdown بههمریخته میفهمند. - اصلاح کاراکترهای لوله (Pipe Escaping): رفع خطایی که در آن علامت
|داخل سلولها، باعث تقسیم یک خانه به دو خانه میشد.
این شکست نشان میدهد که فرض «حفظ معنا در تبدیل متن ساده»، فرضی خطرناک است. برای کسانی که سیستمهای تولید بازیابیافزا (RAG) — مثل دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — میسازند، تکیه بر Markdown خالص در اسناد پیچیده میتواند منجر به «توهمات خاموش» شود؛ وضعیتی که مدل منطقاً درست به نظر میرسد اما بر اساس دادههای جابهجا شده پاسخ میدهد.
گام بعدی شما
- اسکریپتهای ورود داده (Ingestion) خود را برای شناسایی جداول دارای سلولهای ادغامشده بازبینی کنید.
- در صورت وجود جداول پیچیده، لایهای برای تشخیص عدم قابلیت تبدیل به Markdown اضافه کنید.
- برای دادههای حساس، خروجی مدل را با دادههای مرجع (Ground Truth) در قالب جدول مقایسه کنید.
اما این تنها بخشی از چالشهای پاکسازی داده است؛ اثر متدهای تکهبندی (Chunking) بر دقت بازیابی را در گزارش بعدی بررسی خواهیم کرد.




گفتگو