پرش به محتوای اصلی
پرش به محتوای مقاله

شکست مدل‌های انتشار در بازسازی منطق بصری غذا و تحریک حس تهوع

·۱۳ شهریور ۱۴۰۵۶ دقیقه مطالعه
غذای تولیدشده با هوش مصنوعی: ظاهر مصنوعی و رنگ‌های بیش از حد اشباع‌شده
غذای تولیدشده با هوش مصنوعی: ظاهر مصنوعی و رنگ‌های بیش از حد اشباع‌شده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه تحلیل بیولوژیک درباره علت تهوع‌آور بودن تصاویر غذای AI؛ این خبر فراتر از نقد زیبایی‌شناختی، ریشه شکست مدل‌های انتشار را در تضاد با تکامل غریزی انسان و فقدان دانش فیزیکی می‌بیند.

تصور کنید برگری از سنگ یا نودل‌هایی را ببینید که در هیچ‌کجا به پایان نمی‌رسند و در فضای تصویر محو می‌شوند؛ این‌ها نشانه‌های بحران بصری در غذای AI هستند. در ۴ سپتامبر ۲۰۲۶، وب‌سایت The Verge به تفصیل بررسی کرد که چرا رستوران‌ها و برندها به‌طور فزاینده‌ای از محتواهای بصری بی‌کیفیتی استفاده می‌کنند که واکنش‌های غریزی تهوع را در انسان برمی‌انگیزد.

این موج از تصاویر ناخوشایند شامل ترکیبات عجیبی مثل میگوهای دوناتی، ساندویچ‌های روبن (Reubens) که گویی از اعماق اقیانوس آمده‌اند، نودل‌های کرم‌مانند و تکه‌های مرغ رشته‌ای و نامأنوس است. برخی تصاویر، مصالح ساختمانی را در قالب بستنی نمایش می‌دهند یا بستنی‌هایی می‌سازند که شبیه مغز انسان است. نمونه‌های دیگر شامل بوریتوهایی با حفره‌های متعدد، لخته‌های مشکوک و تعداد تکان‌دهنده‌ای از سوراخ‌ها است که برای بسیاری از افراد حس تریپوفوبیا (ترس از حفره‌های ریز) ایجاد می‌کند.

این روند در حالی شکل گرفته که کسب‌وکارها سرعت تولید را بر اصالت بصری در بازاریابی ترجیح می‌دهند. همان‌طور که در تحلیل قبلی ما درباره‌ی اتوماسیون گردش‌های کاری فنی اشاره کردیم — جایی که عوامل AI در حال منسوخ کردن بررسی‌های اجباری کد (code reviews) هستند — هوش مصنوعی در بازسازی اشتهای بصری، یک آزمون بیولوژیک ساده را شکست می‌دهد. برای اکثر انسان‌ها، تصویر غذا صرفاً یک عکس نیست، بلکه یک سیگنال امنیتی برای بقاست.

مکانیسم شکست‌های بصری

کریس راسل (Chris Russell)، استاد هوش مصنوعی، دولت و سیاست در دانشگاه آکسفورد و متخصص بینایی ماشین، معتقد است ریشه مشکل در نحوه عملکرد مدل انتشار (Diffusion Model) نهفته است. این سیستم‌ها با یک تصویر پر از نویز — شبیه به صفحه‌ای پر از برفک تلویزیون — شروع می‌کنند و به‌تدریج آن نویز را پاک می‌کنند تا تصویر درخواستی ساخته شود.

  • ابتدا ساختارهای کلی و درشت (Coarse structures) بازیابی می‌شوند.
  • جزئیات ظریف بافت (Fine texture details) در آخرین مرحله اضافه می‌شوند.

به نقل از راسل، در بسیاری از تصاویر غذای AI، خطاها در همان مرحله ساختار کلی رخ می‌دهند. اگر مدل در فاز اولیه ساختاری شکست بخورد، صرفاً بافت‌های زنده و رنگارنگ را روی یک زیربنای خراب می‌پوشاند. این همان مکانیزمی است که باعث می‌شود انسانی با شش انگشت به جای پنج انگشت تولید شود، یا منجر به خلق «میگوهای دوناتی» و شیرینی‌های دگرگون‌شده گردد.

تصویری از غذای تولیدشده با هوش مصنوعی با رنگ‌های غیرطبیعی و بافت پلاستیکی.

نبرد با هندسه و خطوط

جووان‌باتیستا کالیفانو (Giovanbattista Califano)، دانشمند علوم رفتاری در دانشگاه ناپل فدریکو دوم در ایتالیا، اشاره می‌کند که مدل‌های انتشار در تولید ساختارهای نازک، پیوسته و دارای نقطه پایان به‌شدت ضعیف هستند. این نقص هندسی خاص باعث می‌شود رندر کردن نودل‌ها، رشته‌ها و زائده‌ها بسیار دشوار باشد.

  • منطق آشپزی: وقتی مدل نمی‌تواند تعیین کند که یک رشته نودل کجا باید تمام شود یا به چه چیزی متصل باشد، «آرتیفکت‌های اسپاگتی‌مانند» ایجاد می‌کند که بدون هیچ منطق آناتومیک یا آشپزی در نقاط نامربوط تصویر پخش می‌شوند.
  • شکست در مرزها: تکرار بافت‌هایی مثل دانه‌ها یا حباب‌ها نیز برای مدل‌ها دشوار است و اغلب به مناطقی نفوذ می‌کنند که نباید در آنجا باشند.

این خطاها توضیح می‌دهند چرا تصاویر غذای AI به‌طور مداوم رشته‌ای، دارای الگوهای آزاردهنده و حفره‌های خوشه‌ای هستند که تریپوفوبیا را تحریک می‌کنند.

فقدان دانش جهانی و فیزیکی

رولاند مایر (Roland Meyer)، استاد فرهنگ‌های دیجیتال و هنر در دانشگاه زوریخ سوئیس، توضیح می‌دهد که هوش مصنوعی هیچ مفهومی از ماهیت واقعی یک ساندویچ، نودل یا بوریتو ندارد. مدل‌ها درک نمی‌کنند که این اشیا در دنیای فیزیکی چه هستند یا در چه محیطی قرار دارند. AI صرفاً در سطح آماری یاد گرفته است که این چیز‌ها معمولاً چه شکلی هستند، اما نمی‌داند چرا این شکل را دارند یا چگونه باید رفتار کنند.

به دلیل این فقدان دانش جهانی، AI گاهی بافت‌هایی را که در بافت معماری عادی هستند — مثل بتن ترک‌خورده یا مصالح بنایی — روی بستنی یا برگر اعمال می‌کند. مایکل کوک (Michael Cook)، مدرس ارشد علوم کامپیوتر در کینگز کالج لندن، می‌گوید این بافت‌ها در لحظه‌ای که ما آن‌ها را به‌عنوان غذای خوراکی تصور می‌کنیم، «غلط» و تهوع‌آور می‌شوند.

تصویری از غذای تولیدشده با هوش مصنوعی با رنگ‌های غیرطبیعی و بافت پلاستیکی

تله داده‌های آموزشی

به گزارش مایکل کوک، داده‌های آموزشی این مدل‌ها دچار سوگیری هستند. چون اطلاعات کمی درباره فرآیندهای آموزشی داریم، مشخص نیست سیستم‌ها چه ترکیبی از محتوا را دریافت می‌کنند یا چه تداعی‌هایی می‌سازند. عکاسی حرفه‌ای از غذا معمولاً بسیار استایل‌یزه شده، با کنتراست شدید، رنگ‌های تند، نورپردازی براق و شکل‌های اغراق‌آمیز است. گاهی حتی «غذا» در این عکس‌ها، غذای واقعی نیست.

مایر اشاره می‌کند که AI ظاهر عکاسی — یعنی ویژگی‌های سطحی و قراردادهای بصری — را تقلید می‌کند اما استراتژی‌های زیبایی‌شناختی حرفه‌ای پشت آن را نمی‌فهمد. این تقلید بدون درک زمینه (Context)، در نهایت همان چیزی است که تصاویر را به‌شدت ناخوشایند می‌کند. این نوع محتواهای بی‌کیفیت و مصنوعی، بخشی از پدیده گسترده‌تری هستند که در تحلیل ما درباره برچسب «محتوای بی‌ارزش» و تنبلی فکری در عصر AI به آن پرداختیم.

علاوه بر این، سایمون کولتون (Simon Colton)، استاد خلاقیت محاسباتی، بازی و هوش مصنوعی در دانشگاه کوئین مری لندن، معتقد است در اینترنت تصاویر کمی از «غذاهای معمولی» وجود دارد. او می‌پرسد: «چه کسی می‌خواهد عکس یک سیب معمولی و خسته‌کننده را در وب پست کند؟» در عوض، افسانه‌های عجیب اینترنتی، میم‌ها و محتواهای «brain rot» در پلتفرم‌هایی مثل ردیت فراوان‌اند و باعث شده‌اند AI تداعی‌های عجیبی از شکل غذا بسازد. این سوگیری در داده‌ها مشابه بحرانی است که در تولید تصاویر جعلی حیوانات برای کلاهبرداری مشاهده می‌شود و اعتماد کاربران به محتوای دیجیتال را تخریب می‌کند.

فروپاشی مدل و خطاهای پرامپت

روند جدیدی شکل گرفته که در آن مدل‌ها روی محتوای تولیدشده توسط AI دیگر آموزش می‌بینند. کوک به ترند ویدیوهای AI اشاره می‌کند که در آن افراد در توده‌ای از غذا می‌پرند یا روی آن‌ها می‌جهند. این چرخه منجر به فروپاشی مدل (Model Collapse) می‌شود که باعث تخریب بصری و یکنواختی فزاینده بین تصاویر می‌گردد.

مهندسی پرامپت (Prompt Engineering) نیز در اینجا اثر منفی می‌گذارد. پرامپت‌ها — چه نوشته‌های کاربر و چه دستورات سطح سیستم — ممکن است بیش از حد مبهم باشند، مثلاً صرفاً درخواست «یک ساندویچ». برخی پرامپت‌ها از عباراتی مثل «دقیق باش» استفاده می‌کنند که برای متن منطقی است اما برای تولید تصویر خیر. وقتی این خطاهای کم‌رزولوشن در ابعاد بزرگ‌تر نمایش داده می‌شوند، نقص‌های آزاردهنده تشدید می‌شوند یا مدل مجبور می‌شود خلأها را به‌طور ناقص پر کند.

واکنش بیولوژیک انسان

انسان‌ها از نظر تکاملی برنامه‌ریزی شده‌اند تا غذاهای ناامن را تشخیص دهند. دانشمندان باور دارند حس تهوع برای محافظت ما در برابر انگل‌ها، پاتوژن‌ها، سموم و سایر تهدیدات احتمالی تکامل یافته است. این موضوع ما را به‌شدت نسبت به هر چیزی که برای خوردن ناامن به نظر برسد، حساس می‌کند.

کالیفانو بیان می‌کند که این امر باعث می‌شود «دره وهم» (Uncanny Valley) در مورد غذا، بسیار عمیق‌تر و فیزیکی‌تر از تجربه ما از چهره‌های غیرانسانی باشد. غذای AI چندین محرک بیولوژیک را هم‌زمان فعال می‌کند:

  • انگل‌ها: رشته‌های عجیب و نودل‌مانند شبیه به کرم‌ها هستند.
  • آلودگی: خوشه‌های حفره‌ای یادآور آلودگی‌های بافتی و حشرات است.
  • فساد: رنگ‌ها و بافت‌های نامأنوس سیگنال پوسیدگی و فساد غذا را می‌فرستند.

در سطح غریزی، غذای AI غلط است. ممکن است شبیه غذا باشد، اما مغز ما می‌داند که این‌ها «آشغال» (slop) هستند و واکنش پس‌زنی نشان می‌دهد. این شکست شکاف بزرگی را در هوش مصنوعی چندوجهی (Multimodal) آشکار می‌کند: تفاوت بین تقلید آماری و مبنای فیزیکی (Physical Grounding). تا زمانی که مدل‌ها «چرایی» یک بوریتو را نفهمند، به تولید آشغال‌های بصری که ما را منزجر می‌کند ادامه خواهند داد. این نوع واکنش‌های شدید کاربران به خروجی‌های ناقص AI، یادآور عقب‌نشینی گوگل و متا از برخی قابلیت‌های AI در پی اعتراضات توده‌ای است.

گام بعدی شما

  • اگر از ابزارهای تولید تصویر برای محتوای غذایی استفاده می‌کنید، از پرامپت‌های منفی (Negative Prompts) برای حذف کلمات «noodly» یا «holes» استفاده کنید.
  • برای بررسی کیفیت، تصاویر را در ابعاد کوچک بررسی نکنید؛ زوم کردن روی بافت‌ها تنها راه تشخیص «آشغال‌های بصری» است.
  • برای اینکه ببینید آیا این روند ادامه می‌یابد یا خیر، منتظر ادغام شبکه‌های عصبی مبتنی بر فیزیک (PINNs) در مدل‌های تصویری باشید تا AI بفهمد بستنی نباید شبیه بتن باشد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع نشان می‌دهد که درک فیزیکی جهان، مرز بعدی تکامل مدل‌های مولد است. عدم توانایی AI در رعایت منطق‌های ساده بصری، اعتبار برندهایی که به تولید محتوای انبوه تکیه می‌کنند را به شدت تخریب می‌کند.

تأثیر برای ایران

برای تولیدکنندگان محتوای بصری و آژانس‌های تبلیغاتی ایرانی که به ابزارهای رایگان AI روی آورده‌اند، این یک هشدار است تا از انتشار تصاویر بدون بازبینی دقیق بافت‌ها پرهیز کنند تا از واکنش منفی مخاطب جلوگیری شود.

·نگاه ما
تحریریه دات‌هوش

این بحران بصری نشان می‌دهد که مقیاس‌بندی داده‌ها (Scaling) به‌تنهایی برای رسیدن به درک دنیای واقعی کافی نیست. مدل‌های انتشار در واقع «آمارِ پیکسل‌ها» را یاد گرفته‌اند، نه «منطقِ اشیا» را. تا زمانی که مدل‌ها از تقلید آماری به سمت مبنای فیزیکی (Physical Grounding) حرکت نکنند، در هر حوزه‌ای که حس بقای انسان (مثل غذا یا پزشکی) درگیر باشد، با مقاومت غریزی مخاطب روبرو خواهند شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.