پرش به محتوای اصلی
پرش به محتوای مقاله

پژوهش NIDDK: خطای ۳۴۵ کالری در تخمین‌های اپلیکیشن‌های AI

·۱۵ مرداد ۱۴۰۵۸ دقیقه مطالعه۳ بازدید
شبکه عصبی شعر یسنینی می‌نویسد بی‌خطر، اما درباره کالری بشقاب دروغ می‌گوید
شبکه عصبی شعر یسنینی می‌نویسد بی‌خطر، اما درباره کالری بشقاب دروغ می‌گوید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه عدد دقیق خطای سیستماتیک (۲۵۰ تا ۳۴۵ کالری) برای اپلیکیشن‌های پیشرو؛ این خبر ثابت می‌کند که مشکل فقط «خطای تصادفی» نیست، بلکه مدل‌ها به‌طور کلی تمایل به تخمین کمتر (Underestimation) دارند.

اگر برای کاهش وزن به عکس‌های غذایتان تکیه می‌کنید، احتمالاً دارید کالری‌های بیشتری از آنچه فکر می‌کنید می‌بلعید. طبق یافته‌های پژوهشی که در کنفرانس NUTRITION ۲۰۲۶ ارائه شد، اپلیکیشن‌های ردیابی غذا با هوش مصنوعی، مقدار انرژی دریافتی کاربران را به‌شدت کمتر از واقعیت تخمین می‌زنند. این مطالعه توسط مؤسسه ملی بیماری‌های دیابت، گوارش و کلیه (NIDDK) انجام شده است.

پژوهشگران این مؤسسه برای دستیابی به نتایج دقیق، از یک محیط کنترل‌شده به نام «آشپزخانه متابولیک» استفاده کردند. آن‌ها به داوطلبان غذاهای مشخصی دادند و سپس مقدار واقعی کالری این غذاها را با تخمینات چهار اپلیکیشن محبوب و پرکاربرد یعنی MyFitnessPal، Lose It!، CalAI و Appediet مقایسه کردند تا ببینند هوش مصنوعی تا چه حد در تشخیص محتویات بشقاب قادر است.

شبکه عصبی شعر سپید می‌سراید، اما کالری غذا را دروغ می‌گوید

نتایج این بررسی تکان‌دهنده است و شکافی مداوم در دقت این ابزارها را نشان می‌دهد. این اختلاف نه با درصد، بلکه با اعداد دقیق کالری اندازه‌گیری شده است: این اپلیکیشن‌ها به‌ طور متوسط بین ۲۵۰ تا ۳۴۵ کیلوکالری در هر وعده را نادیده می‌گیرند و حدود ۳۰ گرم چربی را در تخمین‌های خود گم می‌کنند. اولیویا چارلز، پژوهشگر پس‌دکترا در NIDDK، به نقل از گزارش‌های Medical Xpress نتیجه‌گیری صریحی را فرموله کرد: «کاربرانی که بدون تنظیم دستی اندازه پرس‌ها از اپلیکیشن‌های ردیابی مبتنی بر عکس استفاده می‌کنند، باید نتایج را با تردید زیادی بپذیرند و به آن اعتماد کامل نکنند».

این شکست نشان می‌دهد که ما نباید تمام خطاهای هوش مصنوعی را در یک دسته‌بندی کلی قرار دهیم. ما اغلب تمام اشتباهات را در یک سبد می‌ریزیم و می‌گوییم «هوش مصنوعی اشتباه می‌کند»، اما ریسک‌ها بسته به نوع درخواست (Prompt) به‌شدت متفاوت است. برای مثال، نوشتن یک شعر به سبک یک شاعر محبوب یا تفسیر یک خواب، هیچ ریسک واقعی و فاکت-محوری ندارد، در حالی که شمارش کالری‌ها شامل داده‌های قابل اندازه‌گیری است که مستقیماً پیامدهای سلامتی دارد. برای درک اینکه کجا می‌توان به AI اعتماد کرد، باید این سناریوها را بر اساس مکانیزم‌های زیرین‌شان تفکیک کنیم.

منطقه امن خلاقیت

استایل‌بندی متن بر اساس شاعران کلاسیک، هم از نظر قانونی و هم از نظر فنی، بسیار ایمن است. در روسیه، این مورد پایدارترین سناریو در میان چهار حالت بررسی شده است. طبق ماده ۱۲۵۹ قانون مدنی روسیه (بند ۵)، ایده‌ها، متدها و روش‌های حل مسائل صراحتاً از حفاظت حق نشر (کپی‌رایت) مستثنی شده‌اند. این بدان معناست که «سبک» یک نویسنده یا شاعر تحت حمایت کپی‌رایت نیست و تنها متن خاص و نوشته شده است که محافظت می‌شود (طبق داده‌های ConsultantPlus).

علاوه بر این، حقوق انحصاری یک اثر تا ۷۰ سال پس از مرگ نویسنده اعتبار دارد. از آنجایی که الکساندر پوشکین در سال ۱۸۳۷ و سرگئی یسینین در سال ۱۹۲۵e وفات یافته‌اند، آثار هر دو مدت‌هاست که طبق ماده ۱۲۸۱ قانون مدنی در مالکیت عمومی (Public Domain) قرار گرفته‌اند. بنابراین، درخواست از یک شبکه عصبی برای تقلید از لحن آن‌ها، نقض حقوق ورثه نیست، زیرا هیچ ورثه‌ای با حقوق انحصاری روی این متون خاص وجود ندارد.

بنچمارک‌های فنی برای این نوع AI «خلاق» بسته به مدل متفاوت است. در یک تست کاربر در پلتفرم Pikabu، مدل DeepSeek v3 برای شعر به سبک پوشکین نمره ۶ از ۱۰ گرفت، در حالی که DeepSeek R1 نمره ۷ را کسب کرد و مدل‌های ChatGPT o1 و Claude 3.7 به نمره ۸ از ۱۰ رسیدند. اگرچه یک مشاهده ذهنی تنها کاربر یک متدولوژی کامل نیست، اما روند کلی واضح است: مدل‌های جدیدتر «استدلالی» (Reasoning models) بهتر از مدل‌های قدیمی‌تر می‌توانند استایل‌ها را بازسازی کنند.

شبکه عصبی شعر سپید می‌سراید، اما کالری غذا را دروغ می‌گوید

برای دستیابی به این کیفیت، توسعه‌دهندگان پروژه «AI da Pushkin» مدل خود را روی ۶۰ میلیون شعر آموزش دادند و در نهایت حدود ۱۰ میلیون متن را به دلیل نامناسب بودن حذف کردند. طبق وبلاگ فنی T-Bank، احتمال به‌دست آوردن یک قافیه در یک خط تولید شده توسط AI حدود ۵۰٪ است. با این حال، اگر سیستم ۱۰ متغیر مختلف تولید کند و بهترین آن‌ها را انتخاب کند، وجود قافیه تقریباً تضمین شده است. بنابراین، استایل‌بندی باکیفیت نتیجه «نمونه‌گیری گزินشی» است، نه یک حدس تصادفی و خوش‌شانس.

شکاف تفسیر

تفسیر خواب یا «کتاب تعبیر خواب AI» در دسته متفاوتی قرار می‌گیرد. در اینجا هیچ ریسک قانونی وجود ندارد، اما یک فقدان کامل در مبنای شواهد علمی دیده می‌شود. نظرات روان‌شناسان نه بر سر متد، بلکه بر سر تأکید بر علت شکست این ابزارها متفاوت است:

  • دیدگاه علمی: الکسی شستاکوف، روان‌شناس بالینی و هیپنوتراپیست، به RBC Trends گفت که او هیچ کتاب تعبیر خوابی را نمی‌شناسد که بر پایه پژوهش‌های علمی باشد. او تعبیر خواب‌های AI یا کتابی را با طالع‌بینی و فال می‌داند، فارغ از اینکه منبع آن یک کتاب قدیمی باشد یا یک هوش مصنوعی پیشرفته.
  • دیدگاه روان‌شناختی: اولگ دولگیtsky، روان‌شناس پزشکی، استدلال می‌کند که مشکل اصلی «ساده‌سازی بیش از حد» است. او خاطرنشان می‌کند که هر چه یک نماد را جهانی‌تر و کلی‌تر تعریف کنیم، توصیف آن برای خواب خاص یک فرد خاص، ضعیف‌تر و بدتر می‌شود.

در واقع، یک کتاب تعبیر خواب مبتنی بر AI هیچ تفاوتی با یک کتاب کاغذی ندارد؛ این ژانر در هر دو فرمت به یک اندازه غیرقابل اثبات است. این موضوع بیشتر به بازتاب شخصی و بیان فردی مربوط می‌شود تا داده‌های واقعی.

چرا هوش مصنوعی تغذیه شکست می‌خورد؟

شمارش کالری تنها سناریویی است که یک «حقیقت مرجع» (Ground Truth) قابل تأیید دارد: وزن واقعی غذا و چگالی کالری آن. در این حوزه، خطاها با امتیازات ذهنی یا «کیفیت استایل» سنجیده نمی‌شوند، بلکه با گرم و کالری اندازه‌گیری می‌شوند.

دقت فنی و خطاها:
یک مطالعه مستقل در مجله Nutrients (از طریق PubMed Central) دقت تشخیص اجزا را در هفت اپلیکیشن تست کرد. نتایج پراکنده بود: دقت از ۴۶٪ (در Lose It! و FatSecret) تا ۹۷٪ (در MyFitnessPal) متغیر بود. نکته حیاتی این است که برای غذاهای مخلوط، خطای کالری می‌تواند به رقم تکان‌دهنده ±۲۷۰٪ برسد. اگرچه حجم نمونه کوچک بود (۲۲ عکس و ۳۹ جزء)، اما مرتبه بزرگی این خطاها هشداردهنده است.

مکانیزم سوگیری فرهنگی:
یک سوگیری فرهنگی قابل توجه نیز وجود دارد. گزارش Tech Times حاکی از آن است که این پایگاه‌های داده عمدتاً روی غذاهای غربی آموزش دیده‌اند. به همین دلیل، AI در تشخیص غذاهای آسیای جنوبی، آفریقایی، آسیای شرقی و آمریکای لاتین به‌شدت دچار مشکل می‌شود. مکانیزم ساده است: هر چه یک غذا در داده‌های آموزشی کمتر تکرار شده باشد، تخمین کالری آن توسط AI بدتر خواهد بود.

پارادوکس توهم:
برخی توسعه‌دهندگان ادعا می‌کنند AI هنوز از انسان بهتر است. وید نوریس، بنیان‌گذار SnapCalorie، در مصاحبه‌ای با TechCrunch در سال ۲۰۲۳ ادعا کرد که با یک الگوریتم کالیبره شده برای تخمین اندازه پرس، خطای اپلیکیشن او کمتر از ۲۰٪ است. او استدلال می‌کند که «انسان‌ها در تخمین بصری اندازه پرس یک بشقاب غذا افتضاح هستند».

با این حال، کیفیت استایل بالا به معنای قابلیت اطمینان در داده‌های واقعی نیست. کارت‌های سیستم (System Cards) شرکت OpenAI روندی نگران‌کننده را نشان می‌دهند: با تکامل مدل‌ها، آن‌ها ممکن است در وظایف خاص مستعد خطای بیشتری شوند. در بنچمارک PersonQA، مدل استدلالی جدیدتر o4-mini در ۴۸٪ پاسخ‌ها توهم زد، مدل o3 در ۳۳٪ و مدل قدیمی‌تر o1 تنها در ۱۶٪ موارد دچار توهم شد. این نشان می‌دهد که رشد کیفیت استایل و رشد خطاهای واقعی، دو نمودار متفاوت روی یک خط مدل هستند.

حتی ردیابی توسط انسان نیز نقص دارد. مطالعه Nutrients دریافت که ردیابی دستی به‌طور سیستماتیک رژیم‌های غربی را ۱۰۴۰ کیلوژول بیشتر و رژیم‌های آسیایی را ۱۵۲۰ کیلوژول کمتر تخمین می‌زند. این موضوع باعث نمی‌شود AI قابل اعتمادتر شود؛ بلکه صرفاً نشان می‌دهد که خطاها در «نقاط کور» خاصی مثل اندازه پرس، غذاهای مخلوط و آشپزی‌های غیر رایج متمرکز شده‌اند.

ماتریس تصمیم‌گیری کاربر

طبق داده‌های ITPro، «بیانگری» (وظایف خلاقانه) حدود ۱۱٪ از پیام‌های ChatGPT را تشکیل می‌دهد، در حالی که بازتاب‌های شخصی و روابط ۱.۹٪ هستند. برای این کاربران، پروفایل ریسک به این صورت است:

  • شعر/تبریک: (خطای رایج: کیفیت ذهنی ۶-۸ از ۱۰). بررسی دستی: ریتم، قافیه و نبود کلمات قدیمی یا نابجا. اطمینان از صحت تاریخ‌ها و نام‌ها.
  • تحلیل خواب: (خطای رایج: غیرقابل تأیید). بررسی دستی: به عنوان سرگرمی یا محرکی برای تفکر در نظر بگیرید، نه به عنوان ابزار تشخیص پزشکی.
  • ردیابی کالری: (خطای رایج: تخمین کمتر بین ۲۵۰ تا ۳۴۵ کالری؛ دقت اجزا ۴۶-۹۷٪). بررسی دستی: وزن کردن پرس‌ها، وارد کردن دستی مقدار گرم و بازبینی دقیق غذاهای مخلوط یا دستورهای غیرغربی.

اگر شما به‌طور منظم برای مشتریان خود متن‌های استایل‌بندی شده یا تبریکات می‌نویسید، در کنار مسئله قابلیت اطمینان، موضوع هزینه نیز مطرح می‌شود. دسترسی جداگانه به چندین مدل سطح بالا (OpenAI, Anthropic, DeepSeek) گران است. ابزارهای مانند provod.ai به شما امکان می‌دهند به Claude، o1 و DeepSeek در یک مکان و با استفاده از پروتکل سازگار با OpenAI متصل شوید. شما فقط کافی است URL پایه و کلید را جایگزین کنید و نیازی به بازنویسی کد یا مدیریت چندین اشتراک مختلف ندارید. این سرویس از پرداخت‌های روسیه به روبل از طریق کارت یا SBP پشتیبانی می‌کند و نیاز به VPN یا کارت‌های خارجی را از بین می‌برد.

provod.ai — اتصال LLMها و مدل‌های رسانه‌ای در یک سناریو

اجازه دهید یک مدل ایده و پرامپت را بنویسد، مدل دیگر تصویر را خلق کند و سومی ویدیو را آماده کند. یک API واحد، زنجیره اتوماسیون و مدیریت دسترسی تیم را ساده می‌کند. کاتالوگ شامل موارد زیر است:

  • متن: GPT (OpenAI), Claude (Anthropic), Gemini (Google), Grok (xAI), DeepSeek, Qwen, GLM, Kimi, و MiniMax.
  • تصاویر: Nano Banana 2 Pro و GPT Image.
  • ویدیو: آخرین نسخه‌های Seedance, Kling, Veo, و Google Omni.
  • تخصصی: مدل‌هایی برای استدلال، جستجو، اسناد، Embeddingها، موسیقی و صدا.

سناریوهای ترکیبی هزینه اضافی دریافت نمی‌کنند؛ هر فراخوانی یک‌به‌یک و طبق قیمت رسمی مدل مربوطه محاسبه می‌شود. مسیر از ایده تا کلیپ را اتومات کنید: فرم ثبت‌نام · قیمت مدل‌ها · حفاظت از داده‌ها طبق قانون ۱۵۲-FZ · API و یکپارچه‌سازی‌ها.

چرا این موضوع مهم است؟

این مطالعه اعتبار متدولوژی‌های ردیابی خودکار غذا را زیر سؤال می‌برد و نشان می‌دهد اتکای صرف به بینایی ماشین در پزشکی و تغذیه خطرناک است. تخصص پژوهشگران NIDDK ثابت کرد که خطاهای AI در این حوزه سیستماتیک است و با بهبود مدل‌های زبانی به‌تنهایی حل نمی‌شود.

تأثیر برای ایران

بسیاری از کاربران ایرانی از نسخه‌های رایگان یا کرک‌شده این اپلیکیشن‌ها استفاده می‌کنند که ممکن است دیتابیس‌های قدیمی‌تری داشته باشند و خطای تخمین در غذاهای ایرانی (به دلیل سوگیری غربی) حتی بیشتر از اعداد گزارش‌شده باشد.

·نگاه ما
تحریریه دات‌هوش

تضاد میان کیفیت استایل (Stylization) و صحت داده (Factual Accuracy) در مدل‌های جدید، نشان می‌دهد که «توانایی استدلال» در AI هنوز با «درک فیزیکی جهان» گره نخورده است. مدل‌ها می‌توانند پیچیده‌ترین ساختارهای ادبی را تقلید کنند چون الگوهای متنی هستند، اما در تخمین حجم یک تکه گوشت شکست می‌خورند چون درک واقعی از ابعاد سه بعدی ندارند. این یعنی برای کارهای حیاتی، مدل‌های Reasoning جایگزین داده‌های سخت نمی‌شوند، بلکه فقط رابط کاربری بهتری برای دسترسی به آن‌ها هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.