پرش به محتوای اصلی
پرش به محتوای مقاله

گزارش FBI: کلاهبرداری‌های صوتی هوش مصنوعی ۸۹۳ میلیون دلار خسارت زد

·۱۳ مهر ۱۴۰۵۹ دقیقه مطالعه
راهنما
هشدار: کلاهبرداری صوتی با هوش مصنوعی؛ نحوه شناسایی قبل از ضرر مالی
هشدار: کلاهبرداری صوتی با هوش مصنوعی؛ نحوه شناسایی قبل از ضرر مالی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم تشخیص تقلب؛ دیگر «چگونه صدا به نظر می‌رسد» معیاری برای تشخیص نیست، بلکه «چه فرآیند تأییدی طی شده» تنها راه نجات است.

تصور کنید تماسی از فرزندتان دریافت می‌کنید که در وضعیت اضطراری است و از شما کمک مالی می‌خواهد؛ صدایش دقیقاً همان است، اما طرف خط یک ماشین هوش مصنوعی است. اگر هنوز فکر می‌کنید می‌توانید تقلب‌های صوتی را با تشخیص «لحن رباتیک» شناسایی کنید، در معرض خطری هستید که در سال ۲۰۲۵ نزدیک به ۹۰۰ میلیون دلار خسارت به جای گذاشت.

طبق اعلام FBI، آمریکایی‌ها در سال ۲۰۲۵ مبلغ ۸۹۳ میلیون دلار را در ۲۲,۳۶۴ مورد کلاهبرداری مرتبط با هوش مصنوعی از دست داده‌اند. این ارقام بخشی از مجموع ۲۰.۹ میلیارد دلار خسارت ناشی از جرایم سایبری در سال جاری است. این نخستین بار در تاریخ ۲۵ ساله این مرکز است که حجم شکایت‌ها از مرز یک میلیون مورد گذشت. FBI هشدار می‌دهد که کلاهبرداری‌های مبتنی بر هوش مصنوعی زاینده (Generative AI) — شبیه به یک نقاش چیره‌دست که می‌تواند هر چه را بخواهد با دقت خیره‌کننده بازتولید کند — اکنون به یک صنعت میلیارد دلاری تبدیل شده است. این سازمان همچنین هشدار می‌دهد که خسارات واقعی احتمالاً بسیار بیشتر از این ارقام است، زیرا بسیاری از قربانیان هرگز متوجه نمی‌شوند که در صدا یا ویدیوی مورد استفاده علیه آن‌ها، از هوش مصنوعی استفاده شده است.

هشدار: کلاهبرداری صوتی با هوش مصنوعی؛ نحوه شناسایی قبل از ضرر مالی

این جهش زمانی رخ می‌دهد که فناوری شبیه‌سازی صدا (Voice Cloning) به نقطه بحرانی رسیده است. در حالی که صداهای قدیمی مصنوعی، تخت یا رباتیک بودند، مدل‌های امروزی می‌توانند با دقتی تقریباً کامل از صدای انسان تقلید کنند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های مولد اشاره کردیم، مرز بین واقعیت و جعل در حال محو شدن است. این روند تخریب سدهای دفاعی سنتی نشان می‌دهد که داده‌های شخصی ما اکنون به هدف‌های اصلی برای ابزارهای جعل تبدیل شده‌اند. FBI تأکید می‌کند که صداهای تولید شده اکنون چنان مشابه اصل هستند که تشخیص آن‌ها برای گوش انسان تقریباً غیرممکن است و توصیه‌های قدیمی مثل «گوش دادن به مکث‌های غیرطبیعی»، «تخت بودن لحن» یا «نبود نویز پس‌زمینه» دیگر کاربردی ندارند و کاملاً منسوخ شده‌اند.

برای یک کاربر عادی، این یعنی تماس تلفنی از طرف فرزند، رئیس یا بانک دیگر دلیلی برای اثبات هویت نیست. کلاهبرداران ترکیبی از صدای باکیفیت و مهندسی اجتماعی تهاجمی را به کار می‌گیرند تا قضاوت انسانی را دور بزنند. به گزارش این سازمان، شکایت‌های مربوط به جعل هویت مقامات دولتی در سال ۲۰۲۵ با جهشی چشمگیر تقریباً دو برابر شده و از حدود ۱۷,۴۰۰ مورد در سال ۲۰۲۴ به بیش از ۳۲,۴۰۰ مورد رسیده است.

مکانیسم شبیه‌سازی: سه ثانیه تا سرقت هویت

مهاجمان برای سرقت صدای شما به ساعت‌ها ضبط استودیویی نیاز ندارند. مکانیسم این کار ساده‌تر از آن چیزی است که اکثر مردم تصور می‌کنند. برخی ابزارهای تجاری اکنون ادعا می‌کنند که تنها با ۳ ثانیه فایل صوتی می‌توان یک کلون متقاعدکننده ساخت. این نمونه‌های صوتی به‌راحتی از منابع زیر جمع‌آوری می‌شوند:

  • ویدیوهای شبکه‌های اجتماعی (تیک‌تاک و اینستاگرام)
  • حضور در پادکست‌ها
  • پیام‌های خوش‌آمدگویی صندوق صوتی
  • تماس‌های ضبط‌شده حرفه‌ای

وقتی کلاهبردار یک کلیپ کوتاه دارد، آن را به یک مدل شبیه‌سازی صدا می‌دهد. این مدل‌ها از همان دسته‌ی مدل‌های سریع و ارزان‌قیمتی هستند که هزینه استنتاج را در کل صنعت کاهش داده‌اند و باعث شده‌اند عرضه مدل‌های جدید ارزان‌تر شود. در واقع، دسترسی به ابزارهای جعل صوتی چنان گسترده شده که اکنون برخی کیت‌های تخصصی اسپوفینگ با قیمتی کمتر از ۵۰۰ دلار در دسترس هستند. در نتیجه، مهاجم می‌تواند در لحظه، هر جمله‌ای را به زبان «شما» بیان کند.

اما صدا تنها نیمی از حمله است؛ نیم دیگر «سناریو» یا همان مهندسی اجتماعی است که برای دور زدن قضاوت طراحی شده است. چه داستان فرزند در زندان باشد، چه مدیر مالی (CFO) که انتقال وجهی را تأیید می‌کند و چه «بخش تقلب» بانک که برای متوقف کردن یک تراکنش به کد شما نیاز دارد؛ صدا باعث باورپذیری داستان می‌شود و فوریتِ ساختگی باعث می‌شود قربانی پیش از بررسی، اقدام کند.

وقتی احساسات بر منطق غلبه می‌کنند

مجرمان صدای باکیفیت را با داستانی ترکیب می‌کنند که برای تحریک واکنش احساسی مهندسی شده است. با خلق یک بحران، آن‌ها قربانی را مجبور می‌کنند به جای منطق، بر اساس غریزه عمل کند. صدا اعتبار می‌بخشد و سناریو فشار می‌آورد.

این ترکیب برای نادیده گرفتن نشانه‌های خطر طراحی شده است. وقتی صدای عزیزی را در وضعیت بد می‌شنوید یا دستوری مستقیم از مقام بالا دریافت می‌کنید، مغز شما به گونه‌ای سیم‌کشی شده است که کمک کند یا اطاعت نماید. کلاهبرداران از این آسیب‌پذیری بیولوژیکی استفاده می‌کنند تا شما فرصت تأیید درخواست از طریق یک کانال مجزا را نداشته باشید.

دو مسیر اصلی حمله: خانواده و شرکت‌ها

کلاهبرداری‌های صوتی معمولاً به دو دسته تقسیم می‌شوند: فوریت‌های شخصی و تقلب‌های شرکتی. اگرچه روش‌های دفاعی در هر دو مورد مشابه است، اما هدف و مقیاس خسارات به طور قابل توجهی متفاوت است.

تماس‌های اضطراری خانوادگی
در این مدل، تماسی وحشت‌زده از یک نوه یا فرزند دریافت می‌کنید که ادعا می‌کند تصادف کرده یا بازداشت شده است. آن‌ها برای وثیقه پول می‌خواهند و فوراً اصرار می‌کنند: «به مامان نگو»، تا از نظر دادن شخص دوم جلوگیری کنند. FTC هشدار داده که این طرح‌ها روی این نکته متکی هستند که صدا درست به نظر برسد تا واکنش ترس را فعال کند. کلاهبرداران قربانیان را به سمت کارت‌های هدیه، حواله‌های بانکی یا ارزهای دیجیتال سوق می‌دهند، زیرا بازپس‌گیری این مبالغ تقریباً غیرممکن است.

مدیران جعلی
حملات شرکتی بسیار سودآورترند. در ژانویه ۲۰۲۴، کارمندی در شرکت مهندسی Arup در یک تماس ویدیویی با کسی شرکت کرد که به نظر می‌رسید مدیر مالی (CFO) شرکت و چندین همکار دیگر باشند. همه چهره‌ها و صداها آشنا بودند. در طول گفتگو، به این کارمند دستور داده شد تا مجموعه‌ای از انتقال‌های «محرمانه» را انجام دهد.

هشدار: کلاهبرداری صوتی با هوش مصنوعی؛ تشخیص و پیشگیری

این حمله منجر به ۱۵ تراکنش به مبلغ ۲۵.۶ میلیون دلار شد که به پنج حساب بانکی در هنگ‌کنگ منتقل گشت. تمام چهره‌ها و صداها در آن تماس، به جز قربانی، جعل عمیق (Deepfake) بودند که از ویدیوها و صداهای عمومی مدیران واقعی Arup ساخته شده بودند. راب گریگ، مدیر فناوری وقت Arup، اشاره کرد که این یک مهندسی اجتماعی تقویت‌شده با فناوری بود؛ این حمله نه از طریق دیوار آتش (Firewall)، بلکه از طریق «انسان» رخ داد. کارمند در ابتدا به ایمیل دریافتی مشکوک بود، اما تماس ویدیویی چندنفره تمام تردیدهای او را از بین برد.

پروتکل تأیید هویت: گوش خود را باور نکنید

از آنجا که دیگر نمی‌توان به گوش‌ها اعتماد کرد، FBI و FTC دفاع مبتنی بر «فرآیند» را توصیه می‌کنند. شما نمی‌توانید با تکیه بر شنوایی، یک کلون صوتی مدرن را تشخیص دهید. مؤثرترین استراتژی این است: تماس را قطع کنید و با شماره‌ای که قبلاً در مخاطبین خود ذخیره کرده‌اید تماس بگیرید؛ هرگز با شماره‌ای که با شما تماس گرفته یا لینکی که می‌فرستند، ارتباط برقرار نکنید.

برای خانواده‌ها، توصیه می‌شود از یک «عبارت رمز» (Code Phrase) استفاده کنند. برخلاف سوالات امنیتی (مثل «اسم سگ شما چیست؟») که می‌توان آن‌ها را در شبکه‌های اجتماعی پیدا کرد، یک کلمه رمز مشترک و محرمانه را نمی‌توان با هوش مصنوعی استخراج کرد. FBI صراحتاً توصیه می‌کند که برای تأیید هویت، یک کلمه رمز با اعضای خانواده ایجاد کنید.

جزئیات گام‌های دفاعی

برای متوقف کردن این حملات، دقیقاً این پروتکل را دنبال کنید:

  • قطع تماس و تماس مجدد: تماس را فوراً قطع کنید. با شماره‌ای که از قبل دارید با شخص یا سازمان تماس بگیرید. این کار باعث می‌شود وقتی با شخص واقعی ارتباط می‌گیرید، جعل هویت فاش شود.
  • رد کردن فشار زمانی: درخواست‌های مشروع با یک وقفه کوتاه از بین نمی‌روند. به تماس‌گیرنده بگویید که بعداً تماس می‌گیرید و سپس این کار را طبق شرایط خودتان انجام دهید. فوریتی که تحمل ۵ دقیقه تأخیر را نداشته باشد، خودِ کلاهبرداری است.
  • حفاظت از کدهای یک‌بار مصرف: هرگز کد یک‌بار مصرف (OTP) یا کد ۲FA را برای کسی که به‌طور غیرمنتظره تماس گرفته است، نخوانید. در عوض، از طریق کانال‌های رسمی با سازمان مربوطه تماس بگیرید.
  • تأیید خارج از باند (Out-of-band): برای هر درخواست پول، دستورالعمل‌های حواله یا پرداخت را پیش از ارسال هر مبلغی، از طریق یک کانال شناخته‌شده تأیید کنید؛ به‌ویژه اگر درخواست «محرمانه» است.

نشانه‌های خطر (Red Flags)

بیشتر کلاهبرداری‌های صوتی هوش مصنوعی اثرانگشت‌های مشابهی دارند. نکته کلیدی در «چگونگی صدای فرد» نیست، بلکه در «چیزی است که می‌خواهد» و «سرعتی است که آن را می‌طلبد». نسبت به این محرک‌های خاص هوشیار باشید:

  • فوریت ساختگی: تقاضا برای اقدام ظرف چند دقیقه (مثلاً «تا ده دقیقه دیگر به این پول نیاز دارم»).
  • پرداخت‌های غیرمعمول: درخواست کارت‌های هدیه، ارزهای دیجیتال یا حواله به حساب‌های «محرمانه».
  • رازداری: دستوراتی برای مخفی نگه داشتن تراکنش تا از نظر دادن شخص دوم جلوگیری شود.
  • درخواست اعتبارنامه‌ها: درخواست کدهای ورود یک‌بار مصرف یا ۲FA از طریق تلفن. هرگز این‌ها را برای تماس‌گیرنده‌ای که انتظارش را ندارید نخوانید.
  • تغییر پلتفرم: درخواست‌هایی مانند «به جای اینجا، به این شماره پیام بده». از طریق کانالی که از قبل به آن اعتماد دارید تأیید کنید.
  • آشنایی غیرمنتظره: شنیدن صدای آشنا در تماسی که انتظارش را نداشتید، دلیلی برای اثبات هویت نیست.

دفاع‌های ساختاری برای کسب‌وکارها

هوشیاری فردی در یک سلسله‌مراتب شرکتی که در آن دستور «مدیرعامل» می‌تواند کارکنان رده‌پایین را بترساند، کافی نیست. نقطه ضعف، انسانی است که تحت فشار قرار دارد و راه حل، فرآیندی است که فشار نتواند آن را دور بزند. شرکت‌ها باید کنترل‌های ساختاری را برای توقف تقلب‌های دیپ‌فیک اجرا کنند:

  • تأیید دوگانه (Dual Approval): برای حواله‌های بانکی بالاتر از یک سقف مشخص، تأیید دو نفر را الزامی کنید.
  • تماس‌های بازگشتی اجباری: پروتکلی ایجاد کنید که هر درخواست پرداخت تلفنی یا ویدیویی باید از طریق یک کانال مجزا و شناخته‌شده تأیید شود.
  • تغییر فرهنگی: فرهنگی را ترویج کنید که در آن یک کارمند رده‌پایین بتواند تراکنشی را که مدیر مالی «دستور» داده است، بدون ترس از تلافی، متوقف کند.
  • حداقل‌سازی داده‌ها: مقدار صداها و ویدیوهای باکیفیت مدیران را که به‌صورت عمومی در دسترس است محدود کنید تا داده‌های آموزشی مدل‌های شبیه‌سازی کاهش یابد.

پاسخ‌های نظارتی و قانونی

رگولاتورها در حال بستن شکاف‌های قانونی هستند. در فوریه ۲۰۲۴، FCC حکم داد که صداهای تولید شده توسط هوش مصنوعی تحت «قانون حفاظت از مصرف‌کننده تلفن» به عنوان صداهای «مصنوعی» شناخته می‌شوند. این بدان معناست که تماس‌های رباتیک (Robocalls) که از صداهای کلون شده استفاده می‌کنند، مشمول محدودیت‌های موجود هستند و به دادستان‌های ایالتی ابزاری مستقیم برای تعقیب مجرمان می‌دهند. این حکم پس از یک تماس رباتیک جعلی صادر شد که صدای رئیس‌جمهور بایدن را پیش از انتخابات مقدماتی نیوهمپشایر تقلید کرده بود.

با این حال، احکام قانونی به‌ندرت می‌توانند مهاجمان مصمم خارج از کشور را متوقف کنند. همان جهش مولدی که ابزارهای قانونی (مانند ابزارهای مایکروسافت و آنتروپیک) را قدرت می‌بخشد، همان چیزی است که شبیه‌سازی ۳ ثانیه‌ای را ممکن می‌کند. تنها دفاع قابل اعتماد، یک فرآیند تأیید سخت‌گیرانه است که با هر صدای آشنای غیرمنتظره به عنوان یک جعل احتمالی برخورد کند تا زمانی که خلاف آن ثابت شود.

خلاصه حقایق کلیدی (۲۰۲۶)

برای درک مقیاس این تهدید، این ارقام مستند را در نظر بگیرید:

  • حداقل صوتی: برخی ابزارهای تجاری شبیه‌سازی را تنها با ۳ ثانیه صدا تبلیغ می‌کنند.
  • مجموع خسارات کلاهبرداری سایبری آمریکا در ۲۰۲۵: حدود ۲۰.۹ میلیارد دلار (بیشترین مقدار در تاریخ).
  • خسارات خاص هوش مصنوعی: حدود ۸۹۳ میلیون دلار در ۲۲,۳۶۴ شکایت (که احتمالاً کمتر از مقدار واقعی گزارش شده است).
  • مثال خسارت شرکتی: ۲۵.۶ میلیون دلار خسارت شرکت Arup در سال ۲۰۲۴.
  • کانال‌های گزارش‌دهی: ic3.gov (FBI) و reportfraud.ftc.gov (FTC).

معنای این وضعیت برای کیف پول شما ساده است: هزینه اعتماد بالا رفته است. در عصر کلون‌های سه ثانیه‌ای، تنها تراکنش امن، تراکنشی است که از طریق کانالی که شما به‌طور مستقل کنترل می‌کنید، تأیید شود. اگر به کلاهبرداری مشکوک شدید، ارتباط را قطع کنید، تماس را پایان دهید و حادثه را به ic3.gov یا reportfraud.ftc.gov گزارش دهید.

اما داستان سخت‌افزاری این تحول و نحوه پردازش این مدل‌های صوتی حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و سرعت استنتاج آن‌ها مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با تکیه بر داده‌های رسمی FBI، اعتبار تهدیدات جعل عمیق را از حد تئوری به خسارات میلیاردی رساند. اکنون سازمان‌ها مجبورند فرآیندهای تأیید هویت خود را از حالت تک‌مرحله‌ای به سیستم‌های چندعاملی و سخت‌گیرانه تغییر دهند.

تأثیر برای ایران

با توجه به گسترش استفاده از پیام‌رسان‌هایی مثل واتس‌اپ و تلگرام در ایران، احتمال اجرای این مدل حملات با استفاده از نمونه‌های صوتی کاربران ایرانی بالاست. توصیه می‌شود خانواده‌ها و کسب‌وکارهای کوچک سریعاً کلمات رمز محرمانه تعریف کنند.

·نگاه ما
تحریریه دات‌هوش

انتقال کلاهبرداری از متون متقاعدکننده به صداهای تک‌نسخه‌ای، نقطه پایان عصر «اعتماد به حس شنوایی» است. این وضعیت نشان می‌دهد که امنیت در عصر هوش مصنوعی دیگر یک مسئله فنی یا نرم‌افزاری نیست، بلکه یک مسئله فرهنگی و رفتاری است؛ یعنی جایگزینی «اعتماد به حس» با «اعتماد به پروتکل».

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.