پرش به محتوای اصلی
پرش به محتوای مقاله

DetectifAI تشخیص جعل عمیق صوتی را به سخت‌افزار گوشی منتقل کرد

·۶ مهر ۱۴۰۵۴ دقیقه مطالعه
پدربزرگش با صدای جعلی فریب خورد؛ بنیان‌گذار برای مقابله با دیپ‌فیک صوتی وارد عمل شد
پدربزرگش با صدای جعلی فریب خورد؛ بنیان‌گذار برای مقابله با دیپ‌فیک صوتی وارد عمل شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

طراحی مدل‌های تشخیص جعل عمیق به‌صورت Native برای سیستم‌عامل گوشی، به‌جای کوانتایز کردن مدل‌های ابری؛ این یعنی تشخیص آنی بدون خروج داده از دستگاه.

تصور کنید پدربزرگ شما تماسی دریافت می‌کند و صدای برادرش را می‌شنود که ادعا می‌کند ربوده شده است؛ او بدون شک مبلغ هنگفتی را می‌پردازد، اما در واقع با یک مدل هوش مصنوعی طرف بوده است. این کابوس شخصی، نقطه شروع تأسیس DetectifAI بود تا هیچ‌کس در لحظه تماس، بی‌دفاع نباشد.

تارینی پادمانابونی، مؤسس شرکت، این مسیر را پس از یک بحران خانوادگی آغاز کرد. پدربزرگ او تماسی دریافت کرد که در آن شخصی با صدای دقیق برادرش ادعا می‌کرد ربوده شده و درخواست باج کرد. پدربزرگ او مبلغ را پرداخت کرد، اما بعداً متوجه شد که برادرش در جای دیگری بوده و اصلاً از این کلاهبرداری بی‌خبر است. پادمانابونی به یاد می‌آورد که تکان‌دهنده‌ترین بخش این اتفاق، ضرر مالی نبود، بلکه این حقیقت بود که پدربزرگش هیچ راهی نداشت تا بفهمد آن صدا یک جعل عمیق (Deepfake) است.

طبق داده‌های FBI، آمریکایی‌ها سال گذشته نزدیک به ۹۰۰ میلیون دلار را به کلاهبرداری‌های مبتنی بر هوش مصنوعی باخته‌اند که نسبت به سال ۲۰۲۴ افزایشی ۲۴ درصدی را نشان می‌دهد. به همین دلیل، این استارتاپ مستقر در سان‌فرانسیسکو تصمیم گرفت تشخیص جعل عمیق — شبیه به یک نگهبان دیجیتال که لرزش‌های غیرطبیعی صدا را می‌شناسد — را از سرورهای دوردست به سخت‌افزار گوشی منتقل کند.

همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های مولد اشاره کردیم، تأخیر در پردازش داده‌ها بزرگ‌ترین نقطه ضعف سیستم‌های امنیتی است. در حال حاضر، ابزارهای تشخیص جعل عمیق یا بسیار کند هستند یا برای تحلیل صدا نیاز به ارسال فایل به سرور دارند، که این یعنی کاربر در حین یک تماس زنده، عملاً هیچ حفاظتی ندارد. این حادثه خانوادگی پادمانابونی دقیقاً همین آسیب‌پذیری بحرانی را برجسته می‌کند.

DetectifAI برخلاف رقبایی مثل Reality Defender، Pindrop، Resemble AI، Nuance یا Microsoft Azure AI Content Safety که بر پردازش ابری تکیه می‌کنند، مسیر فنی متفاوتی را برگزیده است. این شرکت به‌جای کوچک کردن مدل‌های غول‌پیکر ابری برای گنجاندن در گوشی، مدل‌های هوش مصنوعی فشرده‌ای را از پایه طراحی کرده است. این مدل‌ها به‌قدری کوچک هستند که درون سیستم‌عامل گوشی جای می‌گیرند و تضمین می‌کنند که هیچ داده صوتی هرگز از دستگاه خارج نشود.

بر اساس مستندات این شرکت، فناوری آن‌ها از طریق یک کیت توسعه نرم‌افزاری (SDK) — مثل یک جعبه‌ابزار آماده از کدها که برنامه‌نویسان دیگر می‌توانند آن را به محصول خود اضافه کنند — توزیع می‌شود. هدف این است که تشخیص جعل عمیق به یک استاندارد سخت‌افزاری تبدیل شود، درست مثل رزولوشن دوربین گوشی‌ها. پادمانابونی این پتانسیل را با نقش انحصاری AT&T در زمان عرضه اولین آیفون مقایسه می‌کند و معتقد است اولین تولیدکننده گوشی که این فناوری را عرضه کند، برتری رقابتی قابل‌توجهی کسب خواهد کرد.

جزئیات عملیاتی این سیستم عبارت است از:

  • ادغام مستقیم در سیستم‌عامل: اعطای مجوز ابزارها به تولیدکنندگان برای ارائه قابلیت تشخیص به عنوان یک ویژگی پیش‌فرض و داخلی در سیستم‌عامل.
  • لایسنس B2B: ارائه ابزارهای پیشگیری از کلاهبرداری به کسب‌وکارها و مؤسسات مالی به عنوان یک منبع درآمد ثانویه. این رویکرد در راستای تلاش‌های گسترده‌تر برای بازرسی و تأیید زنجیره تأمین نرم‌افزاری عامل‌های هوش مصنوعی است تا امنیت سیستم‌های خودکار تضمین شود.
  • میزان پذیرش: این استارتاپ در حال حاضر بیش از ۱۰۰ هزار تماس در ماه را برای مؤسسات مالی در هند پردازش می‌کند. این تماس‌ها مربوط به عوامل صوتی هوش مصنوعی است که امور وصول بدهی‌ها و پیگیری اسناد وام را مدیریت می‌کنند و از هر دو قابلیت تشخیص جعل عمیق و تأیید گوینده برای احراز هویت استفاده می‌کنند.

با حذف رفت‌وبرگشت داده‌ها به سرور ابری، این سیستم در لحظه اعلام می‌کند که آیا صدا در حین تماس‌ها، پیام‌های صوتی و سایر فایل‌های صوتی، توسط هوش مصنوعی تولید شده است یا خیر. این قابلیت برای سالمندان حیاتی است؛ چرا که طبق گزارش FBI، افراد ۶۰ سال و بالاتر، دو برابر بیشتر از گروه سنی ۵۰ تا ۵۹ سال، مبلغات هنگفتی را در این کلاهبرداری‌ها از دست داده‌اند.

برای یک کاربر عادی، این به معنای آن است که خود گوشی مانند یک دیوار آتش (Firewall) عمل می‌کند. شما دیگر نیازی ندارید یک کلیپ مشکوک را به اپلیکیشنی ثالث بفرستید؛ سیستم‌عامل به‌صورت آنی صدای مصنوعی را شناسایی و علامت‌گذاری می‌کند. این موضوع در یک تست بتا در واتس‌اپ به نمایش درآمد، جایی که کاربران یادداشت‌های صوتی مشکوک را برای ارزیابی ارسال می‌کردند. یکی از آزمایش‌کنندگان که بستگانش قربانی کلاهبرداری شده بودند، اظهار داشت که بدون هیچ تردیدی برای این سرویس هزینه پرداخت می‌کند.

تارینی پادمانابونی، مؤسس این شرکت، تخصص خود را از سنین پایین آغاز کرد و در ۱۲ سالگی کار در زمینه یادگیری ماشین را شروع نمود. او بعدها در مؤسسه فناوری مانیپال در هند در رشته سیستم‌های سایبر-فیزیکی تحصیل کرد. او در آنجا به جوان‌ترین رهبر تیم برای اولین بخش خودروهای مسابقه‌ای بدون راننده هند در رقابت‌های Formula Student (یک رقابت مهندسی بین‌المللی) تبدیل شد.

DetectifAI موفق به جذب سرمایه اولیه (Seed Funding) از سرمایه‌گذاران برجسته‌ای چون جاش کنستاین (سابقاً ویراستار TechCrunch) و مانوهار کامات (مدیر در KM Growth) شده است. این استارتاپ اکنون برای حضور در رقابت Startup Battlefield در رویداد TechCrunch Disrupt که از ۱۳ تا ۱۵ اکتبر در مرکز شهر سان‌فرانسیسکو برگزار می‌شود، در حال ارزیابی است.

گام بعدی شما

  • اگر در سازمان‌های مالی فعالیت می‌کنید، مدل‌های رایانش لبه (Edge Computing) را برای کاهش تأخیر در احراز هویت بررسی کنید. این فناوری مشابه رویکردهای نوین در تبدیل حجم عظیم داده‌های محلی به پایگاه‌های دانش قابل جستجو است که بر پردازش در محل تمرکز دارند.
  • در تماس‌های مشکوک، از متدهای تأیید هویت خارج از تماس (Out-of-band) استفاده کنید تا زمانی که این ابزارها استاندارد شوند.
  • تحولات مربوط به تراشه‌های NPU در گوشی‌های جدید را دنبال کنید، زیرا زیربنای اجرای این مدل‌های فشرده هستند.

اما نبرد اصلی اکنون بر سر دسترسی به داده‌های آموزشی برای مدل‌های لبه است — به تحلیل ما درباره حریم خصوصی در مدل‌های کوچک مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با حذف تأخیر ابری، اعتبار تشخیص را در لحظه تماس فراهم می‌کند و امنیت کاربران آسیب‌پذیر را تضمین می‌کند. تکیه بر سخت‌افزار به جای نرم‌افزار، استانداردهای جدیدی برای تولیدکنندگان گوشی‌های هوشمند ایجاد خواهد کرد.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به SDKهای پیشرفته و تحریم‌های سخت‌افزاری، این قابلیت فعلاً برای کاربران ایرانی در دسترس نیست، اما برای توسعه‌دهندگان داخلی در حوزه امنیت صوتی، الگوی مناسبی برای پیاده‌سازی مدل‌های لبه است.

·نگاه ما
تحریریه دات‌هوش

انتقال تشخیص جعل از ابر به لبه (Edge)، پارادایم امنیتی را از «واکنش پس از حادثه» به «پیشگیری در لحظه» تغییر می‌دهد. این رویکرد نشان می‌دهد که آینده امنیت هوش مصنوعی نه در مدل‌های بزرگ‌تر، بلکه در مدل‌های تخصصی و فشرده‌ای است که در لایه‌های پایین‌تر سخت‌افزار ادغام می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.