پرش به محتوای اصلی
پرش به محتوای مقاله

قمار ۴ میلیارد دلاری Synthesia برای جایگزینی روابط عمومی با آواتارهای تعاملی

·۴ مهر ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
آواتار دیجیتال تعاملی از خودم ساختم — می‌توانید با آن صحبت کنید | تک‌کرانچ
آواتار دیجیتال تعاملی از خودم ساختم — می‌توانید با آن صحبت کنید | تک‌کرانچ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از ویدیوهای اسکریپت‌محور به عامل‌های تعاملی که می‌توانند در لحظه گوش دهند و پاسخ دهند. نوآوری اصلی در استفاده از مدل‌های قطعی برای حذف توهمات در محیط‌های حساس سازمانی است.

تصور کنید یک خبرنگار برای دریافت پاسخ درباره کلاهبرداری‌های سرمایه‌گذاری، به‌جای تماس با مدیر شرکت، با یک نسخه دیجیتال و دقیق از خودِ آن خبرنگار گفتگو کند. این دیگر یک صحنه از فیلم‌های علمی-تخیلی نیست، بلکه استراتژی جدیدی است که Synthesia برای تغییر بنیادین روابط عمومی شرکت‌ها به کار گرفته است. این شرکت با یک قمار ۴ میلیارد دلاری، قصد دارد روابط عمومی شرکتی را با آواتارهای تعاملی جایگزین کند. با استقرار یک همزاد دیجیتال از یک خبرنگار برای مدیریت پرسش‌های مطبوعاتی درباره کلاهبرداری‌های سرمایه‌گذاری خطرپذیر (VC)، این شرکت در حال تغییر مسیر از ویدیوهای ایای استاتیک به سمت آواتارهای «عامل‌محور» (Agentic) است؛ موجوداتی که به‌جای خواندن ساده‌ی متون، قادرند در لحظه گوش دهند، پردازش کنند و پاسخ دهند.

آواتارهای دیجیتال تا پیش از این بیشتر ابزاری برای سرگرمی در شبکه‌های اجتماعی یا ویدیوهای ارائه‌ای ساده بودند. نویسنده اشاره می‌کند که کاربران اینستاگرام پیش از این از شباهت‌های دیجیتال برای تولید محتوای اجتماعی استفاده می‌کردند. اما اکنون صنعت به سمت کلون‌های با دقت بالا (High-fidelity) حرکت می‌کند که مستقیماً در جریان‌های کاری سازمانی ادغام شوند. این تحول در زمانی رخ می‌دهد که شرکت‌ها به‌دنبال شخصی‌سازی ارتباطات در مقیاس وسیع هستند، بدون اینکه نیاز باشد تعداد کارکنان انسانی خود را افزایش دهند.

Synthesia که یک استارتاپ بریتانیایی است و اکنون در نیویورک فعالیت می‌کند، خود را در مرکز این تغییر قرار داده است. این شرکت در کنار رقبایی چون D-ID، HeyGen و Colossyan پیشتاز این حوزه است. طبق گزارش TechCrunch که در ۲۶ سپتامبر ۲۰۲۶ منتشر شد، این شرکت در اوایل سال جاری به ارزش ۴ میلیارد دلار رسید و گزارش داد که سال گذشته درآمد سالانه تکرارشونده‌ای (ARR) بیش از ۱۰۰ میلیون دلار ثبت کرده است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، هرگونه اتوماسیون در سطح سازمانی با چالش اعتماد روبروست. در مورد Synthesia، این تغییر زمانی آغاز شد که الکساندرو ووئیکا، مدیر امور شرکتی شرکت، یک آواتار تعاملی از خودش را منتشر کرد. این آواتار به‌طور خاص آموزش دیده بود تا به پرسش‌های متداول مطبوعاتی درباره ماهیت Synthesia و سازوکار فناوری آن پاسخ دهد. این اقدام یک جهش قابل توجه نسبت به استفاده‌های ساده از متن‌های تولید شده توسط هوش مصنوعی در پیشنهادهای روابط عمومی (PR pitches) محسوب می‌شود.

برای ساخت این «همزاد دیجیتال» از خبرنگار، فرآیند ضبط در یک استودیوی کوچک فیلم‌برداری در داخل دفتر نیویورک Synthesia انجام شد. این فرآیند مستلزم آن بود که فرد مورد نظر پیش از تولید آواتارها، رضایت رسمی خود را اعلام کند. نتیجه این کار، مجموعه‌ای شامل یک آواتار شخصی (که متنی ارائه شده را می‌خواند) و یک آواتار تعاملی (که می‌تواند گوش دهد و پاسخ دهد) بود. هر دو نسخه در دو حالت «با عینک» و «بدون عینک» ساخته شدند.

ساخت یک آواتار تعاملی با کیفیت بالا نیازمند یک خط لوله چندمدلی (Multi-model pipeline) است. این مسیر با یک جلسه ضبط فیزیکی آغاز می‌شود که شامل عکس‌های متعدد و یک نمونه صوتی دو دقیقه‌ای برای ثبت دقیق شباهت ظاهری و لحن فرد است. سپس تجربه تعاملی توسط چهار لایه متمایز مدیریت می‌شود:

  • تبدیل گفتار به متن (Voice-to-Text): ورودی صوتی کاربر را به یک رشته متنی تبدیل می‌کند.
  • مدل زبانی عامل‌محور (Agentic Language Model): متن را پردازش کرده و بر اساس داده‌های آموزشی، اقدام یا پاسخ مناسب را تعیین می‌کند. این رویکرد به مدل‌های برنامه‌ریز شباهت دارد که مانند تلاش‌های دانیجار هافنر برای ساخت ربات‌های هوشمند، سعی در تبدیل داده‌ها به اقدامات هدفمند دارند.
  • تبدیل متن به گفتار (Text-to-Voice): پاسخ تولید شده را دوباره به سیگنال صوتی تبدیل می‌کند.
  • مدل ویدیو: موتور انیمیشن اختصاصی Synthesia که حرکات لب و میمیک صورت آواتار را با صدا هماهنگ می‌کند.

در حالی که Synthesia مدل‌های صوتی و ویدیویی خود را ارائه می‌دهد، این پلتفرم به شرکت‌ها اجازه می‌دهد تا جایگزین‌هایی از ElevenLabs، Google، OpenAI یا Cartesia را جایگزین کنند. همچنین شرکت‌ها می‌توانند بین میزبانی توسط Synthesia یا استفاده از زیرساخت ابری خصوصی خود انتخاب کنند.

Synthesia محصولات خود را در سه سطح دسته‌بندی کرده است تا نیازهای مختلف تجاری را پوشش دهد:

۱. پلتفرم ساخت ویدیو: مدل کلاسیک که در آن کاربران یک متن را تایپ می‌کنند و یک آواتار استاتیک آن را برای توزیع تکرار می‌کند.
۲. Sessions (پلتفرم عامل‌محور): یک محیط تعاملی که در آن آواتارها در نظرسنجی‌ها یا نقش‌آفرینی‌ها شرکت می‌کنند. این بخش شامل «جلسات نقش‌آفرینی» است که در آن کارکنان تمرین ارائه‌های فروش (Sales pitches) را انجام می‌دهند و نمراتی تولید شده توسط هوش مصنوعی درباره عملکردشان دریافت می‌کنند.
۳. پلتفرم API: مجموعه‌ای از ابزارها برای توسعه‌دهندگان که به شخص ثالث اجازه می‌دهد مدل‌های Synthesia را با سرویس‌های دیگر ترکیب کرده و محصولات تعاملی سفارشی بسازند.

یکی از کلیدی‌ترین مفاهیم در اینجا، تفاوت بین مدل‌های قطعی (Deterministic) و غیرقطعی است. آواتار خبرنگار به‌صورت یک عامل قطعی ساخته شده بود؛ به این معنی که منحصراً روی یک داستان خاص درباره اینکه چرا استارتاپ‌های تحت حمایت سرمایه‌گذاران خطرپذیر (VC) بیشتر از استارتاپ‌های غیر VC مرتکب کلاهبرداری می‌شوند، آموزش دیده بود.

در تست‌های انجام شده، مرزهای این مدل بسیار سخت‌گیرانه بود. وقتی از آواتار درباره سوابق شغلی خبرنگار پیش از TechCrunch یا اینکه در کدام محله نیویورک زندگی می‌کند پرسیده شد، مدل کاربر را دوباره به موضوع کلاهبرداری سرمایه‌گذاری بازگرداند. حتی والدین خبرنگار که سعی کردند سوالاتی بپرسند که «فقط آن‌ها باید می‌دانستند»، به داده‌های آموزشی ارجاع داده شدند. این رویکرد از توهم (Hallucination) — که در چت‌بات‌های باز رایج است — جلوگیری می‌کند و تضمین می‌کند که AI طبق استراتژی برند و بر اساس واقعیت‌ها صحبت کند.

با این حال، انتقال به آواتارهای غیرقطعی — آن‌هایی که توسط مدل‌های زبانی بزرگ (LLM) با دسترسی آزاد هدایت می‌شوند — ریسک «سایکوز AI» را به همراه دارد؛ جایی که آواتار ممکن است شروع به سخنرانی‌های طولانی یا رفتارهای غیرقابل‌پیش‌بینی کند. نویسنده اشاره می‌کند که هنگام تماشای یک آواتار قطعی، وقتی صحبتش تمام می‌شود، نوعی احساس ناخوشایند ایجاد می‌شود؛ زیرا کاربر منتظر یک پلک زدن یا لبخندی است که هرگز نمی‌آید، چون مدل خودمختار (Autonomous) نیست.

این فناوری پرسش‌های بنیادینی درباره اعتماد حرفه‌ای ایجاد می‌کند. در حالی که یک مدیرعامل ممکن است آواتار AI را برای به‌روزرسانی‌های روتین مفید بداند، هسته ژورنالیسم بر ارتباط انسانی و اعتبار استوار است. نویسنده استدلال می‌کند که اگرچه تحقیق و نوشتن می‌تواند تقویت شود، اما «اعتماد» را نمی‌توان به یک هوش مصنوعی برون‌سپاری کرد.

مقاومت قابل توجهی در برابر «زباله‌های هوش مصنوعی» (AI slop) در شبکه‌های اجتماعی وجود دارد و برخی سرمایه‌گذاران معتقدند اخباری که توسط آواتارها ارائه شود، توسط مخاطبان رد خواهد شد. یکی از سرمایه‌گذاران در پاسخ به این سوال که آیا مردم با اخبار ارائه شده توسط آواتار راحت هستند، بلافاصله پاسخ «نه» داد. توانایی برون‌سپاری «ارائه» اطلاعات اکنون حل شده است؛ اما توانایی برون‌سپاری «اعتمادی» که با آن اطلاعات همراه است، همچنان مانع اصلی است.

برای دنیای کسب‌وکار، جذابیت این ابزار کاربردی‌تر است. احتمال اینکه یک کلون دیجیتال کارهای روتین یا پاسخ به سوالات متداول (FAQ) را در زمان تعطیلات انسانی مدیریت کند، یک جهش بهره‌وری برای تیم‌های روابط عمومی و امور شرکتی است. با این حال، یک شکاف نسلی وجود دارد. نویسنده پیشنهاد می‌کند که نسل Z ممکن است در عادت کردن به همزادهای دیجیتال دچار مشکل شوند زیرا این ابزارها بیش از حد شبیه فیلم‌های علمی-تخیلی هستند و هر آنچه در سینما دیده شده را بازتاب می‌دهند. با این حال، آن‌ها کمتر از ربات‌های انسان‌نما (Humanoid) تکان‌دهنده هستند، زیرا کاربر در صورت عجیب شدن تجربه، می‌تواند به‌سادگی از سیستم خارج شود.

گام بعدی شما

  • اگر مدیر محتوا یا روابط عمومی هستید، قابلیت‌های پلتفرم Sessions را برای اتوماسیون پاسخ به سوالات متداول بررسی کنید.
  • در صورت استفاده از API، مدل‌های صوتی ElevenLabs را برای افزایش طبیعی بودن لحن آواتارها تست کنید.
  • تفاوت بین مدل‌های قطعی و غیرقطعی را در استراتژی برندینگ خود لحاظ کنید تا از توهمات مدل جلوگیری شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار فنی Synthesia، مرز بین محتوای تولید شده توسط AI و تعامل زنده را از بین می‌برد. اثر آن کاهش هزینه‌های عملیاتی در بخش‌های PR و آموزش سازمانی است، اما هم‌زمان چالش‌های اخلاقی جدیدی در مورد هویت دیجیتال ایجاد می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به پلتفرم Sessions برای شرکت‌های ایرانی دشوار است. با این حال، این مدل می‌تواند الگوی جدیدی برای اتوماسیون پشتیبانی مشتریان در استارتاپ‌های داخلی باشد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «اعتبار انسانی» با «دقت مدل‌های قطعی» بزرگ‌ترین ریسک Synthesia است. در حالی که اتوماسیون پاسخ‌های روتین بهره‌وری را بالا می‌برد، اما در بحران‌های ارتباطی، نبودِ همدلی انسانی می‌تواند اثر عکس بگذارد. این حرکت نشان می‌دهد که آینده‌ی آواتارها نه در شبیه‌سازی ظاهر، بلکه در کنترل دقیقِ خروجی (Determinism) برای جلوگیری از توهمات است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.