تصور کنید یک خبرنگار برای دریافت پاسخ درباره کلاهبرداریهای سرمایهگذاری، بهجای تماس با مدیر شرکت، با یک نسخه دیجیتال و دقیق از خودِ آن خبرنگار گفتگو کند. این دیگر یک صحنه از فیلمهای علمی-تخیلی نیست، بلکه استراتژی جدیدی است که Synthesia برای تغییر بنیادین روابط عمومی شرکتها به کار گرفته است. این شرکت با یک قمار ۴ میلیارد دلاری، قصد دارد روابط عمومی شرکتی را با آواتارهای تعاملی جایگزین کند. با استقرار یک همزاد دیجیتال از یک خبرنگار برای مدیریت پرسشهای مطبوعاتی درباره کلاهبرداریهای سرمایهگذاری خطرپذیر (VC)، این شرکت در حال تغییر مسیر از ویدیوهای ایای استاتیک به سمت آواتارهای «عاملمحور» (Agentic) است؛ موجوداتی که بهجای خواندن سادهی متون، قادرند در لحظه گوش دهند، پردازش کنند و پاسخ دهند.
آواتارهای دیجیتال تا پیش از این بیشتر ابزاری برای سرگرمی در شبکههای اجتماعی یا ویدیوهای ارائهای ساده بودند. نویسنده اشاره میکند که کاربران اینستاگرام پیش از این از شباهتهای دیجیتال برای تولید محتوای اجتماعی استفاده میکردند. اما اکنون صنعت به سمت کلونهای با دقت بالا (High-fidelity) حرکت میکند که مستقیماً در جریانهای کاری سازمانی ادغام شوند. این تحول در زمانی رخ میدهد که شرکتها بهدنبال شخصیسازی ارتباطات در مقیاس وسیع هستند، بدون اینکه نیاز باشد تعداد کارکنان انسانی خود را افزایش دهند.
Synthesia که یک استارتاپ بریتانیایی است و اکنون در نیویورک فعالیت میکند، خود را در مرکز این تغییر قرار داده است. این شرکت در کنار رقبایی چون D-ID، HeyGen و Colossyan پیشتاز این حوزه است. طبق گزارش TechCrunch که در ۲۶ سپتامبر ۲۰۲۶ منتشر شد، این شرکت در اوایل سال جاری به ارزش ۴ میلیارد دلار رسید و گزارش داد که سال گذشته درآمد سالانه تکرارشوندهای (ARR) بیش از ۱۰۰ میلیون دلار ثبت کرده است.
همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، هرگونه اتوماسیون در سطح سازمانی با چالش اعتماد روبروست. در مورد Synthesia، این تغییر زمانی آغاز شد که الکساندرو ووئیکا، مدیر امور شرکتی شرکت، یک آواتار تعاملی از خودش را منتشر کرد. این آواتار بهطور خاص آموزش دیده بود تا به پرسشهای متداول مطبوعاتی درباره ماهیت Synthesia و سازوکار فناوری آن پاسخ دهد. این اقدام یک جهش قابل توجه نسبت به استفادههای ساده از متنهای تولید شده توسط هوش مصنوعی در پیشنهادهای روابط عمومی (PR pitches) محسوب میشود.
برای ساخت این «همزاد دیجیتال» از خبرنگار، فرآیند ضبط در یک استودیوی کوچک فیلمبرداری در داخل دفتر نیویورک Synthesia انجام شد. این فرآیند مستلزم آن بود که فرد مورد نظر پیش از تولید آواتارها، رضایت رسمی خود را اعلام کند. نتیجه این کار، مجموعهای شامل یک آواتار شخصی (که متنی ارائه شده را میخواند) و یک آواتار تعاملی (که میتواند گوش دهد و پاسخ دهد) بود. هر دو نسخه در دو حالت «با عینک» و «بدون عینک» ساخته شدند.
ساخت یک آواتار تعاملی با کیفیت بالا نیازمند یک خط لوله چندمدلی (Multi-model pipeline) است. این مسیر با یک جلسه ضبط فیزیکی آغاز میشود که شامل عکسهای متعدد و یک نمونه صوتی دو دقیقهای برای ثبت دقیق شباهت ظاهری و لحن فرد است. سپس تجربه تعاملی توسط چهار لایه متمایز مدیریت میشود:
- تبدیل گفتار به متن (Voice-to-Text): ورودی صوتی کاربر را به یک رشته متنی تبدیل میکند.
- مدل زبانی عاملمحور (Agentic Language Model): متن را پردازش کرده و بر اساس دادههای آموزشی، اقدام یا پاسخ مناسب را تعیین میکند. این رویکرد به مدلهای برنامهریز شباهت دارد که مانند تلاشهای دانیجار هافنر برای ساخت رباتهای هوشمند، سعی در تبدیل دادهها به اقدامات هدفمند دارند.
- تبدیل متن به گفتار (Text-to-Voice): پاسخ تولید شده را دوباره به سیگنال صوتی تبدیل میکند.
- مدل ویدیو: موتور انیمیشن اختصاصی Synthesia که حرکات لب و میمیک صورت آواتار را با صدا هماهنگ میکند.
در حالی که Synthesia مدلهای صوتی و ویدیویی خود را ارائه میدهد، این پلتفرم به شرکتها اجازه میدهد تا جایگزینهایی از ElevenLabs، Google، OpenAI یا Cartesia را جایگزین کنند. همچنین شرکتها میتوانند بین میزبانی توسط Synthesia یا استفاده از زیرساخت ابری خصوصی خود انتخاب کنند.
Synthesia محصولات خود را در سه سطح دستهبندی کرده است تا نیازهای مختلف تجاری را پوشش دهد:
۱. پلتفرم ساخت ویدیو: مدل کلاسیک که در آن کاربران یک متن را تایپ میکنند و یک آواتار استاتیک آن را برای توزیع تکرار میکند.
۲. Sessions (پلتفرم عاملمحور): یک محیط تعاملی که در آن آواتارها در نظرسنجیها یا نقشآفرینیها شرکت میکنند. این بخش شامل «جلسات نقشآفرینی» است که در آن کارکنان تمرین ارائههای فروش (Sales pitches) را انجام میدهند و نمراتی تولید شده توسط هوش مصنوعی درباره عملکردشان دریافت میکنند.
۳. پلتفرم API: مجموعهای از ابزارها برای توسعهدهندگان که به شخص ثالث اجازه میدهد مدلهای Synthesia را با سرویسهای دیگر ترکیب کرده و محصولات تعاملی سفارشی بسازند.
یکی از کلیدیترین مفاهیم در اینجا، تفاوت بین مدلهای قطعی (Deterministic) و غیرقطعی است. آواتار خبرنگار بهصورت یک عامل قطعی ساخته شده بود؛ به این معنی که منحصراً روی یک داستان خاص درباره اینکه چرا استارتاپهای تحت حمایت سرمایهگذاران خطرپذیر (VC) بیشتر از استارتاپهای غیر VC مرتکب کلاهبرداری میشوند، آموزش دیده بود.
در تستهای انجام شده، مرزهای این مدل بسیار سختگیرانه بود. وقتی از آواتار درباره سوابق شغلی خبرنگار پیش از TechCrunch یا اینکه در کدام محله نیویورک زندگی میکند پرسیده شد، مدل کاربر را دوباره به موضوع کلاهبرداری سرمایهگذاری بازگرداند. حتی والدین خبرنگار که سعی کردند سوالاتی بپرسند که «فقط آنها باید میدانستند»، به دادههای آموزشی ارجاع داده شدند. این رویکرد از توهم (Hallucination) — که در چتباتهای باز رایج است — جلوگیری میکند و تضمین میکند که AI طبق استراتژی برند و بر اساس واقعیتها صحبت کند.
با این حال، انتقال به آواتارهای غیرقطعی — آنهایی که توسط مدلهای زبانی بزرگ (LLM) با دسترسی آزاد هدایت میشوند — ریسک «سایکوز AI» را به همراه دارد؛ جایی که آواتار ممکن است شروع به سخنرانیهای طولانی یا رفتارهای غیرقابلپیشبینی کند. نویسنده اشاره میکند که هنگام تماشای یک آواتار قطعی، وقتی صحبتش تمام میشود، نوعی احساس ناخوشایند ایجاد میشود؛ زیرا کاربر منتظر یک پلک زدن یا لبخندی است که هرگز نمیآید، چون مدل خودمختار (Autonomous) نیست.
این فناوری پرسشهای بنیادینی درباره اعتماد حرفهای ایجاد میکند. در حالی که یک مدیرعامل ممکن است آواتار AI را برای بهروزرسانیهای روتین مفید بداند، هسته ژورنالیسم بر ارتباط انسانی و اعتبار استوار است. نویسنده استدلال میکند که اگرچه تحقیق و نوشتن میتواند تقویت شود، اما «اعتماد» را نمیتوان به یک هوش مصنوعی برونسپاری کرد.
مقاومت قابل توجهی در برابر «زبالههای هوش مصنوعی» (AI slop) در شبکههای اجتماعی وجود دارد و برخی سرمایهگذاران معتقدند اخباری که توسط آواتارها ارائه شود، توسط مخاطبان رد خواهد شد. یکی از سرمایهگذاران در پاسخ به این سوال که آیا مردم با اخبار ارائه شده توسط آواتار راحت هستند، بلافاصله پاسخ «نه» داد. توانایی برونسپاری «ارائه» اطلاعات اکنون حل شده است؛ اما توانایی برونسپاری «اعتمادی» که با آن اطلاعات همراه است، همچنان مانع اصلی است.
برای دنیای کسبوکار، جذابیت این ابزار کاربردیتر است. احتمال اینکه یک کلون دیجیتال کارهای روتین یا پاسخ به سوالات متداول (FAQ) را در زمان تعطیلات انسانی مدیریت کند، یک جهش بهرهوری برای تیمهای روابط عمومی و امور شرکتی است. با این حال، یک شکاف نسلی وجود دارد. نویسنده پیشنهاد میکند که نسل Z ممکن است در عادت کردن به همزادهای دیجیتال دچار مشکل شوند زیرا این ابزارها بیش از حد شبیه فیلمهای علمی-تخیلی هستند و هر آنچه در سینما دیده شده را بازتاب میدهند. با این حال، آنها کمتر از رباتهای انساننما (Humanoid) تکاندهنده هستند، زیرا کاربر در صورت عجیب شدن تجربه، میتواند بهسادگی از سیستم خارج شود.
گام بعدی شما
- اگر مدیر محتوا یا روابط عمومی هستید، قابلیتهای پلتفرم Sessions را برای اتوماسیون پاسخ به سوالات متداول بررسی کنید.
- در صورت استفاده از API، مدلهای صوتی ElevenLabs را برای افزایش طبیعی بودن لحن آواتارها تست کنید.
- تفاوت بین مدلهای قطعی و غیرقطعی را در استراتژی برندینگ خود لحاظ کنید تا از توهمات مدل جلوگیری شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو