پرش به محتوای اصلی
پرش به محتوای مقاله

ترکیب Twilio و Deepgram امکان ساخت دستیار تلفنی بدون سخت‌افزار را فراهم کرد

·۱۱ مرداد ۱۴۰۵۴ دقیقه مطالعه۷ بازدید
راهنما
دستگاه پاسخگوی هوشمند ساخت خودتان: راهنمای ساخت دستیار صوتی مبتنی بر هوش مصنوعی
دستگاه پاسخگوی هوشمند ساخت خودتان: راهنمای ساخت دستیار صوتی مبتنی بر هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ادغام کامل زنجیره STT-LLM-TTS در یک پل وب‌ساکت واحد، به‌جای استفاده از سه مدل مجزا و متوالی. این کار تأخیر را حذف کرده و اجازه می‌دهد «قطع کلام» (Barge-in) در سطح پروتکل تلفنی به‌طور طبیعی اتفاق بیفتد.

تصور کنید یک پذیرشگر دیجیتال دارید که به‌جای یادداشت‌برداری ساده، دقیقاً می‌فهمد کاربر چه می‌خواهد و مشکلات او را در لحظه حل می‌کند. اگر امروز قصد دارید چنین سیستمی بسازید، دیگر نیازی به خرید سخت‌افزارهای گران‌قیمت یا مدیریت سرورهای صوتی پیچیده ندارید. در حالی که سیستم‌های تلفنی سنتی اغلب به زیرساخت‌های فیزیکی cumbersome و دشوار متکی هستند، یک پشته بدون سخت‌افزار متشکل از Twilio و Deepgram اکنون امکان ایجاد یک دستیار تلفنی هوش مصنوعی کاملاً خودکار را فراهم می‌کند تا تماس‌های زنده، خوش‌آمدگویی‌ها و پرس‌وجوهای پیچیده را مدیریت کند.

طبق گزارش منتشرشده در ۲ اوت ۲۰۲۶، این معماری اجازه می‌دهد یک شخصیت هوش مصنوعی (AI Persona) تعریف‌شده، یک مکالمه صوتی را مدیریت کند و سپس تماس را بدون هیچ‌گونه وقفه صوتی به یک اپراتور انسانی بسپارد. برای اکثر توسعه‌دهندگان، ساخت چنین سیستمی تا پیش از این نیازمند اتصال سه مدل مجزا بود: تبدیل گفتار به متن (STT)، یک مدل زبانی بزرگ (LLM) برای استدلال — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — و تبدیل متن به گفتار (TTS). رویکرد جدید، تمام این خط لوله (Pipeline) را در یک «پل وب‌ساکت» (Websocket Bridge) دوطرفه ادغام کرده و متمرکز کرده است.

زمینه: پشته بدون سخت‌افزار

کل این زیرساخت در واقع یک پل ارتباطی بین دو وب‌ساکت است. در این مدل، Twilio مالک خط تلفن است و Deepgram مالک مکالمه صوتی است. از آنجا که این پل بر پایه ابزارهای متن‌باز ساخته شده است، بخش بزرگی از سیستم را می‌توان با استفاده از نرم‌افزارهای رایگان و حساب‌های آزمایشی ایجاد کرد.

برای کاهش موانع پیش روی توسعه‌دهندگان، یک حساب آزمایشی Twilio با ۱۵ دلار اعتبار ارائه می‌شود و یک حساب آزمایشی Deepgram مبلغ ۲۰۰ دلار اعتبار فراهم می‌کند. این ترکیب اعتبار برای ساخت و تست کامل سیستم از ابتدا تا انتها (End-to-End) بیش از حد کافی است.

دستگاه پاسخگوی هوشمند شخصی‌سازی‌شده با هوش مصنوعی

به نقل از راهنمای dev.to، این سیستم با اتصال دو وب‌ساکت عمل می‌کند: Twilio صدای کاربر را استریم می‌کند و عامل صوتی دیپ‌گرام (Deepgram Voice Agent) که در آدرس wss://agent.deepgram.com/v1/agent/converse قرار دارد، مراحل «گوش دادن»، «فکر کردن» و «سخن گفتن» را پردازش می‌کند. این رویکرد در مدیریت عامل‌های هوشمند مشابه است با روشی که در معماری جدید عامل‌های Knock برای بهینه‌سازی ابزارهای API از سیستم‌فایل مجازی استفاده شد تا تعاملات با داده‌ها سریع‌تر صورت گیرد. توسعه‌دهنده از TwiML (زبان نشانه‌گذاری توئیلیو) استفاده می‌کند تا تماس‌های ورودی را به یک سرور هدایت کند. دستور کلیدی XML مورد استفاده در این مسیر به این شکل است: <Connect> <Stream url="wss://your-server/ws/screening" /> </Connect>.

دستگاه پاسخگوی هوشمند شخصی‌سازی‌شده با هوش مصنوعی

جزئیات فنی و مکانیسم‌ها

این تنظیمات، تماس تلفنی را به یک وب‌ساکت تبدیل می‌کند. Twilio صدای کاربر را به صورت فریم‌های $\mu$-law کدگذاری‌شده در قالب base64 ارسال می‌کند و هر صوتی که از سمت سرور بازگردانده شود، برای کاربر پخش می‌گردد. توسعه‌دهندگان می‌توانند هوش مصنوعی را به سه روش فعال کنند:

  • جایگزین (Fall-through): ابتدا با استفاده از دستور <Dial timeout="20"> تلفن را برای انسان بزنید و اگر پاسخی دریافت نشد، اجازه دهید هوش مصنوعی کنترل را به دست بگیرد.
  • فوری (Immediate): اگر هیچ انسانی در دسترس نیست، بلافاصله با هوش مصنوعی پاسخ دهید.
  • درخواست‌محور (On-Demand): اجازه دهید یک انسان روی دکمه «غربالگری این تماس» (screen this call) کلیک کند تا تماس در حال ringing به هوش مصنوعی منتقل شود.

عامل صوتی دیپ‌گرام جایگزین خط لوله سنتی گفتار شده است. مشخصات فنی دقیق این سیستم عبارتند از:

  • فرمت صوتی: استفاده از $\mu$-law با نرخ ۸ کیلوهرتز (8 kHz) هم برای ورودی و هم برای خروجی. این فرمت دقیقاً با استانداردهای تلفنی مطابقت دارد، به این معنی که هیچ نیازی به تبدیل کد (Transcoding) نیست و فریم‌ها مستقیماً عبور می‌کنند.
  • فاز «تفکر»: یک مدل زبانی بزرگ (LLM) گفتگو را بر اساس یک «پرامپت سیستمی» پیش می‌برد. این شخصیت (Persona) تعریف می‌کند که هوش مصنوعی جایگزین چه کسی است، لحن او چگونه باشد، چه داده‌هایی را باید جمع‌آوری کند و اجازه دارد چه پیشنهاداتی را ارائه دهد.
  • فاز «سخن»: یکی از صداهای Deepgram پاسخ‌ها را تحویل می‌دهد. این بخش شامل افشای اجباری (Disclosure) است که به کاربر اعلام کند در حال صحبت با یک دستیار خودکار است.
  • منطق قطع کلام (Barge-in): وقتی کاربر حرف AI را قطع می‌کند، سرور یک «رویداد پاک‌سازی» (Clear Event) برای Twilio می‌فرستد تا صداهای پخش‌نشده در صف حذف شوند. این کار تضمین می‌کند که AI در میانه جمله متوقف شود، به جای اینکه روی صدای کاربر صحبت کند.
  • فراخوانی تابع (Function Calling): اگر کاربر داده‌ای لحظه‌ای بخواهد (مثلاً بپرسد «آیا داروخانه‌ای نزدیک من هست؟»)، عامل درخواستی را روی ساکت ارسال می‌کند. سرور جست‌وجو را انجام داده و AI نتیجه را بیان می‌کند. این قابلیت‌ها توسط تنظیمات شخصیت (Persona settings) محدود و کنترل می‌شوند.

دستگاه پاسخگوی هوشمند شخصی‌سازی‌شده با هوش مصنوعی

توسعه‌دهندگان می‌توانند این ساختار را با کمترین هزینه اولیه نمونه‌سازی کنند. همان‌طور که نویسنده اشاره کرده است، اعتبار ۱۵ دلاری Twilio و ۲۰۰ دلاری Deepgram برای تست کامل جریان کاری از ابتدا تا انتها کاملاً کافی است.

دستگاه پاسخگوی هوشمند شخصی با هوش مصنوعی بسازید

این تغییر، پیچیدگی را از زیرساخت سخت‌افزاری به سمت «طراحی شخصیت» می‌برد. از آنجا که شخصیت AI — شامل خوش‌آمدگویی، صدا و قابلیت‌هایش — از طریق یک فرم مدیریت می‌شود و نه از طریق منطق کدنویسی سخت (Hard-coded)، صاحبان کسب‌وکار می‌توانند رفتار دستیار خود را بدون نیاز به استقرار کد جدید، فوراً تغییر دهند.

برای کاربر نهایی، قابل‌توجه‌ترین اثر در مکانیسم «تحویل» یا Takeover است. چون AI تنها یک ضلع از یک تماس عادی Twilio است، یک انسان می‌تواند بی‌صدا وارد گفتگو شود. با هدایت مجدد تماس به خط اپراتور، ضلع مربوط به هوش مصنوعی به‌سادگی پایان می‌یابد. این اتفاق بدون نیاز به موسیقی انتظار یا انتقال‌های پیچیده رخ می‌دهد و کاربر هرگز مجبور نیست دو بار شماره‌گیری کند.

این الگو اساساً روش مدیریت مشتریان بالقوه (Lead Qualification) و پشتیبانی‌های پایه در کسب‌وکارهای کوچک را تغییر می‌دهد. با خودکارسازی مرحله «غربالگری» (Screening)، کارکنان انسانی تنها با مشتریانی ارتباط می‌گیرند که قصد خرید یا تعامل بالایی دارند و پیش‌تر توسط AI تایید و بررسی شده‌اند.

نقشه راه آینده

با نگاه به آینده، این خط لوله امکان برنامه‌های پیشرفته‌ای را فراتر از پاسخگویی ساده فراهم می‌کند:

  • شبیه‌سازهای آموزشی: استفاده از این خط لوله صوتی به عنوان ابزاری داخلی که در آن شخصیت‌های AI نقش «تماس‌گیرندگان دشوار» را بازی می‌کنند تا اعضای جدید تیم بتوانند تمرین کنند.
  • هوش پیاده‌سازی شده در متن (Transcript Intelligence): اجرای ردیابی لحظه‌ای احساسات و رعایت قوانین (Compliance) برای شناسایی عبارات ریسک‌دار یا عصبانیت کاربر در لحظه وقوع.
  • هوشمندی لحظه‌ای تماس: ارائه مربیگری (Coaching) زنده و بینش‌های لحظه‌ای که بر اساس متن گفتگو و نحوه استفاده AI از ابزارها هدایت می‌شوند.
  • پر کردن خودکار رابط کاربری (Auto-Filling UI): ایجاد فرم‌هایی که با داده‌های ساختاریافته استخراج شده از کاربر، در حالی که مکالمه هنوز فعال است، به‌طور خودکار پر می‌شوند.

برای شروع، توسعه‌دهندگان باید API عامل صوتی Deepgram و دستورات <Connect><Stream> در Twilio را برای ساخت اولین پل صوتی خود بررسی کنند.

اما اثر این معماری بر کاهش تأخیر (Latency) در مدل‌های چندوجهی حتی جذاب‌تر است — به تحلیل ما درباره‌ی بهینه‌سازی‌های استنتاج در لبه مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با حذف نیاز به سخت‌افزارهای DSP و سرورهای VoIP پیچیده، هزینه ورود به بازار دستیارهای صوتی را برای کسب‌وکارهای کوچک به شدت کاهش می‌دهد. تکیه بر استانداردهای تلفنی (8kHz $\mu$-law) باعث می‌شود این سیستم در مقیاس جهانی بدون تأخیرهای تبدیل کد قابل اجرا باشد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API در Twilio و Deepgram، پیاده‌سازی این مدل برای توسعه‌دهندگان ایرانی نیازمند استفاده از سرویس‌های واسط یا جایگزین‌های داخلی است؛ در غیر این صورت دسترسی مستقیم به این زیرساخت‌ها محدود است.

·نگاه ما
تحریریه دات‌هوش

جداسازی لایه‌ی شخصیت از لایه‌ی کد، یعنی تبدیل AI به یک تنظیماتِ فرم‌محور، نقطه عطفی در دموکراتیزه کردن ابزارهای اتوماسیون است. این رویکرد نشان می‌دهد که در آینده، مهندسی سیستم‌های صوتی از «کدنویسی جریان‌های تماس» به «طراحی روان‌شناختی شخصیت‌ها» تغییر مسیر می‌دهد و نقش توسعه‌دهنده را از معمار زیرساخت به طراح تجربه تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.