تصور کنید یک پذیرشگر دیجیتال دارید که بهجای یادداشتبرداری ساده، دقیقاً میفهمد کاربر چه میخواهد و مشکلات او را در لحظه حل میکند. اگر امروز قصد دارید چنین سیستمی بسازید، دیگر نیازی به خرید سختافزارهای گرانقیمت یا مدیریت سرورهای صوتی پیچیده ندارید. در حالی که سیستمهای تلفنی سنتی اغلب به زیرساختهای فیزیکی cumbersome و دشوار متکی هستند، یک پشته بدون سختافزار متشکل از Twilio و Deepgram اکنون امکان ایجاد یک دستیار تلفنی هوش مصنوعی کاملاً خودکار را فراهم میکند تا تماسهای زنده، خوشآمدگوییها و پرسوجوهای پیچیده را مدیریت کند.
طبق گزارش منتشرشده در ۲ اوت ۲۰۲۶، این معماری اجازه میدهد یک شخصیت هوش مصنوعی (AI Persona) تعریفشده، یک مکالمه صوتی را مدیریت کند و سپس تماس را بدون هیچگونه وقفه صوتی به یک اپراتور انسانی بسپارد. برای اکثر توسعهدهندگان، ساخت چنین سیستمی تا پیش از این نیازمند اتصال سه مدل مجزا بود: تبدیل گفتار به متن (STT)، یک مدل زبانی بزرگ (LLM) برای استدلال — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — و تبدیل متن به گفتار (TTS). رویکرد جدید، تمام این خط لوله (Pipeline) را در یک «پل وبساکت» (Websocket Bridge) دوطرفه ادغام کرده و متمرکز کرده است.
زمینه: پشته بدون سختافزار
کل این زیرساخت در واقع یک پل ارتباطی بین دو وبساکت است. در این مدل، Twilio مالک خط تلفن است و Deepgram مالک مکالمه صوتی است. از آنجا که این پل بر پایه ابزارهای متنباز ساخته شده است، بخش بزرگی از سیستم را میتوان با استفاده از نرمافزارهای رایگان و حسابهای آزمایشی ایجاد کرد.
برای کاهش موانع پیش روی توسعهدهندگان، یک حساب آزمایشی Twilio با ۱۵ دلار اعتبار ارائه میشود و یک حساب آزمایشی Deepgram مبلغ ۲۰۰ دلار اعتبار فراهم میکند. این ترکیب اعتبار برای ساخت و تست کامل سیستم از ابتدا تا انتها (End-to-End) بیش از حد کافی است.

به نقل از راهنمای dev.to، این سیستم با اتصال دو وبساکت عمل میکند: Twilio صدای کاربر را استریم میکند و عامل صوتی دیپگرام (Deepgram Voice Agent) که در آدرس wss://agent.deepgram.com/v1/agent/converse قرار دارد، مراحل «گوش دادن»، «فکر کردن» و «سخن گفتن» را پردازش میکند. این رویکرد در مدیریت عاملهای هوشمند مشابه است با روشی که در معماری جدید عاملهای Knock برای بهینهسازی ابزارهای API از سیستمفایل مجازی استفاده شد تا تعاملات با دادهها سریعتر صورت گیرد. توسعهدهنده از TwiML (زبان نشانهگذاری توئیلیو) استفاده میکند تا تماسهای ورودی را به یک سرور هدایت کند. دستور کلیدی XML مورد استفاده در این مسیر به این شکل است: <Connect> <Stream url="wss://your-server/ws/screening" /> </Connect>.

جزئیات فنی و مکانیسمها
این تنظیمات، تماس تلفنی را به یک وبساکت تبدیل میکند. Twilio صدای کاربر را به صورت فریمهای $\mu$-law کدگذاریشده در قالب base64 ارسال میکند و هر صوتی که از سمت سرور بازگردانده شود، برای کاربر پخش میگردد. توسعهدهندگان میتوانند هوش مصنوعی را به سه روش فعال کنند:
- جایگزین (Fall-through): ابتدا با استفاده از دستور
<Dial timeout="20">تلفن را برای انسان بزنید و اگر پاسخی دریافت نشد، اجازه دهید هوش مصنوعی کنترل را به دست بگیرد. - فوری (Immediate): اگر هیچ انسانی در دسترس نیست، بلافاصله با هوش مصنوعی پاسخ دهید.
- درخواستمحور (On-Demand): اجازه دهید یک انسان روی دکمه «غربالگری این تماس» (screen this call) کلیک کند تا تماس در حال ringing به هوش مصنوعی منتقل شود.
عامل صوتی دیپگرام جایگزین خط لوله سنتی گفتار شده است. مشخصات فنی دقیق این سیستم عبارتند از:
- فرمت صوتی: استفاده از $\mu$-law با نرخ ۸ کیلوهرتز (8 kHz) هم برای ورودی و هم برای خروجی. این فرمت دقیقاً با استانداردهای تلفنی مطابقت دارد، به این معنی که هیچ نیازی به تبدیل کد (Transcoding) نیست و فریمها مستقیماً عبور میکنند.
- فاز «تفکر»: یک مدل زبانی بزرگ (LLM) گفتگو را بر اساس یک «پرامپت سیستمی» پیش میبرد. این شخصیت (Persona) تعریف میکند که هوش مصنوعی جایگزین چه کسی است، لحن او چگونه باشد، چه دادههایی را باید جمعآوری کند و اجازه دارد چه پیشنهاداتی را ارائه دهد.
- فاز «سخن»: یکی از صداهای Deepgram پاسخها را تحویل میدهد. این بخش شامل افشای اجباری (Disclosure) است که به کاربر اعلام کند در حال صحبت با یک دستیار خودکار است.
- منطق قطع کلام (Barge-in): وقتی کاربر حرف AI را قطع میکند، سرور یک «رویداد پاکسازی» (Clear Event) برای Twilio میفرستد تا صداهای پخشنشده در صف حذف شوند. این کار تضمین میکند که AI در میانه جمله متوقف شود، به جای اینکه روی صدای کاربر صحبت کند.
- فراخوانی تابع (Function Calling): اگر کاربر دادهای لحظهای بخواهد (مثلاً بپرسد «آیا داروخانهای نزدیک من هست؟»)، عامل درخواستی را روی ساکت ارسال میکند. سرور جستوجو را انجام داده و AI نتیجه را بیان میکند. این قابلیتها توسط تنظیمات شخصیت (Persona settings) محدود و کنترل میشوند.

توسعهدهندگان میتوانند این ساختار را با کمترین هزینه اولیه نمونهسازی کنند. همانطور که نویسنده اشاره کرده است، اعتبار ۱۵ دلاری Twilio و ۲۰۰ دلاری Deepgram برای تست کامل جریان کاری از ابتدا تا انتها کاملاً کافی است.

این تغییر، پیچیدگی را از زیرساخت سختافزاری به سمت «طراحی شخصیت» میبرد. از آنجا که شخصیت AI — شامل خوشآمدگویی، صدا و قابلیتهایش — از طریق یک فرم مدیریت میشود و نه از طریق منطق کدنویسی سخت (Hard-coded)، صاحبان کسبوکار میتوانند رفتار دستیار خود را بدون نیاز به استقرار کد جدید، فوراً تغییر دهند.
برای کاربر نهایی، قابلتوجهترین اثر در مکانیسم «تحویل» یا Takeover است. چون AI تنها یک ضلع از یک تماس عادی Twilio است، یک انسان میتواند بیصدا وارد گفتگو شود. با هدایت مجدد تماس به خط اپراتور، ضلع مربوط به هوش مصنوعی بهسادگی پایان مییابد. این اتفاق بدون نیاز به موسیقی انتظار یا انتقالهای پیچیده رخ میدهد و کاربر هرگز مجبور نیست دو بار شمارهگیری کند.
این الگو اساساً روش مدیریت مشتریان بالقوه (Lead Qualification) و پشتیبانیهای پایه در کسبوکارهای کوچک را تغییر میدهد. با خودکارسازی مرحله «غربالگری» (Screening)، کارکنان انسانی تنها با مشتریانی ارتباط میگیرند که قصد خرید یا تعامل بالایی دارند و پیشتر توسط AI تایید و بررسی شدهاند.
نقشه راه آینده
با نگاه به آینده، این خط لوله امکان برنامههای پیشرفتهای را فراتر از پاسخگویی ساده فراهم میکند:
- شبیهسازهای آموزشی: استفاده از این خط لوله صوتی به عنوان ابزاری داخلی که در آن شخصیتهای AI نقش «تماسگیرندگان دشوار» را بازی میکنند تا اعضای جدید تیم بتوانند تمرین کنند.
- هوش پیادهسازی شده در متن (Transcript Intelligence): اجرای ردیابی لحظهای احساسات و رعایت قوانین (Compliance) برای شناسایی عبارات ریسکدار یا عصبانیت کاربر در لحظه وقوع.
- هوشمندی لحظهای تماس: ارائه مربیگری (Coaching) زنده و بینشهای لحظهای که بر اساس متن گفتگو و نحوه استفاده AI از ابزارها هدایت میشوند.
- پر کردن خودکار رابط کاربری (Auto-Filling UI): ایجاد فرمهایی که با دادههای ساختاریافته استخراج شده از کاربر، در حالی که مکالمه هنوز فعال است، بهطور خودکار پر میشوند.
برای شروع، توسعهدهندگان باید API عامل صوتی Deepgram و دستورات <Connect><Stream> در Twilio را برای ساخت اولین پل صوتی خود بررسی کنند.
اما اثر این معماری بر کاهش تأخیر (Latency) در مدلهای چندوجهی حتی جذابتر است — به تحلیل ما دربارهی بهینهسازیهای استنتاج در لبه مراجعه کنید.




گفتگو