پرش به محتوای اصلی
پرش به محتوای مقاله

AVA: اتصال عامل‌های صوتی هوش مصنوعی به سخت‌افزارهای تلفنی Asterisk

·۲۴ تیر ۱۴۰۵۲۱ دقیقه مطالعه
عامل صوتی هوش مصنوعی متن‌باز برای یکپارچه‌سازی با سیستم تلفنی Asterisk/FreePBX از طریق فناوری Audiosocket/RTP
عامل صوتی هوش مصنوعی متن‌باز برای یکپارچه‌سازی با سیستم تلفنی Asterisk/FreePBX از طریق فناوری Audiosocket/RTP
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل یک ابزار مبتنی بر فایل تنظیمات به یک پلتفرم مدیریتی (Admin UI) که اجازه می‌دهد عامل‌های صوتی بدون ری‌استارت سیستم و به‌صورت لحظه‌ای تغییر کنند.

تصور کنید یک مدیر فناوری در شرکتی است که هنوز از سیستم‌های تلفنی قدیمی استفاده می‌کند و حالا می‌خواهد بدون تغییر کل زیرساخت، یک پذیرنده هوشمند با صدای طبیعی داشته باشد. اگر امروز برای افزودن عامل‌های صوتی پیشرفته به سیستم‌های قدیمی هزینه می‌کنید، احتمالاً با میان‌افزارهای گران‌قیمت و پل‌های ارتباطی پیچیده درگیر هستید؛ اما AVA این معادله را تغییر می‌دهد.

بر اساس مستندات پروژه، AVA (عامل صوتی هوش مصنوعی برای Asterisk) موتور هوش مصنوعی را مستقیماً به مراکز تلفنی (PBX) می‌آورد. این سیستم اجازه می‌دهد کاربران Asterisk و FreePBX از طریق فناوری AudioSocket و RTP، پیشرفته‌ترین عامل‌های صوتی را مستقر کنند.

همان‌طور که در تحلیل قبلی ما درباره‌ی شکست‌های لایه صوتی در ردیابی مدل‌های زبانی اشاره کردیم، مشکل اصلی همواره «شکاف صوتی پنهان» بوده است. AVA با مدیریت متمرکز سه مرحله‌ی بازشناسی گفتار (Speech-to-Text) — شبیه به گوش دادن فعال یک انسان به کلمات —، مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — و تبدیل متن به گفتار (TTS) — همان تبدیل نوشته به صدای انسانی — این شکاف را پر می‌کند. طبق اعلام توسعه‌دهندگان، اگر تأخیر بین این سه مرحله چند ثانیه بیشتر شود، مکالمه با سکوت‌های آزاردهنده یا تداخل صدا مواجه می‌شود و کاربر احساس می‌کند با یک ماشین کند طرف است.

معماری هسته

به نقل از گزارش فنی مورخ ۱۳ جولای ۲۰۲۶، AVA از یک معماری دو-کانتینری برای تضمین پایداری استفاده می‌کند:

  • ai_engine: یک ارکستراتور سبک که چرخه حیات تماس را مدیریت کرده و از طریق رابط REST Asterisk (ARI) به سیستم متصل می‌شود. این بخش در واقع پل ارتباطی میان لایه تلفنی و هوش مصنوعی است. این رویکرد تفکیک‌شده، یادآور گذار صنعت به سمت معماری‌های ماژولار در مقیاس سازمانی است که جایگزین حلقه‌های خودکار و یکپارچه برای دستیابی به پایداری بیشتر شدند.
  • local_ai_server: کانتینری اختیاری برای کاربرانی که می‌خواهند مدل‌ها را به‌صورت درون‌سازمانی (On-premises) اجرا کنند. این بخش از ابزارهایی نظیر llama.cpp، Vosk و Kokoro پشتیبانی می‌کند.

این تفکیک باعث می‌شود استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره‌ی آموزش آشپز — باعث مسدود شدن مدیریت تماس‌های سبک نشود. سیستم از دو حالت انتقال داده پشتیبانی می‌کند: AudioSocket (پیش‌فرض) و استریم RTP خارجی.

اکوسیستم ارائه‌دهندگان ابری و محلی

پلتفرم AVA هفت پیکربندی «سند بنیادین» برای نیازهای مختلف تجاری ارائه می‌دهد:

  • OpenAI Realtime API: اجازه مکالمات طبیعی با تأخیر کمتر از ۲ ثانیه را می‌دهد. مدل‌های فعلی شامل gpt-realtime-1.5 (کیفیت حداکثری) و gpt-realtime-mini (بهینه از نظر هزینه) هستند.
  • Google Live API (Gemini 2.0 Flash): قابلیت‌های چندوجهی (Multimodal) — مدلی که هم‌زمان متن، عکس و صدا را می‌فهمد، مثل ما که با چند حس دنیا را می‌خوانیم — با پاسخ‌های زیر ۲ ثانیه.
  • Deepgram Voice Agent: عامل ابری سازمانی با مرحله «تفکر» برای استدلال‌های پیچیده و تأخیر زیر ۳ ثانیه.
  • ElevenLabs Agent: تمرکز بر کیفیت صدای ممتاز و پاسخ‌های سریع.
  • xAI Grok Voice Agent: ارائه‌دهنده آن‌لاین با ۵ صدای پیش‌فرض (مانند eve و leo)؛ هرچند مدل‌های فعلی تا ۱۲۰ دقیقه را پشتیبانی می‌کنند، اما سیستم هشدار محدودیت ۲۸ دقیقه‌ای نسخه‌های قدیمی را حفظ کرده است.
  • Telnyx AI Inference: رویکردی مقرون‌به‌صرفه با دسترسی به بیش از ۵۳ مدل از جمله Claude و Llama.
  • Local Hybrid: حالتی متمرکز بر حریم خصوصی که از بازشناسی گفتار محلی اما مدل‌های زبانی ابری استفاده می‌کند.

علاوه بر این‌ها، AVA با MiniMax LLM برای مکالمات با زمینه طولانی و همچنین بک‌اندهای گفتاری روسی برای پشتیبانی منطقه‌ای ادغام شده است.

قابلیت‌های پیشرفته هوش مصنوعی محلی

برای دستیابی به «حاکمیت کامل داده»، حالت Fully Local تمام وابستگی‌های ابری را حذف می‌کند. در این حالت سه توپولوژی وجود دارد:

  • فقط CPU: تأخیر ۵ تا ۱۵ ثانیه؛ مناسب برای تست و حریم خصوصی شدید.
  • GPU (روی یک سخت‌افزار): تأخیر ۰.۵ تا ۲ ثانیه؛ مناسب برای محیط‌های عملیاتی.
  • سرور مجزا (GPU راه دور): تأخیر ۱ تا ۳ ثانیه؛ ایده‌آل برای زمانی که PBX روی VPS است.

بر اساس بررسی‌های جامعه کاربری، استفاده از یک کارت گرافیک RTX 4090 با نسخه CUDA-enabled llama.cpp می‌تواند تأخیر نهایی را به حدود ۱ ثانیه برساند. همچنین می‌توان از طریق Ollama مدل‌هایی مثل llama3.2 (۲ گیگابایت) یا qwen2.5 (۴.۷ گیگابایت) را برای فراخوانی ابزارها به کار گرفت.

تحولات نسخه ۷.x: از فایل تنظیمات به پلتفرم مدیریتی

در به‌روزرسانی‌های اخیر، AVA از یک ابزار مبتنی بر فایل به یک پلتفرم مدیریتی تبدیل شده است. نسخه ۷.۰۰ یک Admin UI اختصاصی معرفی کرد که در آن اپراتورها می‌توانند برای پذیرندگان یا پشتیبانی‌های خارج از ساعت کاری، عامل‌های مختلف بسازند.

نسخه ۷.۱.۱ پایداری داشبورد را با اعمال هیسترزیس (Hysteresis) در وضعیت Asterisk بهبود داد تا نوسانات کوچک در اتصال باعث پرش وضعیت نشود. همچنین استانداردهای دسترسی WCAG AA را برای پیمایش راحت‌تر کاربران اعمال کرد.

در نسخه ۷.۲۰، «مرکز وضعیت زنده» معرفی شد. حالا به جای درخواست‌های مکرر (Polling)، موتور هوش مصنوعی تغییرات را به‌صورت لحظه‌ای به داشبورد ارسال می‌کند تا زمان به‌روزرسانی به زیر یک ثانیه برسد.

نسخه ۷.۳.۰ مالکیت صدا را از ارائه‌دهنده به عامل منتقل کرد. حالا می‌توان صدای خاصی از بین ۱۰ صدای OpenAI یا ۳۰ صدای Google Live را به هر عامل اختصاص داد، بدون اینکه نیاز به ری‌استارت موتور باشد.

در نهایت، نسخه ۷.۳.۳ بر «پایداری هوش مصنوعی محلی» تمرکز کرد. این نسخه از نشت وضعیت گفتگو در اتصالات WebSocket جلوگیری کرده و مکانیزم Barge-in (قطع کردن صحبت مدل توسط کاربر) را بهبود بخشید تا پاسخ‌های ناقص مدل در تاریخچه گفتگو ذخیره نشوند.

ابزارهای عملیاتی تلفنی

عامل‌های AVA فقط حرف نمی‌زنند، بلکه می‌توانند سیستم تلفن را کنترل کنند:

  • کنترل تماس: انتقال تماس به داخلی‌های SIP، صف‌های ACD یا قطع تماس پس از پیام خداحافظی.
  • مدیریت پیام‌گیر: هدایت مستقیم تماس‌گیرنده به صندوق صوتی.
  • یکپارچگی داده‌ها: ارسال خلاصه‌ی تماس به ایمیل مدیر یا اجرای درخواست‌های HTTP برای استخراج داده پیش از تماس (pre_call_lookup) جهت شناسایی مشتری در CRM.

الزامات فنی و استقرار

استقرار سیستم از طریق اسکریپت preflight.sh انجام می‌شود و نیازمند محیط لینوکس (اوبونتو ۲۰.۰۴ به بالا) با Docker Compose v2 و Asterisk 18+ است.

از نظر سخت‌افزاری، برای حالت‌های ابری ۲ هسته و ۴ گیگابایت رم کافی است، اما برای استقرار کاملاً محلی با GPU، حداقل یک کارت RTX 3060 و ۸ تا ۱۶ گیگابایت رم توصیه می‌شود. برای سیستم‌های فقط CPU، مدل Qwen 2.5-1.5B با سرعت ۱۵ تا ۳۰ توکن در ثانیه، عملکرد بهتری نسبت به Phi-3 دارد.

مدیران می‌توانند از ابزار agent rca برای تحلیل ریشه‌ای (Root Cause Analysis) خطاها استفاده کنند. در FreePBX، می‌توان با تعریف متغیر AI_AGENT در dialplan، تماس‌ها را به عامل‌های خاصی (مثلاً عامل فروش) هدایت کرد.

این حرکت به سمت یک استک صوتی باز، به کسب‌وکارها اجازه می‌دهد «جعبه سیاه» پلتفرم‌های تجاری را کنار بگذارند و کنترل کاملی بر مهندسی پرامپت و مسیریابی داده‌ها داشته باشند.

گام بعدی شما

  • اگر زیرساخت Asterisk دارید، ابتدا دسترسی‌های ARI خود را بررسی کنید.
  • با استفاده از پیکربندی‌های Golden، یک خط لوله (Pipeline) ساده با OpenAI Realtime تست کنید.
  • برای کاهش هزینه‌ها، مدل Qwen 2.5 را روی سخت‌افزار محلی ارزیابی کنید.

اما قابلیت‌های فعال (Proactive) مانند کمپین‌های تماس خروجی و سیستم‌های موافقت صوتی در نسخه‌های آلفای آینده منتشر خواهند شد؛ تحلیل ما از اثر این قابلیت‌ها بر مراکز تماس را در گزارش بعدی بخوانید.

چرا این موضوع مهم است؟

این ابزار با حذف واسطه‌های ابری، هزینه‌ی عملیاتی مراکز تماس را کاهش داده و کنترل کامل داده‌های صوتی را به سازمان‌ها بازمی‌گرداند. تخصص AVA در مدیریت تأخیر (Latency)، استانداردی جدید برای تبدیل PBXهای قدیمی به مراکز تماس هوشمند ایجاد می‌کند.

تأثیر برای ایران

به‌دلیل تحریم‌های OpenAI و گوگل، توسعه‌دهندگان ایرانی می‌توانند از حالت Local Hybrid یا Fully Local با مدل‌های Llama و Qwen استفاده کنند تا بدون نیاز به APIهای خارجی، سیستم‌های پاسخگویی صوتی هوشمند را در سازمان‌ها پیاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز AVA بر لایه‌ی ارکستراسیون به‌جای مدل‌سازی، یک استراتژی هوشمندانه برای بقا در برابر غول‌های ابری است. با باز کردن دسترسی به لایه‌ی انتقال (Transport)، این پروژه عملاً کنترل «تجربه‌ی شنیداری» را از شرکت‌های SaaS می‌گیرد و به مدیران شبکه برمی‌گرداند. این رویکرد نشان می‌دهد که آینده‌ی کاربردهای تجاری AI نه در مدل‌های بزرگتر، بلکه در کاهش تأخیر لایه‌های رابط است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.