تصور کنید با یک پشتیبان تلفنی صحبت میکنید که نه تنها لحنی کاملاً انسانی دارد، بلکه هیچگونه مکث مصنوعی یا تأخیر خستهکنندهای در پاسخهایش نیست. اگر امروز از عاملهای صوتی استفاده میکنید، احتمالاً با آن سکوت چندثانیهای آشنا هستید که فریاد میزند: «من یک ربات هستم».
این تأخیر، بزرگترین مانع در مسیر عبور از تست تورینگ برای صدا است. طبق گزارش ۳۱ جولای ۲۰۲۶ از TechCrunch، استارتاپ Smallest.ai برای حل این مشکل، ۱۳ میلیون دلار سرمایه در دور سری A (Series A) جذب کرد تا معماریهای فوقسریع و تخصصی جایگزین مدلهای غولپیکر کنند. این تلاش برای مدرنسازی ارتباطات صوتی، در راستای موج جدیدی است که در آن استارتاپهایی نظیر Rime با هدف جایگزینی سیستمهای تلفنی قدیمی تلاش میکنند تا تجربه کاربر را متحول کنند.
اکثر عاملهای فعلی به دلیل پردازش خطی دستورات، دچار وقفه در پاسخدهی هستند. اما Smallest.ai بر این باور است که در یک مکالمه انسانی، ما منتظر تمام شدن جملهی طرف مقابل نمیمانیم تا فکر کنیم؛ بلکه همزمان با شنیدن، پاسخ را میسازیم. همانطور که در بحثهای گذشتهی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، بهینهسازی سرعت همیشه با ریسکهای دقت همراه است، اما این شرکت راهکار متفاوتی دارد.
این استارتاپ از یک استراتژی مدل دوگانه استفاده میکند:
- یک مدل زبانی کوچک (SLM) — شبیه به یک دستیار سریع که فقط روی واکنشهای فوری و لهجهها تمرکز دارد — تعاملات لحظهای و محیطهای پرصدا را مدیریت میکند.
- یک مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — مسئول استدلالهای پیچیده است. اگر سؤال کاربر سخت باشد، سیستم او را برای لحظهای در حالت انتظار میگذارد تا مدل بزرگتر تحقیق کند.
سودارشان کامات (Sudarshan Kamath)، مؤسس و مدیرعامل Smallest.ai، معتقد است تمرکز روی قابلیتهای صوتی پیشرفته برای اکثر استارتاپهای پشتیبانی مشتری، یک اتلاف وقت است. به همین دلیل، شرکت او تنها لایه هوش لحظهای را برای سازمانها فراهم میکند. در حال حاضر شرکتهای RingCentral و Truecaller از این فناوری استفاده میکنند.
این رویکرد مستقیماً با غولهایی مثل ElevenLabs، Cartesia و Sarvam رقابت میکند. با این حال، در حالی که رقبا بیشتر روی دوبله یا پادکست متمرکز شدهاند، Smallest.ai فقط روی عاملهای مکالمهای سازمانی تمرکز دارد.
این چرخش به سمت «هوش ترکیبی» (Hybrid Intelligence) است؛ جایی که سرعت و عمق تفکر بین مدلهای کوچک و بزرگ تقسیم شده است. هدف نهایی، رسیدن به رابطهای است که در آن نتوان بر اساس زمانبندی پاسخ، تشخیص داد که طرف مقابل انسان است یا ماشین.
گام بعدی شما
- مدلهای صوتی لبه (Edge Voice Models) را در گردش کارهای اتوماسیون خود بررسی کنید.
- تفاوت بین Latency (تأخیر) و Response Time را در استقرار عاملهای صوتی بسنجید.
- فرصتهای جایگزینی سیستمهای IVR قدیمی با لایههای هوش لحظهای را ارزیابی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو