تصور کنید میخواهید به یک مدل صوتی بیاموزید که چگونه در یک بحث داغ، لحظه مناسب برای پاسخ دادن را تشخیص دهد، اما تمام دادههای شما در یک فایل صوتی درهمتنیده است که در آن همه همزمان حرف میزنند. این دقیقاً همان بنبستی است که توسعهدهندگان هوش مصنوعی صوتی با آن دستوپنجه میکنند. در واقع، حتی اگر یک ضبط صوتی حاوی دقیقترین رفتارهای مکالمهای باشد که یک مدل نیاز به یادگیری دارد، اغلب به صورت یک جریان صوتی مخلوط (Mixed audio stream) ارائه میشود. این موضوع یک مشکل دادهای دشوار ایجاد میکند؛ توسعهدهندگان باید با دادههای «نامنظم» یا Messy دستوپنجه نرم کنند، جایی که گویندگان حرف یکدیگر را قطع میکنند، میخندند یا روی نویزهای پسزمینه صحبت میکنند—مثلاً زمانی که افراد پیش از پایان صحبت گوینده اصلی، تاییدهای کوتاهی را بیان میکنند.
AudioShake برای حل این مشکل، سامانه The Refinery را معرفی کرد؛ سیستمی که هدفش تبدیل ضبطهای صوتی مخلوط به دادههای ساختارمند و تفکیکشده بر اساس گوینده برای آموزش هوش مصنوعی است. طبق اعلام این شرکت، بسیاری از مدلهای صوتی فعلی روی مکالمات نمایشی (Staged) یا دادههای مصنوعی آموزش میبینند که اغلب فاقد ظرافتهای تعاملات واقعی انسانی است. The Refinery به سازمانها اجازه میدهد از ضبطهایی که در حال حاضر مالک آنها هستند استفاده کنند و صدای هر فرد را بدون نیاز به فایلهای چندکاناله (Multi-track) اصلی یا استمهای (Stems) ضبطشده بهطور جداگانه، استخراج کنند. این تغییر رویکرد، جداسازی صدا را از یک ابزار لوکس در پستولید (Post-production) به بخشی کلیدی از خط لوله دادههای هوش مصنوعی تبدیل کرده است. این امر این پرسش را ایجاد میکند که آیا مجموعهدادهها میتوانند زمانبندی و پیچیدگی مکالمات واقعی را حفظ کنند و در عین حال برچسبگذاری، بازرسی و استفاده از آنها آسانتر شود؟
همانطور که در تحلیلهای پیشین ما دربارهی چالشهای جمعآوری داده برای مدلهای بنیادی اشاره کردیم، کیفیت دادهها بسیار حیاتیتر از حجم آنهاست.
سازوکار تفکیک صدا
بر اساس مستندات فنی، The Refinery صداها را بازسازی یا تولید نمیکند؛ بلکه آنچه را که واقعاً ضبط شده است، آشکار و استخراج میکند. صداهای تفکیکشده و فرکانسهای مربوط به آنها مستقیماً از ضبط اصلی استخراج میشوند. این تمایز برای توسعهدهندگانی که بهدنبال نمونههایی از «رفتار واقعی مکالمهای» هستند (و نه یک اجرای جدید از آن)، حیاتی است. این سیستم مکالمات را به ترکهای همتراز تقسیم میکند تا صدای هر گوینده در یک مسیر مجزا قرار گیرد.
- حفظ همپوشانی: وقتی دو نفر همزمان صحبت میکنند، سیستم هر دو صدا را بهطور مجزا بازیابی میکند اما زمانبندی مشترک آنها را حفظ میکند. این قابلیت دقیقاً نشان میدهد که تداخل در چه لحظهای رخ داده است.
- جداسازی نویز: دیالوگها بهطور کامل از موسیقی و صداهای محیطی پسزمینه تفکیک میشوند.
- تمرکز آکوستیک: این سامانه بهجای تکیه بر مدلهای زبانی، بر پایه ویژگیهای آکوستیک عمل میکند. این موضوع به سیستم اجازه میدهد تا نرخهای نمونهبرداری (Sample rates) و شرایط ضبط مختلف را پشتیبانی کند.
این رویکرد با کاهش نویز استاندارد یا صرفاً پاکسازی یک ضبط تا زمانی که یک صدای غالب باقی بماند، متفاوت است. در هوش مصنوعی مکالمهمحور، «قطع کردن حرف طرف مقابل» نویز نیست، بلکه یک نقطه داده حیاتی است. یک تایید کوتاه میتواند نشان دهد که گوینده در حال گوش دادن است، موافقت میکند یا آماده است نوبت صحبت را بگیرد. تبدیل این تعاملات به یک جریان واحد، تداوم این رفتارها و مرتبط کردن آنها با گوینده درست را دشوار میکند.
فراتر از تشخیص گوینده (Diarization)
AudioShake فناوری خود را با تشخیص گوینده (Diarization) متفاوت میداند. در حالی که تشخیص گوینده صرفاً برچسب میزند که «چه زمانی» یک گوینده فعال است، تفکیک چندگوینده (Multi-Speaker Separation) سیگنالهای صوتی مستقلی برای هر شخص تولید میکند. برچسبگذاری یک بازه زمانی به عنوان حاوی دو گوینده، بهتنهایی به توسعهدهنده دو ترک صوتی مستقل و قابل استفاده نمیدهد.
برای تضمین کیفیت دادهها، این سیستم دو امتیاز اطمینان (Confidence scores) مجزا ارائه میدهد:
۱. اطمینان از تخصیص (Assignment Confidence): اینکه سیستم چقدر مطمئن است که این صدا متعلق به گوینده درست است.
۲. کیفیت تفکیک (Separation Quality): اینکه ترک صوتی خروجی چقدر پاک است، فارغ از اینکه چه کسی در حال صحبت است.
این دو امتیاز مشکلات متفاوتی را هدف قرار میدهند: یک صدا ممکن است بهدرستی تخصیص یافته باشد اما همچنان حاوی صداهای فردی دیگر باشد. برای یک خط لوله آموزشی، تفکیک این توابع باعث میشود بازبینی دقیقتر شود. یک تیم ممکن است نیاز داشته باشد هویت گوینده، شفافیت یک ترک خاص یا دقت ترنسکریپت تولید شده پس از آن را بررسی کند. در نظر گرفتن هر سه مورد به عنوان یک موفقیت یا شکست واحد، باعث میشود مشخص نشود که خطا دقیقاً از کجا وارد مجموعهداده شده است.
بنچمارکها و عملکرد
در یک ارزیابی فنی از سیستم Multi-Speaker 2.0، شرکت AudioShake نرخ خطای کلمه کمینه-جایگشت متصل (cmPER) ۹.۱۷٪ را روی مجموعه داده LibriCSS گزارش کرد. برای مقایسه، یک چکپوینت MERL TF-Locoformer در شرایطی که هر دو از طریق خط لوله ترنسکریپت Whisper large-v3 پردازش شدند، امتیاز ۳۷.۷۵٪ را ثبت کرد. نرخ خطای پایینتر در این ارزیابی نشاندهنده اشتباهات ترنسکریپت کمتری است.
با این حال، شرکت خاطرنشان کرد که این نتایج بر اساس یک مقایسه آماده (Off-the-shelf) بود که در آن مدل پایه خارج از دامنه آموزشی خود تست شده است. AudioShake این موضوع را به عنوان یک مقایسه مطرح میکند و نه لزوماً دلیلی بر اینکه یک معماری در شرایط آموزشی یکسان بهطور ذاتی برتر است. همچنین اشاره شده که با افزایش تعداد گویندگان و مدتزمان همپوشانیهای طولانی، دقت سیستم تمایل به کاهش دارد.
باید توجه داشت که اینها نتایج گزارششده توسط خود شرکت هستند و یک ارزیابی مستقل از هر استقرار Refinery نیستند. کیفیت تفکیک و عملکرد مدلهای پاییندستی (Downstream) دو نتیجه متفاوت هستند. اگرچه یک کورپوس آموزشی پاکتر ارزشمند است، اما این عرضه هنوز ثابت نکرده است که یک مدل مکالمهای خاص پس از یادگیری از این دادهها چقدر بهبود مییابد؛ این امر مستلزم آزمایشهای جداگانه با شرایط کاربردی و ارزیابی تعریفشده است.
ادغام عملیاتی
برای مدیریت آرشیوهای عظیم، The Refinery از امتیازات کیفی برای دستهبندی دادهها به سه گروه «قابل استفاده»، «قابل اصلاح» و «نامناسب» استفاده میکند. این یک ویژگی عملیاتی حیاتی است، زیرا گوش دادن دستی به هر دقیقه صدا در مقیاس یک آرشیو صوتی قابل توجه، به یک گلوگاه تبدیل میشود.
- بررسی هدفمند: امتیازات باعث میشوند توجه انسانها به سمت بخشهای مشکوک هدایت شود. یک تیم میتواند اولویت را به یک مکالمه شلوغ بدهد که در آن تشخیص گوینده آرام دشوار است، بهجای صرف وقت برای یک ضبط ساده تکنفره.
- مدیریت موازنه: انتخاب تنها کلیپهای بسیار شفاف میتواند منجر به تولید مجموعهدادهای شود که موقعیتهای دشواری را که هدف اصلی پروژه بوده، از دست میدهد. تیمها باید هم کیفیت خروجی و هم تنوع مکالمهای که پس از فیلتر کردن باقی مانده است را ارزیابی کنند.
- آمادهسازی برای آموزش: آمادگی برای آموزش فراتر از تولید فایلهاست. توسعهدهندگان باید همچنان تعیین کنند که چگونه ترکها، ترنسکریپتها، زمانبندی، برچسبهای گوینده و متادیتای کیفیت با اهداف یادگیری خاص آنها سازگار میشود.
گزینههای استقرار شامل API یا نصب درونسازمانی (On-premises) است. گزینه دوم بهطور خاص برای سازمانهایی طراحی شده است که با ضبطهای حساس یا اختصاصی سروکار دارند تا اطمینان حاصل شود که مشتریان مالکیت کامل دادهها و خروجیهای خود را حفظ میکنند.
از رسانه به زیرساخت
AudioShake از تاریخچه خود در تولید رسانهای و خدمات به مشتریانی چون ESPN، Universal Music Group و Warner Bros. Studios بهره میبرد. کارهای فعلی این شرکت شامل جداسازی صدا برای میکس، بومیسازی (Localization)، تحلیل صوتی و ویرایش صوتی-تصویری است. آنها با به کارگیری این تکنیکهای جداسازی صنعت موسیقی در حوزه هوش مصنوعی، آرشیوهای رسانهای را به زیرساختی برای هوش مصنوعی صوتی تبدیل میکنند.
خدمات دادهای AudioShake همچنین شامل آمادهسازی مجموعهدادهها از محتوای مشتریان و توسعه مدلهای جداسازی تخصصی برای کاتالوگهای خاص است. با این حال، این به معنای مناسب بودن هر آرشیوی نیست. سازمانها باید همچنان شناسایی کنند که کدام ضبطها با کاربرد آنها سازگار است و مجوزهای قانونی را برقرار کنند. The Refinery بهطور خاص برای مشتریانی جایگاهسازی شده است که در حال حاضر حقوق استفاده از صداها را دارند.
نسخههای اولیه این فناوری پیش از این با آزمایشگاههای پیشرو هوش مصنوعی و شرکتهایی مانند Luel و Rime، در کنار آزمایشگاههای نامبردهنشده و بازارهای داده (Data marketplaces) مستقر شدهاند. شرکت گزارش میدهد که تا به امروز بیش از ۱۰۰ میلیون دقیقه صدا را پردازش کرده است.
برای جامعه فنی، این موضوع این فرض را تغییر میدهد که دادههای مکالمهای باکیفیت حتماً باید بهطور دقیق و نمایشی طراحی و ضبط شوند. اگر «نامنظمیهای» دنیای واقعی را بتوان بدون حذف کردنشان ساختارمند کرد، سقف تعاملات صوتی طبیعی بهشدت بالا میرود. این رویکرد در کنار ابزارهای پیشرفته تولید صدا، مانند قابلیتهای تعاملی ElevenLabs که تجربه شنیداری را از حالت رباتیک خارج میکند، میتواند به خلق مدلهای صوتی بسیار واقعگرایانهتر منجر شود.
توسعهدهندگانی که این سیستم را ارزیابی میکنند باید بر این موارد تمرکز کنند: آیا گویندگان آرام پس از فرآیند تفکیک باقی میمانند؟ آیا قطع کردن حرفها همچنان همتراز (Aligned) هستند؟ و چه مقدار اصلاح دستی پیش از آنکه دادهها واقعاً «آماده آموزش» شوند، مورد نیاز است؟
منتظر باشید تا ببینید این فناوری چگونه بر آموزش مدلهای چندوجهی (Multimodal) نسل بعد که هدفشان تسلط بر دینامیکهای اجتماعی گفتار انسانی است، تأثیر میگذارد.




گفتگو