پرش به محتوای اصلی
پرش به محتوای مقاله

AphasiaBridge با مدل Gemma-2B صدای بیماران آفازی را در ۱۷۴ میلی‌ثانیه بازگرداند

·۱۳ مهر ۱۴۰۵۱۱ دقیقه مطالعه
دوستی که هر خط کد را می‌شناخت اما نمی‌توانست آب بخواهد. با Tinker صدایش را در ۱۷۴ میلی‌ثانیه بازگرداندم.
دوستی که هر خط کد را می‌شناخت اما نمی‌توانست آب بخواهد. با Tinker صدایش را در ۱۷۴ میلی‌ثانیه بازگرداندم.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از مدل Gemma-2B برای تبدیل عبارات تلگرافی به گفتار اول‌شخص با تأخیر زیر ۲۰۰ میلی‌ثانیه و حذف کامل توهمات مدل‌های عمومی در محیط ICU.

۱۷۴ میلی‌ثانیه. این تمام زمانی است که AphasiaBridge نیاز دارد تا کلمات تکه‌تکه و تلگرافی یک بیمار را به جملاتی باکرامت و اول‌شخص تبدیل کند. این ابزار عصبی که برای چالش Hacktoberfest با عنوان «ساخت برای یک دوست» (Build for a Friend) توسعه یافته است، اخیراً صدای یک مهندس نرم‌افزار ۲۴ ساله را که هشت ماه در سکوت مطلق گرفتار شده بود، بازگرداند.

هزینه انسانی انزوای شناختی

این پروژه از دل یک تراژدی متولد شد. هشت ماه پیش، طارق، مهندس نرم‌افزار ۲۴ ساله و دوچرخه‌سوار حرفه‌ای، هنگام رکاب‌زنی صبحگاهی در مرکز شهر مورد تصادف یک خودروی SUV قرار گرفت. او از یک عمل جراحی اورژانسی کرانیوتومی (برداشتن بخشی از جمجمه) شش ساعته جان سالم به در برد، اما پیامدهای پس از آن، نبردی از نوع دیگر بود. وقتی او در واحد مراقبت‌های ویژه تروماهای عصبی به هوش آمد، دچار آفازی اکسپرسیو بروکا (Broca's Expressive Aphasia) شدید بود که با دیس‌آرتری (اختلال در کنترل عضلات تکلم) همراه شده بود.

طارق پارادوکسی بی‌رحم را تجربه می‌کرد: شناخت و ادراک او کاملاً دست‌نخورده باقی مانده بود. او مادرش را می‌شناخت، تاریخچه کامیت‌های گیت (git commit history) خود را به یاد داشت و هر کلمه‌ای را که پزشکان در پایین تختش زمزمه می‌کردند، می‌فهمید. با این حال، پل فیزیکی که عقل او را به تارهای صوتی‌اش متصل می‌کرد، فرو ریخته بود.

این انزوای شناختی شکافی ویرانگر ایجاد کرد. در حالی که ذهن او هنوز می‌توانست افکار پیچیده و تفاوت‌های ظریف احساسی را پردازش کند، مسیر حرکتی تکلم بین مغز و زبانش قطع شده بود. تارهای صوتی او قفل شده بودند و دست راستش دچار لرزش‌های حرکتی ظریف شده بود. وقتی سعی می‌کرد روی یک آیپد تایپ کند، تنها می‌توانست عبارات شکسته و تلگرافی تولید کند، مانند:

  • «آب... یخ... گلو می‌سوزه... نی خمیده»
  • «کاتتر... فشار... سوزش... کیسه را چک کنید»
  • «دست چپ... بی‌حس... سوزن... دکتر را صدا کنید»

شکست هوش مصنوعی‌های چندمنظوره

طارق که برای ارتباط برقرار کردن مستأصل شده بود، سعی کرد از دستیاران هوش مصنوعی آماده روی گوشی هوشمندش استفاده کند. این تجربه تحقیرآمیز بود. از آنجا که مدل‌های تجاری مانند ChatGPT، Claude و سایر مدل‌های زبانی بزرگ (LLM) عمومی، برای تبدیل شدن به دستیاران گفتگو به صورت Instruction-tuned و با متد RLHF (یادگیری تقویت‌شده از بازخورد انسانی) تنظیم شده‌اند، آن‌ها عبارات کوتاه و دردناک او را به عنوان پرسش‌های معمولی مشتریان تلقی می‌کردند.

وقتی طارق با زحمت تایپ کرد «دست چپ... بی‌حس... سوزن... پرستار»، چت‌بات ۲.۵ ثانیه زمان گذاشت تا یک سلب مسئولیت پزشکی ۶۵ کلمه‌ای را پاسخ دهد: «سلام طارق! تجربه بی‌حسی و گزگز در بازوی چپ می‌تواند علامت تحریک ریشه عصبی گردنی یا تغییرات گردش خون باشد. من به عنوان یک هوش مصنوعی، شدیداً توصیه می‌کنم به پزشک معالج خود اطلاع دهید...»

طارق تبلت را به گوشه اتاق بیمارستان پرتاب کرد. در تخت ICU، با یک کاتتر تحت فشار یا گلویی خشک، بیمار به دنبال یک مقاله متکبرانه یا سخنرانی سوم‌شخص نیست؛ او فقط می‌خواهد صدای خودش را پس بگیرد.

معماری فنی

AphasiaBridge یک ابزار صوتی عصبی با اولویت آفلاین است که به‌طور خاص برای افرادی که در حال بهبودی از سکته مغزی، آسیب‌های تروماتیک مغزی و از دست دادن توان تکلم حرکتی هستند، مهندسی شده است. این سیستم در سه لایه تخصصی عمل می‌کند تا شکاف بین شناخت سالم و مسیرهای حرکتی شکسته را پر کند:

  • ماتریس صوتی AAC لمسی: یک شبکه فیزیکی در دسترس با اهداف لمسی بزرگ (بیش از ۸۸ پیکسل). این‌ها در شش دامنه بالینی گروه‌بندی شده‌اند: پزشکی فوری و درد، تغذیه و غذا، موقعیت تخت، خانواده و عشق، استقلال شخصی و طنز اجتماعی. این ساختار به بیماران اجازه می‌دهد تا عبارات تلگرافی را با کمترین فشار شناختی سرهم کنند. رابط کاربری به عنوان یک ابزار دقیق توسعه‌دهنده با پالت رنگی Dark-mode Obsidian و رنگ‌های سبز فسفری (Phosphor Emerald) طراحی شده است. این رابط از کلیدهای عددی [1] تا [9] با بازخوردهای لمسی (Haptics) شبیه‌سازی شده کیبورد پشتیبانی می‌کند.
  • موتور تنظیم‌شده Tinker: هسته سیستم از Google Gemma-2B، یک مدل با وزن‌های باز (Open-weight)، استفاده می‌کند. توسعه‌دهنده از Tinker API متعلق به Thinking Machines برای پیاده‌سازی یک آداپتور LoRA (Low-Rank Adaptation) با رتبه (Rank) ۸ و آلفای ۱۶ استفاده کرد. این تنظیمات روی ماژول‌های q_proj و v_proj با نرخ Dropout 0.05 و Bias روی حالت «none» اعمال شد.
  • بازسازی صوتی: سیستم با ادغام ElevenLabs، صدای پیش از تصادف بیمار را از ویدئوهای قدیمی تلفنی کلون می‌کند. این امر تضمین می‌کند که خروجی، گام (Pitch) و آهنگ طبیعی صدای طارق را منعکس کند، نه اینکه شبیه به یک اسکنر خودکار سوپرمارکت باشد. همچنین یک سیستم جایگزین AudioContext بومی برای تکلم بدون تأخیر در حالت Air-gapped (بدون اتصال به شبکه) گنجانده شده است.

جزئیات اجزای سیستم

برای اطمینان از اینکه سیستم به جای یک اسباب‌بازی، به عنوان یک ابزار در سطح پزشکی عمل کند، چندین فناوری خاص در پشته (Stack) نرم‌افزاری ادغام شدند:

  • فریم‌ورک فرانت‌اند: ساخته شده با Next.js 16 (App Router) و React 19.
  • بصری و صوتی: استفاده از Spline 3D Runtime برای رابط کاربری و Web Audio API برای تولید صدا با تأخیر کم.
  • استقرار (Deployment): پروژه به عنوان یک باندل استاتیک از طریق GitHub Pages مستقر شده و دارای یک گردش کار تأیید خودکار از طریق GitHub Actions است.
  • مجوزها: تمام دارایی‌ها، از جمله خط لوله tinker/train_tinker.py و مجموعه‌داده بالینی AAC در data/dataset.json تحت مجوز باز و سهل‌العبور MIT منتشر شده‌اند.

فرآیند آموزش

تنظیم دقیق (Fine-tuning) یک مدل زبانی برای تکلم فوری در بالین بیمار، نیازمند سه ویژگی غیرقابل مذاکره است: حذف هرگونه پرکننده سوم‌شخص، تأخیر زیر ۲۰۰ میلی‌ثانیه برای حفظ ریتم طبیعی گفتگو، و حریم خصوصی کامل (Air-gapped) برای رعایت استانداردهای HIPAA در بخش‌های ICU.

برای حذف شخصیت «چت‌بات»، توسعه‌دهنده یک حلقه آموزشی سطح پایین در train_tinker.py با استفاده از کلاینت Tinker پیاده کرد. این حلقه از forward_backward برای تجمع گرادینت روی وزن‌های LoRA و optim_step با بهینه‌ساز AdamW استفاده کرد. مدل در ۵ اپوک (Epoch) با نرخ یادگیری 2e-4 و Gradient Clip 1.0 آموزش دید.

این فرآیند با موفقیت توزیع احتمالی مدل را تغییر داد. مقدار Loss آموزش به طور واضح از ۲.۴۵ به ۰.۴۴ کاهش یافت و به مدل آموخت که تمام چارچوب‌های گفتگویی را رها کرده و ۱۰۰٪ جرم احتمالی خود را روی درخواست فوری اول‌شخص بیمار متمرکز کند.

بنچ‌مارک‌های تجربی

برای اثبات کارایی بالینی، سیستم در ۲۵ سناریوی پزشکی (N=25) که شامل فوریت‌های درد، نیازهای فیزیولوژیک پایه و جملات احساسی بود، آزمایش شد. مدل Gemma-2B تنظیم‌شده، به شدت از مدل پایه (Zero-shot) پیشی گرفت:

  • حفظ قصد (Intent Preservation): دقت از ۴۳.۶٪ به ۹۸.۴٪ جهش کرد (۵۴.۸٪ افزایش)، که تضمین می‌کند هیچ معنای تحریف‌شده‌ای ایجاد نمی‌شود.
  • تأخیر استنتاج (Inference Latency): میانگین زمان پاسخ از ۱,۴۷۳.۶ میلی‌ثانیه به ۱۷۴.۴ میلی‌ثانیه کاهش یافت؛ یک سرعت ۸.۴ برابری که با تمپوی گفتگوی انسانی مطابقت دارد.
  • تأخیر P90: تأخیر P90 برابر با ۱۸۲.۰ میلی‌ثانیه بود که پاسخ زیر ۲۰۰ میلی‌ثانیه در بالین بیمار را تضمین می‌کند.
  • توهمات (Hallucinations): جملات پرکننده ناخواسته و سلب مسئولیت‌های پزشکی از ۱۶.۰٪ به ۰.۰٪ کاهش یافت و سخنرانی‌های پزشکی کاملاً ریشه‌کن شدند.
  • عاملیت (Agency): انطباق با اول‌شخص به ۱۰۰٪ رسید و پایبندی سخت‌گیرانه به صدای بیمار حفظ شد.

تأثیر بالینی و حریم خصوصی

از آنجا که مدل به صورت محلی روی سخت‌افزارهای مصرف‌کننده اجرا می‌شود، هزینه هر استنتاج ۰.۰۰ دلار است. این موضوع اضطراب مالی مرتبط با صورت‌حساب‌های توکن-محور API را برای خانواده‌هایی که پیش از این هزینه‌های توان‌بخشی آسیب‌های مغزی آن‌ها را تحلیل برده است، از بین می‌برد.

علاوه بر این، ماهیت Air-gapped استقرار تضمین می‌کند که تله‌متری‌های خصوصی بیمار هرگز سخت‌افزار بالین را ترک نکند. در اتاق‌های ICU با دیوارهای سرب‌کشی شده یا کلینیک‌های روستایی با وای‌فای ضعیف، این یک نیاز حیاتی است. مدل‌های ابری بسته، داده‌ها را از طریق سرورهای شخص ثالث و شبکه‌های عمومی هدایت می‌کنند، در حالی که مدل‌های وزن-باز مانند Gemma-2B، حفظ ۱۰۰٪ داده‌ها در محل را تضمین می‌کنند. این رویکرد یادآور تلاش‌های مشابه برای استقلال از مدل‌های ابری با استفاده از سخت‌افزارهای ارزان‌قیمت است که نشان می‌دهد چگونه مدل‌های محلی می‌توانند تاب‌آوری سیستم‌های حمایتی را افزایش دهند.

ادغام با مراقبان

با درک این موضوع که پرستارانی که شیفت‌های ۱۲ ساعته شب را کار می‌کنند نمی‌توانند مدام یک تبلت کوچک را نظارت کنند، AphasiaBridge شامل یک جریان تله‌متری مراقب (Caregiver Telemetry Stream) است. این لاگ حسابرسی بالینی زنده، برچسب‌های زمانی، دسته‌های فوریت و بنچ‌مارک‌های تأخیر را ثبت می‌کند و دارای ویژگی‌های زیر است:

  • نشان‌های فوریت (Urgency Badges): رنگ‌بندی ارتباطات ورودی بر اساس دامنه بالینی برای کمک به کادر درمان در اولویت‌بندی نیازها.
  • زنگ‌های بالینی: یک زنگ هشدار دو-تونه متمایز در بازه ۸۸۰ هرتز تا ۵۸۷ هرتز برای اطلاع‌رسانی فوری به کارکنان.
  • دکمه تأیید (Acknowledge): یک سیستم تأیید فوری برای پرستاران تا سیگنال دهند که درخواست را دیده‌اند.
  • لاگ حسابرسی: یک فید لحظه‌ای که فوریت و تأخیر هر جمله بازسازی شده را ردیابی می‌کند.

اعتبارسنجی در دنیای واقعی

در یک بعدازظهر یکشنبه در کلینیک توان‌بخشی، این نمونه اولیه مورد آزمایش قرار گرفت. طارق که روی تخت تکیه داده بود و با یک توپ استرس زرد برای فیزیوتراپی کار می‌کرد، از صفحه کلید لمسی استفاده کرد. او چند ثانیه به کاشی‌ها خیره شد و زد: «دیگه... درباره من... حرف نزنید... مستقیم... با من... حرف بزنید».

پس از یک پالس ۱۷۴ میلی‌ثانیه‌ای، صدای کلون شده ElevenLabs او با وضوح کریستالی گفت: «لطفاً دیگر درباره من به صورت سوم‌شخص صحبت نکنید. به من نگاه کنید و مستقیم با من حرف بزنید.» اتاق در سکوت فرو رفت؛ مادرش که هشت ماه بود می‌شنید پزشکان طارق را طوری بررسی می‌کنند که انگار یک تکه مبلمان بی‌جان است، شروع به گریه کرد.

سپس طارق زد: «دوستت دارم مامان... ممنونم... پیشم بمون». بلندگو با صدای گرم و آشنای خودش پژواک داد: «دوستت دارم مامان. خیلی ممنونم که پیشم موندی.»

طارق بعدها در ترمینال تایپ کرد: «برای شش ماه، پشت دیواری از هجاهای شکسته زندانی بودم. وقتی ماشین با صدای من و کلمات من حرف می‌زند، من دیگر بیمار تخت شماره ۴ نیستم. من دوباره طارق هستم.»

مسیرهای آینده

توسعه‌دهنده در حال حاضر با گفتاردرمانگران طارق همکاری می‌کند تا لغت‌نامه تلگرافی بالینی را از ۲۵ عبارت به بیش از ۲۵۰ ترکیب پزشکی رایج گسترش دهد. برای افزایش دسترسی، تیم در حال بسته‌بندی مدل با ONNX Runtime است تا اجازه دهد سیستم به طور کامل روی یک تبلت لمسی ارزان‌قیمت Raspberry Pi 5 اجرا شود.

این پروژه معیار هوش مصنوعی کمکی را از «فصاحت» به «کرامت» تغییر می‌دهد. این ثابت می‌کند که مدل‌های کوچک‌تر و وزن-باز، وقتی با استفاده از ابزارهایی مانند Tinker API برای یک نیاز انسانی خاص به طور جراحی تنظیم شوند، می‌توانند در محیط‌های حساس، از بزرگ‌ترین مدل‌های بسته دنیا پیشی بگیرند. تمام خط لوله‌های آموزش، مجموعه‌داده‌های بنچ‌مارک و دارایی‌های فرانت‌اند Next.js (شامل Spline 3D و Web Audio API) به طور کامل تحت مجوز MIT در گیت‌هاب متن‌باز شده‌اند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مخزن متن‌باز AphasiaBridge در گیت‌هاب را برای بررسی پیاده‌سازی LoRA روی مدل‌های کوچک بررسی کنید.
  • برای کسانی که با بیماران دچار آفازی در ارتباط هستند، ابزارهای AAC (ارتباط جایگزین و افزایشی) را به عنوان مکمل درمان بررسی کنید.
  • بررسی کنید که چگونه مدل‌های SLM می‌توانند در محیط‌های حساس (مانند پزشکی) جایگزین مدل‌های ابری شوند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های NPU در دستگاه‌های لبه مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد نشان می‌دهد که مدل‌های با وزن باز (Open Weights) می‌توانند با هزینه صفر و حریم خصوصی کامل، نیازهای حیاتی پزشکی را برطرف کنند. تخصص در تنظیم دقیق مدل‌های کوچک، جایگزینی واقعی برای مدل‌های بسته و گران‌قیمت در کاربردهای تخصصی است.

تأثیر برای ایران

به‌دلیل متن‌باز بودن مدل و قابلیت اجرای آفلاین، توسعه‌دهندگان ایرانی می‌توانند این سیستم را بدون نیاز به APIهای تحریمی و با سخت‌افزارهای ارزان‌قیمت برای بیماران ایرانی بومی‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

این پروژه ثابت می‌کند که در محیط‌های حساس پزشکی، «دقت در هدف» بسیار ارزشمندتر از «عمومیت مدل» است. جایگزینی مدل‌های غول‌پیکر ابری با مدل‌های کوچک تنظیم‌شده (SLM)، نه تنها تأخیر را به سطح انسانی می‌رساند، بلکه با حذف لایه‌های مودبانه و اضافی، کرامت انسانی بیمار را بازمی‌گرداند. این یک چرخش از هوش مصنوعی «سخنور» به هوش مصنوعی «ابزاری» است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.