پرش به محتوای اصلی
پرش به محتوای مقاله

«مدل‌های کوچک برترند»؛ درس Numberwang برای بهینه‌سازی هوش مصنوعی

·۲۵ شهریور ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
شبکه عصبی کوچک برای تشخیص Numberwang بودن اعداد در گیت‌هاب.
شبکه عصبی کوچک برای تشخیص Numberwang بودن اعداد در گیت‌هاب.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

پیاده‌سازی یک شبکه عصبی کاربردی در ۱۰۰ خط کد پایتون بدون هیچ کتابخانه خارجی (مانند PyTorch یا TensorFlow) که مستقیماً روی نویسه‌ها عمل می‌کند.

تصور کنید به جای تکیه بر سرویس‌های ابری سنگین، یک اسکریپت کوچک روی سیستم شما تمام کارهای پیچیده شناسایی الگو را انجام دهد. پروژه Numberwang که در ۱۵ سپتامبر ۲۰۲۶ منتشر شد، دقیقاً همین ایده را با یک فایل JSON ۱.۸ مگابایتی اجرا می‌کند.

بسیاری تصور می‌کنند برای شناسایی الگوها حتماً به سخت‌افزارهای گران‌قیمت یا فریم‌ورک‌های حجیمی مثل PyTorch نیاز است، اما این مدل خلاف آن عمل می‌کند. این شبکه عصبی — شبیه نقشه مترویی که سیگنال‌ها را از ورودی به جواب می‌رساند — تنها با استفاده از کتابخانه‌های استاندارد پایتون اجرا می‌شود و نیازی به نصب پیش‌نیازهای گیگابایتی ندارد.

همان‌طور که در بحث‌های گذشته ما درباره‌ی مدل‌های زبانی کوچک (SLM) اشاره کردیم، بهینه‌سازی اندازه مدل می‌تواند سرعت استنتاج را به‌شدت افزایش دهد. در این پروژه، «وانگ بودن» به عنوان ویژگی ذاتی عدد در نظر گرفته شده است؛ بنابراین فرقی نمی‌کند عدد را به انگلیسی (four)، آلمانی (vier) یا اسپانیایی (cuatro) بنویسید.

طبق مستندات مخزن گیت‌هاب، معماری این مدل بر پایه نویسه‌ها (Characters) است و از هیچ توکن‌ساز یا نرمال‌کننده‌ای استفاده نمی‌کند. جزئیات فنی لایه‌ها به شرح زیر است:

  • ورودی: نویسه‌های خام
  • لایه‌ها: بردار معنایی (Embedding) با ۳۲ بعد $\rightarrow$ لایه Conv1d (۱۲۸ فیلتر، هسته ۳) $\rightarrow$ ReLU $\rightarrow$ لایه Conv1d (۱۲۸ فیلتر، هسته ۳) $\rightarrow$ ReLU $\rightarrow$ Max Pool جهانی $\rightarrow$ لایه Linear (۱۲۸) $\rightarrow$ ReLU $\rightarrow$ لایه Linear (۴) $\rightarrow$ سافت‌مکس (Softmax)
  • مقیاس: دقیقاً ۸۰,۸۰۴ پارامتر

به گزارش توسعه‌دهنده، این شبکه عصبی ورودی‌های متنوعی را می‌پذیرد؛ از ارقام ساده و کلمات در ۱۱ زبان مختلف گرفته تا عملیات ریاضی ابتدایی مثل «۱۲ به‌علاوه ۴». مدل حتی حالت خاص «Wangernumb» را برای اعداد ۱ و ۴۴ تشخیص می‌دهد و متن‌های غیرعددی را به‌درستی رد می‌کند.

داده‌های عملکردی نشان می‌دهد که این مدل در ۴۸۶ مورد آزمایشی به صحت ۸۸.۹٪ و امتیاز F1 برابر با ۰.۸۹۶ رسیده است. بیشترین دقت مدل در شناسایی «Wangernumb» (دقت ۰.۹۶۸) است، اما در مواجهه با عملیات ریاضی جدید، صحت آن به ۴۴ تا ۷۲ درصد کاهش می‌یابد.

این افت دقت به این دلیل است که شبکه به جای محاسبه ریاضی، عبارت‌های رایج را حفظ می‌کند. برای مثال، عبارت «۵۲» برای مدل آشناست، اما «۹۰۴۳» را صرفاً حدس می‌زند. برای رسیدن به نتیجه کامل، پیشنهاد می‌شود ابتدا عبارت ریاضی محاسبه شده و سپس نتیجه به مدل داده شود.

برای یک کاربر عادی، این پروژه درسی در «هوش مصنوعی کوچک» است. این مدل ثابت می‌کند که برای کارهای خاص، قاعده‌مند یا سرگرمی، یک مدل تخصصی کوچک می‌تواند از نظر سرعت و بهره‌وری، مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — را شکست دهد.

این رویکرد، بحث را از «چقدر می‌توانیم مدل را بزرگ کنیم» به «چقدر می‌توانیم راهکار را کوچک کنیم» تغییر می‌دهد. با حذف توکن‌سازی و موتورهای قاعده‌مند، تمام منطق زبانی و عددی مستقیماً در وزن‌های مدل ذخیره شده است.

شما می‌توانید این مدل را از طریق Hugging Face Spaces تست کنید یا مخزن آن را برای اجرا با پایتون ۳.۸ کلون نمایید.

گام بعدی شما

  • بررسی مخزن گیت‌هاب پروژه برای درک نحوه پیاده‌سازی لایه‌های Conv1d بدون فریم‌ورک‌های سنگین
  • تست مدل با عبارات ریاضی پیچیده برای مشاهده مرز بین «حفظ کردن» و «استدلال»
  • تلاش برای آموزش یک مدل مشابه روی یک مجموعه داده کوچک و تخصصی در حوزه کاری خودتان

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه اعتبار رویکرد Small AI را افزایش می‌دهد و نشان می‌دهد که بهینه‌سازی پارامترها می‌تواند جایگزین افزایش محاسبات شود. این تغییر پارادایم، هزینه استنتاج را برای کاربر نهایی به شدت کاهش می‌دهد.

تأثیر برای ایران

این مدل به دلیل عدم نیاز به GPU و کتابخانه‌های حجیم، برای توسعه‌دهندگانی که با محدودیت سخت‌افزاری یا اینترنت ضعیف در ایران روبرو هستند، الگویی ایده‌آل برای ساخت ابزارهای سبک است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «حفظ کردن» به جای «محاسبه» در این مدل، نقطه ضعف فنی اما نقطه قوت مهندسی آن است. این پروژه ثابت می‌کند که برای بسیاری از کاربردهای تجاری، نیازی به مدل‌های استدلالی پیچیده نیست و یک شبکه عصبی ساده با پارامترهای اندک می‌تواند توهمات مدل‌های بزرگ را با تخصص در یک دامنه کوچک حذف کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.