تصور کنید به جای تکیه بر سرویسهای ابری سنگین، یک اسکریپت کوچک روی سیستم شما تمام کارهای پیچیده شناسایی الگو را انجام دهد. پروژه Numberwang که در ۱۵ سپتامبر ۲۰۲۶ منتشر شد، دقیقاً همین ایده را با یک فایل JSON ۱.۸ مگابایتی اجرا میکند.
بسیاری تصور میکنند برای شناسایی الگوها حتماً به سختافزارهای گرانقیمت یا فریمورکهای حجیمی مثل PyTorch نیاز است، اما این مدل خلاف آن عمل میکند. این شبکه عصبی — شبیه نقشه مترویی که سیگنالها را از ورودی به جواب میرساند — تنها با استفاده از کتابخانههای استاندارد پایتون اجرا میشود و نیازی به نصب پیشنیازهای گیگابایتی ندارد.
همانطور که در بحثهای گذشته ما دربارهی مدلهای زبانی کوچک (SLM) اشاره کردیم، بهینهسازی اندازه مدل میتواند سرعت استنتاج را بهشدت افزایش دهد. در این پروژه، «وانگ بودن» به عنوان ویژگی ذاتی عدد در نظر گرفته شده است؛ بنابراین فرقی نمیکند عدد را به انگلیسی (four)، آلمانی (vier) یا اسپانیایی (cuatro) بنویسید.
طبق مستندات مخزن گیتهاب، معماری این مدل بر پایه نویسهها (Characters) است و از هیچ توکنساز یا نرمالکنندهای استفاده نمیکند. جزئیات فنی لایهها به شرح زیر است:
- ورودی: نویسههای خام
- لایهها: بردار معنایی (Embedding) با ۳۲ بعد $\rightarrow$ لایه Conv1d (۱۲۸ فیلتر، هسته ۳) $\rightarrow$ ReLU $\rightarrow$ لایه Conv1d (۱۲۸ فیلتر، هسته ۳) $\rightarrow$ ReLU $\rightarrow$ Max Pool جهانی $\rightarrow$ لایه Linear (۱۲۸) $\rightarrow$ ReLU $\rightarrow$ لایه Linear (۴) $\rightarrow$ سافتمکس (Softmax)
- مقیاس: دقیقاً ۸۰,۸۰۴ پارامتر
به گزارش توسعهدهنده، این شبکه عصبی ورودیهای متنوعی را میپذیرد؛ از ارقام ساده و کلمات در ۱۱ زبان مختلف گرفته تا عملیات ریاضی ابتدایی مثل «۱۲ بهعلاوه ۴». مدل حتی حالت خاص «Wangernumb» را برای اعداد ۱ و ۴۴ تشخیص میدهد و متنهای غیرعددی را بهدرستی رد میکند.
دادههای عملکردی نشان میدهد که این مدل در ۴۸۶ مورد آزمایشی به صحت ۸۸.۹٪ و امتیاز F1 برابر با ۰.۸۹۶ رسیده است. بیشترین دقت مدل در شناسایی «Wangernumb» (دقت ۰.۹۶۸) است، اما در مواجهه با عملیات ریاضی جدید، صحت آن به ۴۴ تا ۷۲ درصد کاهش مییابد.
این افت دقت به این دلیل است که شبکه به جای محاسبه ریاضی، عبارتهای رایج را حفظ میکند. برای مثال، عبارت «۵۲» برای مدل آشناست، اما «۹۰۴۳» را صرفاً حدس میزند. برای رسیدن به نتیجه کامل، پیشنهاد میشود ابتدا عبارت ریاضی محاسبه شده و سپس نتیجه به مدل داده شود.
برای یک کاربر عادی، این پروژه درسی در «هوش مصنوعی کوچک» است. این مدل ثابت میکند که برای کارهای خاص، قاعدهمند یا سرگرمی، یک مدل تخصصی کوچک میتواند از نظر سرعت و بهرهوری، مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — را شکست دهد.
این رویکرد، بحث را از «چقدر میتوانیم مدل را بزرگ کنیم» به «چقدر میتوانیم راهکار را کوچک کنیم» تغییر میدهد. با حذف توکنسازی و موتورهای قاعدهمند، تمام منطق زبانی و عددی مستقیماً در وزنهای مدل ذخیره شده است.
شما میتوانید این مدل را از طریق Hugging Face Spaces تست کنید یا مخزن آن را برای اجرا با پایتون ۳.۸ کلون نمایید.
گام بعدی شما
- بررسی مخزن گیتهاب پروژه برای درک نحوه پیادهسازی لایههای Conv1d بدون فریمورکهای سنگین
- تست مدل با عبارات ریاضی پیچیده برای مشاهده مرز بین «حفظ کردن» و «استدلال»
- تلاش برای آموزش یک مدل مشابه روی یک مجموعه داده کوچک و تخصصی در حوزه کاری خودتان
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو