اگر امروز برای اجرای هر وظیفهی ساده در سیستم خود به مدلهای غولپیکر پول میدهید، احتمالاً بودجهی خود را برای چیزی هدر میدهید که نیازی به آن نیست. استفاده از یک مدل پیشرو برای هر تسک کوچک، شبیه این است که برای روشن کردن یک شمع از شعلهافکن استفاده کنید؛ کار میکند، اما تمام بودجهی شما را میسوزاند. این دیدگاه که ابتدا در overmindlab.ai منتشر شد، وسواس فعلی صنعت روی اندازه مدلها را به چالش میکشد.
به نقل از تایلر ادواردز، مدیرعامل Overmind، مدلهای زبانی کوچک (SLM) — مثل دستیاری که بهجای دانستن همه چیز، در یک مهارت خاص استاد شده است — با ۱ تا ۸ میلیارد پارامتر، در اکثر زیر-وظایف عملیاتی دقیقتر و بهمراتب ارزانتر از مدلهای عظیم هستند. سالهاست صنعت هوش مصنوعی درگیر مسابقهی افزایش تعداد پارامترهاست و تصور میکند تنها راه رسیدن به هوش عمومی، مقیاسپذیری بیحد است. این طرز تفکر به نفع آزمایشگاههای بنیادین است اما واقعیتهای محیط عملیاتی هوش مصنوعی را نادیده میگیرد. فرض ضمنی این است که هر چیز دیگری صرفاً در انتظار است تا به سطح هوش عمومی برسد. این رویکرد منجر به ایجاد کلاسترهای بزرگتر، صورتحسابهای سنگینتر و تیمهای بزرگتر برای مدیریت پیچیدگیهای حاصل از آن میشود.
اکثر گردشهای کاری عاملمحور (Agentic) شامل وظایفی تکراری و محدود است؛ مثل استخراج یک فیلد، طبقهبندی یک تیکت یا قالببندی خروجی. این کارها نیازی به مجموعهی دانش بشری ندارند بلکه به مدلی نیاز دارند که سریع، پیشبینیپذیر، ارزان در اجرا و تنظیمشده باشد تا دقیقاً همانطور که در یک بافت تعریفشده انتظار میرود، رفتار کند. این نیاز به دقت در وظایف تخصصی در حالی است که پژوهشهای اخیر نشان میدهد نرخ موفقیت عاملهای هوش مصنوعی در وظایف حرفهای هنوز بسیار پایین است، موضوعی که اهمیت مدلهای تخصصی و تنظیمشده را دوچندان میکند.

شکاف عملکرد در حال بسته شدن است
بر اساس بررسی منابع متعدد و بنچمارکهای اخیر، مدلهای تخصصی اکنون میتوانند در دامنههای خاص، قدرتمندترین مدلهای تجاری و انحصاری را شکست دهند. مدلهایی مثل Llama، Phi، Qwen و Mistral که دو سال پیش در سطح مدلهای پیشرو (Frontier) محسوب میشدند، اکنون بهصورت رایگان در دسترساند، قابلیت تنظیم دقیق (Fine-tune) دارند و میتوان آنها را روی سختافزاری که خودتان کنترل میکنید، مستقر کنید. شکاف عملکردی که زمانی هزینه و وابستگی به غولهای انحصاری را توجیه میکرد، اکنون بهشدت کاهش یافته است. در این میان، توانایی مدلهای پیشرو در تحلیلهای عمیق همچنان مورد بحث است، بهویژه در مواردی که قابلیت استخراج ایدههای نو از مراجع پژوهشی به چالش کشیده شده است.
- ریاضیات: مدل Qwen2.5-Math-7B با استفاده از چارچوب استدلالی rStar-Math مایکروسافت، در محک MATH نمرهی ۹۰٪ گرفت و از o1-preview شرکت OpenAI پیشی گرفت.
- پزشکی: پزشکان در ارزیابیهای کور، مدل MedS (۸ میلیارد پارامتری) محصول John Snow Labs را در تمام ابعاد از جمله صحت علمی، ارتباط بالینی و ایجاز، به GPT-4o ترجیح دادند.
- شیمی: مدل LlaSMol (۷ میلیارد پارامتری) در پیشبینی مولکولی به تطابق دقیق ۹۳٪ رسید، در حالی که GPT-4 نمرهای زیر ۵٪ کسب کرد.
- فراخوانی تابع: در حال حاضر یک مدل تخصصی ۸ میلیارد پارامتری در صدر جدول برکلی برای فراخوانی تابع (Function Calling) قرار دارد و از Claude 3.5 Sonnet و GPT-4o جلو زده است.
اقتصاد مالکیت در برابر اجاره
سرویسدهی به یک مدل ۷ میلیارد پارامتری از نظر تأخیر (Latency)، مصرف انرژی و توان پردازشی، تقریباً ۱۰ تا ۳۰ برابر ارزانتر از مدلهای ۷۰ تا ۱۷۵ میلیارد پارامتری است. در یک سیستم عاملمحور پیچیده که یک گردش کار ممکن است ۳۰ یا ۴۰ بار مدل را فراخوانی کند، این هزینهها بهسرعت انباشته شده و اثر ترکیبی میگذارند. مدلهای پیشرو در مراکز داده و پشت APIها اجرا میشوند و تأخیر آنها در حد صدها میلیثانیه است؛ اما مدلهای کوچک گامهای شبکه را حذف کرده و دقیقاً در جایی که دادهها قرار دارند اجرا میشوند.
علاوه بر صورتحساب، وزنهای باز (Open Weights) — یعنی دسترسی به پارامترهای مدل بهجای خرید خروجی آماده — کنترل کامل را به شرکتها میدهد. مدل پیشرویی که از طریق API دسترسی پیدا میکنید، یک وابستگی است، نه زیرساخت، و قطعاً یک «خندق فنی» (Technical Moat) محسوب نمیشود. وقتی ارائهدهنده نسخهای را تغییر میدهد، مدلی را بازنشسته میکند یا قیمت API را تغییر میدهد، کاربر است که ریسک را میپذیرد. در مقابل، یک مدل زبانی کوچک (SLM) دارایی شرکت است که میتوان آن را بازرسی، مالکیت و اصلاح کرد.
هوش لبه و حریم خصوصی
مدلهای کوچک اجازه میدهند هوش مصنوعی از ابر (Cloud) به هوش شخصی در جیب کاربران منتقل شود. چون مدلهای ۷ و ۸ میلیارد پارامتری روی گوشیها و لپتاپهای مدرن اجرا میشوند، میتوان آنها را نه تنها برای یک گردش کار خاص، بلکه برای یک فرد خاص تنظیم دقیق کرد. عاملی که روی دستگاه زندگی میکند و از نحوه کار واقعی کاربر میآموزد، اساساً با عاملی که برای هر درخواست به یک مرکز داده متصل میشود، متفاوت است.
این تغییر فیزیکی، بحث امنیت و انطباق (Compliance) را دگرگون میکند. یک مدل تشخیص کلاهبرداری که روی سختافزار داخلی یک بانک اجرا میشود و با الگوهای تراکنش همان مؤسسه آموزش دیده، تضمین میکند که دادههای حساس هرگز از مرز شبکه خارج نشوند. این امر وابستگیهای خارجی را حذف کرده و پروفایل ریسک را بهشدت کاهش میدهد.
حلقهی بازخورد عملیاتی
هر بار فراخوانی مدل در یک گردش کار عملیاتی، منبعی برای دادههای آموزشی باکیفیت است. چون پرامپتها تعریفشده و خروجیهای مورد انتظار محدود هستند، سیگنال موفقیت یا شکست هر گردش کار کاملاً شفاف و پاک است. تیمها میتوانند با استفاده از یک شنودگر (Listener) در رابط فراخوانی مدل برای ثبت ورودیها، خروجیها و نتایج پاییندستی، دقیقترین مجموعهداده مورد نیاز برای تنظیم دقیق مستمر یک مدل تخصصی را جمعآوری کنند.
شرکت Overmind در حال ساخت زیرساختی برای خودکارسازی این فرآیند است. هدف این است که ردپاهای عملیاتی (Production Traces) به مدلهای تخصصی تبدیل شوند که بهطور خودکار آموزش دیده، محک میخورند و سرویسدهی میشوند. این یعنی سیستم با هر بار اجرا، فراتر از صرفهجویی اقتصادی، در یک چرخه بهبود مستمر قرار میگیرد.
نظارت و امنیت
مدلهای تخصصی بهدلیل دامنه محدود و تعریفشده، نظارت بر آنها سادهتر است. وقتی مدل فقط برای یک شغل خاص ساخته شده، توزیع خروجیها متمرکزتر و حالتهای شکست پیشبینیپذیرتر است. شما دقیقاً میدانید مدل باید چه کاری انجام دهد، و همین موضوع شناسایی رفتارهای غیرمنتظره را آسانتر میکند.
مدلهای عمومی مشکل متفاوتی دارند. سطح شکست آنها بسیار گسترده است، مدام تغییر میکند و تقریباً غیرممکن است که بتوان تمام حالتهای خطا را از پیش فهرست کرد. پاسخ فعلی صنعت، استفاده از حفاظها (Guardrails) است؛ یعنی لیستی از قوانین که توسط انسانها نوشته شده تا بهصورت ایستا، مجموعهای بینهایت از روشهایی که یک مدل پیشرو ممکن است اشتباه کند را پوشش دهد.
هزینه پیادهسازی
با وجود مزایا، استقرار مدلهای کوچک سختتر از APIها است. فراخوانی API ساده است: پرامپت مینویسید، جواب میگیرید، تکرار میکنید و محصول را عرضه میکنید. اما ساختن یک پشتهی مبتنی بر مدلهای کوچک (SLM-first stack) نیاز به سربار مهندسی قابلتوجه و رویکردی اختصاصی به زیرساخت دارد.
برای موفقیت در اجرای مدلهای تخصصی در محیط عملیاتی، تیمها به چهار جزء کلیدی نیاز دارند:
- ابزارگذاری (Instrumentation): سامانههایی برای ثبت ردپاهای عملیاتی.
- پاکسازی (Curation): فرآیندهایی برای برچسبگذاری و پالایش دادههای ثبتشده.
- خط لولههای تنظیم دقیق (Fine-tuning Pipelines): زیرساختی برای اجرای منظم دورههای آموزش.
- ارزیابی و نسخهبندی (Evaluation & Versioning): ابزارهایی که به تیمها اجازه میدهد مدلها را بدون قطع شدن سیستم تعویض کنند.
مقایسه دو رویکرد
هنگام تصمیمگیری بین یک API پیشرو و یک SLM تخصصی، تفاوتها در ابعاد مختلف بسیار چشمگیر است:
- بهترین کاربرد: مدلهای پیشرو در استدلالهای باز و گفتگو عالی هستند؛ مدلهای تخصصی برای زیر-وظایف تکراری، محدود و غیرگفتگویی برترند.
- هزینه سرویسدهی: هزینههای API با هر توکن انباشته میشوند. یک SLM ۷ میلیارد پارامتری تقریباً ۱۰ تا ۳۰ برابر ارزانتر از یک LLM ۷۰ تا ۱۷۵ میلیارد پارامتری است.
- تأخیر: APIها شامل گامهای شبکه و صدها میلیثانیه تأخیر هستند. SLMها در محل دادهها اجرا شده و گام شبکه را حذف میکنند.
- کنترل: در APIها، بازنشستگی نسخهها و تغییر قیمتها به شما تحمیل میشود. در SLMها، مدل متعلق به شماست تا آن را بازرسی، اصلاح و نسخهبندی کنید.
- سطح شکست: مدلهای عمومی سطح شکست گسترده و متغیری دارند. مدلهای تخصصی دامنه محدود و شکستهای پیشبینیپذیری دارند.
- تلاش برای راهاندازی: راهاندازی API ساده است (پرامپت، تکرار، عرضه). راهاندازی SLM نیازمند ابزارگذاری، پالایش داده، آموزش و ارزیابی است.
تحلیل تحریریه
این تغییر نشاندهنده حرکتی به سمت «پراگماتیسم هوش مصنوعی» است. صنعت در حال درک این موضوع است که رویکرد «یک مدل برای حاکمیت بر همه»، از نظر اقتصادی برای سازمانها ناپایدار است. برندگان واقعی عصر عاملها (Agentic Era) احتمالاً کسانی خواهند بود که با مدلها به عنوان اجزای ماژولار و قابل تعویض برخورد کنند، نه وابستگیهای یکپارچه و غولپیکر. شرطبندی Overmind این است که تیمهای پیروز، کسانی هستند که مدلهای خود را مالک باشند، نه کسانی که قدرتمندترین مدلها را اجاره میکنند.
برای توسعهدهندگان، این بدان معناست که ارزشمندترین مهارت دیگر «مهندسی پرامپت» نیست، بلکه «پالایش دادهها» (Data Curation) است. توانایی ثبت و برچسبگذاری ردپاهای عملیاتی است که خندق فنی ایجاد میکند، نه انتخاب اینکه کدام API پیشرو اجاره شود. این زیرساخت برای آینده هوش مصنوعی ضروری است، چه برای اجرای تشخیصهای پزشکی در بیمارستانها و چه برای سازگاری با افراد روی گوشیهایشان.
منتظر ظهور «باغهای مدل» (Model Orchards) باشید؛ جایی که یک عامل واحد، دهها SLM کوچک و فوقتخصصی را مدیریت میکند بهجای اینکه از یک LLM بزرگ استفاده کند. میدان نبرد بعدی، ابزارهایی خواهد بود که این استقرارهای چند-مدلی را در مقیاس بزرگ مدیریت کرده و محیطهای عملیاتی را به موتورهای آموزشی خودشان تبدیل میکنند.
گام بعدی شما
- شناسایی وظایفی در گردش کارتان که تکراری هستند و نیازی به دانش عمومی ندارند.
- بررسی مدلهای Qwen2.5 یا Mistral برای جایگزینی برخی فراخوانیهای گرانقیمت API.
- طراحی سیستمی برای ثبت ورودی و خروجیهای مدل (Traces) جهت جمعآوری داده برای تنظیم دقیق آینده.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو