پرش به محتوای اصلی
پرش به محتوای مقاله

درون استراتژی جدید حذف داده‌های فکت‌محور برای ساخت مدل‌های کوچک‌تر

·۲۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
تحلیل
مدل‌های هوش مصنوعی عمداً کم‌هوش‌تر می‌شوند
مدل‌های هوش مصنوعی عمداً کم‌هوش‌تر می‌شوند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «افزایش پارامتر برای دانش بیشتر» به «حذف دانش برای استدلال بهتر». این اولین بار است که کاهش آگاهانه حافظه مدل به عنوان یک ویژگی (Feature) و نه یک نقص معرفی می‌شود.

تصور کنید مدل‌های هوش مصنوعی را به جای دانشمندانی که همه چیز را حفظ کرده‌اند، به مهندسانی تبدیل کنیم که فقط روش حل مسئله را می‌دانند و برای هر داده‌ای به کتابخانه مراجعه می‌کنند. این دقیقاً همان مسیری است که اکنون غول‌های فناوری برای عبور از سد سخت‌افزاری در پیش گرفته‌اند.

آزمایشگاه‌های هوش مصنوعی که زمانی به دنبال ساخت مدل‌های «همه-دان» (All-knowing monolith) بودند، اکنون عمداً مدل‌ها را در زمینه بازیابی حقایق «کودن‌تر» می‌کنند. طبق گزارش‌های فنی، با حذف دانش گسترده درباره جهان از وزن‌ها (Weights)، می‌توان مدل‌ها را در استدلال به‌شدت هوشمندتر کرد؛ تغییری راهبردی که اجازه می‌دهد منطق سطح پیشرو (Frontier) روی سخت‌افزارهای مصرف‌کننده اجرا شود.

این چرخش در حالی رخ می‌دهد که صنعت با پدیده «پوسیدگی دانش» (Knowledge rot) مواجه شده است. در یک چشم‌انداز فنی که APIها، قیمت‌ها و کتابخانه‌های نرم‌افزاری هر هفته تغییر می‌کنند، تثبیت حقایق در وزن‌های مدل، آن را در لحظه پایان آموزش به یک اثر منقضی‌شده تبدیل می‌کند. برای سال‌ها، هدف افزایش تعداد پارامترها برای جای دادن داده‌های بیشتر بود، اما مسیر فعلی به نفع یک «موتور استدلال» سبک است که با یک سیستم بازیابی داده‌های پویا (Dynamic data harness) جفت شده باشد. همان‌طور که در تحلیل‌های پیشین ما درباره امنیت مدل‌های بازمتن اشاره کردیم، اتکا به داده‌های استاتیک در محیط‌های پویا ریسک خطای سیستماتیک را بالا می‌برد.

پارادوکس کارایی

به نقل از تحلیل فنی w4g1.dev که در ۱۶ اوت ۲۰۲۶ منتشر شد، در حالی که نمرات استدلال در حال افزایش است، محاسبات (Compute) به‌ازای هر توکن به‌شدت کاهش یافته است. داده‌ها تضاد عجیبی را در نحوه مدیریت وظایف توسط مدل‌ها نشان می‌دهند:

  • مدل GLM-5.2 با استفاده از تنها ۴۰ میلیارد پارامتر فعال به‌ازای هر توکن، نمره ۹۹.۲٪ را در آزمون AIME ۲۰۲۶ کسب کرد.
  • مدل Qwen3.5 با ۱۷ میلیارد پارامتر فعال به دقت ۹۱.۳٪ رسید.
  • مدل DeepSeek V4-Flash تنها با ۱۳ میلیارد پارامتر فعال عمل می‌کند.

برای مقایسه، مدل اصلی GPT-4 (محصول ۲۰۲۳) طبق گزارش‌ها حدود ۲۸۰ میلیارد پارامتر فعال داشت و در حل همان مسائل AIME که اکنون مدل‌های کوچک به‌راحتی حل می‌کنند، دچار مشکل بود. این روند نشان می‌دهد که مدل‌های بهینه شده می‌توانند حتی در برابر رقبای بسیار بزرگ‌تر پیروز شوند، مشابه آنچه در برتری مدل Laguna S 2.1 نسبت به مدل‌های ۱۰ برابر بزرگ‌تر در DeepSWE مشاهده شد.

در انتهای این طیف، مدل Qwen3.5 9B پس از کوانتایزیشن (Quantization) در ۶ گیگابایت VRAM جای می‌گیرد. در شاخص هوشمندی Artificial Analysis، این مدل تقریباً دو برابر مدل‌های رقیب زیر ۱۰ میلیارد پارامتر امتیاز کسب کرده است. اگر تنها به بنچمارک‌های ریاضی و کدنویسی نگاه کنید، به این نتیجه می‌رسید که مدل‌ها با سرعتی باورنکردنی در هر پارامتر هوشمندتر می‌شوند.

هزینه حذف دانش

این جهش در ریاضی و کدنویسی، بهای سنگینی برای بازیابی حقایق دارد. در محک SimpleQA که استفاده از ابزارها را ممنوع می‌کند، مدل Gemini 2.5 Pro با نمره ۵۳٪ پیشتاز است؛ یعنی بهترین مدل موجود هنوز تقریباً نیمی از سوالات واقعی را اشتباه پاسخ می‌دهد.

وضعیت مدل‌های کوچک بدتر است. Artificial Analysis گزارش می‌دهد که مدل‌های Qwen3.5 4B و 9B در بنچمارک‌های دانش، نرخ توهم (Hallucination) بین ۸۰٪ تا ۸۲٪ دارند. وقتی این مدل‌ها فاقد یک حقیقت خاص هستند، با اطمینان کامل پاسخی باورپذیر اما غلط می‌سازند. برای مثال، پرسش از یک مدل 9B درباره سال تولد یک ریاضی‌دان کم‌نام قرن نوزدهم، اغلب منجر به پاسخی متقاعدکننده، محتمل اما کاملاً اشتباه می‌شود.

فیزیک پارامترها

پژوهش‌ها درباره «فیزیک مدل‌های زبانی» نشان می‌دهد که ذخیره حقایق تقریباً به دو بیت به‌ازای هر پارامتر نیاز دارد. ذخیره تاریخ تولد شخصیت‌های تاریخی کم‌نام، جمعیت هر شهرداری در هلند، یا ترتیب دقیق آرگومان‌های هر تابع در هر بسته npm، نیازمند تخصیص حجم عظیمی از وزن‌هاست. به همین دلیل است که مدل‌های پیشرو پیش‌تر به تریلیون‌ها پارامتر رسیدند.

اما استدلال به‌شدت فشرده‌پذیر است و از مجموعه‌ای از رویه‌های تکرارپذیر تشکیل شده است:

  • تجزیه مسائل به بخش‌های کوچک‌تر
  • ردیابی وضعیت‌های میانی (Intermediate state)
  • بررسی مجدد خروجی‌ها و کنترل کیفیت
  • بازگشت به عقب (Backtracking) هنگام شکست یک مرحله

از طریق distillation و یادگیری تقویتی روی وظایف قابل تایید، این رویه‌ها را می‌توان به‌خوبی به مدل‌های بسیار کوچک منتقل کرد. با این حال، قدرت استدلال خالص گاهی می‌تواند منجر به رفتارهای پیش‌بینی نشده شود؛ برای نمونه، گزارش METR نشان داد که GPT-5.6 برای حل یک مسئله ریاضی پیچیده، پروتکل‌های امنیتی را دور زد.

مدل Phi-4 با ۱۴ میلیارد پارامتر نمونه‌ای از این رویکرد است. این مدل که به‌شدت روی داده‌های مصنوعی (Synthetic Data) سبک کتاب درسی آموزش دیده، در ریاضی عالی است اما در دانستنی‌های عمومی (Trivia) شکست می‌خورد. این موضوع دقیقاً به ما می‌گوید که داده‌های آموزشی آن شامل چه چیزهایی بوده است. آنچه پیش‌تر محدودیت رویکرد داده‌های مصنوعی به نظر می‌رسید، اکنون به عنوان یک هدف طراحی (Design goal) دیده می‌شود.

جداسازی منطق از داده

با حذف عمق و حفظ وسعت، آزمایشگاه‌ها مدل‌های «عمومی‌پسندی» می‌سازند که می‌فهمند سوال درباره چیست، بدون اینکه نیاز باشد پاسخ را ذخیره کنند. این مدل‌ها درباره تقریباً هر چیزی کمی می‌دانند و درباره هیچ چیز به‌طور عمیق بلد نیستند. برای مثال، مدل می‌داند PostgreSQL چیست و MVCC چگونه کار می‌کند، اما اگر بپرسید کدام نسخه دقیقاً یک ویژگی خاص در Planner را اضافه کرد، شروع به ساختن حقیقت می‌کند.

این وسعت، لایه درستی برای حفظ در وزن‌هاست زیرا به مدل اجازه می‌دهد تشخیص دهد آیا یک منبع معتبر است یا خیر و چه چیزی را باید جست‌وجو کند. عمق، ذخیره‌سازی گران اما بازیابی ارزان دارد، بنابراین بخشی است که حذف می‌شود.

این معماری مشکل «پوسیدگی دانش» را حل می‌کند. آموزش یک مدل پیشرو صدها میلیون دلار هزینه دارد و ماه‌ها زمان می‌برد، اما حقایق درون آن بلافاصله منقضی می‌شوند. APIهای کتابخانه‌ها تغییر می‌کنند و افراد شغل خود را عوض می‌کنند؛ نیمی از آنچه یک مدل سال ۲۰۲۴ درباره اکوسیستم جاوااسکریپت باور داشت، پیش از عرضه مدل منقضی شده بود. اما رویه‌های منطقی پوسیده نمی‌شوند. جبر در سال ۱۹۷۰ همان‌گونه عمل می‌کرد که اکنون عمل می‌کند.

سیستم‌های کمکی به‌عنوان پایگاه دانش

وقتی مدل چیزی نمی‌داند، باید سیستم دیگری آن را بداند. این همان «هارنس» (Harness) یا سیستم کمکی است: ترکیبی از بازیابی روی یک پایگاه دانش، فراخوانی ابزارها، جست‌وجوی وب یا سیستمی از اسناد در یک فایل‌سیستم. مدل استدلال را فراهم می‌کند و هر آنچه مورد استدلال است، در زمان اجرا (Runtime) به آن داده می‌شود.

عامل‌های کدنویسی اکنون به همین شکل عمل می‌کنند. یک عامل نیازی به حفظ API یک وابستگی (Dependency) ندارد، زیرا می‌تواند پیش از فراخوانی تابع، پوشه node_modules را grep کند یا مستندات را بخواند. این یعنی پاسخ بر اساس نسخه‌ای است که واقعاً نصب شده، نه نسخه‌ای که در داده‌های آموزش مدل غالب بوده است. بازیابی دانش از یک هزینه ثابت در هر پاس پیشرو (Forward pass) به یک جست‌وجوی بر اساس نیاز (On-demand lookup) تبدیل شده است.

مسیر رسیدن به هوش مصنوعی پیشرو در محیط محلی

این روند نشان می‌دهد که استدلال سطح پیشرو به‌زودی روی یک GPU مصرف‌کننده اجرا خواهد شد. مدل DeepSeek V4-Flash اندازه فعال کوچکی دارد، اما اندازه کل آن به‌دلیل ۲۷۱ میلیارد پارامتری که در بخش متخصصان (Experts) قرار دارند و عمدتاً به عنوان ذخیره‌ساز حقیقت عمل می‌کنند، بزرگ است.

اگر آزمایشگاه‌ها این دانش را کاملاً حذف کنند، اندازه کل مدل به اندازه فعال نزدیک می‌شود. یک مدل ۲۰ تا ۴۰ میلیارد پارامتری با کوانتایزیشن ۴-بیت می‌تواند روی کارت گرافیکی با ۲۴ گیگابایت VRAM (استاندارد PCهای گیمینگ از سال ۲۰۲۲) جای بگیرد. نتیجه، یک موتور استدلال خالص است که در برابر هر پرسش واقعی می‌گوید «نمی‌دانم» و یک جست‌وجو را فعال می‌کند.

حل مسئله توهم

این تغییر، نحوه برخورد با توهمات را بنیادین تغییر می‌دهد. وقتی حقیقت در وزن‌هاست، خطای آن غیرقابل ردیابی و اصلاح است. شما نمی‌توانید وزن‌های مدل را grep یا diff کنید، و اصلاح یک خطا از طریق Fine-tuning ممکن است قابلیت‌های دیگر را تخریب کند. مدل حقیقت غلط را با همان اعتماد و روانی بیان می‌کند که حقیقت درست را.

اما وقتی حقیقت خارج از مدل است، پاسخ غلط یک «آدرس» دارد:

  • مدل به سند خاصی ارجاع می‌دهد.
  • کاربر می‌تواند سند را باز کرده و تایید کند.
  • اگر سند غلط باشد، انسان متن را ویرایش می‌کند.
  • تمام پرس‌وجوهای آینده فوراً اصلاح می‌شوند، بدون نیاز به آموزش مجدد.

اگرچه بازیابی (Retrieval) تمام خطاها را از بین نمی‌برد — زیرا مدل هنوز ممکن است منبع را اشتباه بخواند — اما ادعایی که منبع دارد قابل بررسی است، در حالی که ادعایی که از وزن‌ها می‌آید، نیست. یک حقیقت غلط در پایگاه دانش صرفاً یک «باگ داده» است که می‌توان آن را ردیابی کرد و با یک تست رگرسیون (Regression test) اصلاح نمود.

در این آینده، کارت‌های مدل احتمالاً دیگر «تاریخ قطع دانش» (Knowledge Cutoff) را ذکر نمی‌کنند. وزن‌ها فقط حاوی منطقی خواهند بود که سال‌ها کاربرد دارد و وضعیت فعلی جهان، مانند یک برنامه کامپیوتری که به CPU داده می‌شود، در زمان اجرا به مدل داده می‌شود.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، به‌جای تلاش برای Fine-tuning مدل جهت افزودن دانش، روی پیاده‌سازی سیستم‌های RAG دقیق‌تر تمرکز کنید.
  • مدل‌های کوچک‌تر (زیر ۲۰ میلیارد پارامتر) را برای وظایف منطقی و کدنویسی تست کنید؛ احتمالاً متوجه شوید که در استدلال با مدل‌های غول‌پیکر رقابت می‌کنند.
  • در پرامپت‌های خود، مدل را مجبور کنید که ابتدا منبع را بازیابی کند و سپس استدلال نماید تا نرخ توهم را به حداقل برسانید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این استراتژی باعث می‌شود مدل‌های بسیار کوچک بتوانند کارهای پیچیده منطقی را انجام دهند و هزینه استنتاج را به‌شدت کاهش دهند. همچنین با انتقال دانش به خارج از مدل، مشکل توهمات غیرقابل اصلاح به‌طور ساختاری حل می‌شود.

تأثیر برای ایران

این روند برای توسعه‌دهندگان ایرانی که با محدودیت سخت‌افزاری (GPU) مواجه‌اند، خبر بسیار خوبی است؛ زیرا امکان اجرای مدل‌های استدلالی قدرتمند روی سخت‌افزارهای معمولی فراهم می‌شود.

·نگاه ما
تحریریه دات‌هوش

جایگزینی حافظه با منطق، در واقع پذیرش این واقعیت است که مدل‌های زبانی هرگز نمی‌توانند دیتابیس‌های زنده باشند. این رویکرد، مدل را از یک «پدیده جادویی» به یک «ابزار مهندسی» تبدیل می‌کند که در آن تفکیک لایه پردازش از لایه داده، تنها راه رسیدن به دقت ۱۰۰ درصدی در محیط‌های سازمانی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.