پرش به محتوای اصلی
پرش به محتوای مقاله

تبادل وزن‌ها در برابر تبادل متن؛ روشی ارزان‌تر برای اتصال مدل‌های AI

·۱۱ شهریور ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
ریاضیدانان روس به مدل‌های هوش مصنوعی آموختند بدون کلام با هم گفتگو کنند
ریاضیدانان روس به مدل‌های هوش مصنوعی آموختند بدون کلام با هم گفتگو کنند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی تبادل توکن‌های متنی با تبادل مستقیم مقادیر ریاضی وزن‌ها بین دو مدل متفاوت؛ این اولین بار است که مدل‌های کوچک بدون Distillation، هوشمندی مدل‌های غول‌پیکر را از طریق یک پل ریاضی به ارث می‌برند.

تصور کنید بتوانید قدرت یک ابرکامپیوتر را در گوشی موبایلتان جای دهید، بدون آنکه باتری دستگاه در عرض چند دقیقه تخلیه شود. این رویای دست‌نیافتنی، حالا با روشی شبیه به «تله‌پاتی ماشینی» در دسترس است.

استارتاپ Mostik راهکاری را توسعه داده که در آن مدل‌های هوش مصنوعی به‌جای تولید متنی که مدل دیگر باید آن را بخواند و تحلیل کند، مستقیماً از طریق مقادیر ریاضی موجود در وزن‌ها (Weights) — یعنی همان اعدادی که تعیین می‌کنند یک ورودی چگونه به خروجی تبدیل شود — با هم تعامل می‌کنند.

این رویکرد در زمانی ارائه می‌شود که صنعت با هزینه‌های سرسام‌آور محاسباتی برای مقیاس‌بندی مدل‌های یکپارچه دست‌وپنجه نرم می‌کند. در حالی که روند فعلی بر بزرگ‌تر کردن مدل‌ها برای افزایش هوش متمرکز است، Mostik پیشنهاد می‌کند آینده در گرو «مجموعه‌ها» است؛ یعنی ترکیب مدل‌های تخصصی برای رسیدن به نتایج برتر، بدون نیاز به واسطه‌های متنی سنتی. این تلاش برای بهینه‌سازی، در راستای موج جدیدی از بازطراحی معماری ترنسفورمرها برای کاهش هزینه‌های مدل‌های زبانی است که توسط چندین استارتاپ پیشرو دنبال می‌شود.

ساشا مالیشوا (Sasha Malysheva)، مدیرعامل این شرکت و ابداع‌کننده این روش، آینده هوش مصنوعی را با یک استدلال ریاضی می‌بیند. او این وضعیت را به شوخی معروف دنیای ریاضی درباره تخمین وزن یک خوک تشبیه می‌کند؛ در این سناریوها، میانگین حدس‌های چند فرد عادی می‌تواند دقیق‌تر از تخمین یک تک‌تخصص باشد، مشروط بر اینکه حدس‌های آن‌ها با هم ترکیب و میانگین‌گیری شود.

همان‌طور که در بحث‌های گذشته ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تمرکز بر مدل‌های توزیع‌شده می‌تواند نقاط ضعف مدل‌های متمرکز را پوشش دهد. مالیشوا معتقد است ترکیب خروجی‌های چندین مدل، نتایجی بهتر از هر مدل واحد دارد و صراحتاً با استراتژی فعلی صنعت مخالف است. او می‌گوید: «من شخصاً فکر نمی‌کنم در آینده مدل‌های یکپارچه داشته باشیم یا قابلیت‌های مدل‌ها صرفاً از مقیاس‌بندی حاصل شود.»

به گزارش Wired در ۲ سپتامبر ۲۰۲۶، این تیم از این تکنیک برای ساخت مدلی استفاده کرد که به صدر رقابت ARC-AGI 3 — یکی از دشوارترین مسابقات هوش مصنوعی — رسید. آن‌ها برای اثبات این مفهوم، پلی میان دو مدل با وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پخت آن‌ها علناً منتشر شده و نه فقط غذای آماده — ایجاد کردند:

  • GLM-5.2: مدلی عظیم با ۷۵۳ میلیارد پارامتر.
  • Qwen-3.5: نسخه‌ای بهینه برای موبایل با ۴ میلیارد پارامتر.

این بهره‌گیری از مدل‌های خانواده Qwen، یادآور استقرار موفقیت‌آمیز مدل Qwen3.8-Max در بات‌های تلگرامی است که کارایی بالای این معماری را در محیط‌های عملیاتی به اثبات رساند.

سیستم ترکیبی حاصل، عملکردی دقیقاً بین این دو مدل ارائه می‌دهد، اما هزینه اجرای آن تنها یک‌بیستم مدل کامل GLM است. این کاهش چشمگیر در هزینه‌های عملیاتی، با تحلیل‌های اخیر مبنی بر سقوط شتابان هزینه‌های پروژه‌های هوش مصنوعی در شش ماه گذشته همسو است.

ستانیسلاو اسمیرنوف (Stanislav Smirnov)، برنده مدال فیلدز سال ۲۰۱۰ و دانشمند ارشد Mostik، اشاره می‌کند که یافتن زمین مشترک ریاضی بین مدل‌های مختلف به‌طور تاریخی دشوار بوده است. او مشاهده می‌کند که برای این منظور، «به نظر می‌رسد هنوز هیچ زبان ریاضی مناسبی وجود ندارد.»

اسمیرنوف باور دارد این «پل» در نهایت می‌تواند موارد زیر را آشکار کند:

  • درک عمیق‌تر از نحوه عملکرد واقعی مدل‌های هوش مصنوعی.
  • مقایسه استدلال ماشین با سازوکارهای مغز انسان.
  • یافتن نقاط مشترک در نحوه حل مسائل دشوار توسط انسان و هوش مصنوعی.

ولادیمیر آروستامیان (Vladimir Arustamian) از شرکت Lovable می‌گوید این اتفاق می‌تواند موجی از مدل‌های تخصصی در حوزه‌هایی مثل فیزیک یا زیست‌شناسی ایجاد کند. او تأکید می‌کند تیمی در Mostik در عرض چند ماه به چیزی رسید که او تصور می‌کرد سال‌ها زمان ببرد.

کارل تویلز، دانشمند سابق گوگل دیپ‌مایند، سازوکار این روش را بیشتر توضیح می‌دهد. او می‌گوید این تکنیک اجازه می‌دهد بدون اینکه مدل بزرگ تمام چرخه را مدیریت کند، به کیفیت آن دست یافت؛ یعنی با اجرای یک مدل کوچک‌تر در کنار مدل بزرگ، بهبودهای چشمگیری حاصل می‌شود.

برای کاربر نهایی، این یعنی قابلیت‌های سطح بالای هوش مصنوعی به‌زودی روی دستگاه‌های موبایل و با کمترین مصرف باتری اجرا می‌شوند. این موضوع ارزش مدل‌های بازمتن را بالا می‌برد و به آن‌ها اجازه می‌دهد تا به‌طور مؤثرتری با سیستم‌های بسته OpenAI یا Anthropic رقابت کنند.

اگر این روش مقیاس‌پذیر شود، صنعت از «قوانین مقیاس‌بندی» (Scaling Laws) — که می‌گوید هرچه مدل بزرگ‌تر باشد، بهتر است — فاصله می‌گیرد. به‌جای یک مغز غول‌پیکر، شاهد شبکه‌ای از خبره‌های کوچک و کارآمد خواهیم بود که به زبانی غیرقابل‌فهم برای انسان با هم حرف می‌زنند.

نتایج نهایی رقابت ARC-AGI 3 را دنبال کنید تا ببینید آیا ارتباط مبتنی بر وزن‌ها برتری واقعی و قابل اثباتی نسبت به مقیاس‌بندی سنتی دارد یا خیر.

گام بعدی شما

  • نتایج نهایی رقابت ARC-AGI 3 را دنبال کنید تا ببینید آیا ارتباط مبتنی بر وزن‌ها برتری واقعی نسبت به مقیاس‌بندی سنتی دارد یا خیر.
  • اگر توسعه‌دهنده هستید، مدل‌های کوچک‌تر (SLM) را برای ترکیب با مدل‌های بزرگ‌تر در گردش‌های کاری خود بررسی کنید.
  • روی مدل‌های بازمتن سرمایه‌گذاری کنید، زیرا این تکنیک آن‌ها را به رقیبی جدی برای مدل‌های بسته تبدیل می‌کند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این روش با کاهش شدید هزینه استنتاج، دسترسی به مدل‌های سطح بالا را از مراکز داده به دستگاه‌های شخصی منتقل می‌کند. اعتبار این ادعا با موفقیت Mostik در بنچمارک سخت ARC-AGI 3 تقویت شده است.

تأثیر برای ایران

این تکنیک فرصتی استثنایی برای توسعه‌دهندگان ایرانی است تا با استفاده از مدل‌های بازمتن و سخت‌افزارهای محدود، به عملکرد مدل‌های بسته و گران‌قیمت دست یابند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی متن با وزن‌های ریاضی در ارتباط بین مدل‌ها، در واقع حذف لایه «ترجمه» از تفکر ماشین است. این رویکرد فرضیه برتری مدل‌های یکپارچه (Monolithic) را به چالش می‌کشد و نشان می‌دهد که هوش مصنوعی می‌تواند به‌جای رشد عمودی، به‌صورت افقی و از طریق شبکه‌ای از مدل‌های کوچک رشد کند. این تغییر پارادایم، قدرت را از مراکز داده عظیم به سمت رایانش لبه (Edge Computing) منتقل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.