پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های وزن‌باز ۶۵٪ از حجم توکن‌های جهانی را تصاحب کردند

·۲۵ تیر ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
راهنما
مدل‌های متن‌باز ۶۵٪ مصرف توکن جهانی را در اختیار گرفتند — راهنمای ساخت مسیریاب چندمدلی برای کاهش ۹۰٪ هزینه API
مدل‌های متن‌باز ۶۵٪ مصرف توکن جهانی را در اختیار گرفتند — راهنمای ساخت مسیریاب چندمدلی برای کاهش ۹۰٪ هزینه API
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تایید رسمی همگرایی عملکردی مدل‌های باز و بسته (شکاف ۳.۳ درصدی) و تبدیل مدل‌های پیشرو به کالاهای ارزان‌قیمت با کاهش ۵۰ برابری هزینه استنتاج در ۳ سال.

تصور کنید هزینه‌ی دسترسی به یک مدل استدلالی تراز اول، با هزینه‌ی یک اسکریپت ساده‌ی تکمیل خودکار متن برابر شود. این واقعیتِ سال ۲۰۲۶ است؛ جایی که شاهد سقوط دراماتیک «سه غول» (Big 3) هستیم: در عرض تنها ۱۲ ماه، سهم ترکیبی توکن‌های گوگل، OpenAI و Anthropic از ۷۲٪ به ۳۳٪ سقوط کرده است.

طبق داده‌های ژوئن ۲۰۲۶، این یک جابجایی تکتونیکی است و مدل‌های وزن‌باز (Open Weights) — که مثل دستور پخت‌های علنی غذا هستند و هر کسی می‌تواند آن‌ها را اجرا کند — اکنون ۶۵٪ از کل حجم توکن‌های عبوری از پلتفرم‌های اصلی هوش مصنوعی را در اختیار دارند. این انتقال، پایان انحصار مدل‌های بسته بر عملکرد بالا را اعلام می‌کند. برای توسعه‌دهندگان، محرک اصلی نه صرفاً ایدئولوژی، بلکه یک واقعیت اقتصادی بی‌رحمانه است: قیمت هوش در حال سقوط است در حالی که کیفیت مدل‌ها تثبیت شده است.

در این چشم‌انداز، هزینه‌ی مدل‌های سطح GPT-4 از ۲۰ دلار به ازای هر میلیون توکن در اواخر ۲۰۲۲، به تنها ۰.۴۰ دلار در دسامبر ۲۰۲۵ رسید؛ یعنی یک کاهش ۵۰ برابری در بازه‌ای ۳۶ ماهه.

####e

ظهور مدل‌های بازمتن چینی

به گزارش OpenRouter که هفته‌ای ۲۰۰ میلیون فراخوانی API را مدیریت می‌کند، مدل‌های چینی اکنون نیروی مسلط بازار هستند. ۸ مورد از ۱۰ مدل پرکاربرد این پلتفرم، مدل‌های بازمتن چینی هستند. تا ژوئیه ۲۰۲۶، مدل‌های چینی حدود ۴۲٪ از حجم پلتفرم را در دست دارند، در حالی که مدل‌های آمریکایی تنها ۳۵٪ سهم دارند.

بررسی فهرست OpenRouter برای ژوئیه ۲۰۲۶، توزیع حجم را به وضوح نشان می‌دهد. مدل‌های برتر بر اساس توکن‌های هفتگی عبارت‌اند از:

  • DeepSeek V4 Flash: ۱۸.۴ تریلیون توکن (چین/باز)
  • Xiaomi MiMo-V2.5: ۱۴.۹ تریلیون توکن (چین/باز)
  • Tencent Hy3 Preview: ۱۴.۸ تریلیون توکن (چین/باز)
  • MiniMax M3: حدود ۴ تریلیون توکن (چین/باز)
  • GLM-5.2 (Z.ai): حدود ۳.۲ تریلیون توکن (چین/باز)
  • Qwen 4.1 235B: حدود ۲.۹ تریلیون توکن (چین/باز)

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، حتی مدل‌های آمریکایی نیز دچار شکاف شده‌اند. در حالی که GPT-5.6 Luna (۲.۴ تریلیون) و Claude Opus 4.8 (۱.۹ تریلیون) همچنان بسته هستند، مدل‌هایی مانند Nemotron 3 Ultra (۲.۰ تریلیون) باز شده‌اند که نشان‌دهنده یک تغییر ساختاری گسترده‌تر در نحوه توزیع هوش مصنوعی است.

همگرایی در عملکرد

شکاف عملکردی عملاً ناپدید شده است. بر اساس مستندات گزارش وضعیت هوش مصنوعی بازمتن ۲۰۲۶ توسط Mozilla که در ۱۴ ژوئیه ۲۰۲۶ منتشر شد، فاصله عملکردی میان مدل‌های وزن‌باز و مدل‌های بسته در بنچمارک‌های Chatbot Arena اکنون تنها ۳.۳٪ است. مدل‌های باز اکنون در کدنویسی، دانش عمومی و پیروی از دستورات (Instruction Following) اساساً با مدل‌های بسته برابر شده‌اند.

این همگرایی باعث شده تفاوت قیمت تنها متغیر مهم و تعیین‌کننده باشد. برای بارهای کاری تولیدی، دلتای قیمت‌گذاری خیره‌کننده است:

  • DeepSeek V4 Flash: ۰.۱۴ دلار ورودی / ۰.۲۸ دلار خروجی (بهترین برای کارهای با حجم بالا)
  • Xiaomi MiMo-V2.5: ۰.۱۰۵ دلار ورودی / ۰.۲۸ دلار خروجی (بهترین برای کدنویسی و کارهای عامل‌محور/Agentic)
  • MiniMax M3: ۱.۲۰ دلار ورودی / ۴.۸۰ دلار خروجی (بهترین برای استدلال‌های پیچیده)
  • Qwen3.7-Plus: ۱.۳۹ دلار ورودی / ۵.۵۶ دلار خروجی (عملکرد متوازن)
  • GLM-4-Plus: ۱.۳۹ دلار ورودی / ۱.۳۹ دلار خروجی (ترکیبی از چینی و انگلیسی)
  • Claude Opus 4.8: ۱۵.۰۰ دلار ورودی / ۷۵.۰۰ دلار خروجی (فقط برای سخت‌ترین وظایف)
  • GPT-5: ۱۰.۰۰ دلار ورودی / ۳۰.۰۰ دلار خروجی (مقاصد عمومی)

در وظایفی که عملکرد مشابه است، مدل DeepSeek V4 Flash اکنون ۵۰ تا ۱۰۰ برابر ارزان‌تر از Claude Opus 4.8 است.

مهندسی مسیریاب چندمودله

تیم‌های تولیدی هوشمند استراتژی «تک-مدلی» را کنار گذاشته و به معماری مسیریابی (Routing Architecture) روی آورده‌اند. به جای استفاده از یک مدل پیشرو گران‌قیمت برای هر پرسش، آن‌ها وظایف را به ارزان‌ترین مدلی که قادر به مدیریت پیچیدگی موردنظر است، هدایت می‌کنند. این رویکرد در واقع تکامل استراتژی‌هایی است که در تحلیل‌های پیشین درباره‌ی کاهش هزینه‌های API با استفاده از مسیریابی مدل‌ها به آن‌ها پرداختیم، جایی که مشخص شد مدل‌های ارزان در بسیاری از حجم‌های کاری با مدل‌های سطح‌بالا رقابت می‌کنند.

داده‌های Vercel AI Gateway این شکاف را برجسته می‌کند: مدل‌های وزن‌باز ۲۹٪ از توکن‌ها را پردازش می‌کنند اما تنها ۴٪ از کل هزینه‌ها را به خود اختصاص می‌دهند. در مقابل، Anthropic ۳۲٪ توکن‌ها را مدیریت می‌کند اما ۶۱٪ هزینه‌ها را می‌بلعد. کارهای حجیم و کم-ریسک مانند چت‌های ساده و استخراج داده به مدل‌های باز ارزان سرازیر شده‌اند، در حالی که وظایف پرریسک مانند بررسی‌های حقوقی در مدل‌های پیشرو گران باقی مانده‌اند.

توسعه‌دهندگان می‌توانند این سیستم را از طریق یک مسیریاب مبتنی بر پایتون که درخواست‌ها را طبقه‌بندی می‌کند، پیاده‌سازی کنند.

جزئیات پیاده‌سازی

برای ساخت یک مسیریاب، لایه‌های مدل (Model Tiers) را به صورت متمایز تعریف کنید:

  • لایه سریع (Fast Tier): استفاده از deepseek-v4-flash برای کارهای ساده و حجیم مانند خلاصه‌سازی یا استخراج داده با قیمت 0.۱۴ دلار به ازای هر میلیون توکن.
  • لایه متوازن (Balanced Tier): استفاده از qwen3.7-plus برای کارهای با پیچیدگی متوسط مانند تحلیل‌های داده‌ای یا ترجمه با قیمت ۱.۳۹ دلار.
  • لایه سنگین (Heavy Tier): استفاده از claude-opus-4.8 برای تصمیمات حیاتی و استدلال‌های پیچیده حقوقی با قیمت ۱۵.۰۰ دلار.

منطق مسیریابی با اسکن کلمات کلیدی در پرامپت عمل می‌کند. برای مثال، کلمات کلیدی مانند «تحلیل» (analyze)، «حسابرسی» (audit) یا «انطباق» (compliance) لایه سنگین را فعال می‌کنند. کلمات کلیدی مانند «خلاصه» (summarize)، «ترجمه» (translate) یا «لیست» (list) لایه سریع را فعال می‌کنند. اگر هیچ‌کدام یافت نشد، سیستم به طور پیش‌فرض به لایه متوازن باز می‌گردد.

پیاده‌سازی‌های پیشرفته شامل مکانیزم جایگزینی هوشمند (Smart Fallback) است. در این حالت، مسیریاب ابتدا ارزان‌ترین مدل را امتحان می‌کند و اگر کیفیت پاسخ کافی نبود یا در یک بررسی عقلانیت ساده (Sanity Check) شکست خورد (مثلاً اگر طول نتیجه کمتر از ۲۰ کاراکتر بود)، آن را به لایه بالاتر ارجاع می‌دهد. در محیط‌های عملیاتی کامل، توسعه‌دهندگان از یک مدل زبانی به‌مثابه داور (LLM-as-a-judge) استفاده می‌کنند تا کیفیت خروجی مدل سریع را قبل از تصمیم برای ارتقای لایه، تأیید کنند.

اثرات اقتصادی در دنیای واقعی

یک تیم SaaS گزارش داد که پس از تغییر استک خود از GPT-4o خالص به رویکرد مسیریابی، هزینه‌های ماهانه API خود را ۸۵٪ کاهش داده است؛ به طوری که هزینه برای ۱۰ میلیارد توکن از ۱۲,۰۰۰ دلار به ۱,۸۰۰ دلار کاهش یافت.

علاوه بر هزینه‌ها، عملکرد فنی نیز به طور قابل توجهی بهبود یافت:

  • تأخیر میانگین (Average Latency): از ۱,۲۰۰ میلی‌ثانیه به ۶۰۰ میلی‌ثانیه رسید (۵۰٪ سریع‌تر).
  • تأخیر P99: از ۳,۵۰۰ میلی‌ثانیه به ۱,۸۰۰ میلی‌ثانیه رسید (۴۹٪ سریع‌تر).
  • امتیاز کیفیت (Quality Score): کاهش جزئی از ۹.۲ به ۸.۹ (افت ۳ درصدی).

تیم مذکور متوجه شد که این افت ۳ درصدی کیفیت به این دلیل رخ داده که حدود ۵٪ از وظایف به مدل‌هایی ارجاع داده شده بودند که بیش از حد ساده بودند. تنظیم دقیق طبقه‌بندی کلمات کلیدی توانست اکثر این خطاها را برطرف کند.

برای دسترسی به این مدل‌ها خارج از چین، توسعه‌دهندگان به طور فزاینده‌ای از گیت‌وی‌های سازگار با OpenAI مانند TunanAPI استفاده می‌کنند. با تنظیم base_url روی https://api.tunanapi.com/v1 می‌توان با یک کلید API و یک SDK واحد به مدل‌های DeepSeek V4، Qwen 3.7، GLM و MiniMax M3 دسترسی داشت. این کار اصطکاک یکپارچه‌سازی ناشی از مدیریت SDKهای مختلف ارائه‌دهندگان را حذف کرده و جایگزینی مدل‌ها را به تغییر ساده‌ی یک رشته (String) در فراخوانی API تبدیل می‌کند.

این چرخش، هوش مصنوعی را از یک سرویس API لوکس به یک کالای مصرفی (Commodity Utility) تبدیل می‌کند. مزیت رقابتی دیگر در این نیست که به کدام مدل دسترسی دارید، بلکه در این است که چقدر هوشمندانه بارهای کاری خود را مسیریابی می‌کنید تا تعادلی بهینه میان هزینه و کیفیت ایجاد کنید.

توسعه‌دهندگان باید اکنون صورت‌حساب توکن‌های خود را بررسی کرده و وظایف «کم-ریسک» و حجیم را شناسایی کنند تا فوراً آن‌ها را به مدل‌های وزن‌باز منتقل کنند.

گام بعدی شما

  • تحلیل لاگ‌های API خود برای شناسایی درخواست‌های تکراری و ساده که می‌توانند توسط مدل‌های ارزان‌تر (مثل DeepSeek Flash) مدیریت شوند.
  • پیاده‌سازی یک لایه مسیریابی (Router) ساده بر اساس کلمات کلیدی برای جداسازی وظایف حساس از کارهای عملیاتی.
  • تست مدل‌های وزن‌باز چینی از طریق APIهای سازگار با OpenAI برای مقایسه سرعت و هزینه در مقیاس واقعی.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ اثر این کاهش هزینه بر تقاضای GPU را در تحلیل بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این تغییر پارادایم، قدرت را از شرکت‌های مالک مدل (Model Labs) به سمت مهندسان سیستم (System Engineers) منتقل می‌کند. اعتبار این ادعا با داده‌های OpenRouter و Vercel تایید شده که نشان می‌دهد بهره‌وری عملیاتی اکنون بیش از دسترسی به مدل‌های پیشرو اهمیت دارد.

تأثیر برای ایران

استفاده از گیت‌وی‌های سازگار با OpenAI مانند TunanAPI، مسیر دسترسی توسعه‌دهندگان ایرانی به مدل‌های قدرتمند چینی را بدون نیاز به زیرساخت‌های پیچیده هموار کرده است.

·نگاه ما
تحریریه دات‌هوش

سقوط قیمت توکن‌ها در مدل‌های سطح GPT-4 نشان می‌دهد که ما از دوران «کمیابی مدل» به دوران «بهینه‌سازی توزیع» رسیده‌ایم. وقتی تفاوت عملکردی به زیر ۴ درصد می‌رسد، مدل‌های بسته دیگر نمی‌توانند با تکیه بر کیفیت تنها قیمت‌های نجومی خود را توجیه کنند. برنده واقعی این میدان، کسانی هستند که معماری «مسیریاب» را جایگزین «تک-مدلی» می‌کنند و هوش مصنوعی را نه به عنوان یک مغز واحد، بلکه به عنوان یک سلسله‌مراتب از ابزارهای ارزان و گران مدیریت می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.