اگر امروز محصولی میسازید که تنها مزیتش امکان جابهجایی بین مدلهای مختلف است، احتمالاً ارزش واقعی برای کاربر خلق نکردهاید. در دنیای رقابتی امروز، کاربران به دنبال ابزاری هستند که مشکلشان را حل کند، نه لیستی از مدلهایی که بتوانند بین آنها دستوپا بزنند. وعده انعطافپذیری در تعویض مدلها، اغلب جایگزینی ضعیف برای ارائه بهترین عملکرد ممکن در یک وظیفه خاص است.
این بحث در حالی بالا گرفته است که موج جدیدی از استارتاپها، بهویژه در دورههای اخیر Y Combinator، در حال ساخت «هارنسهای سفارشی» (Custom Harnesses) برای کاربردهای خاص هستند. طبق نقد منتشر شده در وبسایت ferran.sh در ۴ اکتبر ۲۰۲۶، بسیاری از این محصولات ادعا میکنند که با ارائه صدها مدل مختلف — گاهی با اعداد اغراقآمیز مثل «۴۲۰,۶۹ مدل» — کاربر را در برابر افزایش قیمت یا افت کیفیت شرکتهایی مثل OpenAI یا Anthropic بیمه میکنند. Y Combinator اخیراً در یکی از گفتگوهای Paper Club خود به این روند اشاره کرده است. این رویکرد با هوش مصنوعی مانند یک کالای مصرفی ساده برخورد میکند، نه به عنوان هسته مرکزی تجربه کاربری.
توهم وابستگی به تأمینکننده
بسیاری از توسعهدهندگان استدلال میکنند که وجود یک انتخابگر مدل ضروری است، زیرا از آیندهای میترسند که در آن تأمینکنندهای مانند OpenAI قیمتها را تا حدی بالا ببرد که مدل غیرقابل تحمل شود، یا ابزاری مانند Muse ناگهان «بسیار بد» شود. اما به باور نویسنده، «عدم وابستگی به تأمینکننده» (Vendor Lock-in) ضعیفترین پاسخ ممکن است؛ بهخصوص زمانی که محصول شما صرفاً کپی از یک ابزار موفق است که فقط یک «انتخابگر مدل» به آن اضافه شده است.
برای اکثر کاربران، نیاز به بالاترین سطح هوشمندی بر ترس از وابستگی به یک شرکت غلبه میکند. مدلهای پیشرو مانند Claude Fable 5.1، Opus 5.5 و GPT-6 Astra سطحی از کاربرد و سودمندی را ارائه میدهند که مدلهای متنباز — یعنی مدلهایی که دستور پختشان علناً منتشر شده و هر کسی میتواند آنها را اجرا کند — هنوز قادر به رقابت با آنها نیستند. این رقابت در سطوح فنی، بهویژه در بحث اتوماسیون، به جزئیات دقیقی مانند ساختار خروجی مدلها تبدیل شده است که تعیین میکند کدام شرکت در محیطهای تجاری پیروز شود. مدلهای متنباز ارزانترند، اما در کارهای حساس و پیچیده، اغلب در ارائه نتایج مشابه شکست میخورند و همین امر آنها را به گزینهای پیشفرض و ضعیف برای وظایف حیاتی تبدیل میکند.
عملکرد در برابر متنباز
یک چرخه تکراری در این صنعت وجود دارد: مدلهای متنباز هنگام عرضه بسیار مورد توجه قرار میگیرند و بحثهای زیادی پیرامون آنها شکل میگیرد، اما به سرعت جای خود را به مدلهای پیشرو میدهند که همچنان پیشتازی خود را حفظ کردهاند. نویسنده با اشاره به تجربه شخصیاش میگوید ابتدا به دلیل هزینه، با Claude Fable مخالف بود و تصور میکرد Kimi K3 میتواند همه کارها را مدیریت کند؛ اما پس از تجربه واقعی، متوجه شد Fable بهترین مهندس راهکاری است که میتوانست داشته باشد و هیچ مدل دیگری حتی نزدیک به آن نبود. او Astra را نیز به عنوان یک «همکار واقعاً واقعاً خوب» توصیف میکند که همچنان بیرقیب است.
محکهای فنی (Benchmarks) نیز این واقعیت را تأیید میکنند. اگرچه مدلهای متنباز در حال پر کردن این شکاف هستند، اما هنوز هیچکدام به سطح مدلهای پیشرو در وضعیت فعلیشان نرسیدهاند. ساخت محصولی بر پایه مدلهای ضعیفتر و تبلیغ «لیست مدلها»، بدترین شرطبندی یک توسعهدهنده است؛ چون کاربر به سادگی به دنبال عملکرد برتر است، نه یک جدول رتبهبندی از مدلهای مختلف.
تغییر رویکرد به «هزینه به ازای هر وظیفه»
صنعت اکنون در حال تغییر معیار ارزیابی است و از اندازهگیری ارزش بر اساس هزینه به ازای هر میلیون توکن — تکههای کوچکی از متن که مدل تکهتکه میخورد — فاصله میگیرد. در عوض، استاندارد طلایی جدید «هزینه به ازای هر وظیفه» (Cost per Task) است. مدلی با قیمت توکن بالاتر، اگر بتواند یک کار پیچیده را در یک تلاش به درستی به پایان برساند، در واقع ارزانتر از مدل ارزانقیمتی است که نیاز به چندین تکرار دارد یا در نهایت در انجام کار شکست میخورد.

این تغییر باعث میشود توسعهدهندگان استکهای خود را متفاوت ارزیابی کنند. هدف دیگر یافتن ارزانترین توکن نیست، بلکه اطمینان از این است که کاربر با کمترین اصطکاک به نتیجه مطلوب برسد. این رویکرد با تلاشهای اخیر شرکتهای بزرگ برای کاهش هزینههای عملیاتی همسو است، همانطور که OpenAI با کاهش شدید هزینه استنتاج، نظارت بر عاملها را برای توسعهدهندگان رایگانتر کرده است. این موضوع در افزایش امتیازات DeepSWE در برابر میانگین دلار به ازای هر وظیفه مشهود است.

اولویت تجربه کاربری بر انتخاب مدل
محصولات موفق در حال حاضر انتخابگر مدل را کاملاً مخفی میکنند تا روی رابط کاربری تمرکز کنند. ChatGPT و Codex پیشرو در این مسیر هستند؛ آنها تجربهای یکپارچه ارائه میدهند که در آن مدل، مانند یک موتور نامرئی عمل میکند. چه در حال یادداشتگذاری روی یک تصویر باشید و چه در ویرایش سندی در OpenAI Spaces، سیستم بهطور خودکار مدل مناسب را برای متناسب شدن با آن وظیفه انتخاب میکند. اگر OpenAI یک آزمایشگاه مدل نبود، احتمالاً هرگز اجازه انتخاب مدل را به کاربر نمیداد، چون وظیفه اصلی، تحویل نتیجه به کاربر است.
ابزارهای دیگری نیز با تمرکز بر «هارنس» و تجربه کاربری خاص در حال پیروزی هستند:
- T3 Code: مهندسی نرمافزار را لذتبخش میکند؛ کاربر برنامهریزی و معماری را انجام میدهد و عاملها (Agents) — برنامههایی که میتوانند بهطور مستقل تصمیم بگیرند و ابزارها را به کار بگیرند — کد را مینویسند.
- Paper: تجربه محصول را با اجازه دادن به مهندسان برای طراحی روی یک بوم (Canvas)، استفاده از هر عاملی و به اشتراکگذاری نتیجه، به درستی پیاده کرده است.
- Anthropic: با قابلیتهای «استفاده از کامپیوتر» (Computer Use) در مسیری مشابه حرکت میکند که بهشدت مؤثرتر شده است.
در این محیطها، مدل خاص مورد استفاده اهمیتی ندارد، تا زمانی که عامل بتواند کد را بنویسد یا طراحی را بهدرستی رندر کند. این نشان میدهد که «لیست رتبهبندی مدلها» برای کاربر عادی یک عامل حواسپرتی است. مردم نمیخواهند لیستی از ۴۰۰ مدل را مدیریت کنند؛ آنها ابزاری میخواهند که «کار کند».
در نهایت، مزیت رقابتی در تجربه محصول است، نه انعطافپذیری زیرساخت. نویسنده این وضعیت را با محصولات تکنولوژی بین سالهای ۲۰۱۰ تا ۲۰۲۱ مقایسه میکند؛ وقتی اکثر دستگاهها به اندازه کافی «خوب» شدند، برند خاص دستگاه کمتر از تواناییاش در انجام کار اهمیت یافت. مدلها نیز به همین مسیر میروند. اینکه از چه مدلی استفاده میکنید، کمتر از اینکه با آن چه میسازید اهمیت دارد.
این بحث به معنای بیارزش بودن مدلهای متنباز نیست — آنها به دلیل ارزان بودن و کاربردی بودن مفیدند — اما بحث بر سر «نتایج» است. برنده کسی خواهد بود که محصولی محبوب بسازد، فارغ از اینکه چه مدلی آن را میراند. نتیجه نهایی برای کاربران بسیار مهمتر از توانایی انتخاب مدل است.
گام بعدی شما
- اگر توسعهدهنده هستید، به جای افزودن مدلهای بیشتر، روی کاهش «هزینه به ازای هر وظیفه» تمرکز کنید.
- رابط کاربری خود را ساده کنید و انتخاب مدل را از مسیر کاربر حذف کرده و آن را به یک فرآیند خودکار تبدیل کنید.
- روی ساخت «هارنسهای» تخصصی تمرکز کنید که تجربه کاربری را در یک حوزه خاص (مثل کدنویسی یا طراحی) بهینه میکنند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو