پرش به محتوای اصلی
پرش به محتوای مقاله

Claude Opus 5: عملکرد مشابه Fable 5 با نصف قیمت استنتاج

·۶ مرداد ۱۴۰۵۷ دقیقه مطالعه
اپوس ۵ در حال اجرای قطعه‌ای شگفت‌انگیز با کیبورد رول‌آپ در کنار روباهی در حال تعظیم
اپوس ۵ در حال اجرای قطعه‌ای شگفت‌انگیز با کیبورد رول‌آپ در کنار روباهی در حال تعظیم
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر استراتژی از «افزایش قدرت خام» به «بهینه‌سازی هزینه استنتاج» در مدل‌های پیشرو؛ جایی که Opus 5 عملکرد رقیب را با نصف هزینه ارائه می‌دهد.

اگر امروز برای مدل‌های سطح بالای هوش مصنوعی هزینه می‌پردازید، باید بدانید که هزینه استنتاج شما از این پس می‌تواند نصف شود بدون اینکه کیفیت پاسخ‌ها افت کند. این ادعای مرکزی آنتروپیک (Anthropic) در انتشار مدل Claude Opus 5 در ۲۸ ژوئیه ۲۰۲۶ است که وعده می‌دهد عملکردی برابر با مدل‌های رقیب را با نیمی از هزینه ارائه دهد. این رقابت بر سر بهینه‌سازی هزینه و سرعت، یادآور تلاش‌های اخیر سایر مدل‌هاست؛ برای مثال مدل Grok 4.5 نیز تلاش کرد تا سرعت استنتاج را دوبرابر کند، هرچند در برخی زمینه‌های تخصصی با چالش مواجه شد.

دنیای فعلی ما با تقابل شدید میان غول‌های کد‌بسته و جنبش وزن‌های باز شناخته می‌شود. همان‌طور که مدل‌هایی مانند Kimi K3 وزن‌ها و گزارش‌های فنی خود را منتشر می‌کنند، صنعت به دو دسته تقسیم شده است: کسانی که وزن‌های باز را یک ضرورت دموکراتیک می‌بینند و کسانی که آن را یک ریسک امنیتی می‌دانند. این وضعیت شبیه به رقابت میان رستوران‌های زنجیره‌ای است که دستور پخت را مخفی می‌کنند و آشپزخانه‌های محلی که هر کسی می‌تواند با تغییر در مواد اولیه، غذای بهتری بسازد. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن دیدیم، این دوقطبی اکنون به یک بحث استراتژیک درباره امنیت و دموکراسی در دسترسی به فناوری تبدیل شده است.

اپوس ۵ در حال پیشی گرفتن از فیبل ۵: نبرد آینده بازی‌های نقش‌آفرینی

پارادوکس عملکرد در Opus 5

به نقل از Ben's Bites، هدف Claude Opus 5 رسیدن به توان‌مندی‌های Fable 5 است، اما با قیمت ۵۰٪ کمتر. با این حال، بازخوردهای اولیه کاربران شکافی میان نتایج آزمون‌های کور و کاربرد واقعی را نشان می‌دهد. برای نمونه، کاربری به نام کلیر ابتدا از تجربه کار با این مدل متنفر بود، اما وقتی از او خواسته شد تا خروجی‌های مدل‌ها را در یک آزمون کور (بدون دانستن نام مدل‌ها) رتبه‌بندی کند، در نهایت Opus 5 را در رتبه اول قرار داد. این تضاد میان نتایج آزمایشگاهی و تجربه کاربر، موضوعی است که در بررسی هزینه‌های واقعی عملیاتی در برابر بنچمارک‌های تئوری مدل‌های کدنویسی نیز به تفصیل مورد بحث قرار گرفته است.

طبق گزارش Every’s، این مدل رفتارهای متناقضی دارد؛ مدل تمایل دارد با کاربر بحث کند، وظایف را پیش از موعد متوقف می‌کند و در برابر مهارت‌های سفارشی (Custom Skills) که کاربران برای نسخه‌های قدیمی‌تر مدل‌ها ساخته بودند، مقاومت می‌کند. این موضوع باعث شده کاربران گمان کنند مدل بیش از حد تنظیم دقیق (Fine-tuning) شده یا دچار «اوور‌پرامپت» (Overprompted) شده است — یعنی مثل پزشکی که آنقدر روی یک بیماری خاص تمرکز کرده که دیگر تشخیص‌های کلی را فراموش کرده است.

تجربه توسعه‌دهندگان نیز در حال تغییر است. تئو از وب‌سایت t3.gg گزارش داد که ساعت‌ها وقت صرف بازنویسی دستی فایل‌های CLAUDE.md و AGENTS.md به همراه چندین مهارت جدید کرد. او پس از بازرسی و حذف مقدار مشابهی از محتواهای قدیمی، گزارش داد که این کار «۱۰۰٪ می‌ارزید». این موضوع نشان می‌دهد که مهارت‌های قدیمی مهندسی پرامپت (Prompt Engineering) — یعنی همان هنر پرسیدن سؤال درست برای گرفتن بهترین جواب — به صورت مستقیم و بی‌نقص در Opus 5 جواب نمی‌دهد و نیاز به بازنگری دارد.

بهینه‌سازی مهندسی و قابلیت‌های صوتی

آنتروپیک منطق داخلی مدل‌های خود را به‌شدت ساده کرده است. بر اساس مستندات این شرکت، آن‌ها بیش از ۸۰٪ از پرامپت سیستمی (System Prompt) را در ابزار Claude Code برای هر دو مدل Opus 5 و Fable 5 حذف کرده‌اند و این کار را بدون هیچ‌گونه کاهش قابل‌اندازه‌گیری در امتیازات ارزیابی کدنویسی انجام داده‌اند.

در کنار این تغییرات، قابلیت‌های صوتی در حال گسترش است:

  • ChatGPT Voice اکنون با اپلیکیشن دسکتاپ ادغام شده و اجازه می‌دهد کاربر وظایفی را به جلسات جدید بسپارد و نتایج را به رشته‌گفتار اصلی برگرداند. این قابلیت در هر دو نسخه ChatGPT Work و Codex در دسترس است.
  • Claude اکنون از مدل‌های Sonnet و Opus در حالت صوتی پشتیبانی می‌کند و از محدودیت قبلی که فقط از مدل Haiku استفاده می‌کرد، فراتر رفته است. این مدل اکنون می‌تواند در میانه گفتگو، ابزارهایی مانند Gmail، تقویم و Slack را فراخوانی کند.

با این حال، کاربرانی مثل کشاو اشاره کرده‌اند که در کارهای «جدی»، تفاوت‌ها مشهود است. در حالی که صدای ChatGPT برای کارهای بهره‌وری مثل بررسی ایمیل‌ها، پیش‌نویس پاسخ‌ها یا استخراج اطلاعات داشبورد برای تبدیل به نمودار عالی است، اما فاقد آن کنترل دقیقی است که روی سطوح تفکر مدل در نسخه 5.6 Sol در Codex یافت می‌شود. به همین دلیل برخی کاربران هنوز ترجیح می‌دهند از اپلیکیشن‌های تخصصی تبدیل گفتار به متن (مانند optionafk.com) استفاده کنند تا کنترل کامل روی میزان تلاش و دقت مدل داشته باشند.

نزاع بر سر وزن‌های باز

در حالی که اکثر شرکت‌های پیشرو در صنعت، از جمله گوگل، مایکروسافت و OpenAI بیانیه‌ای به حمایت از هوش مصنوعی متن‌باز را با تأیید جنسن هوانگ، مدیرعامل NVIDIA، امضا کردند، آنتروپیک به طور قابل‌توجهی از این امضا خودداری کرد. این بیانیه توسط بیش از ۱۵۰ شرکت پذیرفته شده است.

این تصمیم منجر به اتهام‌های عمومی به ریاکاری شد. منتقدانی مانند Nacho Business و Quixotic معتقدند آنتروپیک فقط از مدل‌های کوچک ۸ میلیاردی (8b) که در واقع «اسباب‌بازی» هستند حمایت می‌کند و در مقابل، جلوی رقبای بزرگ‌تر با وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پخت‌شان علناً منتشر شده — را می‌گیرد چون این مدل‌ها مدل تجاری شرکت را تهدید می‌کنند. آنتروپیک برای حفظ ظاهر، مقاله‌ای منتشر کرد و مدعی شد که هرگز برای ممنوعیت وزن‌های باز فشار نیاورده است، اما واکنش عمومی همچنان انتقادی باقی ماند.

پاکی مک‌کورمیک به تناقض «سرمایه‌داری» در این فضا اشاره کرد؛ جایی که ۸ تریلیون دلار ارزش بازار، از مدل‌های باز حمایت می‌کند، صرفاً چون این کار به نفع منافع تجاری خاص آن‌ها و بهبود تصویر عمومی‌شان در نزد مصرف‌کنندگان است.

تکامل سریع ابزارها و اکوسیستم

فراتر از مدل‌های هسته، موجی از ابزارهای عامل‌محور (Agentic) در حال ظهور است. شرکت Ability AI پلتفرمی را با لایسنس Apache 2.0 به صورت متن‌باز منتشر کرد که ۱۷ عامل (Agent) — شبیه به کارمندان مجازی که هر کدام یک تخصص دارند — را برای عملیات واقعی در زمینه‌های بازاریابی، بررسی سلامت مشتری، اطلاعات رقابتی و امور مالی اجرا می‌کند. این عامل‌ها دارای قابلیت رهگیری در گیت (git-tracked) هستند و برای اقدامات خارجی نیاز به تأیید انسانی دارند.

سایر موارد قابل توجه عبارت‌اند از:

  • FLUX 3: یک مدل یکپارچه برای تصویر، ویدیو، صوت و پیش‌بینی حرکت که در حال حاضر بخش ویدیویی آن در دسترسی اولیه است. این تکامل در مدل‌های زایشی در حالی رخ می‌دهد که هنوز شکافی میان خلاقیت نمادین و مدل‌های زایشی وجود دارد که با افزایش توان پردازشی لزوماً پر نمی‌شود.
  • OpenWorker: عاملی متن‌باز برای سیستم‌عامل مک که برای کارهای روزمره طراحی شده و برای اقدامات حساس به تأیید انسانی نیاز دارد.
  • The Stack v3: مجموعه‌ای عظیم از داده‌های کد شامل تقریباً ۵ تریلیون توکن (Token) — یعنی تکه‌های کوچک متن که مدل می‌خورد — در ۷۷۰ زبان مختلف.
  • Kimi K3: اکنون در Droid با ۵۰٪ تخفیف تا ۱۰ اوت در دسترس است.
  • box: محیط‌های ایزوله (Sandbox) کامل برای عامل‌ها با هزینه بسیار اندک ۰.۰۰۰۰۱ دلار در ثانیه، دارای قابلیت‌های Snapshot، SSH و دسکتاپ.
  • Mintlify: ابزاری که تیکت‌های پشتیبانی حل‌شده را به پیشنهاداتی برای اصلاح مستندات تبدیل می‌کند.
  • Pilot Protocol: شبکه‌ای متشکل از بیش از ۲۵۰,۰۰۰ عامل که برای توزیع اپلیکیشن‌ها استفاده می‌شوند.

رابط‌های کاربری نیز به سمت حالت «بوم» (Canvas) می‌روند. اپلیکیشن آفلاین tldraw اکنون برای ساخت ویجت‌های تعاملی، مانند بررسی‌کننده‌های منطقه زمانی و تایم‌لاین‌های آب‌وهوا استفاده می‌شود. بن تاتسل (Ben Tossell) در حال آزمایش تبدیل لوگوها به ماسکوت‌های متحرک (Bites) است و قصد دارد از یک بوم به عنوان مرکز متمرکز برای لیست کارهای روزانه، ایمیل‌ها و سایت شخصی خود استفاده کند.

به‌روزرسانی‌های اضافی اکوسیستم عبارت‌اند از:

  • Notion as code: یک نسخه بتا که به کاربران اجازه می‌دهد کل فضای کاری خود را در زبان تایپ‌اسکریپت تعریف کرده و از طریق API مستقر کنند.
  • سلامت در ChatGPT: کاربران آمریکایی می‌توانند به صورت اختیاری داده‌های Apple Health و سوابق پزشکی پشتیبانی‌شده را متصل کنند تا کانتکست بالینی به پرس‌وجوهای آن‌ها اضافه شود.
  • BackSearch: ابزاری برای جستجو در وب به گونه‌ای که در یک تاریخ خاص وجود داشته است (در حال حاضر محدود به اخبار سال ۲۰۲۶).
  • here.now Workspaces: محیط‌های خصوصی تیمی برای سایت‌ها، اسناد و داشبوردهایی که توسط عامل‌ها منتشر شده‌اند.
  • open-git: یک میزبان کد برای عامل‌ها با یک خلبان خودکار (Autopilot) که وقتی CI قرمز می‌شود، PRها را اصلاح می‌کند.
  • Interface Craft: درس‌های جدید در مورد انیمیشن‌های پیشرفته و نسخه به‌روز شده مهارت DialKit برای تایم‌لاین‌ها.
  • sharechat: به کاربران اجازه می‌دهد جلسات Claude Code یا Codex را از طریق لینک‌های غیرلیست‌شده و بدون نیاز به ورود به سیستم به اشتراک بگذارند.

این موج از انتشارها نشان می‌دهد که مرز فناوری دیگر تنها بر سر اندازه مدل نیست، بلکه بر سر این است که مدل چگونه در سیستم‌عامل و داده‌های سلامتی فیزیکی کاربر ادغام شود. مزیت رقابتی از کسی که «똑똑ترین» مدل را دارد، به کسی منتقل می‌شود که «یکپارچه‌ترین» جریان کاری عاملی (Agentic Workflow) را داشته باشد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، فایل‌های CLAUDE.md و AGENTS.md خود را برای Opus 5 بازنویسی کنید تا از افت عملکرد جلوگیری کنید.
  • قابلیت‌های تفویض اختیار صوتی (Voice-delegation) در ChatGPT Work را برای مدیریت جلسات و گزارش نتایج امتحان کنید.
  • ابزار open-git را برای اتوماسیون اصلاحات PR توسط عامل‌ها و ابزار /prototype را برای نسخه‌بندی رابط کاربری بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول باعث می‌شود استقرار مدل‌های سطح بالا در مقیاس صنعتی به دلیل کاهش ۵۰ درصدی هزینه‌ها توجیه‌پذیر شود. همچنین، تضاد آنتروپیک با جنبش وزن‌های باز، شکاف استراتژیک میان مدل‌های تجاری بسته و اکوسیستم‌های دموکراتیک را عمیق‌تر می‌کند.

تأثیر برای ایران

به دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به Opus 5 دشوار است؛ اما کاهش هزینه استنتاج در سطح جهانی، قیمت سرویس‌های واسط داخلی را در آینده کاهش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

تمرکز آنتروپیک بر نسبت هزینه به عملکرد نشان می‌دهد که دوران رقابت صرفاً بر سر «بزرگ‌ترین مدل» به پایان رسیده و اکنون میدان نبرد، بهره‌وری اقتصادی است. نکته کلیدی این است که بهبودهای معماری ممکن است باعث شکست مهندسی پرامپت‌های قدیمی شود و کاربران را مجبور کند دوباره یاد بگیرند چگونه با مدل‌ها صحبت کنند. این چرخه، وابستگی کاربر به ابزارهای مدیریت پرامپت را بیشتر می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.