اگر امروز برای استنتاج مدلهای پیشرفته هزینه میپردازید، سرعت دریافت پاسخها در مدل جدید آنتروپیک ۳۰٪ بیشتر شده است. این جهش سرعت، تنها بخشی از یک تغییر بنیادین در نحوه پردازش اطلاعات است: حالا «تفکر» (Thinking) برای مدل اجباری شده و کنترل هوش و تأخیر به تنظیمات جدیدی به نام «تلاش» (Effort) منتقل شده است. طبق مستندات فنی منتشر شده توسط آنتروپیک (Anthropic) در ۲۸ سپتامبر ۲۰۲۶، مدل Claude Opus 5.5 اکنون به گونهای طراحی شده که پیش از پاسخ دادن، حتماً فکر میکند. این یعنی کنترل اصلی روی توازن بین هوش و زمان پاسخگویی، از دستورات متنی به یک تنظیم سیستمی منتقل شده است. برای یک متخصص، این تغییر شبیه جابهجایی از یک ماشینحساب جعبهسیاه به همکاری با متخصصی است که فرآیند استدلال خود را بهصورت لحظهای روایت میکند. همانطور که در تحلیل قبلی ما دربارهی ارتش عاملهای کلود و نحوه استفاده توسعهدهندگانی مانند فلیکس ریسبرگ (Felix Rieseberg) از ناوگان عاملهای کلود برای اتوماسیون طراحی اشاره کردیم، توسعهدهندگان اکنون از چتهای ساده به سمت گردشهای کاری عاملمحور (Agentic) حرکت میکنند و Opus 5.5 دقیقاً برای حل مشکل «عاملهای خاموش» — که در کارهای طولانی هیچ بازخوردی به کاربر نمیدهند — طراحی شده است.
کالیبراسیون هوش و هزینه
مهمترین تغییر برای توسعهدهندگان، تنظیمات Effort است. برخلاف نسخههای قبلی، Opus 5.5 از این تنظیم برای تعیین میزان تأمل مدل پیش از پاسخ دادن استفاده میکند. چون تفکر همیشه فعال است، این اولین تنظیمی است که باید هنگام ایجاد توازن بین هوش، تأخیر و هزینه تغییر داده شود:
- تلاش متوسط (Medium): پیشفرض جدید است. طبق گزارش آنتروپیک، این سطح در کدنویسی و کارهای دانشی، عملکرد مدل Opus 5.5 را با سطح «بالا» در نسخه Opus 5 برابر یا حتی بهتر میکند.
- تلاش پایین (Low): تأخیر و هزینه را کاهش میدهد. در برخی ارزیابیهای کدنویسی، سطح تلاش پایین تقریباً با عملکرد سطح بالای مدل قبلی برابری میکند.
- سطوح XHigh و Max: این سطوح برای کارهایی رزرو شدهاند که افزایش کیفیت در آنها قابل اندازهگیری باشد، زیرا تعداد توکنهای خروجی و طول هر نوبت را بهشدت افزایش میدهند. در این سطوح، Opus 5.5 در هر نوبت نسبت به Opus 5 بیشتر فکر میکند.
یک نکته حیاتی برای توسعهدهندگان این است که باید مقدار max_tokens را افزایش دهند — تا سقف ۱۲۸,۰۰۰ توکن که حداکثر ظرفیت مدل است. دلیل این امر آن است که توکنهای تفکر، حتی اگر به کاربر نهایی نمایش داده نشوند، جزو سقف توکنها محاسبه میشوند. اگر محدودیتی که برای Opus 5 (در حالت تفکر خاموش) تنظیم شده بود باقی بماند، ممکن است پاسخها در میانه راه قطع شوند.
برای بهینهسازی عملکرد، توسعهدهندگان باید از قابلیت تغییر Effort در سطح هر پیام (نسخه بتا) برای نوبتهای مجزا استفاده کنند. تغییر مقدار Effort در سطح کلی درخواستها باعث ابطال حافظه پنهان پرامپت (Prompt Cache) میشود، در حالی که تغییرات در سطح هر پیام، حافظه پنهان را دستنخورده باقی میگذارد.
گذار از سیستمهای بدون تفکر
در نسخه Opus 5 امکان غیرفعال کردن تفکر ({"type": "disabled"}) در سطح تلاش بالا یا پایین وجود داشت، اما در Opus 5.5 این قابلیت حذف شده است. به نقل از راهنمای فنی آنتروپیک، برای سیستمهایی که پیشتر بدون تفکر اجرا میشدند، چهار تغییر توصیه میشود:
- شروع با «تلاش پایین»: ابتدا تأخیر و کیفیت را بسنجید. اگر زمان رسیدن به اولین توکن (Time to First Token) همچنان اولویت است، افزودن خطی به پرامپت سیستمی مانند «مستقیماً پاسخ بده بدون اینکه تأمل کنی» میتواند تفکر را بیشتر کاهش دهد. البته هنگام افزودن این دستور، کیفیت را بسنجید زیرا تفکر کمتر میتواند منجر به کاهش کیفیت شود.
- حذف دستورات استدلال: اگر در پرامپتهای قبلی از مدل خواسته میشد که استدلالهای خود را در متن پاسخ بنویسد تا جایگزین تفکر شود، این دستورات باید حذف شوند. فشار آوردن به مدل برای بازتولید استدلال در متن پاسخ اکنون میتواند باعث بروز خطای
reasoning_extraction(رد درخواست استخراج استدلال) شود. در عوض، تنظیمdisplay: "summarized"برای خواندن استدلالها از بلوکهای تفکر توصیه میشود. - بازبینی مجدد حفاظها: هرگونه قانونی که به مدل میگفت «فکر نکن» را حذف کنید. بررسی کنید که آیا دستورات ترکیبی (مانند اجازه صحبت پیش از فراخوانی ابزار، اقدام در صورت عدم تطابق ابزار و عدم استفاده از تگهای داخلی) اکنون که تفکر همیشه فعال است، همچنان ضروری هستند یا خیر.
- تغییر نحوه خواندن بلوکها: کلاینتها باید نوع هر بلوک را بررسی کنند و فرض نکنند که اولین بلوک حتماً متن است، زیرا پاسخها اکنون ممکن است با یک بلوک تفکر شروع شوند. در حالت پیشفرض
display: "omitted"فیلد تفکر در این بلوکها خالی است.
کدنویسی عاملمحور و کارهای دانشی
Opus 5.5 بهطور خاص برای کارهای چندمرحلهای در مخازن کد (Repositories) واقعی بهینه شده است. این مدل میتواند یک تغییر را در یک کدبیس بزرگ دنبال کند تا زمانی که تستها پاس شوند و بتواند ساعتها بهصورت خودکار و با کمترین نظارت کار کند. این قابلیت شامل ممیزیهای چندساعته و مهاجرتهای کد (Migrations) است که بهصورت سرتاسری و با استفاده از زیر-عاملهای موازی اجرا میشوند. این رویکرد تکاملی در اتوماسیون کد، قابلیتهای پیشرفتهای را برای بازبینی بدون نظارت انسانی فراهم میکند که در ابزارهایی مانند Claude Code مشاهده شده است.
در تستهای داخلی، این مدل بهبود چشمگیری در شناسایی باگها در بازبینی کد (Code Review) نشان داد و تعداد هشدارهای اشتباه (False Alarms) را کاهش داد. همچنین تغییرات خود را به زبان ساده توضیح میدهد. این مدل در کارهای دانشی و مدلسازی مالی نیز درخشان عمل میکند، از جمله:
- ساخت مدلهای مالی و خلاصههای یکصفحهای برای تراکنشها.
- یافتن و رفع خطاها در دفاتر کار (Workbooks) ارزیابی قیمت.
- شناسایی تاریخی در یک رشتهتار طولانی برنامهریزی که با روز هفته اشتباه تطبیق دارد.
- شناسایی نمودارهایی در یک اسلاید که با اعداد زیربنایی همخوانی ندارند.
هوش بصری و استفاده از کامپیوتر
پردازش بصری جهشی در دقت داشته است. حتی در پایینترین سطح تلاش، Opus 5.5 مقادیر نمودارهای متراکم را دقیقتر از بالاترین سطح Opus 5 میخواند و برای این کار تنها از بخش کوچکی از توکنهای خروجی استفاده میکند.
- استدلال فضایی: مدل اکنون اتصالات نمودارهای جریان (Flowcharts) را بهتر درک میکند (اینکه هر فلش کدام جعبهها را به هم وصل میکند)، تغییرات بین نسخههای مختلف یک دیاگرام را تشخیص میدهد و زمانهای دقیق را در اسکرینشاتهای تقویم میخواند.
- استفاده از کامپیوتر: قابلیت اطمینان بیشتری در اجرای اپلیکیشنها از طریق اسکرینشات در چندین مرحله دارد. در سطح تلاش پیشفرض، نرخ موفقیت آن با نرخ موفقیت Opus 5 در سطوح تلاش بسیار بالاتر برابری میکند.
- ابزارهای پیشرفته: برای ورودیهای بسیار متراکم مانند نقشههای فنی، استفاده از تصاویر با رزولوشن بالاتر توصیه میشود. آنتروپیک پیشنهاد میکند مدل را بهعنوان یک عامل با دسترسی به یک کانتینر حاوی تصاویر خام و کتابخانههایی مثل PIL و OpenCV برای برش (Crop)، زوم و اندازهگیری به کار بگیرید. یک ابزار برش مستقل نیز مؤثر است. مدل در سطوح تلاش بالاتر از این ابزارها مؤثرتر استفاده میکند. نکته این است که افزایش Effort خواندن نقشههای فنی را بهبود میبخشد اما تأثیر چندانی روی خواندن نمودارها ندارد.
مدیریت عاملهای بدون نظارت
یکی از نقاط اصطکاک اصلی در هوش مصنوعی عاملمحور، «توقف زودهنگام» (Early Stop) است؛ جایی که مدل گزارش پیشرفت میدهد اما قبل از اتمام کامل تکلیف متوقف میشود (و به جای فراخوانی ابزار، متن را با stop_reason: "end_turn" برمیگرداند). Opus 5.5 با اجازه دادن به توسعهدهندگان برای تلقی کردن پایانهای متنی به عنوان «گزارش» و نه «سیگنال اتمام»، این مشکل را حل کرده است.
برای تداوم کار عاملها، آنتروپیک پیشنهاد میکند:
- نگهداری چکلیست: از یک ابزار To-do یا یک فایل برای ردیابی بخشهای تکلیف استفاده کنید. اگر نوبتی با موارد باز و بدون مانع (Blocker) به پایان رسید، سیستم باید یک پیام کوتاه کاربر ارسال کند و آن موارد را نام ببرد.
- تأیید اتمام: از یک مدل مجزا و کوچکتر استفاده کنید تا در پایان هر نوبت، گفتگو را با شرایط اتمام چک کند. اگر شرط برآورده نشد، مدل کوچکتر دلیل آن را بهعنوان پیام کاربر بعدی برمیگرداند.
- تداومهای خودکار: برای جلوگیری از حلقههای بینهایت در صورتی که اجرا واقعاً گیر کرده باشد، پس از دو یا سه تداوم خودکار، عملیات را متوقف کنید.
- پرامپت سیستمی: به مدل دستور دهید از پایان دادن به نوبتها با خلاصههایی که فقط گام بعدی را اعلام میکنند (به جای انجام آن) خودداری کند. به آن بگویید یادداشتهای وضعیت را در همان پیامی قرار دهد که فراخوانی ابزار بعدی در آن است. این کار تضمین میکند که یادداشتها بهعنوان بهروزرسانی پیشرفت بین فراخوانیهای ابزار برسند.
بهروزرسانیهای پیشرفت برای کاربر
بین فراخوانیهای ابزار، Opus 5.5 بهروزرسانیهای کوتاه پیشرفت مینویسد. برای جلوگیری از تجربه «عامل خاموش»، توسعهدهندگان میتوانند از چهار اهرم استفاده کنند:
۱. هدر نمایش: تنظیم display: "updates" (با هدر بتای thinking-display-updates-2026-08-18) برای دریافت خلاصههای بلوکهای تفکر مربوط به بهروزرسانی پیشرفت. بدون این تنظیم، کلاینتی که فقط بلوکهای متنی را رندر میکند، در نوبتهای طولانی ساکت به نظر میرسد.
۲. ابزارهای کلمه-به-کلمه (Verbatim): ارائه ابزاری خاص برای ارسال محتوای خام (مانند تکههای کد) در میانه یک نوبت به کاربر. این ابزار باید از اولین درخواست جلسه در tools تعریف شود تا باعث ابطال بلوکهای تفکر قبلی نشود.
۳. دستورات سیستمی: درخواست الگوهای بهروزرسانی خاص، مانند یک جمله کوتاه درباره قصد مدل پیش از اولین فراخوانی ابزار و یک جمعبندی در پایان. این مورد بهویژه در کارهای «انسان در حلقه» (Human-in-the-loop) مفید است.
۴. یادآورهای سیستم: اگر نوبتی برای چندین گام (مثلاً ۵ گام) ساکت ماند، یک یادآور را بهعنوان پیام سیستمی محدود به نوبت (clear_at: "next_user_message" با هدر بتای mid-conversation-system-clear-at-2026-08-21) اضافه کنید. ثابت شده است که این روش سهم تکالیفی با وقفههای طولانی را بدون تغییر در هزینه، به نصف کاهش میدهد.
گردشهای کاری چند-اپلیکیشنی و سیگنالهای زمانی
برای اتوماسیون بین ایمیلها، CRMها و صفحات گسترده، Opus 5.5 را میتوان ترغیب کرد تا پیش از اقدام، «اطراف را بررسی کند» (Look around). این کار مانع از عجله مدل در انجام تکالیف بدون بررسی سیاستهای پنهان در ایمیلهای قدیمی، قوانین در تبهای دیگر اکسل یا یادداشتهای موجود در سوابق مشتریان میشود. در تستها، این دستور باعث افزایش تکمیل صحیح تکالیف در هر دو سطح تلاش متوسط و حداکثر شد، هرچند تعداد فراخوانی ابزارها و توکنها را کمی افزایش داد.
در ساختارهای چندعاملی، مدل اکنون به «سیگنالهای زمانی» پاسخ میدهد. با ارائه بودجه زمانی سپری شده (مثلاً «۳۴۰ ثانیه از ۱۲۰۰ ثانیه سپری شده»)، توسعهدهندگان میتوانند مدل را به موازیسازی کارها تشویق کنند. در ارزیابیهای تکالیف پژوهشی، تیمهایی که بودجه زمانی داشتند، بسیار زودتر از تک-عاملها کار را به پایان رساندند در حالی که کیفیت مشابهی را حفظ کردند.
امنیت، رد درخواستها و تزریق پرامپت
Opus 5.5 دفاعات قویتری در برابر تزریق پرامپت (Prompt Injection) غیرمستقیم دارد. مدل اکنون میتواند بین دستورات واقعی کاربر و متنی که کاربر از یک وبسایت یا ایمیل کپی کرده است، تمایز قائل شود. برای فعالسازی این قابلیت، توسعهدهندگان باید متون کپیشده را در تگهای باز و بسته با یک شناسه تصادفی کوتاه قرار دهند و یادداشتی مربوط به آن را به پرامپت سیستمی اضافه کنند. این کار ممکن است مدل را کمی محتاطتر کند.
در زمینه ایمنی، مدل از چندین طبقهبندیکننده (Classifier) استفاده میکند:
- زیستشناسی: استفاده از حفاظهای Claude Fable 5.1. سازمانهای علوم زیستی میتوانند برای دسترسی بیشتر در برنامه تأیید علوم زیستی درخواست دهند. سوالات روزمره بهداشتی و آموزشی تحت تأثیر قرار نمیگیرند.
- امنیت سایبری: اجازه یافتن آسیبپذیریها در کد منبع را میدهد اما فعالیتهای پرخطر با کاربرد دوگانه (Dual-use) را ممنوع میکند.
- استخراج استدلال: درخواستهایی که میخواهند استدلالهای داخلی مدل را در متن پاسخ بازتولید کنند، رد میشوند. این موارد بهعنوان
stop_reason: "refusal"همراه با یک شیءstop_detailsارسال میشوند. سیستمهای جایگزین سمت سرور (Fallback) این ردها را دوباره تلاش نمیکنند و مستقیماً به کاربر برمیگردانند.
بهینهسازی اپلیکیشنهای چت
در رابطهای چت، توسعهدهندگان باید دستوراتی مثل «دقیق فکر کن» را از پرامپت سیستمی حذف کنند، زیرا مدل اکنون بر اساس Effort این تصمیم را بهطور خودکار میگیرد. حذف این خطوط باعث میشود پاسخها سریعتر شروع شوند بدون اینکه کیفیت کاهش یابد.
همچنین برای کاهش تأخیر در چتهای چند-نوبتی، میتوان به مدل دستور داد که پاسخهای قبلی را «نهایی شده» (Settled) تلقی کند و دوباره آنها را بررسی نکند. این کار برای چتهای ساده توصیه میشود اما باید در تحلیلهای طولانی یا کارهای عاملمحور که در آنها اشتباهات قبلی باید اصلاح شوند، اجتناب شود. توجه داشته باشید که این کار ممکن است احتمال اشاره مدل به اشتباهات خودش را کاهش دهد. برای دستیابی به چنین پایداری در پاسخها، رعایت برخی عادتهای کلیدی در طراحی مهارتهای کلود میتواند مکمل تنظیمات سیستمی باشد.
پیشفرضهای طراحی فرانتاند
در کارهای فرانتاند، وقتی جهتدهی خاصی وجود ندارد، Opus 5.5 از چند استایل پیشفرض استفاده میکند. دستورات کلی مثل «از ظاهر کلیشهای AI دوری کن» معمولاً بیاثر هستند. در عوض، توسعهدهندگان باید الگوهای خاصی را که نمیخواهند نام ببرند و بهصورت تکرار شونده و بر اساس اولین نتیجه، لیست استایلهای ممنوعه را گسترش دهند.
تحلیل: تغییر به سمت محاسبات زمان تست (Test-Time Compute)
این بهروزرسانی سیگنالی قطعی از حرکت به سمت «محاسبات زمان تست» است؛ این ایده که دادن زمان بیشتر به مدل برای «فکر کردن»، ارزشمندتر از افزایش ساده تعداد پارامترهاست. آنتروپیک با اجباری کردن تفکر و قابل تنظیم کردن Effort، در واقع یک پیچ تنظیم به توسعهدهندگان داده است تا هزینه را با عمق استدلال معاوضه کنند.
برای کاربر نهایی، این بدان معناست که عاملهای هوش مصنوعی کمتر شبیه رباتهای غیرقابل پیشبینی و بیشتر شبیه کارکنانی شفاف به نظر میرسند. قابلیت مشاهده بهروزرسانیهای پیشرفت و افزایش قابلیت اطمینان در «استفاده از کامپیوتر» نشان میدهد که عاملهای اداری کاملاً خودکار از مرحله نمونه اولیه به مرحله تولید (Production) نزدیک شدهاند.
گام بعدی شما
- پرامپتهای فعلی Opus 5 خود را بازبینی کرده و آنها را در سطح Effort «متوسط» تست کنید تا ببینید آیا بدون افت کیفیت، هزینهها کاهش مییابد یا خیر.
- برای بهینهسازی عملکرد حافظه پنهان (Cache)، منتظر عرضه بتای تغییر Effort در سطح هر پیام باشید.
- در صورت استفاده از مدل برای تحلیل تصاویر فنی، دسترسی مدل به کتابخانههای OpenCV را برای برش دقیق تصاویر فراهم کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو