پرش به محتوای اصلی
پرش به محتوای مقاله

آنتروپیک: مکانیزم تفکر تعادل میان هوش و هزینه را برقرار کرد

·۶ مهر ۱۴۰۵۱۵ دقیقه مطالعه۲ بازدید
راهنما
تصویر: رابط کاربری Claude Opus 5.5 در حال پردازش یک درخواست پیچیده برنامه‌نویسی
تصویر: رابط کاربری Claude Opus 5.5 در حال پردازش یک درخواست پیچیده برنامه‌نویسی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کنترل دستی تفکر با سیستم کالیبراسیون Effort و اجباری شدن زنجیره تفکر در تمام سطوح؛ این اولین باری است که توسعه‌دهنده می‌تواند عمق استدلال مدل را مستقیماً با هزینه و تأخیر معاوضه کند.

اگر امروز برای استنتاج مدل‌های پیشرفته هزینه می‌پردازید، سرعت دریافت پاسخ‌ها در مدل جدید آنتروپیک ۳۰٪ بیشتر شده است. این جهش سرعت، تنها بخشی از یک تغییر بنیادین در نحوه پردازش اطلاعات است: حالا «تفکر» (Thinking) برای مدل اجباری شده و کنترل هوش و تأخیر به تنظیمات جدیدی به نام «تلاش» (Effort) منتقل شده است. طبق مستندات فنی منتشر شده توسط آنتروپیک (Anthropic) در ۲۸ سپتامبر ۲۰۲۶، مدل Claude Opus 5.5 اکنون به گونه‌ای طراحی شده که پیش از پاسخ دادن، حتماً فکر می‌کند. این یعنی کنترل اصلی روی توازن بین هوش و زمان پاسخگویی، از دستورات متنی به یک تنظیم سیستمی منتقل شده است. برای یک متخصص، این تغییر شبیه جابه‌جایی از یک ماشین‌حساب جعبه‌سیاه به همکاری با متخصصی است که فرآیند استدلال خود را به‌صورت لحظه‌ای روایت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی ارتش عامل‌های کلود و نحوه استفاده توسعه‌دهندگانی مانند فلیکس ریسبرگ (Felix Rieseberg) از ناوگان عامل‌های کلود برای اتوماسیون طراحی اشاره کردیم، توسعه‌دهندگان اکنون از چت‌های ساده به سمت گردش‌های کاری عامل‌محور (Agentic) حرکت می‌کنند و Opus 5.5 دقیقاً برای حل مشکل «عامل‌های خاموش» — که در کارهای طولانی هیچ بازخوردی به کاربر نمی‌دهند — طراحی شده است.

کالیبراسیون هوش و هزینه

مهم‌ترین تغییر برای توسعه‌دهندگان، تنظیمات Effort است. برخلاف نسخه‌های قبلی، Opus 5.5 از این تنظیم برای تعیین میزان تأمل مدل پیش از پاسخ دادن استفاده می‌کند. چون تفکر همیشه فعال است، این اولین تنظیمی است که باید هنگام ایجاد توازن بین هوش، تأخیر و هزینه تغییر داده شود:

  • تلاش متوسط (Medium): پیش‌فرض جدید است. طبق گزارش آنتروپیک، این سطح در کدنویسی و کارهای دانشی، عملکرد مدل Opus 5.5 را با سطح «بالا» در نسخه Opus 5 برابر یا حتی بهتر می‌کند.
  • تلاش پایین (Low): تأخیر و هزینه را کاهش می‌دهد. در برخی ارزیابی‌های کدنویسی، سطح تلاش پایین تقریباً با عملکرد سطح بالای مدل قبلی برابری می‌کند.
  • سطوح XHigh و Max: این سطوح برای کارهایی رزرو شده‌اند که افزایش کیفیت در آن‌ها قابل اندازه‌گیری باشد، زیرا تعداد توکن‌های خروجی و طول هر نوبت را به‌شدت افزایش می‌دهند. در این سطوح، Opus 5.5 در هر نوبت نسبت به Opus 5 بیشتر فکر می‌کند.

یک نکته حیاتی برای توسعه‌دهندگان این است که باید مقدار max_tokens را افزایش دهند — تا سقف ۱۲۸,۰۰۰ توکن که حداکثر ظرفیت مدل است. دلیل این امر آن است که توکن‌های تفکر، حتی اگر به کاربر نهایی نمایش داده نشوند، جزو سقف توکن‌ها محاسبه می‌شوند. اگر محدودیتی که برای Opus 5 (در حالت تفکر خاموش) تنظیم شده بود باقی بماند، ممکن است پاسخ‌ها در میانه راه قطع شوند.

برای بهینه‌سازی عملکرد، توسعه‌دهندگان باید از قابلیت تغییر Effort در سطح هر پیام (نسخه بتا) برای نوبت‌های مجزا استفاده کنند. تغییر مقدار Effort در سطح کلی درخواست‌ها باعث ابطال حافظه پنهان پرامپت (Prompt Cache) می‌شود، در حالی که تغییرات در سطح هر پیام، حافظه پنهان را دست‌نخورده باقی می‌گذارد.

گذار از سیستم‌های بدون تفکر

در نسخه Opus 5 امکان غیرفعال کردن تفکر ({"type": "disabled"}) در سطح تلاش بالا یا پایین وجود داشت، اما در Opus 5.5 این قابلیت حذف شده است. به نقل از راهنمای فنی آنتروپیک، برای سیستم‌هایی که پیش‌تر بدون تفکر اجرا می‌شدند، چهار تغییر توصیه می‌شود:

  • شروع با «تلاش پایین»: ابتدا تأخیر و کیفیت را بسنجید. اگر زمان رسیدن به اولین توکن (Time to First Token) همچنان اولویت است، افزودن خطی به پرامپت سیستمی مانند «مستقیماً پاسخ بده بدون اینکه تأمل کنی» می‌تواند تفکر را بیشتر کاهش دهد. البته هنگام افزودن این دستور، کیفیت را بسنجید زیرا تفکر کمتر می‌تواند منجر به کاهش کیفیت شود.
  • حذف دستورات استدلال: اگر در پرامپت‌های قبلی از مدل خواسته می‌شد که استدلال‌های خود را در متن پاسخ بنویسد تا جایگزین تفکر شود، این دستورات باید حذف شوند. فشار آوردن به مدل برای بازتولید استدلال در متن پاسخ اکنون می‌تواند باعث بروز خطای reasoning_extraction (رد درخواست استخراج استدلال) شود. در عوض، تنظیم display: "summarized" برای خواندن استدلال‌ها از بلوک‌های تفکر توصیه می‌شود.
  • بازبینی مجدد حفاظ‌ها: هرگونه قانونی که به مدل می‌گفت «فکر نکن» را حذف کنید. بررسی کنید که آیا دستورات ترکیبی (مانند اجازه صحبت پیش از فراخوانی ابزار، اقدام در صورت عدم تطابق ابزار و عدم استفاده از تگ‌های داخلی) اکنون که تفکر همیشه فعال است، همچنان ضروری هستند یا خیر.
  • تغییر نحوه خواندن بلوک‌ها: کلاینت‌ها باید نوع هر بلوک را بررسی کنند و فرض نکنند که اولین بلوک حتماً متن است، زیرا پاسخ‌ها اکنون ممکن است با یک بلوک تفکر شروع شوند. در حالت پیش‌فرض display: "omitted" فیلد تفکر در این بلوک‌ها خالی است.

کدنویسی عامل‌محور و کارهای دانشی

Opus 5.5 به‌طور خاص برای کارهای چندمرحله‌ای در مخازن کد (Repositories) واقعی بهینه‌ شده است. این مدل می‌تواند یک تغییر را در یک کدبیس بزرگ دنبال کند تا زمانی که تست‌ها پاس شوند و بتواند ساعت‌ها به‌صورت خودکار و با کمترین نظارت کار کند. این قابلیت شامل ممیزی‌های چندساعته و مهاجرت‌های کد (Migrations) است که به‌صورت سرتاسری و با استفاده از زیر-عامل‌های موازی اجرا می‌شوند. این رویکرد تکاملی در اتوماسیون کد، قابلیت‌های پیشرفته‌ای را برای بازبینی بدون نظارت انسانی فراهم می‌کند که در ابزارهایی مانند Claude Code مشاهده شده است.

در تست‌های داخلی، این مدل بهبود چشمگیری در شناسایی باگ‌ها در بازبینی کد (Code Review) نشان داد و تعداد هشدارهای اشتباه (False Alarms) را کاهش داد. همچنین تغییرات خود را به زبان ساده توضیح می‌دهد. این مدل در کارهای دانشی و مدل‌سازی مالی نیز درخشان عمل می‌کند، از جمله:

  • ساخت مدل‌های مالی و خلاصه‌های یک‌صفحه‌ای برای تراکنش‌ها.
  • یافتن و رفع خطاها در دفاتر کار (Workbooks) ارزیابی قیمت.
  • شناسایی تاریخی در یک رشته‌تار طولانی برنامه‌ریزی که با روز هفته اشتباه تطبیق دارد.
  • شناسایی نمودارهایی در یک اسلاید که با اعداد زیربنایی همخوانی ندارند.

هوش بصری و استفاده از کامپیوتر

پردازش بصری جهشی در دقت داشته است. حتی در پایین‌ترین سطح تلاش، Opus 5.5 مقادیر نمودارهای متراکم را دقیق‌تر از بالاترین سطح Opus 5 می‌خواند و برای این کار تنها از بخش کوچکی از توکن‌های خروجی استفاده می‌کند.

  • استدلال فضایی: مدل اکنون اتصالات نمودارهای جریان (Flowcharts) را بهتر درک می‌کند (اینکه هر فلش کدام جعبه‌ها را به هم وصل می‌کند)، تغییرات بین نسخه‌های مختلف یک دیاگرام را تشخیص می‌دهد و زمان‌های دقیق را در اسکرین‌شات‌های تقویم می‌خواند.
  • استفاده از کامپیوتر: قابلیت اطمینان بیشتری در اجرای اپلیکیشن‌ها از طریق اسکرین‌شات در چندین مرحله دارد. در سطح تلاش پیش‌فرض، نرخ موفقیت آن با نرخ موفقیت Opus 5 در سطوح تلاش بسیار بالاتر برابری می‌کند.
  • ابزارهای پیشرفته: برای ورودی‌های بسیار متراکم مانند نقشه‌های فنی، استفاده از تصاویر با رزولوشن بالاتر توصیه می‌شود. آنتروپیک پیشنهاد می‌کند مدل را به‌عنوان یک عامل با دسترسی به یک کانتینر حاوی تصاویر خام و کتابخانه‌هایی مثل PIL و OpenCV برای برش (Crop)، زوم و اندازه‌گیری به کار بگیرید. یک ابزار برش مستقل نیز مؤثر است. مدل در سطوح تلاش بالاتر از این ابزارها مؤثرتر استفاده می‌کند. نکته این است که افزایش Effort خواندن نقشه‌های فنی را بهبود می‌بخشد اما تأثیر چندانی روی خواندن نمودارها ندارد.

مدیریت عامل‌های بدون نظارت

یکی از نقاط اصطکاک اصلی در هوش مصنوعی عامل‌محور، «توقف زودهنگام» (Early Stop) است؛ جایی که مدل گزارش پیشرفت می‌دهد اما قبل از اتمام کامل تکلیف متوقف می‌شود (و به جای فراخوانی ابزار، متن را با stop_reason: "end_turn" برمی‌گرداند). Opus 5.5 با اجازه دادن به توسعه‌دهندگان برای تلقی کردن پایان‌های متنی به عنوان «گزارش» و نه «سیگنال اتمام»، این مشکل را حل کرده است.

برای تداوم کار عامل‌ها، آنتروپیک پیشنهاد می‌کند:

  • نگهداری چک‌لیست: از یک ابزار To-do یا یک فایل برای ردیابی بخش‌های تکلیف استفاده کنید. اگر نوبتی با موارد باز و بدون مانع (Blocker) به پایان رسید، سیستم باید یک پیام کوتاه کاربر ارسال کند و آن موارد را نام ببرد.
  • تأیید اتمام: از یک مدل مجزا و کوچک‌تر استفاده کنید تا در پایان هر نوبت، گفتگو را با شرایط اتمام چک کند. اگر شرط برآورده نشد، مدل کوچک‌تر دلیل آن را به‌عنوان پیام کاربر بعدی برمی‌گرداند.
  • تداوم‌های خودکار: برای جلوگیری از حلقه‌های بی‌نهایت در صورتی که اجرا واقعاً گیر کرده باشد، پس از دو یا سه تداوم خودکار، عملیات را متوقف کنید.
  • پرامپت سیستمی: به مدل دستور دهید از پایان دادن به نوبت‌ها با خلاصه‌هایی که فقط گام بعدی را اعلام می‌کنند (به جای انجام آن) خودداری کند. به آن بگویید یادداشت‌های وضعیت را در همان پیامی قرار دهد که فراخوانی ابزار بعدی در آن است. این کار تضمین می‌کند که یادداشت‌ها به‌عنوان به‌روزرسانی پیشرفت بین فراخوانی‌های ابزار برسند.

به‌روزرسانی‌های پیشرفت برای کاربر

بین فراخوانی‌های ابزار، Opus 5.5 به‌روزرسانی‌های کوتاه پیشرفت می‌نویسد. برای جلوگیری از تجربه «عامل خاموش»، توسعه‌دهندگان می‌توانند از چهار اهرم استفاده کنند:

۱. هدر نمایش: تنظیم display: "updates" (با هدر بتای thinking-display-updates-2026-08-18) برای دریافت خلاصه‌های بلوک‌های تفکر مربوط به به‌روزرسانی پیشرفت. بدون این تنظیم، کلاینتی که فقط بلوک‌های متنی را رندر می‌کند، در نوبت‌های طولانی ساکت به نظر می‌رسد.
۲. ابزارهای کلمه-به-کلمه (Verbatim): ارائه ابزاری خاص برای ارسال محتوای خام (مانند تکه‌های کد) در میانه یک نوبت به کاربر. این ابزار باید از اولین درخواست جلسه در tools تعریف شود تا باعث ابطال بلوک‌های تفکر قبلی نشود.
۳. دستورات سیستمی: درخواست الگوهای به‌روزرسانی خاص، مانند یک جمله کوتاه درباره قصد مدل پیش از اولین فراخوانی ابزار و یک جمع‌بندی در پایان. این مورد به‌ویژه در کارهای «انسان در حلقه» (Human-in-the-loop) مفید است.
۴. یادآورهای سیستم: اگر نوبتی برای چندین گام (مثلاً ۵ گام) ساکت ماند، یک یادآور را به‌عنوان پیام سیستمی محدود به نوبت (clear_at: "next_user_message" با هدر بتای mid-conversation-system-clear-at-2026-08-21) اضافه کنید. ثابت شده است که این روش سهم تکالیفی با وقفه‌های طولانی را بدون تغییر در هزینه، به نصف کاهش می‌دهد.

گردش‌های کاری چند-اپلیکیشنی و سیگنال‌های زمانی

برای اتوماسیون بین ایمیل‌ها، CRMها و صفحات گسترده، Opus 5.5 را می‌توان ترغیب کرد تا پیش از اقدام، «اطراف را بررسی کند» (Look around). این کار مانع از عجله مدل در انجام تکالیف بدون بررسی سیاست‌های پنهان در ایمیل‌های قدیمی، قوانین در تب‌های دیگر اکسل یا یادداشت‌های موجود در سوابق مشتریان می‌شود. در تست‌ها، این دستور باعث افزایش تکمیل صحیح تکالیف در هر دو سطح تلاش متوسط و حداکثر شد، هرچند تعداد فراخوانی ابزارها و توکن‌ها را کمی افزایش داد.

در ساختارهای چندعاملی، مدل اکنون به «سیگنال‌های زمانی» پاسخ می‌دهد. با ارائه بودجه زمانی سپری شده (مثلاً «۳۴۰ ثانیه از ۱۲۰۰ ثانیه سپری شده»)، توسعه‌دهندگان می‌توانند مدل را به موازی‌سازی کارها تشویق کنند. در ارزیابی‌های تکالیف پژوهشی، تیم‌هایی که بودجه زمانی داشتند، بسیار زودتر از تک-عامل‌ها کار را به پایان رساندند در حالی که کیفیت مشابهی را حفظ کردند.

امنیت، رد درخواست‌ها و تزریق پرامپت

Opus 5.5 دفاعات قوی‌تری در برابر تزریق پرامپت (Prompt Injection) غیرمستقیم دارد. مدل اکنون می‌تواند بین دستورات واقعی کاربر و متنی که کاربر از یک وب‌سایت یا ایمیل کپی کرده است، تمایز قائل شود. برای فعال‌سازی این قابلیت، توسعه‌دهندگان باید متون کپی‌شده را در تگ‌های باز و بسته با یک شناسه تصادفی کوتاه قرار دهند و یادداشتی مربوط به آن را به پرامپت سیستمی اضافه کنند. این کار ممکن است مدل را کمی محتاط‌تر کند.

در زمینه ایمنی، مدل از چندین طبقه‌بندی‌کننده (Classifier) استفاده می‌کند:

  • زیست‌شناسی: استفاده از حفاظ‌های Claude Fable 5.1. سازمان‌های علوم زیستی می‌توانند برای دسترسی بیشتر در برنامه تأیید علوم زیستی درخواست دهند. سوالات روزمره بهداشتی و آموزشی تحت تأثیر قرار نمی‌گیرند.
  • امنیت سایبری: اجازه یافتن آسیب‌پذیری‌ها در کد منبع را می‌دهد اما فعالیت‌های پرخطر با کاربرد دوگانه (Dual-use) را ممنوع می‌کند.
  • استخراج استدلال: درخواست‌هایی که می‌خواهند استدلال‌های داخلی مدل را در متن پاسخ بازتولید کنند، رد می‌شوند. این موارد به‌عنوان stop_reason: "refusal" همراه با یک شیء stop_details ارسال می‌شوند. سیستم‌های جایگزین سمت سرور (Fallback) این ردها را دوباره تلاش نمی‌کنند و مستقیماً به کاربر برمی‌گردانند.

بهینه‌سازی اپلیکیشن‌های چت

در رابط‌های چت، توسعه‌دهندگان باید دستوراتی مثل «دقیق فکر کن» را از پرامپت سیستمی حذف کنند، زیرا مدل اکنون بر اساس Effort این تصمیم را به‌طور خودکار می‌گیرد. حذف این خطوط باعث می‌شود پاسخ‌ها سریع‌تر شروع شوند بدون اینکه کیفیت کاهش یابد.

همچنین برای کاهش تأخیر در چت‌های چند-نوبتی، می‌توان به مدل دستور داد که پاسخ‌های قبلی را «نهایی شده» (Settled) تلقی کند و دوباره آن‌ها را بررسی نکند. این کار برای چت‌های ساده توصیه می‌شود اما باید در تحلیل‌های طولانی یا کارهای عامل‌محور که در آن‌ها اشتباهات قبلی باید اصلاح شوند، اجتناب شود. توجه داشته باشید که این کار ممکن است احتمال اشاره مدل به اشتباهات خودش را کاهش دهد. برای دستیابی به چنین پایداری در پاسخ‌ها، رعایت برخی عادت‌های کلیدی در طراحی مهارت‌های کلود می‌تواند مکمل تنظیمات سیستمی باشد.

پیش‌فرض‌های طراحی فرانت‌اند

در کارهای فرانت‌اند، وقتی جهت‌دهی خاصی وجود ندارد، Opus 5.5 از چند استایل پیش‌فرض استفاده می‌کند. دستورات کلی مثل «از ظاهر کلیشه‌ای AI دوری کن» معمولاً بی‌اثر هستند. در عوض، توسعه‌دهندگان باید الگوهای خاصی را که نمی‌خواهند نام ببرند و به‌صورت تکرار شونده و بر اساس اولین نتیجه، لیست استایل‌های ممنوعه را گسترش دهند.

تحلیل: تغییر به سمت محاسبات زمان تست (Test-Time Compute)

این به‌روزرسانی سیگنالی قطعی از حرکت به سمت «محاسبات زمان تست» است؛ این ایده که دادن زمان بیشتر به مدل برای «فکر کردن»، ارزشمندتر از افزایش ساده تعداد پارامترهاست. آنتروپیک با اجباری کردن تفکر و قابل تنظیم کردن Effort، در واقع یک پیچ تنظیم به توسعه‌دهندگان داده است تا هزینه را با عمق استدلال معاوضه کنند.

برای کاربر نهایی، این بدان معناست که عامل‌های هوش مصنوعی کمتر شبیه ربات‌های غیرقابل پیش‌بینی و بیشتر شبیه کارکنانی شفاف به نظر می‌رسند. قابلیت مشاهده به‌روزرسانی‌های پیشرفت و افزایش قابلیت اطمینان در «استفاده از کامپیوتر» نشان می‌دهد که عامل‌های اداری کاملاً خودکار از مرحله نمونه اولیه به مرحله تولید (Production) نزدیک شده‌اند.

گام بعدی شما

  • پرامپت‌های فعلی Opus 5 خود را بازبینی کرده و آن‌ها را در سطح Effort «متوسط» تست کنید تا ببینید آیا بدون افت کیفیت، هزینه‌ها کاهش می‌یابد یا خیر.
  • برای بهینه‌سازی عملکرد حافظه پنهان (Cache)، منتظر عرضه بتای تغییر Effort در سطح هر پیام باشید.
  • در صورت استفاده از مدل برای تحلیل تصاویر فنی، دسترسی مدل به کتابخانه‌های OpenCV را برای برش دقیق تصاویر فراهم کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر تخصص آنتروپیک در مدل‌های استدلالی، فاصله بین نمونه‌های اولیه (Prototype) و استقرار واقعی (Production) عامل‌های اداری خودکار را از بین می‌برد. قابلیت مشاهده پیشرفت کار و افزایش دقت در استفاده از کامپیوتر، اعتماد سازمان‌ها به سپردن تسک‌های چندساعته به AI را جلب می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به مدل‌های Opus معمولاً از طریق واسط‌هاست که هزینه استنتاج را افزایش می‌دهد؛ لذا استفاده از سطح Effort «پایین» برای کاهش هزینه‌ها در پروژه‌های داخلی حیاتی است.

·نگاه ما
تحریریه دات‌هوش

تمرکز آنتروپیک بر «محاسبات زمان استنتاج» (Test-time Compute) نشان می‌دهد که صنعت از مسیر افزایش صرفِ پارامترها فاصله گرفته و به سمت بهینه‌سازی نحوه تفکر مدل در لحظه پاسخ‌دهی حرکت کرده است. با اجباری کردن تفکر و دادن دستگیره کنترل Effort به توسعه‌دهنده، مدل‌های زبانی از ابزارهای پیش‌بینی متن به «کارمندان شفاف» تبدیل می‌شوند که می‌توانند هزینه و کیفیت را بر اساس اهمیت هر تسک مدیریت کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.