اگر امروز برای اجرای مدلهای هوش مصنوعی هزینه میپردازید، باید بدانید که عصر «چتباتهای محبوس در جعبه» به پایان رسیده است. حالا سیستمهایی در راهاند که میتوانند مانند انسان صفحه نمایش را ببینند، از اشتباهات خود در لحظه درس بگیرند و روی سختافزاری اجرا شوند که دقیقاً برای معماری آنها ساخته شده است.
به گزارش The Sequence، در هفتهی گذشته (۱۸ تا ۲۴ اوت ۲۰۲۶)، سه پیشرفت مجزا در لایههای مدل، محیط و زیرساخت رخ داد که نشاندهنده چرخش به سمت سیستمهای عاملمحور (Agentic) است. این یعنی هوش مصنوعی دیگر فقط یک مدل زبانی بزرگ (LLM) — شبیه کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — نیست، بلکه به سیستمی تبدیل شده که محیط دیجیتال شما را بهطور کامل درک میکند.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، یکپارچگی لایهها کلید پایداری است. این تحول در سه سطح رخ داده است:
- لایه مدل: شرکت DeepSeek قابلیتهای بینایی را در مدل سریع V4 خود ادغام کرد. این یعنی عاملها میتوانند اسکرینشاتها، نمودارها و اسناد پیچیده را مستقیماً به گامهای اجرایی تبدیل کنند. این رویکرد در ادامه تلاشهای این شرکت برای بهینهسازی مدلهاست، مشابه آنچه در برتری مدل Laguna S 2.1 در برابر رقبای بسیار بزرگتر خود مشاهده کردیم.
- لایه محیط: تیمی از Google Cloud AI Research چارچوب EnvHarness را معرفی کرد. این سیستم اجازه میدهد محیطهای آموزشی بهطور پویا با نقاط ضعف عامل سازگار شوند؛ درست مثل مربیای که سختترین تمرینات را دقیقاً روی نقاط ضعف ورزشکارش متمرکز میکند تا او را مجبور به پیشرفت کند. این تحولات پژوهشی در حالی رخ میدهد که گوگل اخیراً ساختار سازمانی خود را برای جداسازی عملیات محصول از پژوهشهای AGI تغییر داده است.
- لایه زیرساخت: شرکت Etched با ارسال نخستین رک استنتاج خود به Jane Street، فرضیه سختافزار تخصصی را از مرحله دمو به تولید رساند.

بر اساس مستندات منتشر شده، این همگرایی نشان میدهد جهش بعدی بهرهوری از یک «مدل خدایگونه» واحد نمیآید، بلکه حاصل همکاری این لایههاست. وقتی مدلی مثل V4 با آموزش تطبیقی EnvHarness ترکیب شود و روی تراشههای Etched اجرا گردد، هزینه استنتاج (Inference) — یعنی همان لحظهای که مدل واقعاً جواب تولید میکند و شبیه خودِ آشپزی است، نه دورهی آموزش آشپز — کاهش و قابلیت اطمینان اقدامات خودکار افزایش مییابد. این کاهش هزینه با مفاهیمی چون تقطیر محاسبات زمان استنتاج برای فشردهسازی استدلال در وزنهای مدل همسو است تا بهرهوری سختافزاری به حداکثر برسد.
برای کاربر نهایی، این یعنی عاملهایی که ارزانتر هستند و بدون نیاز به اصلاح مداوم انسان، رابطهای نرمافزاری دنیای واقعی را مدیریت میکنند.
گام بعدی شما
- نتایج بنچمارکهای استقرار در Jane Street را دنبال کنید تا بفهمید سختافزار تخصصی واقعاً چقدر سریعتر از GPUهای عمومی است.
- قابلیتهای بینایی مدل V4 را برای اتوماسیون فرآیندهای مبتنی بر رابط کاربری (UI) بررسی کنید.
- مدلهای عاملمحور را جایگزین چتباتهای ساده در گردشکارهای تکراری کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو