اگر امروز برای مدیریت فرآیندهای تجاری خود به چتباتها تکیه میکنید، باید بدانید که عصر «پاسخهای متنی» در حال جایگزینی با «تصمیمات دقیق» است. سرمایهگذاری ۸۷۰ میلیون دلاری در دور Series A شرکت TypeSafe AI که ارزش این شرکت را به ۷.۵ میلیارد دلار رساند، دقیقاً به همین تغییر استراتژیک اشاره دارد. این جذب سرمایه که در ۱۱ اکتبر ۲۰۲۶ توسط Andreessen Horowitz (a16z) رهبری شد، سیگنالی است از تغییر نگاه سرمایهگذاران به نحوه قیمتگذاری آینده هوش مصنوعی. در این دور، شرکتهای Sequoia Capital، سرمایهگذار قدیمی DCVC و تعدادی از سرمایهگذاران فرشته (Angel Investors) مشارکت داشتند و مارتین کاسادو از a16z به هیئت مدیره این شرکت پیوست. این جهش قیمتی در حالی رخ داد که تنها چهار هفته پیش در سپتامبر، ارزش این شرکت در دور Seed تنها ۲۰۰ میلیون دلار بود و ۴۰ میلیون دلار جذب کرده بود.
برای درک این تغییر، باید بدانید که برای سالها، بازار با هوش مصنوعی به عنوان رقابتی برای رسیدن به یک مدل واحد و قادر مطلق برخورد میکرد. اما اکنون، صنعت در حال تقسیم شدن به مسائل اقتصادی متمایز است: تولید قابلیتهای خام، تحویل بهینه این قابلیتها، حفظ کنترل حاکمیتی و تأیید رفتار مدل. ما در حال ظهور یک «پشته استقرار» (Deployment Stack) هستیم که در آن ماشینآلات مربوط به قضاوت درباره هوش، به اندازه خودِ هوش ارزشمند میشوند.
ظهور هوش تخصصی
مدل Jev متعلق به TypeSafe AI بر روی هزاران قضاوت کوچک و حیاتی در دل فرآیندهای تجاری تمرکز دارد. بهجای تولید یک پاسخ محاورهای یا متنی، این مدل «تصمیمات تایپشده» (Typed Decisions) را همراه با تخمینهای میزان اطمینان (Confidence Estimates) تولید میکند که نرمافزارها میتوانند مستقیماً آنها را مصرف کنند. این رویکرد به یک سیستم اجازه میدهد تا یک درخواست را طبقهبندی کند، ابزار مناسب را انتخاب کند یا یک استثنا (Exception) را ارجاع دهد، بدون اینکه با پیشبینیناپذیری متون خام روبرو شود.
به گزارش thesequence.substack.com، مدل Jev در حال حاضر توسط تقریباً یکسوم شرکتهای Fortune 500 استفاده میشود. ارزشگذاری کلان این شرکت بر این فرض استوار است که بازار برای هوش تخصصی و ماشینخوان، بسیار بزرگتر از بازار دستیارهای همهمنظوره خواهد بود. اگرچه فرصت مهندسی در اینجا بسیار جذاب است، اما نتیجه تجاری کامل آن هنوز نیازمند اثبات است.
مدلهای حاکمیتی و بهینه
در حالی که TypeSafe لایه اپلیکیشن را هدف قرار داده است، شرکت Mistral روی زیرساخت و حاکمیت تمرکز کرده است. این شرکت پیشنمایشی از Mistral Large 4 (با نام مستعار Le Chonk) را معرفی کرد؛ یک مدل باز-وزن (Open-weight) با قابلیتهای چندوجهی بومی (Natively Multimodal) که دارای یک تریلیون پارامتر است و ۴۹ میلیارد پارامتر فعال دارد.
Mistral این مدل را روی ۳۸۰۰ عدد GPU مدل NVIDIA Grace Blackwell در داخل خاک اروپا آموزش داده است. با تأکید بر زیرساختهای اروپایی، Mistral مفهوم «حاکمیت» (Sovereignty) را به یک ویژگی محصول برای سازمانهایی تبدیل کرده است که نیاز دارند کنترل کنند چه کسی استقرار، سفارشیسازی و دسترسی به دادههای آنها را مدیریت میکند. این مدل نتایج قدرتمندی در زمینه عاملمحور (Agentic) نشان داده است؛ بهطوری که امتیاز ۶۱.۷٪ را در DeepSWE v1.1 کسب کرده و بالاترین امتیاز مدلهای باز-وزن خارج از چین را در شاخص سایبری Artificial Analysis به دست آورده است. قرار است وزنهای این مدل تا پایان ماه جاری منتشر شود.
همزمان، شرکت Reflection AI مدل Beam را معرفی کرد؛ یک مدل ترکیب خبرهها (MoE) با ۵۰۱ میلیارد پارامتر کل و ۲۳ میلیارد پارامتر فعال. این مدل از پنجره متنی (Context Window) تا یک میلیون توکن پشتیبانی میکند. Reflection گزارش داده است که برای رسیدن به این سطح از عملکرد، بیش از ۱۰۰ میلیون rollout آموزشی تولید کرده است. ادعای این شرکت این است که Beam با عملکرد استدلالی مشابه GLM-5.2، اما با مصرف محاسباتی استنتاج ۳ تا ۴ برابر کمتر عمل میکند، هرچند این ادعا هنوز بهطور مستقل تأیید نشده است. این مدل در حال حاضر در دسترسی زودهنگام است و وزنهای آن تحت لایسنس Apache 2.0 در اواخر این ماه منتشر خواهد شد.

گلوگاه تأیید (Verification)
با افزایش استقلال عاملهای هوش مصنوعی، صنعت به یک «دیوار تأیید» برخورد کرده است. پلتفرم Arena که ابتدا به عنوان یک پروژه دانشگاهی در برکلی در سال ۲۰۲۳ آغاز شد، در دور Series B مبلغ ۲۰۰ میلیون دلار با ارزشگذاری ۳.۱ میلیارد دلار جذب کرد. این دور توسط Lightspeed و Khosla رهبری شد و شرکتهایی چون Salesforce Ventures، 01 Advisors، Dell Technologies Capital، Endeavor Catalyst، a16z و Felicis در آن مشارکت داشتند. رشد Arena بسیار سریع است؛ نرخ درآمد سالانه (Run Rate) این شرکت از ۳۰ میلیون دلار به ۱۰۰ میلیون دلار تا ژوئن افزایش یافت.
Arena یک «شاخص همراستاسازی» (Alignment Index) را معرفی کرد تا رفتارهایی را اندازهگیری کند که بنچمارکهای معمول اغلب نادیده میگیرند، از جمله:
- اقدامات غیرمجاز (Unauthorized actions)
- ادعاهای دروغین درباره اتمام وظیفه
- تکمیل فریبکارانه (ادعای انجام کار در حالی که واقعاً انجام نشده است)
رتبهبندیهای اولیه نشان میدهد که مدلهای OpenAI پیشتاز هستند، در حالی که Claude Opus 5.5 در جایگاه ششم و Claude Fable در جایگاه نهم قرار دارند. این جایگاهبندی در حالی است که بهینهسازیهای اخیر در مدل Claude Opus 5.5 بیشتر بر کاهش هزینههای عملیاتی متمرکز بوده است تا ارتقای رتبه در شاخصهای رفتاری Arena. این تغییر نشان میدهد که وقتی عاملها سیستمهای تجاری را تغییر میدهند، توانایی اعتماد به رفتار مدل به یک زیرساخت حیاتی تبدیل میشود.
این موضوع توسط OpenAI نیز تأیید شد؛ این شرکت ۷۲۲ دستنوشته ریاضی تولیدشده توسط یک مدل داخلی (که هنوز منتشر نشده) را منتشر کرد. این آثار در ۳۷۲ خانواده از نتایج در حدود ۲۰ زیرشاخه ریاضی دستهبندی شده و در GitHub به همراه توصیههای گروه مشورتی ریاضیات و هوش مصنوعی مؤسسه مطالعات پیشرفته (IAS) قرار گرفتند. هر نتیجه بهطور متوسط از حدود سه ساعت محاسبات معادل ChatGPT Pro استفاده کرده و ۳۰۰ مورد از آنها شامل فرمولبندیهای Lean بودند. این دستاوردها در ادامه مسیر استفاده از عاملهای هوش مصنوعی برای حل مسائل پیچیده ریاضی است که پیشتر در ماه سپتامبر با تلاش برای حل مسئله ناویر-استوکس مشاهده شد. با این حال، شکاف بین «اثباتهای پذیرفتنی» و «دانش ریاضی واقعی» همچنان وجود دارد؛ OpenAI سه دستنوشته را به دلیل یک خطای علامت (Sign Error) پس گرفت و ۱۴ مورد دیگر را اصلاح کرد. چون مدل منتشر نشده است، افراد خارج از شرکت هنوز نمیتوانند نتایج را بازتولید کنند.
رباتیک و چارچوبهای عاملمحور
فراتر از مدلهای زبانی (LLMs)، پشته رباتیک به سمت تاریخچه بصری بلادرنگ (Real-time Visual History) در حال تکامل است. همکاری بین NVIDIA، MIT، HKU و UCSD منجر به معرفی Long-WAM شد؛ چارچوبی برای مقیاسبندی تاریخچه بصری برای کنترل ربات. یافته کلیدی آنها این است که تاریخچه طولانیتر تنها زمانی کمک میکند که بنیاد ویدئویی بهصورت خودرگرسیونی (Autoregressively) پیشآموزش دیده باشد. در ربات RoboCasa GR-1، افزایش تاریخچه از صفر به ۱۹.۲ ثانیه، نرخ موفقیت را از ۶۳.۳٪ به ۷۸.۷٪ رساند. با استفاده از کدگذاری استریمینگ و اجرای ناهمگام روی RTX 5090، تکههای عملیاتی (Action Chunks) در ۱۰۷.۴ میلیثانیه نگه داشته شدند. در رباتهای واقعی Unitree G1 و YAM، این سیستم در چیدن پویا (Dynamic Cup Stacking) به موفقیت ۹۵٪ رسید، در حالی که مدلهای π0.5 و Fast-WAM در هر ۲۰ تلاش شکست خوردند.
سایر تغییرات فنی قابل توجه عبارتند از:
- Harnessed Agentic RL از Microsoft Research Asia: این روش از همان ابزار استقرار عامل (مانند OpenHands یا Claude Code) مستقیماً در یادگیری تقویتشده (RL) از طریق یک پروکسی سازگار با OpenAI استفاده میکند. نسخه متنباز v1.0 یک صفحه کنترل را در ۳۵۰۰ خط کد جای داده و عاملها را به عنوان جابهای Kubernetes اجرا میکند. این روش نرخ Pass@1 مدل Qwen3.5-9B را در SWE-bench Verified از ۴۱.۸٪ به ۵۶.۴٪ رساند (با استفاده از حدود ۶۰۰۰ نمونه آموزشی).
- تحقیقات Apple و دانشگاه Purdue: آنها دریافتند که مسیریابهای MoE، خبرهها را بر اساس عملیات عاملمحور (مانند READ یا UPDATE) گروهبندی میکنند. با افزودن کنترل مسیریابی سلسلهمراتبی و یک گیت آنتروپی برای جلوگیری از بیثباتی آموزش، نرخ موفقیت در AppWorld و AutomationBench بیش از ۱۰ امتیاز بهبود یافت.
- Recurrent Looped Transformer (RLT) از پرینستون و UPenn: این مدل لایهها را به یک رمزگذار علی موازی و یک رمزگشای بازگشتی تقسیم میکند. این مدل توانست مسئله Parity را برای ۲۵۶ بیت با دقت ۱۰۰٪ تعمیم دهد، در حالی که یک ترنسفورمر مشابه در سطح شانس باقی ماند. همچنین در ردیابی جایگشت S5 به دقت ۹۷٪ رسید (در حالی که خط پایه زیر ۱٪ بود).
- دانشگاه مریلند و NVIDIA: آنها چارچوبی مستقل از مدل برای LLMها/VLMهای منجمد پیشنهاد کردند تا از تجربه یاد بگیرند. این سیستم از یک «مهارت» برای استدلال، یک «حافظه دانش» از حقایق تأیید شده و یک «پایگاه دانش چندوجهی» استفاده میکند. این رویکرد عملکرد وظایف پزشکی را در ۶ بنچمارک و ۴ مدل پایه تا ۳۴.۲٪ بهبود بخشید.
- Hebero از NVIDIA، HKUST و Tsinghua: معرفی یک بنچمارک Isaac Lab موازی با GPU برای ۴۰ وظیفه دستورزی ناهمگون. با استفاده از DGPO و روش IW-ABC، آنها به موفقیت ۹۳.۵٪ با ورودیهای بصری و ۹۰.۱٪ با ورودیهای وضعیت رسیدند (۷.۸ امتیاز بالاتر از بهترین خط پایه). یک سیاست شبیهسازی شده توانست چهار وظیفه را روی ربات فیزیکی Piper اجرا کند.
- جذب سرمایه Mecka AI: این شرکت تأسیس شده در سال ۲۰۲۴، در دور Series B مبلغ ۶۰ میلیون دلار را تحت رهبری Sequoia و با مشارکت Nvidia و Microsoft M12 جذب کرد. هدف آنها تبدیل شدن به «Scale AI برای رباتیک» است؛ یعنی پرداخت هزینه به انسانها برای ضبط کارهایی مثل قهوه درست کردن یا تعمیر ماشین با استفاده از حسگرهای بدنی و گوشیهای هوشمند برای تولید دادههای آموزشی حرکات انسانی.
ماشین جذب سرمایه
مقیاس مالی این شرطبندیها تکاندهنده است. DeepSeek در حال نزدیک شدن به دور دوم جذب سرمایه خارجی است که حداقل ۸۰ میلیارد یوان (حدود ۱۲ میلیارد دلار) و احتمالاً تا ۱۰۰ میلیارد یوان (۱۵ میلیارد دلار) خواهد بود، با ارزشگذاری ۵۰۰ میلیارد یوان (حدود ۷۵ میلیارد دلار). پشتیبانان این دور شامل Tencent، CATL، Geely Auto، Monolith Management و Loyal Valley Capital هستند و احتمالاً در سال ۲۰۲۷ در بازار STAR شانگهای IPO خواهند کرد. این پس از دور اول حدود ۵۰ میلیارد یوان (۷.۴ میلیارد دلار) در ژوئن است.
Lambda، ارائهدهنده ابر GPU، در حال جذب تا ۴ میلیارد دلار سرمایه با ارزشگذاری پیش از سرمایه (Pre-money) ۱۴.۵ میلیارد دلار است که توسط Coatue Management و Blackstone رهبری میشود. این احتمالاً آخرین دور خصوصی آنها پیش از IPO در سال ۲۰۲۷ است. سفارشات انباشته (Backlog) لَمبدا از ۱۵ میلیارد دلار در ژوئن به ۵۰ میلیارد دلار در سپتامبر جهش کرد که عمدتاً به دلیل تعهد ۳۵ میلیارد دلاری Anthropic بود. این شرکت همچنین ۱ میلیارد دلار وام برای ساخت مراکز داده جذب کرده است.
حتی لایه عاملمحور نیز در حال ادغام و استانداردسازی است:
- Sierra و Meta به همراه شرکایی چون Genesys، Instinct، Rocket، Shopify، Stripe و Walmart، «پروتکل عامل شخصی» (Personal Agent Protocol) را معرفی کردند. این استاندارد باز از نشستهای OAuth (مهمان یا وارد شده، خواندنی یا نوشتنی) استفاده میکند تا عاملهای مصرفکننده بتوانند با وبسایتها و APIهای شرکتها احراز هویت کنند. مشخصات v0.1 و پیادهسازی مرجع برای اواخر این ماه برنامهریزی شده است.
- Nous Research، سازنده عامل Hermes، مبلغ ۹۰ میلیون دلار در دور Series B با ارزشگذاری ۱.۵ میلیارد دلار جذب کرد. مدل Hermes تاکنون ۲۴ میلیون بار کلون شده و ۲.۵٪ از کل مصرف توکنهای هوش مصنوعی جهان را به خود اختصاص داده است. این بودجه برای ساخت «Hermes برای کسبوکارها» جهت جریانهای کاری خصوصی سازمانها هزینه خواهد شد. شرکت انتظار دارد درآمد سالانه خود را تا پایان سال از ۳۶ میلیون دلار (در اواسط سپتامبر) به بیش از ۱۰۰ میلیون دلار برساند.
- Manus (شرکت مادر Butterfly Effect) بیش از ۵۰۰ میلیون دلار جذب کرد، پس از آنکه مقامات چینی Meta را مجبور کردند خرید ۲ میلیارد دلاری این استارتاپ را لغو کنند. Boyu Capital و IDG Capital رهبری این دور را بر عهده داشتند و Tencent، HSG و ZhenFund نیز مشارکت کردند. Manus اخیراً نسخه ۲.۰ و اپلیکیشن «Cue» را عرضه کرد که به عاملها ایمیل، شماره تلفن، کیف پول و کامپیوتر اختصاصی میدهد.
- Nvidia در حال برنامهریزی برای سرمایهگذاری در d-Matrix است، استارتاپی در زمینه تراشههای استنتاج. d-Matrix تراشههای استنتاج Raptor خود را تا سه ماهه چهارم ۲۰۲۷ در معماری NVLink Fusion و رکهای MGX انویدیا ادغام خواهد کرد. d-Matrix پیش از این در نوامبر ۲۰۲۵ دور Series C را با ۲۷۵ میلیون دلار و ارزش ۲ میلیارد دلار بسته بود و در ژوئیه گزارش شد که به دنبال سرمایهگذاری با ارزش ۵ میلیارد دلار است.
انتشار مدلهای تکمیلی
فراتر از غولها، مدلهای تخصصی جدید در حال پر کردن شکافهای این پشته هستند. Anthropic مدل Claude Haiku 5.5 را منتشر کرد که سریعترین و ارزانترین مدل آن است؛ با قیمت ۰.۱۰ دلار برای هر میلیون توکن ورودی و ۰.۵۰ دلار برای هر میلیون توکن خروجی (کاهش ۹۰ درصدی نسبت به Haiku 4.5). این اولین مدل Haiku است که تنظیمات «تلاش» (Effort) قابل تنظیم دارد و در OSWorld 2.1 (با ۷۲.۴٪) و Terminal-Bench 4.0 (با ۳۹.۲٪) از GPT-6 Luna شرکت OpenAI پیشی گرفته است.
Google DeepMind مدل EmbeddingGemma 2 را منتشر کرد؛ یک مدل Embedding با لایسنس Apache 2.0 که متن، کد، تصویر، ویدئو و صدا را به یک فضای مشترک ۷۶۸-بعدی نگاشت میکند. این مدل با ۷۴۰ میلیون پارامتر و رمزگذارهای ماژولار، بهطور خاص برای جستوجو و بازیابی روی دستگاه (On-device) طراحی شده و در Hugging Face در دسترس است.
این موج سرمایه دیگر صرفاً برای «باهوشتر کردن» مدلها نیست. بلکه هدف، ساخت ریلهاست — احراز هویت، تأیید، ابرهای حاکمیتی و خروجیهای تایپشده — که اجازه میدهد هوش مصنوعی واقعاً یک کسبوکار را اداره کند. برای یک رهبر سازمانی، این بدان معناست که انتخاب مدل اکنون در اولویت دوم قرار دارد و اولویت اول، انتخاب «سیستم کنترل» است. شما دیگر فقط یک امتیاز بنچمارک را نمیخرید، بلکه یک چارچوب حاکمیتی (Governance Framework) را میخرید.
منتظر انتشار وزنهای Mistral Large 4 و Reflection Beam در اواخر این ماه باشید تا ببینیم آیا افزایش کارایی وعده داده شده در تستهای مستقل تأیید میشود یا خیر.
گام بعدی شما
- اگر مدیر محصول هستید، بهجای تمرکز بر مدلهای General-purpose، روی ابزارهای Verification و Typed Outputs تحقیق کنید.
- استقرار مدلهای Open-weights را برای حفظ حاکمیت دادههای سازمانی بررسی کنید.
- منتظر انتشار وزنهای Mistral Large 4 در پایان ماه باشید تا کارایی آن را در محیط واقعی بسنجید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو