اگر فکر میکنید دادههای استخراجشده از وب برای آموزش مدلهای آینده کافی هستند، احتمالاً اشتباه میکنید. رقابت در دنیای هوش مصنوعی اکنون از «مقدار داده» به «کیفیت استدلال» تغییر مسیر داده است.
ارزش شرکت Snorkel AI پس از جذب ۳۵۰ میلیون دلار سرمایه در دور سری E، به ۳.۵ میلیارد دلار رسید. الکس رتنر (Alex Ratner)، مدیرعامل این شرکت، در ۲۲ سپتامبر ۲۰۲۶ تأیید کرد که این سرمایهگذاری توسط Insight و S32 رهبری شده است. در این دور، طیف گستردهای از شرکتهای سرمایهگذاری خطرپذیر از جمله Third Point، March، Blumberg، Allegis، Standard VC و Frontline مشارکت داشتند. همچنین سرمایهگذاران قبلی مانند Addition، Lightspeed، Greylock، GV، P7، Wells Fargo، Walden Catalyst Ventures و Factory نیز در این مرحله حضور یافتند.
زمینه و تاریخچه تأمین مالی
این تزریق سرمایه پس از دور سری D رخ میدهد که در ۲۹ می ۲۰۲۵ اعلام شد. در آن مرحله، شرکت ۱۰۰ میلیون دلار جذب کرد و ارزش آن ۱.۳ میلیارد دلار برآورد شد. دور سری D توسط Addition رهبری شد و سرمایهگذاران استراتژیکی مانند BNY و QBE Ventures در آن نقش داشتند. از زمان تأسیس Snorkel در سال ۲۰۱۹ در شهر ردودسیتی کالیفرنیا، مجموع سرمایههای جذب شده به ۲۳۷ میلیون دلار رسیده بود. سرمایه سری D برای گسترش بخشهای مهندسی، پژوهش و تلاشهای ورود به بازار (go-to-market) استفاده شد که منجر به عرضه عمومی Snorkel Evaluate و خدمات دادههای تخصصی (Snorkel Expert Data-as-a-Service) گردید.
این تزریق سرمایه جدید در حالی رخ میدهد که صنعت با سد دادههای سادهی وب مواجه شده است. همانطور که در تحلیل قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، گلوگاه اصلی سیستمهای هوش مصنوعی اکنون دسترسی به دادههای تخصصی و باکیفیت است. اکثر توسعههای فعلی بر پایه «داده ۱.۰» بودهاند؛ یعنی یک مسئله لجستیکی که در آن هزاران انسان استخدام میشدند تا تصاویر یا متون ساده را برچسبگذاری کنند.
Snorkel AI اکنون به سمت «داده ۲.۰» حرکت میکند. در این رویکرد، توسعه دادهها شبیه به یک مسئله پژوهشی و تکنولوژیک است، نه یک کار یدی. هدف این است که مجموعهدادههای پیچیدهای ساخته شود که بتواند به مدل یاد دهد مسائل مهندسی نرمافزار را حل کند؛ مسائلی که حتی یک مهندس ارشد انسانی هم ممکن است هفتهها روی آنها فکر کند.
به نقل از رتنر، مجموعهدادههای یادگیری تقویتی (Reinforcement Learning) در لبه تکنولوژی باید بتوانند سیگنالهای پاداش ظریف را در خروجیهای مقیاس صنعتی ثبت کنند، در برابر «هک شدن» توسط مدل مقاومت کنند و از چندین صد بررسی کنترل کیفیت عبور نمایند.
جزئیات پلتفرم دادهی عاملمحور
برای رسیدن به این هدف، این شرکت از یک پلتفرم دادهی عاملمحور (Agentic Data Platform) داخلی استفاده میکند. این سامانه — که شبیه به تیمی از دستیاران متخصص است که هر کدام بخشی از یک پروژه بزرگ را پیش میبرند — انسانها را جایگزین نمیکند، بلکه توان آنها را از طریق مکانیسمهای زیر افزایش میدهد:
- عاملهای تخصصی: صدها عامل هوش مصنوعی برای هر نوع وظیفه، طرحهای اولیه (sketches) متخصصان را به محیطهای دادهای کامل و نمونههای واقعی تبدیل میکنند.
- خودبهبودی بازگشتی (RSI): بازخوردهای انسانی به عنوان «نظارت ضعیف» (weak supervision) عمل میکنند تا کیفیت عاملها را اندازهگیری کرده و بهبود بخشند و بدین ترتیب یک حلقه ترکیبی از کیفیت ایجاد کنند.
- اصلاح خطای هدفمند: عاملها تلاش انسان را دقیقاً به سمت حالتهای خطای مدل و اهداف توزیعی هدایت میکنند، بازخوردهای زنده ارائه میدهند و زیرمجموعههای پروژه را به متخصصان مناسب ارجاع میدهند.
طبق گزارش وبلاگ رسمی شرکت، این روش در دادههای کدنویسی نتایج ملموسی داشته است. استفاده از عاملهای تخصصی برای کنترل کیفیت (QC) در کنار انسانها، راندمان این فرآیند را بیش از ۵۰٪ افزایش و دقت بررسیها را بیش از ۱۵ واحد نسبت به مدلهای زبانی بزرگ (LLM) آماده بهبود بخشیده است. علاوه بر این، بازخوردهای انسانی مقیاسپذیر که به عنوان نظارت ضعیف اعمال شدهاند، منجر به بهبود دقت بیش از ۲ برابری نسبت به خط پایه یک LLM پیشرو و غیرتخصصی شده است.
مقیاسپذیری و پژوهشهای باز
رشد مالی شرکت نیز به همین اندازه تهاجمی است. رتنر گزارش داد که درآمد سالانه خدمات داده این شرکت در یک سال ۱۸ برابر شده و در هفتهی اعلام این خبر، نرخ درآمد سالانه (annualized revenue run rate) از ۳۷۵ میلیون دلار عبور کرده است. این رشد نتیجه همکاری با آزمایشگاههای پیشرو، ابرسرویسدهندگان (hyperscalers)، نئولبها، رهبران هوش مصنوعی عمودی، سازمانهای تجاری و آژانسهای دولتی ایالات متحده است. این رویکرد در کنار تلاشهای سایر استارتاپها برای دستیابی به تعاملات انسانیتر، مانند هدف Nuance Labs در توسعه مدلهای بنیادین بصری-شنیداری، نشاندهنده حرکت صنعت به سمت تخصصیتر کردن ورودیهای داده است.
علاوه بر بخش تجاری، Snorkel AI برنامه گرنتهای محکهای باز (Open Benchmarks Grants) را با تعهد مالی ۳ میلیون دلاری گسترش داده است. این برنامه برای تأمین بودجه محکهای مستقل و مصنوعات ارزیابی است. این تلاشها توسط یک کمیته هدایت متشکل از پژوهشگران دانشگاهی و صنعتی بررسی میشوند تا استقلال آنها تضمین شود. برخی از این محکهای کلیدی عبارتند از:
- Terminal-Bench و OSWorld 2.0 (با همکاری آزمایشگاه XLANG دانشگاه هنگکنگ).
- Agent’s Last Exam (با همکاری RDI دانشگاه برکلی) و Continual Learning Bench (با همکاری SkyLab دانشگاه برکلی و دانشگاه UW-Madison).
- SlopCode Bench (با همکاری دانشگاه UW-Madison، دارپا و بنیاد ملی علوم آمریکا) و Senior SWE-bench (با همکاری دانشگاه ویسکانسین و دانشگاه پرینستون).
برای یک مدیر کسبوکار، این اتفاق به معنای جابجایی نقطه ارزش در زنجیره هوش مصنوعی است. مزیت رقابتی دیگر در دست کسی نیست که بیشترین قدرت محاسباتی (Compute) — یعنی همان کرایه آشپزخانه صنعتی برای پخت مدلها — را دارد، بلکه در دست کسی است که میتواند با برنامهنویسی، باکیفیتترین دادههای «استدلالی» را تولید کند. رتنر انتظار دارد در سالهای آینده، سهم بسیار بزرگی از توسعه دادههای جهانی بر روی هوش مصنوعی تخصصی متمرکز شود.
اگر فرضیه «داده ۲.۰» درست باشد، برندگان مسابقه هوش مصنوعی کسانی خواهند بود که موتورهای داده بازگشتی میسازند، نه کسانی که فقط GPUهای بیشتری میخرند. تمرکز فعلی روی همراستاسازی (Alignment) و ایمنی است، جایی که توسعه محیطهای شبیهسازیشده نقشی حیاتی دارد و محور اصلی تحقیق و توسعه آینده Snorkel خواهد بود.
گام بعدی شما
- نتایج Senior SWE-bench را دنبال کنید تا ببینید آیا رویکرد دادههای عاملمحور واقعاً فاصله بین AI و مهندسان ارشد را پر میکند یا خیر.
- اگر در حال توسعه مدلهای تخصصی هستید، به جای جمعآوری دادههای بیشتر، روی ساخت «حلقههای بازخورد بازگشتی» برای بهبود کیفیت دادهها تمرکز کنید.
- بررسی کنید که آیا مدلهای شما در برابر «هک کردن پاداش» (Reward Hacking) آسیبپذیر هستند یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو