پرش به محتوای اصلی
پرش به محتوای مقاله

پلتفرم عامل‌محور Snorkel AI چگونه داده‌های آزمایشگاه‌های پیشرو را می‌سازد؟

·۳۱ شهریور ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
اسنورکل ای‌آی ۳۵۰ میلیون دلار جذب سرمایه کرد تا آزمایشگاه پیشرو داده‌های هوش مصنوعی بسازد
اسنورکل ای‌آی ۳۵۰ میلیون دلار جذب سرمایه کرد تا آزمایشگاه پیشرو داده‌های هوش مصنوعی بسازد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از برچسب‌گذاری دستی (Data 1.0) به تولید برنامه‌ریزی‌شده و بازگشتی داده‌ها (Data 2.0) با استفاده از عامل‌های هوش مصنوعی برای آموزش استدلال‌های پیچیده.

اگر فکر می‌کنید داده‌های استخراج‌شده از وب برای آموزش مدل‌های آینده کافی هستند، احتمالاً اشتباه می‌کنید. رقابت در دنیای هوش مصنوعی اکنون از «مقدار داده» به «کیفیت استدلال» تغییر مسیر داده است.

ارزش شرکت Snorkel AI پس از جذب ۳۵۰ میلیون دلار سرمایه در دور سری E، به ۳.۵ میلیارد دلار رسید. الکس رتنر (Alex Ratner)، مدیرعامل این شرکت، در ۲۲ سپتامبر ۲۰۲۶ تأیید کرد که این سرمایه‌گذاری توسط Insight و S32 رهبری شده است. در این دور، طیف گسترده‌ای از شرکت‌های سرمایه‌گذاری خطرپذیر از جمله Third Point، March، Blumberg، Allegis، Standard VC و Frontline مشارکت داشتند. همچنین سرمایه‌گذاران قبلی مانند Addition، Lightspeed، Greylock، GV، P7، Wells Fargo، Walden Catalyst Ventures و Factory نیز در این مرحله حضور یافتند.

زمینه و تاریخچه تأمین مالی

این تزریق سرمایه پس از دور سری D رخ می‌دهد که در ۲۹ می ۲۰۲۵ اعلام شد. در آن مرحله، شرکت ۱۰۰ میلیون دلار جذب کرد و ارزش آن ۱.۳ میلیارد دلار برآورد شد. دور سری D توسط Addition رهبری شد و سرمایه‌گذاران استراتژیکی مانند BNY و QBE Ventures در آن نقش داشتند. از زمان تأسیس Snorkel در سال ۲۰۱۹ در شهر ردودسیتی کالیفرنیا، مجموع سرمایه‌های جذب شده به ۲۳۷ میلیون دلار رسیده بود. سرمایه سری D برای گسترش بخش‌های مهندسی، پژوهش و تلاش‌های ورود به بازار (go-to-market) استفاده شد که منجر به عرضه عمومی Snorkel Evaluate و خدمات داده‌های تخصصی (Snorkel Expert Data-as-a-Service) گردید.

این تزریق سرمایه جدید در حالی رخ می‌دهد که صنعت با سد داده‌های ساده‌ی وب مواجه شده است. همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، گلوگاه اصلی سیستم‌های هوش مصنوعی اکنون دسترسی به داده‌های تخصصی و باکیفیت است. اکثر توسعه‌های فعلی بر پایه «داده ۱.۰» بوده‌اند؛ یعنی یک مسئله لجستیکی که در آن هزاران انسان استخدام می‌شدند تا تصاویر یا متون ساده را برچسب‌گذاری کنند.

Snorkel AI اکنون به سمت «داده ۲.۰» حرکت می‌کند. در این رویکرد، توسعه داده‌ها شبیه به یک مسئله پژوهشی و تکنولوژیک است، نه یک کار یدی. هدف این است که مجموعه‌داده‌های پیچیده‌ای ساخته شود که بتواند به مدل یاد دهد مسائل مهندسی نرم‌افزار را حل کند؛ مسائلی که حتی یک مهندس ارشد انسانی هم ممکن است هفته‌ها روی آن‌ها فکر کند.

به نقل از رتنر، مجموعه‌داده‌های یادگیری تقویتی (Reinforcement Learning) در لبه تکنولوژی باید بتوانند سیگنال‌های پاداش ظریف را در خروجی‌های مقیاس صنعتی ثبت کنند، در برابر «هک شدن» توسط مدل مقاومت کنند و از چندین صد بررسی کنترل کیفیت عبور نمایند.

جزئیات پلتفرم داده‌ی عامل‌محور

برای رسیدن به این هدف، این شرکت از یک پلتفرم داده‌ی عامل‌محور (Agentic Data Platform) داخلی استفاده می‌کند. این سامانه — که شبیه به تیمی از دستیاران متخصص است که هر کدام بخشی از یک پروژه بزرگ را پیش می‌برند — انسان‌ها را جایگزین نمی‌کند، بلکه توان آن‌ها را از طریق مکانیسم‌های زیر افزایش می‌دهد:

  • عامل‌های تخصصی: صدها عامل هوش مصنوعی برای هر نوع وظیفه، طرح‌های اولیه (sketches) متخصصان را به محیط‌های داده‌ای کامل و نمونه‌های واقعی تبدیل می‌کنند.
  • خودبهبودی بازگشتی (RSI): بازخوردهای انسانی به عنوان «نظارت ضعیف» (weak supervision) عمل می‌کنند تا کیفیت عامل‌ها را اندازه‌گیری کرده و بهبود بخشند و بدین ترتیب یک حلقه ترکیبی از کیفیت ایجاد کنند.
  • اصلاح خطای هدفمند: عامل‌ها تلاش انسان را دقیقاً به سمت حالت‌های خطای مدل و اهداف توزیعی هدایت می‌کنند، بازخوردهای زنده ارائه می‌دهند و زیرمجموعه‌های پروژه را به متخصصان مناسب ارجاع می‌دهند.

طبق گزارش وبلاگ رسمی شرکت، این روش در داده‌های کدنویسی نتایج ملموسی داشته است. استفاده از عامل‌های تخصصی برای کنترل کیفیت (QC) در کنار انسان‌ها، راندمان این فرآیند را بیش از ۵۰٪ افزایش و دقت بررسی‌ها را بیش از ۱۵ واحد نسبت به مدل‌های زبانی بزرگ (LLM) آماده بهبود بخشیده است. علاوه بر این، بازخوردهای انسانی مقیاس‌پذیر که به عنوان نظارت ضعیف اعمال شده‌اند، منجر به بهبود دقت بیش از ۲ برابری نسبت به خط پایه یک LLM پیشرو و غیرتخصصی شده است.

مقیاس‌پذیری و پژوهش‌های باز

رشد مالی شرکت نیز به همین اندازه تهاجمی است. رتنر گزارش داد که درآمد سالانه خدمات داده این شرکت در یک سال ۱۸ برابر شده و در هفته‌ی اعلام این خبر، نرخ درآمد سالانه (annualized revenue run rate) از ۳۷۵ میلیون دلار عبور کرده است. این رشد نتیجه همکاری با آزمایشگاه‌های پیشرو، ابرسرویس‌دهندگان (hyperscalers)، نئولب‌ها، رهبران هوش مصنوعی عمودی، سازمان‌های تجاری و آژانس‌های دولتی ایالات متحده است. این رویکرد در کنار تلاش‌های سایر استارتاپ‌ها برای دستیابی به تعاملات انسانی‌تر، مانند هدف Nuance Labs در توسعه مدل‌های بنیادین بصری-شنیداری، نشان‌دهنده حرکت صنعت به سمت تخصصی‌تر کردن ورودی‌های داده است.

علاوه بر بخش تجاری، Snorkel AI برنامه گرنت‌های محک‌های باز (Open Benchmarks Grants) را با تعهد مالی ۳ میلیون دلاری گسترش داده است. این برنامه برای تأمین بودجه محک‌های مستقل و مصنوعات ارزیابی است. این تلاش‌ها توسط یک کمیته هدایت متشکل از پژوهشگران دانشگاهی و صنعتی بررسی می‌شوند تا استقلال آن‌ها تضمین شود. برخی از این محک‌های کلیدی عبارتند از:

  • Terminal-Bench و OSWorld 2.0 (با همکاری آزمایشگاه XLANG دانشگاه هنگ‌کنگ).
  • Agent’s Last Exam (با همکاری RDI دانشگاه برکلی) و Continual Learning Bench (با همکاری SkyLab دانشگاه برکلی و دانشگاه UW-Madison).
  • SlopCode Bench (با همکاری دانشگاه UW-Madison، دارپا و بنیاد ملی علوم آمریکا) و Senior SWE-bench (با همکاری دانشگاه ویسکانسین و دانشگاه پرینستون).

برای یک مدیر کسب‌وکار، این اتفاق به معنای جابجایی نقطه ارزش در زنجیره هوش مصنوعی است. مزیت رقابتی دیگر در دست کسی نیست که بیشترین قدرت محاسباتی (Compute) — یعنی همان کرایه آشپزخانه صنعتی برای پخت مدل‌ها — را دارد، بلکه در دست کسی است که می‌تواند با برنامه‌نویسی، باکیفیت‌ترین داده‌های «استدلالی» را تولید کند. رتنر انتظار دارد در سال‌های آینده، سهم بسیار بزرگی از توسعه داده‌های جهانی بر روی هوش مصنوعی تخصصی متمرکز شود.

اگر فرضیه «داده ۲.۰» درست باشد، برندگان مسابقه هوش مصنوعی کسانی خواهند بود که موتورهای داده بازگشتی می‌سازند، نه کسانی که فقط GPUهای بیشتری می‌خرند. تمرکز فعلی روی همراستاسازی (Alignment) و ایمنی است، جایی که توسعه محیط‌های شبیه‌سازی‌شده نقشی حیاتی دارد و محور اصلی تحقیق و توسعه آینده Snorkel خواهد بود.

گام بعدی شما

  • نتایج Senior SWE-bench را دنبال کنید تا ببینید آیا رویکرد داده‌های عامل‌محور واقعاً فاصله بین AI و مهندسان ارشد را پر می‌کند یا خیر.
  • اگر در حال توسعه مدل‌های تخصصی هستید، به جای جمع‌آوری داده‌های بیشتر، روی ساخت «حلقه‌های بازخورد بازگشتی» برای بهبود کیفیت داده‌ها تمرکز کنید.
  • بررسی کنید که آیا مدل‌های شما در برابر «هک کردن پاداش» (Reward Hacking) آسیب‌پذیر هستند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این سرمایه‌گذاری تأیید می‌کند که برای رسیدن به هوش مصنوعی سطح انسانی، نیاز به داده‌های تخصصی داریم که با روش‌های سنتی قابل تولید نیستند. اعتبار این رویکرد با همکاری دانشگاه‌های برکلی و پرینستون تقویت شده و مسیر توسعه مدل‌های استدلالی را تغییر می‌دهد.

تأثیر برای ایران

این تحول بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران. با این حال، توسعه‌دهندگان ایرانی می‌توانند از متدولوژی «نظارت ضعیف» برای بهبود مدل‌های زبانی فارسی با داده‌های محدود استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز روی داده‌های استدلالی نشان می‌دهد که عصر «بیشتر بودن داده» به پایان رسیده و عصر «دقیق‌تر بودن داده» آغاز شده است. این جابجایی، قدرت را از غول‌های سخت‌افزاری به سمت شرکت‌های زیرساختی داده منتقل می‌کند که می‌توانند منطق انسانی را به زبان ماشین ترجمه کنند. در واقع، داده‌های مصنوعی با نظارت انسانی در حال تبدیل شدن به نفت جدید این صنعت هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.