پرش به محتوای اصلی
پرش به محتوای مقاله

سرمایه‌گذاری ۴۰ میلیون دلاری Vals برای پایان دادن به تقلب در محک‌های AI

·۲۸ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
والز با حمایت اندرسن هوروویتز، به دنبال تبدیل شدن به استاندارد طلایی بنچمارک هوش مصنوعی است.
والز با حمایت اندرسن هوروویتز، به دنبال تبدیل شدن به استاندارد طلایی بنچمارک هوش مصنوعی است.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم ارزیابی از «آزمون‌های عمومی و قابل آموزش» به «آزمون‌های محرمانه و عملکرد-محور» برای جلوگیری از تقلب سیستماتیک مدل‌ها.

تصور کنید یک مدل هوش مصنوعی در آزمون وکالت نمره کامل می‌گیرد، اما در محیط کار واقعی حتی نمی‌تواند یک لایحه ساده بنویسد. این شکاف میان نمرات تئوری و عملکرد عملی، دلیل اصلی سرمایه‌گذاری ۴۰ میلیون دلاری شرکت Andreessen Horowitz در استارتاپ Vals است. هدف این سرمایه‌گذاری Series A، جلوگیری از بازی شرکت‌های AI با معیارهای عملکردی خودشان است. این رویکرد در راستای تغییر کلی در اکوسیستم استارتاپی است که در آن ارزش واقعی محصول بر استراتژی‌های توزیع ساده اولویت یافته است.

Vals که در سال ۲۰۲۴ تأسیس شد، قصد دارد «استاندارد طلایی» را برای محک‌زنی (Benchmarking) هوش مصنوعی ایجاد کند. این شرکت برخلاف روش‌های رایج، ارزیابی مدل‌ها را شبیه به یک آزمون استخدامی یا تخصصی امن می‌بیند، نه یک کوییز عمومی که پاسخ‌هایش در اینترنت پخش شده باشد.

بحران محک‌زنی (The Benchmarking Crisis)

بسیاری از محک‌ها (Benchmark) — که مثل خط‌کش‌هایی برای اندازه‌گیری هوش مدل‌ها هستند — اکنون عمومی شده‌اند. این موضوع یک رخنه بزرگ ایجاد کرده است؛ آزمایشگاه‌های AI ممکن است به‌طور عمدی یا اتفاقی، سوالات این آزمون‌ها را در داده‌های آموزشی مدل بگنجانند. در نتیجه، مدل به‌جای استدلال، صرفاً پاسخ‌ها را حفظ می‌کند. این پدیده که به آن «تقلب» یا نشت داده (Data Leakage) می‌گویند، باعث شده سیستم‌های قدیمی برای سنجش مدل‌های پیشرو بی‌فایده شوند.

در حال حاضر، محک‌زنی به یک هنجار صنعتی تبدیل شده است تا شرکت‌های AI توانمندی‌های خود را تایید کرده و برتری‌شان را تبلیغ کنند. در بسیاری از موارد، داشتن نمرات خوب در محک‌ها صرفاً به معنای داشتن یک روابط عمومی (PR) خوب است. با این حال، بسیاری از این سیستم‌ها قدیمی هستند و برای اندازه‌گیری قابلیت‌های مدل‌های مدرن طراحی نشده‌اند.

رایان کریشنان (Rayan Krishnan)، هم‌بنیان‌گذار ۲۵ ساله و پژوهشگر سابق استنفورد، Vals را برای پر کردن این خلاء راه انداخت. او که سابقه کار در مایکروسافت، پالانتیر و آزمایشگاه AI استنفورد را دارد، مشاهده کرد که محک‌های آکادمیک نمی‌توانند با سرعت انتشار مدل‌های جدید پیش بروند. به نقل از کریشنان: «ما شاهد ورود سریع مدل‌های جدید و بسیار توانمند به بازار بودیم، اما محک‌های آکادمیک نمی‌توانستند با این پیشرفت‌های پیشرو همگام شوند.»

جزئیات عملیاتی

برای حل این بحران، Vals از چندین سازوکار متمایز استفاده می‌کند:

  • متریال‌های محرمانه: برخلاف محک‌های متن‌باز، Vals محتوای خاص آزمون‌های خود را فاش نمی‌کند. این کار مانع از آن می‌شود که مدل‌ها روی خودِ سوالات امتحان آموزش ببینند.
  • وظایف تخصصی (Domain-Specific): به‌جای سنجش هوش انتزاعی، خروجی‌های حرفه‌ای در حوزه‌های حقوق، مالی و کدنویسی ارزیابی می‌شوند. کریشنان اشاره می‌کند که در حالی که تست‌های قدیمی می‌پرسند آیا مدل دانش کافی برای شرکت در آزمون وکالت را دارد، Vals می‌پرسد آیا مدل می‌تواند خروجی‌هایی با کیفیت مشابه یک انسان متخصص تولید کند.
  • تحلیل پیامدهای منفی: این پلتفرم مدل‌ها را برای اثرات مضر تست می‌کند تا ببیند اگر مدل‌ها در دنیای واقعی «از کنترل خارج شوند» (Ran Wild)، چه اتفاقی می‌افتد.
  • تست‌های پیشرو (Frontier Testing): شرکت در حال گسترش ارزیابی‌ها به حوزه‌هایی مثل بهبود خودکار بازگشتی (Recursive Self-improvement)، سلامت روان، امنیت سایبری، امنیت زیستی و حتی حقوق درگیری‌های مسلحانه است تا ببیند مدل‌ها چگونه کنوانسیون ژنو را اعمال می‌کنند.

رشد و زیرساخت‌ها

مدل درآمدی این استارتاپ شبیه به سازمان College Board در آزمون SAT است؛ شرکت‌ها برای تست کردن مدل‌های خود به Vals پول می‌پردازند. این فرآیند به شرکت‌ها کمک می‌کند تا نقاط ضعف خود را عیب‌یابی کرده و در طول زمان بهبود یابند. این مدل درآمدی به‌سرعت در حال مقیاس‌پذیری است؛ استارتاپ فاش کرد که درآمد فعلی‌اش ۸ برابر بیشتر از سال گذشته است.

این رشد در زیرساخت‌های فیزیکی و انسانی آن‌ها نیز دیده می‌شود. Vals در یک دفتر دوطبقه در خیابان فولسوم سان‌فرانسیسکو فعالیت می‌کند؛ ساختمانی آجری قدیمی که یک قرن پیش یک آبجوسازی بزرگ بود. تیم آن‌ها از ۸ نفر در ابتدای سال به ۲۵ نفر رسیده است. کریشنان قصد دارد به دفتر بسیار بزرگ‌تری نقل مکان کند و ۱۰ تا ۱۵ نفر دیگر استخدام نماید. این تمرکز بر توسعه فیزیکی با استراتژی‌های گسترده‌تر Andreessen Horowitz همسو است که اخیراً میلیاردها دلار برای تقویت زیرساخت‌های فیزیکی عصر ماشین اختصاص داده است.

از منظر تجاری، این تغییر مسیر، اعتبارسنجی AI را از یک ابزار تبلیغاتی به یک ضرورت مالی تبدیل می‌کند. با نزدیک شدن شرکت‌هایی مثل Anthropic (که برای اواخر امسال برنامه‌ریزی شده) و OpenAI به مراحل ثبت رسمی و گزارش‌های مالی عمومی، تاییدیه مستقل از توانمندی‌ها احتمالاً به یک الزام برای سرمایه‌گذاران و رگولاتورها تبدیل خواهد شد. کریشنان معتقد است این ارزیابی‌ها باعث افزایش استفاده از مدل‌ها شده و در مرکز بحث‌های مربوط به سرمایه‌گذاری‌های آتی AI قرار خواهند گرفت.

برای کاربر نهایی، این یعنی ادعاهای «بهترین مدل جهان» (State-of-the-art) در بروشورهای تبلیغاتی جای خود را به گواهینامه‌های تأییدشده توسط شخص ثالث می‌دهد. اگر Vals موفق شود، صنعت دیگر نمی‌پرسد «آیا مدل می‌تواند آزمون وکالت را پاس کند؟»، بلکه می‌پرسد «آیا مدل می‌تواند واقعاً کار یک وکیل را انجام دهد؟».

علاوه بر بخش خصوصی، Vals اخیراً برنامه‌ای را برای ارائه این ارزیابی‌های حیاتی به آژانس‌های فدرال آمریکا آغاز کرده است تا سیستم خود را در زیرساخت‌های ملی AI تثبیت کند. این اقدام پس از یک دور سرمایه‌گذاری Seed به رهبری 8VC و Bloomberg Beta صورت گرفت.

گام بعدی شما

  • اگر مدیر محصول هستید، به‌جای تکیه بر نمرات MMLU، برای مدل‌های خود سناریوهای «تست کور» (Blind Test) طراحی کنید.
  • بر روی خروجی‌های تخصصی (Domain-specific) تمرکز کنید و معیارهای ارزیابی انسانی را جایگزین معیارهای خودکار کنید.
  • منتظر ظهور گواهینامه‌های شخص ثالث برای مدل‌های تجاری باشید و آن‌ها را به عنوان معیار انتخاب ابزار در نظر بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر رویکرد با تکیه بر اعتبار ارزیابی‌های شخص ثالث، ریسک سرمایه‌گذاری در AI را کاهش می‌دهد. همچنین باعث می‌شود رقابت شرکت‌ها از تولید مدل‌های «حفاظ‌دار شده برای آزمون» به سمت تولید مدل‌های واقعاً کاربردی تغییر کند.

تأثیر برای ایران

این تحول بیشتر برای توسعه‌دهندگان مدل‌های بنیادی اهمیت دارد؛ برنامه‌نویسان ایرانی باید بدانند که تکیه بر نمرات عمومی بنچمارک‌ها برای سنجش مدل‌های داخلی، معیار قابل اعتمادی نیست.

·نگاه ما
تحریریه دات‌هوش

جایگزینی محک‌های عمومی با آزمون‌های محرمانه، پایان عصر «بهینه‌سازی برای بنچمارک» است. این رویکرد نشان می‌دهد که صنعت AI از مرحله‌ی نمایش توانایی‌های کلی به مرحله‌ی اثبات بهره‌وری در مشاغل تخصصی وارد شده است. در واقع، ارزش مدل‌ها دیگر با نمره، بلکه با «قابلیت جایگزینی در جریان کار» سنجیده می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.