پرش به محتوای اصلی
پرش به محتوای مقاله

آیا می‌توان بدون اسکریپت‌های پایتونی دقت مدل‌های هوش مصنوعی را سنجید؟

·۱۳ مرداد ۱۴۰۵۷ دقیقه مطالعه
راهنما
ساخت یک ارزیابی هوش مصنوعی از دیتاست هاگینگ‌فیس بدون نوشتن کد پایتون
ساخت یک ارزیابی هوش مصنوعی از دیتاست هاگینگ‌فیس بدون نوشتن کد پایتون
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

حذف کامل نیاز به پایتون برای ارزیابی‌های قطعی (Deterministic) از طریق انتقال منطق اجرا از اسکریپت به فایل‌های پیکربندی TOML.

تصور کنید برای هر تغییر کوچک در پرامپت مدل خود، مجبور باشید ده‌ها خط کد پایتون را برای محاسبه دقت بازنویسی کنید. اگر توسعه‌دهنده مدل‌های زبانی هستید، از امروز می‌توانید تمام این فرآیند خسته‌کننده با یک فایل متنی ساده جایگزین کنید.

Quantiles سامانه‌ای برای ارزیابی بدون کد (No-code) منتشر کرده است که نیاز به نوشتن منطق سفارشی پایتون برای امتیازدهی قطعی (Deterministic) به مدل‌ها را از بین می‌برد. طبق گزارش این شرکت، هدف اصلی این ابزار، کاهش هزینه‌های نگهداری کد در چرخه‌های تکرار سریع است تا تیم‌ها بتوانند عملکرد مدل را در نسخه‌های مختلف یا با پرامپت‌های متفاوت سریع‌تر اعتبارسنجی کنند.

به گزارش منابع فنی، ساخت یک محک (Benchmark) — که شبیه به یک آزمون استاندارد مدرسه برای سنجش سطح دانش دانش‌آموزان است — معمولاً نیازمند مدیریت کدهایی پیچیده برای هر مجموعه‌داده جدید است. این سربار عملیاتی اغلب سرعت چرخه‌ی تکرار را برای تیم‌هایی که به دنبال اعتبارسنجی عملکرد مدل هستند، کاهش می‌دهد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی استانداردهای ارزیابی مدل‌ها اشاره کردیم، تکرار ساختارهای مشابه در هر پروژه، بدهی فنی را افزایش می‌دهد. در واقع، منطق اجرای بنچمارک‌ها به‌ندرت تغییر می‌کند، اما توسعه‌دهندگان مدام در حال بازنویسی آن‌ها از ابتدا هستند. در اکثر موارد، نگهداری چندین پیاده‌سازی سفارشی از یک الگوی ارزیابی یکسان، پیچیدگی و هزینه‌های نگهداری را بالا می‌برد.

ساخت یک ارزیابی هوش مصنوعی از داده‌های Hugging Face بدون نوشتن کد پایتون

در ۴ آگوست ۲۰۲۶، Quantiles گردش‌کاری را معرفی کرد که اسکریپت‌های سفارشی را با رویکردی کاملاً مبتنی بر پیکربندی جایگزین می‌کند. این پلتفرم یک خط لوله اجرایی با کارایی بالا فراهم می‌کند که ارزیابی‌ها تنها از طریق فایل‌های پیکربندی تعریف می‌شوند. این رویکرد باعث تضمین معیارهای استاندارد، قابلیت بازتولید نتایج (Reproducibility) و تاب‌آوری سیستم می‌شود.

سبک‌های امتیازدهی پشتیبانی‌شده

سیستم ارزیابی بدون کد Quantiles در حال حاضر از دو سبک امتیازدهی قطعی پشتیبانی می‌کند:

  • تطابق دقیق (exact_match): زمانی استفاده می‌شود که هر نمونه دارای یک «پاسخ طلایی» (Golden Answer) باشد که شامل یک رشته متنی، عدد یا مقدار بولی (Boolean) ثابت است.
  • چندگزینه‌ای (multiple_choice): زمانی کاربرد دارد که هر نمونه دارای پاسخی باشد که از میان مجموعه‌ای محدود از گزینه‌ها انتخاب شده است؛ این حالت شامل لیست پاسخ‌های احتمالی و پاسخ صحیح است.

اگر ارزیابی شما به تولید بازیابی‌افزا (RAG) — مثل دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — یا عامل‌های چندمرحله‌ای، داوران (Judges) یا منطق امتیازدهی بسیار تخصصی نیاز داشته باشد، کاربران باید به جای این سیستم، از ارزیابی‌های کدنویسی‌شده‌ی سفارشی (Quantiles custom code evaluations) استفاده کنند. این نیاز به دقت در ارزیابی، به‌ویژه در محیط‌های عملیاتی، یادآور رویکرد جایگزینی سنجش کیفیت متن با صحت اقدام است که در عامل‌های DevOps برای توقف خطاهای محصولی به کار می‌رود.

آماده‌سازی محیط

برای شروع، کاربران باید ابزار Quantiles CLI را از طریق دستور شل (Shell) زیر نصب کنند:

curl -fsSL https://cli.quantiles.io/install.sh | bash

پس از نصب، یک پوشه کاری ایجاد کنید که شامل یک فایل پیکربندی quantiles.toml و یک پوشه به نام prompts/ باشد. برای مثال، ساختار پوشه برای مجموعه‌داده MMLU-Pro به این شکل خواهد بود:

.
├── quantiles.toml
└── prompts/
└── mmlu-pro.txt

این مثال از نسخه آینه quantiles/MMLU-Pro استفاده می‌کند که نسخه‌ای از مجموعه‌داده اصلی TIGER-Lab/MMLU-Pro است و تحت مجوز MIT منتشر شده است.

مکانیزم پیکربندی

بر اساس راهنمای وب‌سایت dev.to، هر ارزیابی بر چهار میدان اصلی در فایل TOML استوار است:

  • Type: این مقدار باید روی custom_nocode تنظیم شود تا خط لوله بدون کد فعال گردد.
  • Dataset: منبع داده در Hugging Face را تعریف می‌کند. برای MMLU-Pro، این شامل name = "quantiles/MMLU-Pro"، config_name = "default" و split = "test" است.
  • Prompt Template File: به فایلی با فرمت Jinja اشاره می‌کند (مثلاً prompts/mmlu-pro.txt) که پرامپت‌ها را برای هر نمونه از داده‌ها رندر می‌کند.
  • Style: فیلدهای مجموعه‌داده را به برچسب‌های پاسخ متصل کرده و رفتار تجزیه (Parsing) را انتخاب می‌کند.

در یک تنظیمات چندگزینه‌ای، بلوک style به‌طور مشخص ستونی که شامل گزینه‌هاست (choices = { column = "options" })، برچسب‌ها (مثلاً choice_labels = ["A", "B", "C", "D", "E", "F", "G", "H", "I", "J"]) و ستون پاسخ مورد انتظار (answer = { label_column = "answer" }) را تعریف می‌کند.

مهندسی پرامپت با Jinja

این سیستم از قالب‌های Jinja برای ارائه داده‌ها به مدل استفاده می‌کند. در مجموعه‌داده MMLU-Pro، قالب موجود در prompts/mmlu-pro.txt گزینه‌ها را پیمایش کرده و برچسب‌ها را به متن می‌چسباند:

{{ row.question }} {% for choice in choices %}{{ choice.label }}. {{ choice.text }} {% endfor %} Answer with only the letter of the correct choice.

هر میدانی که در نمونه فعلی مجموعه‌داده وجود داشته باشد، از طریق شیء row در دسترس قالب پرامپت قرار می‌گیرد. برای ارزیابی‌های چندگزینه‌ای، Quantiles یک لیست نرمال‌سازی شده از گزینه‌ها فراهم می‌کند که شامل هر برچسب پاسخ پیکربندی شده و متن متناظر با آن است.

جداسازی پرامپت از منطق ارزیابی بسیار حیاتی است. شما می‌توانید نحوه پرسیدن یک سؤال را بدون دست زدن به معماری زیربنایی ارزیابی یا قوانین امتیازدهی تغییر دهید؛ چرا که فایل پیکربندی به‌طور صریح تعیین می‌کند داده‌های مجموعه‌داده چگونه به ورودی‌های ارزیابی نگاشت شوند.

اجرا و بررسی نتایج

ارزیابی پس از پیکربندی، از طریق دستور qt run آغاز می‌شود. برای مثال:

qt run mmlu-pro-nocode

برای کسانی که می‌خواهند تنظیمات خود را بدون صرف هزینه توکن‌های API اعتبارسنجی کنند، Quantiles یک مدل دموی تصادفی داخلی (model = "random") ارائه داده است که به‌طور تصادفی یکی از برچسب‌های پیکربندی شده را انتخاب می‌کند.

پس از اتمام اجرا، ابزار CLI معیارهای تجمیعی را خروجی می‌دهد. در یک «تست دود» (Smoke Test) با ۱۰ نمونه (که توسط limit = 10 تعریف شده) روی MMLU-Pro، سیستم نتایج زیر را گزارش کرد:

  • صحت (Accuracy): ۰.۸۲
  • بیشترین تأخیر (Max Latency): ۰.۰۵۹۷۹۲ میلی‌ثانیه
  • میانگین تأخیر: ۰.۰۲۲۳۶۱ میلی‌ثانیه
  • میانه تأخیر (Median Latency): ۰.۰۰۳۹۵۹ میلی‌ثانیه
  • کمترین تأخیر (Min Latency): ۰.۰۰۳۳۳۴ میلی‌ثانیه
  • تأخیر p95: ۰.۰۵۴۲۰۸ میلی‌ثانیه
  • تأخیر p99: ۰.۰۵۸۶۷۵ میلی‌ثانیه

کاربران می‌توانند برای بررسی جزئیات در سطح هر نمونه، دستور qt show <run_id> --json را اجرا کنند. سیستم سه معیار اصلی را برای هر نمونه دنبال می‌کند:

  • is_correct: آیا برچسب تجزیه شده با پاسخ مورد انتظار مطابقت دارد یا خیر.
  • response_parsed: آیا پاسخ مدل توانست به یکی از برچسب‌های پیکربندی شده نگاشت شود.
  • latency_ms: زمان پردازش، شامل تأخیر ارائه‌دهنده (Provider) برای مدل‌های میزبانی‌شده.

آزمایش مدل‌های میزبانی‌شده

برای عبور از مرحله دمو، کاربران می‌توانند مدل‌های میزبانی‌شده را ارزیابی کنند. این کار با اکسپورت کردن کلید API و استفاده از پرچم --input برای بازنویسی مقادیر فایل quantiles.toml انجام می‌شود:

export OPENAI_API_KEY="<your_openai_api_key>" qt run mmlu-pro-nocode --input '{"model":"openai:gpt-5.6-luna","limit":10}'

این قابلیت اجازه می‌دهد کاربر نسخه‌های خاصی مانند openai:gpt-5.6-luna را هدف قرار دهد. اگر پرچم --input حذف شود، سیستم منحصراً از پیکربندی تعریف شده در فایل TOML استفاده می‌کند.

ادغام با عامل‌های کدنویسی هوش مصنوعی

Quantiles یک «مهارت عامل» (Agent Skill) برای ابزارهایی مثل Claude Code یا Codex ارائه داده است. با نصب این مهارت از مسیر github.com/quantiles-evals/skill، یک عامل کدنویسی می‌تواند به‌طور خودکار فیلدهای مجموعه‌داده را بررسی کرده، امتیازدهنده‌ها (Scorers) را پیکربندی کند و ارزیابی‌ها را اجرا نماید. این نوع ادغام با ابزارهای خودکار، مشابه محک‌های جدید Supabase برای سنجش عامل‌های هوش مصنوعی است که تمرکز آن‌ها بر ارزیابی عملکرد عامل‌ها در محیط‌های واقعی است.

کاربران می‌توانند پرامپت‌های خاصی به عامل بدهند. برای ارزیابی چندگزینه‌ای، پرامپت باید شامل <dataset_id>، <prompt_column>، <choice_source>، <choice_labels> و <answer_source> باشد. برای ارزیابی تطابق دقیق، پرامپت باید <dataset_id>، <prompt_column> و <answer_column> را مشخص کند.

این امر یک حلقه ایجاد می‌کند که در آن عامل هوش مصنوعی ساختار مجموعه‌داده را شناسایی کرده و پیکربندی بدون کد و خلاصه نتایج را بدون دخالت انسان پیاده‌سازی می‌کند.

این تغییر، ارزیابی هوش مصنوعی را از یک وظیفه مهندسی نرم‌افزار به یک وظیفه پیکربندی تبدیل می‌کند. با استانداردسازی خط لوله اجرا، صنعت می‌تواند از «پراکندگی بنچمارک‌ها» (Benchmark Sprawl) فاصله بگیرد؛ وضعیتی که در آن هر آزمایشگاه یا شرکت، آزمون‌هایی مانند MMLU یا GPQA را کمی متفاوت اجرا می‌کند. این استانداردسازی برای جلوگیری از حلقه‌های تکرار بی‌هدف، اهمیتی مشابه آنچه در درس‌های عملیاتی Supabase برای ثبات عامل‌های کدنویس ذکر شده است، دارد.

برای توسعه‌دهنده، این یعنی کاهش چشمگیر بدهی فنی. وقتی نسخه‌ی جدیدی از یک مدل منتشر می‌شود، گلوگاه دیگر زمانِ نوشتن یک پارسر (Parser) نیست، بلکه زمانِ بهینه‌سازی پرامپت است. هرچند، Quantiles تأکید می‌کند ارزیابی‌های پیچیده‌ای که نیاز به عامل‌های چندمرحله‌ای، داوران یا بازیابی داده (RAG) دارند، همچنان به ارزیابی‌های کدنویسی‌شده سفارشی نیاز دارند. لازم به ذکر است که این راهنمای MMLU-Pro از طرح داده‌ها استفاده کرده اما با پیاده‌سازی اصلی بنچمارک تطابق ۱۰۰ درصدی ندارد.

گام بعدی شما

  • نصب Quantiles CLI برای حذف کدهای تکراری در ارزیابی‌های فعلی خود.
  • جایگزینی اسکریپت‌های پایتون برای تطابق دقیق (Exact Match) با فایل‌های TOML.
  • تست مدل‌های مختلف با استفاده از پرچم --input برای مقایسه سریع عملکرد.

این تحول در ارزیابی، مسیر را برای استقرار سریع‌تر مدل‌های تخصصی هموار می‌کند؛ اما برای درک هزینه واقعی این استنتاج‌ها، تحلیل ما درباره‌ی بهینه‌سازی GPU را بخوانید.

چرا این موضوع مهم است؟

این ابزار با استانداردسازی معیارهای سنجش، اعتبار نتایج بنچمارک‌ها را افزایش می‌دهد. با تکیه بر تخصص در اتوماسیون ارزیابی، Quantiles ریسک خطاهای انسانی در کدنویسیِ دستیِ پارسرهای امتیازدهی را حذف می‌کند.

تأثیر برای ایران

توسعه‌دهندگان ایرانی مدل‌های زبانی می‌توانند از این ابزار رایگان برای استانداردسازی ارزیابی‌های خود استفاده کنند و هزینه زمانی مربوط به نوشتن کدهای تکراری را کاهش دهند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی کد با پیکرباری در ارزیابی‌ها، در واقع تلاش برای تبدیل «هنرِ بنچمارک‌گیری» به یک «فرآیند صنعتی» است. این رویکرد باعث می‌شود رقابت بین مدل‌ها بر سر کیفیت پاسخ (Prompting) باشد، نه بر سر اینکه چه کسی کدِ دقیق‌تری برای محاسبه درصد صحت نوشته است. به نظر ما، این حرکت گامی در جهت دموکراتیزه کردن ارزیابی‌های پیشرفته است تا تیم‌های کوچک هم بتوانند استانداردهای آزمایشگاه‌های بزرگ را پیاده کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.