پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های ارزان‌قیمت در بومی‌سازی هوش مصنوعی با غول‌های فناوری برابری می‌کنند

·۱۹ مهر ۱۴۰۵۶ دقیقه مطالعه
آیا مدل‌های هوش مصنوعی زندگی روزمره در پاکستان را درک می‌کنند؟ آزمایش لخ/کرو، PKT و اردو
آیا مدل‌های هوش مصنوعی زندگی روزمره در پاکستان را درک می‌کنند؟ آزمایش لخ/کرو، PKT و اردو
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات آماری اینکه در وظایف بومی تک‌مرحله‌ای، هیچ رابطه مستقیمی بین افزایش قیمت مدل و افزایش دقت وجود ندارد و مدل‌های ارزان‌قیمت به نقطه اشباع دقت رسیده‌اند.

اگر برای پیاده‌سازی قابلیت‌های بومی در اپلیکیشن خود بودجه محدودی دارید، خبر خوب این است که دیگر نیازی به گران‌ترین مدل‌های بازار ندارید. یک مطالعه جدید ثابت می‌کند که مدل‌های اقتصادی می‌توانند در وظایف منطقه‌ای، شانه به شانه با غول‌های این صنعت حرکت کنند.

طبق گزارشی که در ۱۱ اکتبر ۲۰۲۶ منتشر شد، محک جدیدی به نام Pakistan Local Context LLM Suite نشان می‌دهد که برای دانش بومی پایه، قیمت مدل اهمیت بسیار کمتری نسبت به کارایی آن دارد. اکثر محک‌های جهانی، جزئیات زندگی روزمره در پاکستان را نادیده می‌گیرند؛ مواردی مثل سیستم عددنویسی لک/کرور (lakh/crore)، منطقه زمانی استاندارد پاکستان (PKT) یا ابهامات خاص خط اردو.

این شکاف باعث می‌شود مدل‌ها با اعتمادبه‌نفس کامل پاسخ دهند، اما در ساده‌ترین تبدیل‌های محلی شکست بخورند؛ مثلاً وقتی نمی‌توانند محاسبه کنند که دو کرور چند لک است. همان‌طور که در تحلیل قبلی ما درباره‌ی لایه‌های هماهنگی برای افزایش موفقیت عامل‌ها اشاره کردیم، این محک اکنون تمرکز را از استدلال کلی به «مبنی‌سازی» (Grounding) — یعنی شبیه کردن مدل به کسی که واقعاً در یک محیط فرهنگی زندگی کرده و با قواعد آن آشناست — تغییر می‌دهد. این تست بررسی می‌کند که آیا یک مدل واقعاً می‌تواند در یک اقتصاد و جامعه محلی خاص عمل کند یا صرفاً در پاسخ به اطلاعات عمومی انگلیسی‌محور موفق است. این چالش‌ها در سایر کشورهای منطقه نیز دیده می‌شود؛ برای مثال، نیاز مبرم هند به متخصصان هوش مصنوعی نشان‌دهنده تلاش این منطقه برای کاهش وابستگی به مدل‌های غربی و بومی‌سازی فناوری است.

سازوکار این محک

این مجموعه از پرسش‌های کوتاه با پاسخ‌های قطعی در چهار دسته‌بندی اصلی استفاده می‌کند. نویسنده برای تضمین تکرارپذیری، از کتابخانه kaggle-benchmarks استفاده کرده و پاسخ‌ها را به‌جای استفاده از یک هوش مصنوعی دیگر به‌عنوان داور، از طریق تطبیق عبارت‌های منظم (regex) امتیازدهی کرده است.

به نقل از مستندات این پروژه، مدل‌ها صراحتاً موظف شدند تنها پاسخ نهایی را بدون هیچ توضیحی ارائه دهند. برای جلوگیری از جریمه شدن پاسخ‌های درست به‌دلیل فرمت‌بندی، یک تابع نرمال‌سازی تمام کاماهای داخل اعداد (مثلاً ۱۲,۵۰,۰۰۰) را پیش از بررسی حذف می‌کند. این محک بر روی یک DataFrame اجرا می‌شود که در آن برای هر پرسش، یک وظیفه (Task) تعریف شده است.

دسته‌بندی جزئیات آزمون

  • سیستم لک/کرور: این بخش تبدیل بین لک، کرور، عرب و خراب را می‌سنجد. مثال‌ها شامل تبدیل ۳.۵ کرور به ارقام ساده (۳۵,۰۰۰,۰۰۰)، شناسایی اینکه یک «عرب» دارای ۹ صفر است و دانستن اینکه یک «خراب» برابر با ۱۰۰ عرب است. همچنین سناریوهای دنیای واقعی را شامل می‌شود، مانند محاسبه حقوق سالانه به لک روپیه برای کسی که حقوق ماهیانه ۸۵,۰۰۰ روپیه دریافت می‌کند (۱۰.۲ لک).
  • زمان PKT: تمرکز بر تبدیل UTC به اسلام‌آباد (UTC+5) است. این بخش آفست‌های پایه را می‌سنجد، مثلاً اینکه ساعت ۹:۰۰ صبح در اسلام‌آباد معادل ساعت ۰۴:۰۰ UTC است. همچنین جابه‌جایی‌های پیچیده تاریخ را بررسی می‌کند؛ برای مثال، اگر ساعت ۲۳:۳۰ UTC در ۱۴ اوت باشد، مدل باید بتواند به درستی تشخیص دهد که تاریخ در اسلام‌آباد ۱۵ اوت است.
  • جغرافیا و مدنی: این بخش مراکز استان‌ها و نمادهای ملی را پوشش می‌دهد. پرسش‌ها شامل شناسایی پشاور به‌عنوان مرکز خیبر پختونخوا، گیلگیت برای گیلگیت-بلتستان و کوئت برای بلوچستان است. همچنین دانش مدل درباره رودخانه سند (سد تربلا)، قانون اساسی ۱۹۷۳، بورس اوراق بهادار پاکستان در کراچی و کوه K2 (که با نام‌های گادوین-آستن یا چوگوری نیز شناخته می‌شود) در مرز چین سنجیده می‌شود.
  • خط اردو: توانایی نوشتن کلماتی مثل «کتاب» (book)، «پانی» (water) و «اسکول» (school) در خط اردو را ارزیابی می‌کند. همچنین اعداد با خط اردو، مانند عدد ۷ (۷)، و معنای دوگانه کلمه «کل» (که هم به معنای دیروز و هم فردا است) را مورد آزمایش قرار می‌دهد.

آیا مدل‌های هوش مصنوعی زندگی روزمره در پاکستان را درک می‌کنند؟ آزمایش لخ/کرو، PKT و اردو

یافته‌های کلیدی در عملکرد مدل‌ها

در این آزمون مدل‌های متعددی از جمله Qwen 3 235B A22B Instruct و مدل‌های Google (Gemini 2.5 Flash و Pro) و OpenAI بررسی شدند. نتایج نشان داد که این محک تقریباً «اشباع» شده است؛ یعنی اکثر مدل‌های مدرن و قدرتمند نمرات بسیار بالایی کسب کرده‌اند و به سقف امتیازات نزدیک شده‌اند.

بر اساس گزارش dev.to، تکان‌دهنده‌ترین یافته، گسست میان هزینه و دقت بود. در حالی که امتیازات در تمام مدل‌ها مشابه بود، هزینه هر اجرا تفاوت فاحشی داشت. هزینه‌ها از حدود ۰.۰۰۰۳ دلار برای ارزان‌ترین مدل‌ها تا چندین هزارم دلار برای گران‌ترین‌ها متغیر بود. مدل ارزان‌تری مثل Qwen 3 در «منطقه بهینه» قرار گرفت و دقتی مشابه جایگزین‌های بسیار گران‌تر ارائه داد.

محدودیت‌های تست

کسب نمره بالا در این ۲۵ پرسش به معنای درک کامل پاکستان توسط مدل نیست. این مجموعه از متن‌های تک‌مرحله‌ای و تمیز استفاده می‌کند که با دنیای واقعی متفاوت است. همچنین «اردوی رومی» (Roman Urdu) — روشی که اکثر مردم در گوشی‌های خود تایپ می‌کنند — یا پیچیدگی اسناد حقوقی و مالیاتی طولانی در این تست لحاظ نشده است. این موضوع یادآور چالش‌های مشابه در استخراج داده‌های محلی است، جایی که دستاوردهای جدید در پر کردن شکاف OCR نشان داد که دقت در متون پیچیده بومی همچنان نیازمند ابزارهای تخصصی است.

علاوه بر این، نویسنده اشاره می‌کند که امتیازدهی با regex بسیار سخت‌گیرانه است. در حالی که این سیستم کاماها را مدیریت می‌کند، اما اگر یک پاسخ درست با عبارتی غیرمنتظره نوشته شده باشد، ممکن است غلط تشخیص داده شود. به‌دلیل کوچک بودن مجموعه سوالات، نباید تفاوت‌های جزئی بین مدل‌ها را بیش از حد تفسیر کرد.

تحلیل: چرخش به سمت بهره‌وری

برای توسعه‌دهندگانی که بودجه API محدودی دارند، این یک سیگنال حیاتی است. ثابت شد که برای وظایف بومی تک‌مرحله‌ای، «بهترین» مدل لزوماً گران‌ترین نیست، بلکه بهینه‌ترین است. دوران پرداخت مبالغ هنگفت برای دسترسی به دانش منطقه‌ای پایه به پایان رسیده است.

این تغییر نشان می‌دهد که بستر متنی (Context Window) — شبیه میز کاری که مدل برای پردازش اطلاعات در اختیار دارد — برای داده‌های بومی پایه در مدل‌های تراز اول حل شده است. مرز رقابت بعدی دیگر بازیابی حقایق ساده نیست، بلکه مدیریت بخش‌های «آشفته» بومی‌سازی است: جملاتی با زبان ترکیبی و گویش‌های محلی.

برای پیشروی در این مسیر، نویسنده قصد دارد موارد دشوارتر و چندمرحله‌ای شامل محاسبات مالیاتی و بندهای حقوقی را پیاده‌سازی کند. اندازه‌گیری ثبات مدل‌ها از طریق اجراهای مکرر نیز کلیدی خواهد بود تا مشخص شود آیا این مدل‌ها واقعاً قابل اعتماد هستند یا صرفاً در پاسخ به پرامپت‌های کوتاه خوش‌شانس بوده‌اند. با این حال، تکیه بر نتایج مدل‌ها بدون تحلیل انسانی ریسک‌های خاص خود را دارد و تقویت تفکر انتقادی تنها راه مقابله با وابستگی مطلق به این ابزارهاست. هدف نهایی، حرکت به سمت اندازه‌گیری «هزینه به ازای هر پاسخ درست» است، زیرا در حال حاضر بیشترین تفاوت بین مدل‌ها در همین نقطه نهفته است.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای استخراج داده‌های بومی استفاده می‌کنید، مدل‌های کوچک‌تر و بهینه‌تر مثل سری Qwen را تست کنید.
  • برای ارزیابی دقیق‌تر، تست‌های خود را به «اردوی رومی» و متون غیررسمی گسترش دهید.
  • هزینه هر پاسخ درست (Cost per Correct Answer) را به‌جای دقت کلی، به‌عنوان معیار انتخاب مدل قرار دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر داده‌های تجربی ثابت می‌کند که برای بسیاری از کاربردهای محلی، مدل‌های اقتصادی از نظر اعتبار فنی با مدل‌های پریمیوم برابری می‌کنند. این موضوع باعث کاهش شدید هزینه‌های استنتاج برای استارتاپ‌های فعال در بازارهای منطقه‌ای می‌شود.

تأثیر برای ایران

این رویکرد برای توسعه‌دهندگان ایرانی که با محدودیت بودجه API مواجه‌اند، راهکاری برای جایگزینی مدل‌های گران‌قیمت با مدل‌های بهینه (مانند Qwen) در وظایف بومی‌سازی زبان فارسی است.

·نگاه ما
تحریریه دات‌هوش

دسترسی به دانش بومی دیگر یک مزیت رقابتی برای مدل‌های Closed-source و گران‌قیمت نیست. این یافته‌ها نشان می‌دهد که مدل‌های بازمتن با پارامترهای بهینه، توانسته‌اند شکاف فرهنگی را با داده‌های آموزشی حجیم پر کنند. حالا میدان رقابت از «دانستن حقایق» به «درک پیچیدگی‌های زبانی» در محیط‌های واقعی منتقل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.