پرش به محتوای اصلی
پرش به محتوای مقاله

Agent Benchmarks: مدل V4-Flash-Vision-Exp با Opus 4.8 برابری کرد

·۳۱ مرداد ۱۴۰۵۲ دقیقه مطالعه
دیپ‌سیک مدل بینایی فلش آزمایشی با عملکرد رقابتی اپوس ۴.۸ منتشر کرد
دیپ‌سیک مدل بینایی فلش آزمایشی با عملکرد رقابتی اپوس ۴.۸ منتشر کرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ترکیب توانایی‌های بینایی در یک معماری Flash؛ یعنی رسیدن به عملکرد مدل‌های تراز اول (Frontier) در وظایف عاملی، اما با سرعت و هزینه مدل‌های کوچک.

اگر امروز برای اتوماسیون رابط‌های کاربری (UI) از مدل‌های سنگین و کند استفاده می‌کنید، هزینه‌های استنتاج شما به‌زودی به‌شدت کاهش می‌یابد. مدل DeepSeek V4-Flash-Vision-Exp اکنون در محک‌های داخلیِ عاملی با Opus 4.8 برابری می‌کند و سیگنالی از چرخش به سمت هوش بصری با بازدهی بالا است.

این مدل که در ۲۱ اوت ۲۰۲۶ منتشر شد، به عامل‌های هوش مصنوعی (AI Agents) — شبیه دستیارهای دیجیتالی که می‌توانند به‌جای شما دکمه‌ها را بزنند و فرم‌ها را پر کنند — اجازه می‌دهد تا با عملکردی در سطح مدل‌های پیشرو، رابط‌های دیجیتال را ببینند و با آن‌ها تعامل کنند.

بیشتر مدل‌های چندوجهی (Multimodal) — مدل‌هایی که مثل انسان هم‌زمان متن، عکس و صدا را می‌فهمند — در ایجاد تعادل میان سرعت و استدلال پیچیده شکست می‌خورند. طبق اعلام DeepSeek، این شرکت با گسترش قابلیت‌های متنی V4-Flash و افزودن پردازش تصویر، این شکاف را پر کرده است تا افزودن بینایی باعث تضعیف منطق یا دانش مدل نشود. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های کوچک اشاره کردیم، کاهش تأخیر بدون افت کیفیت، کلید پذیرش گسترده‌ی عامل‌های هوش مصنوعی است.

مشخصات فنی

بر اساس مستندات API در وب‌سایت deepseek.com، این مدل از فرمت‌های JPEG، PNG، GIF و WebP پشتیبانی می‌کند و نوع فایل را بر اساس محتوا، نه نام یا پسوند تشخیص می‌دهد. قابلیت‌های کلیدی عبارت‌اند از:

  • وظایف بصری: استخراج متن از اسکرین‌شات‌ها، تحلیل نمودارهای پیچیده و شرح تصاویر.
  • انعطاف در ورودی: پشتیبانی از کدگذاری Base64، لینک‌های عمومی (تا ۳۲ مگابایت) و API اختصاصی فایل‌ها (تا ۶۴ مگابایت).
  • بهینگی توکن: هر تصویر حداکثر ۳۸۴ توکن — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — هزینه دارد. همچنین امکان کاهش ابعاد تصاویر به ۵۱۲ در ۵۱۲ پیکسل برای کاهش هزینه وجود دارد. این رویکرد در راستای استراتژی شرکت برای استانداردسازی ابعاد تصاویر جهت کنترل هزینه‌های توکن است که پیش‌تر بررسی کرده بودیم.

دیپ‌سیکک مدل بینایی فلش آزمایشی عرضه کرد؛ رقابت با اوپوس ۴.۸ در معیارهای عامل هوشمند

یکپارچه‌سازی و مقیاس

این مدل برای استقرار سریع طراحی شده و از نقاط اتصال (Endpoints) شرکت‌های OpenAI و Anthropic پشتیبانی می‌کند. همچنین نسخه ۰.۱.۱ از چارچوب Harness برای پشتیبانی مستقیم از این مدل عرضه شده است. در هر درخواست می‌توان تا ۶۰۰ تصویر را ارسال کرد، هرچند با ارسال بیش از ۱۵ تصویر، حداکثر طول لبه‌ها از ۸۱۹۲ به ۴۰۹۶ پیکسل کاهش می‌یابد.

برای کاربران تجاری، این یعنی عامل‌های بصری اکنون می‌توانند پردازش حجم بالای اسناد یا اتوماسیون UI را بدون تأخیر مدل‌های بزرگ انجام دهند. دیپ‌سیک با هم‌راستا کردن قیمت‌ها با نرخ‌های V4-Flash، سد مالی شرکت‌هایی را که قصد استقرار ابزارهای بینایی در مقیاس وسیع دارند، پایین آورده است.

گام بعدی شما

  • اگر از خط لوله‌های نویسه‌خوانی نوری (OCR) سنتی استفاده می‌کنید، قابلیت تحلیل اسکرین‌شات این مدل را از طریق Files API تست کنید.
  • پایداری شاخه آزمایشی (Exp) را پیش از انتقال به محیط تولید (Production) زیر نظر بگیرید.
  • برای کاهش هزینه‌ها، فیلد detail را برای تصاویری که نیاز به دقت بالا ندارند فعال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار معماری Flash، هزینه استقرار عامل‌های بصری را برای کسب‌وکارها به‌شدت کاهش می‌دهد. در نتیجه، اتوماسیون رابط‌های کاربری از یک تجربه آزمایشی به یک ابزار تجاری مقیاس‌پذیر تبدیل می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل دشوار است، اما استفاده از نسخه‌های میزبانی‌شده در پلتفرم‌های واسط می‌تواند هزینه اتوماسیون بصری را برای استارتاپ‌های داخلی کاهش دهد.

·نگاه ما
تحریریه دات‌هوش

تمرکز دیپ‌سیک بر روی «بینایی سریع» به‌جای «بینایی دقیق»، نشان می‌دهد که صنعت از مرحله‌ی شگفت‌زده شدن از توانایی مدل‌ها عبور کرده و حالا به دنبال کاربردی کردن آن‌ها در محیط‌های عملیاتی است. این مدل احتمالاً جایگزین بسیاری از سیستم‌های OCR تخصصی می‌شود، زیرا استدلال بصری را با هزینه استنتاج مدل‌های متنی کوچک ترکیب کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.