پرش به محتوای اصلی
پرش به محتوای مقاله

مسیریابی چندمدلی هزینه تولید پروپوزال‌های AI را تا ۸ برابر کاهش داد

·۲۵ مرداد ۱۴۰۵۱۳ دقیقه مطالعه۱ بازدید
راهنما
الگوهای چندمدلی هوش مصنوعی برای نوشتن پیشنهاد در فاندری: الگوهایی که اجرا می‌شوند
الگوهای چندمدلی هوش مصنوعی برای نوشتن پیشنهاد در فاندری: الگوهایی که اجرا می‌شوند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی الگوی «تطبیق تقاضای شناختی با هزینه مدل» برای پروپوزال‌نویسی؛ جایی که به‌جای یک مدل واحد، چهار کلاس مختلف از مدل‌ها بر اساس نوع وظیفه (استخراج، خلاقیت، پیش‌نویس، حسابرسی) زنجیره شده‌اند.

اگر امروز برای تولید پروپوزال‌های پیچیده از مدل‌های پیشرو هزینه می‌دهید، احتمالاً ۴۰۰ تا ۸۰۰ درصد بیشتر از برآورد اولیه پرداخت می‌کنید. دلیل این اتفاق ساده است: استفاده از گران‌ترین مدل‌ها برای تمام مراحل کاری، حتی آن‌هایی که نیاز به تفکر عمیق ندارند.

به نقل از الکس پچنیسکی (Alex Pechenizkiy)، معمار راهکارهای مایکروسافت فاندری (Microsoft Foundry)، در ۱۶ اوت ۲۰۲۶ الگویی معرفی شد که با تطبیق «تقاضای شناختی» با «هزینه مدل»، این مشکل را حل می‌کند. اکثر سازمان‌ها نوشتن پروپوزال را یک تک‌وظیفه می‌بینند، اما در واقع این فرآیند زنجیره‌ای از چهار عملیات مجزا است: استخراج الزامات، ایده‌پردازی برای تم‌های برنده، پیش‌نویس بخش‌ها و بررسی انطباق. هر یک از این مراحل، نقاط شکست و پروفایل هزینه‌ای متفاوتی دارند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، کلید بهره‌وری در عصر AI، عبور از تفکر «بهترین مدل» به سمت «بهترین مدل برای این کار» است. این رویکرد با روند صعود مدل‌های زبانی کوچک در محیط‌های عملیاتی هم‌سو است که نشان می‌دهد کاهش هزینه‌های استنتاج، برنده واقعی تولید است. این معماری لایه‌بندی‌شده تضمین می‌کند که توکن‌های گران‌قیمت مدل‌های پیشرو فقط در جایی استفاده شوند که اثرگذاری بالایی دارند. برای بقیه مراحل، مدل‌های متوازن یا ارزان‌قیمت حجم کار را مدیریت می‌کنند.

این رویکرد کار را به چهار فاز تقسیم می‌کند که هر کدام نیاز به توان شناختی متفاوتی دارند: درک متون طولانی، تولید ایده‌های متنوع، پیش‌نویس‌های محدود و تطبیق الگوها.

زمینه: تجزیه شناختی

نوشتن پروپوزال به‌راحتی بین مدل‌های مختلف تقسیم می‌شود چون معیارهای موفقیت در هر مرحله متفاوت است. برای مثال، استخراج داده‌ها می‌تواند چند دقیقه طول بکشد بدون اینکه کاربر متوجه شود، اما در مرحله پیش‌نویس، تأخیر (Latency) مستقیماً روی تجربه کاربر اثر می‌گذارد. فرصت معماری در اینجا این است که هر وظیفه به کلاس مدلی ارجاع داده شود که با پروفایل آن سازگار است تا هزینه کم شود و کیفیت ثابت بماند.

فاز ۱: استخراج الزامات RFP

این مرحله حساس‌ترین بخش است چون هر خطایی در اینجا به کل زنجیره سرایت می‌کند. یک الزام فراموش‌شده یعنی یک بخش ناقص در پروپوزال و در نهایت رد شدن پیشنهاد.

برای این کار، مدل کلود اوپوس ۴.۷ (Claude Opus 4.7) توصیه می‌شود. این مدل به‌دلیل پنجره متنی (Context Window) — مثل میز کاری که جا برای چند ورق دارد، نه برای کل کتابخانه — بسیار بزرگ و پایداری در خروجی‌های ساختاریافته، برای اسناد بالای ۲۰۰ صفحه ایمن‌تر از GPT-5.5 است.

جزئیات پیاده‌سازی:

  • الگوی پرامپت: مدل به‌عنوان تحلیل‌گر پاسخ پروپوزال تعریف می‌شود و متن کامل RFP را دریافت می‌کند.
  • الزامات استخراج: مدل باید هر الزام شماره‌دار را استخراج کرده و به دسته‌های فنی، مدیریتی، عملکرد گذشته یا قیمت تقسیم کند.
  • فرمت خروجی: خروجی باید دقیقاً مطابق یک اسکیمای JSON باشد تا از وابستگی به یک ارائه‌دهنده خاص (Vendor Lock-in) جلوگیری شود.
  • سخت‌گیری: مدل دستور دارد بدون خلاصه‌سازی، متن را عیناً استخراج کند و موارد مبهم را علامت‌گذاری نماید.

معیارهای ارزیابی:
هدف، دستیابی به نرخ بازیابی (Recall) بالای ۹۵ درصد در برابر داده‌های مرجع است. دقت (Precision) باید ۱۰۰ درصد باشد، زیرا یک الزام ساختگی در پروپوزال‌های دولتی می‌تواند منجر به حذف فوری شود.

فاز ۲: ایده‌پردازی تم‌های برنده

پس از استخراج الزامات، سیستم باید ۳ تا ۵ «تم برنده» ایجاد کند که در تمام بخش‌ها تکرار شوند. این مرحله نیاز به تولید واگرا دارد؛ یعنی توانایی یافتن زوایای خلاقانه‌ای که تیم‌های انسانی ممکن است نادیده بگیرند.

در اینجا GPT-5.5 معمولاً برتر است و به‌جای عبارات کلیشه‌ای، تمایزهای دفاع‌پذیر ارائه می‌دهد. مدل‌های سطح پایین در این مرحله شکست می‌خورند چون صرف‌نظر از ورودی، فهرستی از تم‌های تکراری را تولید می‌کنند.

جزئیات پیاده‌سازی:

  • سیگنال ورودی: خلاصه‌ای از فاز ۱ (۳۰ الزام برتر) و زمینه شرکت (تمایزها و سوابق) به مدل داده می‌شود.
  • الزامات تولید: مدل ۸ تا ۱۲ تم کاندید تولید می‌کند که هر کدام شامل یک تیتر، یک تمایز زیربنایی و منطق توجیهی است.
  • فیلتر کردن: هر تمی که برای هر شرکتی قابل استفاده باشد، حذف می‌شود.

معیارهای ارزیابی:
موفقیت با «امتیاز تنوع» و تست تخصصی سنجیده می‌شود. حداقل ۷۰ درصد تم‌ها باید از فیلتر «عدم کلی بودن» عبور کنند.

الگوهای چندمدلی هوش مصنوعی برای نگارش پیشنهاد در فاندری: الگوهایی که عملیاتی می‌شوند

فاز ۳: پیش‌نویس بخش‌ها

اینجاست که حجم توکن‌ها صورت‌حساب را بالا می‌برد. یک پروپوزال دولتی معمولاً ۳۰ تا ۶۰ بخش دارد. استفاده از مدل‌های پیشرو برای پیش‌نویس‌های اولیه، اتلاف سرمایه است.

مدل‌های متوازن مثل GPT-4.1 یا Mistral Large 123B بهترین گزینه هستند. اگرچه میسترال هزینه کمتری دارد، اما GPT-4.1 پایداری لحن بهتری در بخش‌های مختلف دارد.

جزئیات پیاده‌سازی:

  • ساختار پرامپت: شامل شناسه بخش، محدودیت صفحات و الزامات مربوطه از فاز ۱ است.
  • بافت‌بندی: ۲ تا ۳ تم برنده از فاز ۲ و نمونه‌هایی از لحن پروپوزال‌های موفق قبلی در پرامپت گنجانده می‌شود.
  • محدودیت‌ها: مدل موظف است از انگلیسی ساده استفاده کند و هر صفحه را حدود ۲۸۰ کلمه در نظر بگیرد.

جلوگیری از تغییر لحن:
برای اینکه یک بخش شبیه مشاور و بخش دیگر شبیه بروشور تبلیغاتی نباشد، دو راهکار به کار می‌رود:
۱. ارجاع به لحن (Voice Reference) در هر پرامپت.
۲. یک مرحله بازبینی نهایی (Stitch-Pass) با یک مدل پیشرو که کل متن را برای یکدستی لحن اصلاح می‌کند.

معیارهای ارزیابی:
امتیازدهی توسط انسان یا مدل زبانی به‌مثابه داور (LLM-as-a-judge) بر اساس یک روباریک ۵ امتیازی.

فاز ۴: بررسی انطباق (Compliance)

این مرحله بیشترین حجم کار و کمترین نیاز به خلاقیت را دارد. هدف، یافتن تخلفات با دقت بالا است، نه تولید متن جدید.

طبقه‌بندی‌کننده‌های سریع مثل DeepSeek V3 یا Llama 3.3 70B ایده‌آل هستند. این مدل‌ها وظیفه دارند شکست‌های «پنهان» را پیدا کنند؛ مثلاً جایی که الزام در مفهوم رعایت شده اما در لفظ نه (مثلاً عبارت «تجربه داریم» به‌جای «تجربه اثبات‌شده»). برای مدیریت خطاهای احتمالی در این لایه‌های سریع‌تر، می‌توان از رویکرد «نردبان تخریب» برای جایگزینی خطاهای سیستمی با پاسخ‌های قطعی بهره برد تا پایداری خروجی تضمین شود.

جزئیات پیاده‌سازی:

  • الگوی پرامپت: مدل به‌عنوان حسابرس انطباق عمل کرده و پیش‌نویس را با الزامات فاز ۱ تطبیق می‌دهد.
  • چک‌لیست: مدل باید وضعیت هر الزام را (بله/جزئی/خیر/مبهم) تعیین کرده و جملات خطا را شناسایی کند.
  • خروجی: نتایج در قالب JSON شامل پوشش الزامات و وضعیت محدودیت صفحات بازگردانده می‌شود.

معیارهای ارزیابی:
تیم‌ها با تزریق عمدی ۵ تا ۱۰ خطا در بخش‌های سالم، مدل را تست می‌کنند. هدف، بازیابی بالای ۹۰ درصد برای پروپوزال‌های دولتی است.

لایه ارکستراسیون

در مایکروسافت فاندری، سرویس Foundry Agent Service نقش چسب اتصال را دارد. این ارکستراتور قراردادهای بین فازها را مدیریت می‌کند تا فقط سیگنال‌های با چگالی بالا منتقل شوند.

قراردادهای کلیدی عبارتند از:

  • فاز ۱ به ۲: تبدیل JSON فاز ۱ به خلاصه‌ای از ۳۰ الزام برتر.
  • فاز ۲ به ۳: مسیریابی صریح برای تعیین اینکه کدام تم در کدام بخش قرار گیرد.
  • فاز ۳ به ۴: بررسی موازی پیش‌نویس‌ها؛ اگر تخلفات از حد مجاز بیشتر بود، ارکستراتور دستور بازنویسی به فاز ۳ را صادر می‌کند.

ریاضیات هزینه

بر اساس داده‌های AIThority، مسیریابی چندمدلی در سال ۲۰۲۶ به‌طور مستمر کاهش هزینه ۴ تا ۸ برابری ایجاد کرده است. در سناریوی ۱۰۰ پروپوزال در ماه، صرفه‌جویی از انتقال حجم کار از مدل‌های سطح ۳ به سطوح پایین‌تر می‌آید:

  • استخراج: به‌دلیل حساسیت بازیابی، در سطح ۳ می‌ماند.
  • تم‌های برنده: به‌دلیل حجم کم، در سطح ۳ می‌ماند.
  • پیش‌نویس: انتقال از سطح ۳ به سطح ۲ (GPT-4.1) باعث کاهش ۶۰ تا ۸۰ درصدی هزینه هر توکن می‌شود.
  • انطباق: انتقال به سطح ۱ (DeepSeek V3) کاهش هزینه بیش از ۹۰ درصدی ایجاد می‌کند.

این تغییر، فرض بنیادی مهندسی AI را عوض می‌کند: شما دیگر به‌دنبال «بهترین مدل» نیستید، بلکه به‌دنبال «بهترین مدل برای هر بار پردازش شناختی» هستید.

نقشه راه پیاده‌سازی

برای مقیاس‌های کوچک (زیر ۱۰ پروپوزال در ماه)، پیچیدگی این معماری توجیه ندارد و یک مدل پیشرو کافی است. اما برای سازمان‌های بزرگ، این تنها راه پایدارسازی مالی است.

ترتیب پیشنهادی:

  • هفته ۱: استقرار استخراج با مدل پیشرو و ساخت مجموعه ارزیابی (هدف: بازیابی ۹۵٪).
  • هفته ۲: افزودن فاز تم‌های برنده روی همان مدل.
  • هفته ۳: افزودن پیش‌نویس و ثبت هزینه‌های پایه.
  • هفته ۴: انتقال پیش‌نویس به مدل سطح ۲ و مستندسازی تغییرات کیفیت.
  • هفته ۵: افزودن بررسی انطباق با مدل سطح ۱.
  • هفته ۶: اجرای اولین تمرین جابه‌جایی مدل برای شناسایی نقاط شکست.

برای شروع، ابتدا مجموعه ارزیابی استخراج را بسازید. تنها پس از رسیدن به بازیابی ۹۵ درصد، به فاز بعدی بروید و مدل‌ها را به‌صورت تدریجی جایگزین کنید تا توازن کیفیت و هزینه مستند شود.

گام بعدی شما

  • تحلیل کنید کدام بخش از جریان کاری شما (Workflow) بیشترین توکن را مصرف می‌کند و آیا واقعاً به مدل پیشرو نیاز دارد یا خیر.
  • یک مجموعه داده مرجع (Ground Truth) برای ارزیابی دقت استخراج داده‌هایتان بسازید تا بتوانید مدل‌های ارزان‌تر را تست کنید.
  • از مدل‌های سطح ۱ مثل DeepSeek برای کارهای طبقه‌بندی و بررسی انطباق استفاده کنید تا هزینه‌هایتان را به‌شدت کاهش دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص معماری سیستم‌های توزیع‌شده، هزینه‌های عملیاتی AI را از حالت پیش‌بینی‌ناپذیر به متغیرهای قابل کنترل تبدیل می‌کند. سازمان‌هایی که این لایه‌بندی را اجرا کنند، می‌توانند بدون کاهش کیفیت، مقیاس تولید محتوای تخصصی خود را تا ۸ برابر افزایش دهند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه ارزی و سقف API مواجه‌اند، این استراتژی جایگزینی مدل‌های گران با مدل‌های ارزان‌تر یا وزن‌باز (Open Weights) را در بخش‌های کم‌ریسک ممکن می‌کند.

·نگاه ما
تحریریه دات‌هوش

این معماری نشان می‌دهد که عصر «مدل همه‌کاره» در محیط‌های سازمانی به پایان رسیده و جای خود را به «زنجیره‌های مدل» داده است. به نظر ما، ارزش واقعی این رویکرد نه در کاهش هزینه، بلکه در ایجاد سیستم‌های ارزیابی (Eval Suite) برای هر فاز است که اجازه می‌دهد مدل‌ها را بدون ترس از افت کیفیت، جابه‌جا کرد. این یعنی مدیریت AI از حالت «تجربی» به حالت «مهندسی‌شده» تغییر می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.