پرش به محتوای اصلی
پرش به محتوای مقاله

تولید کیت تبلیغاتی برای کسب‌وکارهای کوچک به ۶.۴۱ دلار رسید

·۹ شهریور ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
لیدسی: گوگل مدل‌ها را به سمت حیاط نشانه‌رفت. ما آژانسی ساختیم که آنجا زندگی می‌کند.
لیدسی: گوگل مدل‌ها را به سمت حیاط نشانه‌رفت. ما آژانسی ساختیم که آنجا زندگی می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل مستقیم داده‌های گوگل‌مپ به کیت‌های تبلیغاتی ویدئویی با هزینه کمتر از ۷ دلار؛ در حالی که پیش از این، تولید چنین محتوایی نیازمند زنجیره‌ای از متخصصان انسانی و هزینه‌های گزاف بود.

تصور کنید صاحب یک نانوایی محلی هستید و می‌خواهید بدون پرداخت هزاران دلار به آژانس‌های تبلیغاتی، یک ویدیوی حرفه‌ای برای جذب مشتری بسازید. حالا این کار تنها ۶.۴۱ دلار هزینه دارد و در چند دقیقه انجام می‌شود. این قیمت، عملاً نیاز به آژانس‌های خلاق گران‌قیمت را از بین می‌برد.

Leadsy در ۳۱ اوت ۲۰۲۶، ابزاری به نام «Flock» را معرفی کرد؛ یک استودیوی عامل‌محور (Agentic) — شبیه به یک مدیر پروژه هوشمند که تمام مراحل تولید را بدون نظارت مستقیم شما پیش می‌برد — که مخصوص کسب‌وکارهای کوچک و متوسط (SMB) در هند طراحی شده است. این پروژه در جریان هکاتون «All Things Agentic» گوگل ساخته شد. هدف این هکاتون به چالش کشیدن سازندگان بود تا ثابت کنند عامل‌های هوش مصنوعی باید واقعاً «کار» کنند و خروجی ملموس تولید کنند، نه اینکه فقط درباره‌ی انجام کارها «چت» کنند.

برای سال‌ها، هوش مصنوعی در دنیای تجارت یعنی چت‌بات‌های ساده و کلی در صفحه اصلی سایت‌ها یا اسلایدهای مدیریتی سطح بالا برای برنامه‌های تحول در شرکت‌های Fortune 500. اما مغازه‌های محلی — از آرایشگاه‌های محله با قفسه‌های پر از محصولات، باشگاه‌های ورزشی که بالای داروخانه‌ها هستند و نانوایی‌های سنتی — همچنان به روش‌های قدیمی تبلیغاتی متکی بودند. آن‌ها یا به کمک یک پسرعمو که گوشی موبایل داشت تکیه می‌کردند یا قراردادهای گران‌قیمت با آژانس‌هایی می‌بستند که فرض می‌کردند هر مغازه محلی یک مدیر برند حرفه‌ای دارد. همان‌طور که در تحلیل قبلی ما درباره‌ی ادغام داده‌های حجیم در مدل‌های زبانی اشاره کردیم (مشابه کاری که Google Gemini Notebook اخیراً با ادغام ۱۰۰,۰۰۰ کتاب گوگل پلی انجام داد)، کلید موفقیت در اتصال مدل به داده‌های واقعی است. Leadsy دقیقاً همین کار را کرد و اکوسیستم گوگل‌مپ را به عنوان منبع اصلی داده برای تجارت محلی در نظر گرفت.

بستر رشد در سطح خرد

به گزارش تیم توسعه‌دهنده، گوگل‌سرچ و گوگل‌مپ در واقع زیربنای رشد کسب‌وکارهای محلی هستند. یک مغازه کوچک (Kirana) یا یک آرایشگاه محله معمولاً مدت‌ها پیش از آنکه وب‌سایتی برای برند خود بسازد، در لیست گوگل‌مپ ثبت شده است. مشکل این کسب‌وکارها هرگز «دیده شدن» یا کشف شدن توسط مشتری نبود؛ بلکه مشکل، جهش از وضعیت «ما در نقشه هستیم» به داشتن یک فیلم تبلیغاتی حرفه‌ای، صدای دوزبانه و یک صفحه‌ی فرود (Landing Page) بود که شماره تلفن صاحب مغازه را در اختیار لیست‌های جمع‌آوری داده (Scraped lists) قرار ندهد. این رویکرد یادآور تلاش‌های مشابه برای دیجیتالی کردن کسب‌وکارهای خرد است، مانند سیستم خودکار Mathondu که عکس‌های منوی دست‌نویس را به اپلیکیشن تبدیل می‌کرد.

در گذشته، این جهش نیازمند یک تیم تولید کامل، یک تدوین‌گر، یک گوینده زبان هندی و یک هفته زمان بود. قیمت این خدمات برای برندهای جهانی تعیین شده بود، نه برای یک مغازه محلی. اما استک فنی گوگل در سال ۲۰۲۶ این اقتصاد واحد (Unit Economics) را تغییر داده است. مدل Gemini 3.5 Flash در پلتفرم Vertex AI به قدری ارزان است که می‌تواند یک لیست کسب‌وکار را بخواند و تحلیل کند، و مدل Veo 3.1 به اندازه کافی مقرون‌به‌صرفه است که یک فیلم ۸ ثانیه‌ای را با قیمت لیست تولید کند. همچنین استفاده از Cloud Run و Pub/Sub اجازه می‌دهد این پردازش‌ها در پس‌زمینه و بدون نیاز به لپ‌تاپ‌های گران‌قیمت با GPU اجرا شوند.

خط لوله‌ی تولید قطعی

Leadsy برای جلوگیری از مشکل توهم (Hallucination) — وضعیتی که در آن مدل با اطمینان چیزی را ابداع می‌کند — از یک خط لوله‌ی سخت‌گیرانه و «اول شواهد» (Evidence-first) استفاده می‌کند. استک‌های مولد زمانی برای کسب‌وکارهای کوچک شکست می‌خورند که شروع به بداهه پردازی کنند؛ مدلی که یک شعبه دوم خیالی، یک تولیدکننده محتوای جعلی (UGC) یا غذایی را ابداع کند که نانوایی اصلاً نمی‌فروشد، یک ریسک است، نه یک دارایی خلاق. این سیستم از بداهه پردازی امتناع می‌کند و فقط از داده‌های موجود در لیست گوگل، داده‌های مپس و وب‌سایت رسمی مغازه استفاده می‌کند.

این فرآیند از ۵ بخش اصلی تشکیل شده است:

  • Scout: عامل را بر اساس حقایق موجود مستقر می‌کند. این بخش از گوگل‌سرچ، مپس و محتوای URL به عنوان «ابزار» استفاده می‌کند، نه بر اساس «حس و حال» (Vibes)، تا از ابداع آدرس‌ها یا جزئیات جعلی جلوگیری شود.
  • Inka: تولید ویدیو را بر اساس عکس‌های واقعی مغازه، منو و فریم‌های لیست تنظیم می‌کند. مدل Gemini Image تنها زمانی به عنوان جایگزین برای تصاویر ثابت استفاده می‌شود که هیچ شواهد بصری قابل استفاده‌ای وجود نداشته باشد؛ سیستم از استخراج فایل‌های آماده (Swipe files) یا تولید UGC جعلی خودداری می‌کند.
  • Ledge: به عنوان دروازه کیفیت عمل می‌کند. این بخش یک بررسی Regex، یک طبقه‌بندی‌کننده Gemma و یک داور Gemini را روی متن‌ها اجرا می‌کند. اگر متن رد شود، یک بار بازبینی می‌شود؛ اگر دوباره شکست بخورد، هرگز ارسال نمی‌شود.
  • Stella: کیت نهایی را در قالب‌های فرمت شده برای متا، واتس‌اپ و گوگل به صاحب مغازه تحویل می‌دهد.
  • Flo: مغز عامل است که بریف (Brief)، متن و دروازه کیفیت را مدیریت می‌کند تا اطمینان حاصل شود که منابع گران‌قیمت برای یک تیتر ساده هدر نمی‌روند.

معماری فنی بر بستر گوگل

موتور فنی این سامانه بر پایه یک معماری ناهمگام (Asynchronous) و سبک بنا شده تا هزینه کم و پایداری بالا بماند. معماری از یک خط ساده پیروی می‌کند: مغازه لینک لیست خود را می‌پasted می‌کند، flock-api در Cloud Run به عنوان درگاه عمل می‌کند، Pub/Sub درخواست‌ها را توزیع می‌کند و flock-worker در Cloud Run کار را انجام می‌دهد.

Cloud Run (که در منطقه asia-south1 مستقر شده) پردازش‌های API و Worker را مدیریت می‌کند. کارهای کوتاه‌مدت در API می‌مانند، در حالی که وظایف طولانی‌مدت توسط Worker مدیریت می‌شوند تا نیازی نباشد لپ‌تاپی شبانه‌روز روشن بماند. Pub/Sub (campaign-steps) ستون فقرات ناهمگام را مدیریت می‌کند و از تحویل «حداقل یک‌بار» (At-least-once delivery) استفاده می‌کند که در آن ویژگی Idempotency در رسیدها قرار دارد. این امر تضمین می‌کند که کارهای طولانی، مانند تولید ویدیو، درخواست‌ها را برای ۸ ثانیه باز نگه ندارند.

Gemini 3.5 Flash از طریق Vertex AI به عنوان «مغز» برای کپی‌رایتینگ و بریف‌نویسی عمل می‌کند. برای دارایی‌های بصری، Veo 3.1 فیلم‌های ۸ ثانیه‌ای همراه با صدا تولید می‌کند. برای بهینه‌سازی بیشتر هزینه‌ها، تیم از ffmpeg استفاده می‌کند تا از یک کلیپ اصلی، چندین نسبت ابعادی (۴:۵، ۱:۱، ۹:۱۶ و ۱.۹۱:۱) استخراج کند، به جای اینکه برای هر پلتفرم دوباره پیکسل‌ها را تولید کند.

اجزای اضافی شامل Model Armor برای غربالگری متن‌های ورودی و جلوگیری از تزریق پرامپت (Prompt Injection)، Gemini TTS برای ترکیب زبان انگلیسی و یک زبان هندی روی یک تصویر، و Lyria برای تولید آهنگ‌های کوتاه (Jingles) در صورت موجود بودن سهمیه (Quota) است. بک‌اند توسط Firestore برای رسیدها، Cloud Storage برای فیلم‌ها، Memory Bank برای بافتار طولانی (Long context) و Cloud Trace/OpenTelemetry برای ممیزی‌های مورد نیاز در مسیر Fortified Enterprise Fleet پشتیبانی می‌شود.

اقتصاد «حیاط پشتی»

بر اساس گزارش منتشر شده در dev.to، هزینه کالاهای فروخته شده (COGS) عمدتاً توسط ویدیو تسلط یافته است. تولید دو کلیپ ۸ ثانیه‌ای Veo با صدا تقریباً ۶.۴۰ دلار هزینه دارد (با نرخ ۰.۴۰ دلار در ثانیه)، در حالی که Gemini Flash برای متن تنها چند سنت هزینه دارد و Gemini TTS در حد یک خطای گرد کردن است.

برای یک دموی واقعی به نام Glen’s Bakehouse — یک لیست عمومی که تیم با آن‌ها تماس نگرفته بود — کل هزینه مصرف در Vertex AI دقیقاً ۶.۴۱ دلار (تقریباً ۵۴۵ روپیه) بود. این هزینه واقعی COGS موتور است، نه قیمت فروش یا فاکتور گوگل. این نشان‌دهنده یک تغییر عظیم در اقتصاد واحد است؛ جایی که مانع ورود از «چه کسی می‌تواند آژانس استخدام کند» به «چه کسی بهترین عکس‌ها از مغازه‌اش را دارد» تغییر می‌کند.

کنترل انسانی در حلقه

Leadsy به طور صریح از انتشار خودکار محتوا خودداری می‌کند. سیستم یک «کیت» برای متا، واتس‌اپ و گوگل تولید می‌کند، اما صاحب کسب‌وکار باید شخصاً آن را بررسی کرده و بگوید «بله» تا محتوا منتشر شود. این کار از تبدیل یک تولید ۶ دلاری به یک اشتباه عمومی پرهزینه در یک صفحه واقعی جلوگیری می‌کند.

این موتور «کمترین هزینه» در واقع مجموعه‌ای از «امتناع‌های استراتژیک» است:

  1. امتناع از تولید ویدیو تا زمانی که صاحب مغازه تایید کند.
  2. امتناع از منتظر ماندن برای Veo در مسیر تعاملی کاربر.
  3. امتناع از فراخوانی دوم Veo برای برش مربع (Square crop).
  4. امتناع از تولید UGC جعلی برای جلوگیری از هزینه‌های اخلاقی و مالی.
  5. امتناع از انتشار خودکار.
  6. امتناع از پنهان کردن هزینه‌ها؛ اگر Veo ۹۹٪ هزینه COGS است، سیستم این را اعلام می‌کند.

این رویکرد، نقش هوش مصنوعی را از یک «خلاقِ بداهه» به یک «تولیدکننده اجرایی» تغییر می‌دهد. با تبدیل لیست گوگل به یک بریف و استک Vertex به یک تیم تولید، عامل هر بار یک نتیجه قطعی تحویل می‌دهد. برای خواننده، این به معنای بسته شدن «شکاف آژانسی» است. صاحبان کسب‌وکارهای کوچک دیگر برای ساخت یک تبلیغ دوزبانه به تیم تولید، تدوین‌گر و گوینده نیاز ندارند؛ آن‌ها فقط به یک لیست تایید شده در گوگل و چند دلار هزینه پردازشی نیاز دارند.

برای مشاهده این سیستم در عمل، می‌توانید محیط عمومی (flock-api)، نمودارهای معماری (/architecture) و رصدخانه (/dash) ارائه شده توسط تیم Leadsy را بررسی کنید تا درک کنید چگونه جریان‌های کاری عامل‌محور از دموها به کاربردهای واقعی در سطح خرد منتقل می‌شوند.

گام بعدی شما

  • اگر صاحب کسب‌وکار هستید، ابتدا پروفایل گوگل‌مپ خود را با عکس‌های باکیفیت به‌روز کنید؛ چون کیفیت خروجی AI مستقیماً به داده‌های ورودی شما وابسته است.
  • توسعه‌دهندگان می‌توانند معماری flock-api را برای درک نحوه پیاده‌سازی جریان‌های کاری عامل‌محور در مقیاس واقعی بررسی کنند.
  • بررسی کنید که چگونه ترکیب مدل‌های ارزان (Flash) برای منطق و مدل‌های گران (Veo) برای خروجی، می‌تواند هزینه محصول شما را کاهش دهد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل نشان می‌دهد که کاهش هزینه استنتاج در مدل‌های چندوجهی، دسترسی به بازاریابی حرفه‌ای را برای میلیون‌ها کسب‌وکار خرد ممکن می‌کند. اعتبار این ادعا از اجرای واقعی روی زیرساخت Vertex AI و ثبت هزینه‌های دقیق استنتاج تأیید می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API گوگل و تحریم‌ها، دسترسی مستقیم به Vertex AI برای توسعه‌دهندگان ایرانی دشوار است، اما این مدل می‌تواند الگویی برای ساخت ابزارهای مشابه با مدل‌های بازمتن در بازار ایران باشد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «خلاقیت بداهه» با «تولید قطعی» در این پروژه، نقطه عطف مهمی است. Leadsy ثابت کرد که برای کاربر نهایی، دقت و ارزان بودنِ خروجی بسیار ارزشمندتر از توانایی مدل در تخیل است. این رویکرد، مدل‌های زبانی را از جایگاه یک نویسنده به جایگاه یک اپراتور تبدیل می‌کند که فقط ابزارها را مدیریت می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.