تصور کنید صاحب یک نانوایی محلی هستید و میخواهید بدون پرداخت هزاران دلار به آژانسهای تبلیغاتی، یک ویدیوی حرفهای برای جذب مشتری بسازید. حالا این کار تنها ۶.۴۱ دلار هزینه دارد و در چند دقیقه انجام میشود. این قیمت، عملاً نیاز به آژانسهای خلاق گرانقیمت را از بین میبرد.
Leadsy در ۳۱ اوت ۲۰۲۶، ابزاری به نام «Flock» را معرفی کرد؛ یک استودیوی عاملمحور (Agentic) — شبیه به یک مدیر پروژه هوشمند که تمام مراحل تولید را بدون نظارت مستقیم شما پیش میبرد — که مخصوص کسبوکارهای کوچک و متوسط (SMB) در هند طراحی شده است. این پروژه در جریان هکاتون «All Things Agentic» گوگل ساخته شد. هدف این هکاتون به چالش کشیدن سازندگان بود تا ثابت کنند عاملهای هوش مصنوعی باید واقعاً «کار» کنند و خروجی ملموس تولید کنند، نه اینکه فقط دربارهی انجام کارها «چت» کنند.
برای سالها، هوش مصنوعی در دنیای تجارت یعنی چتباتهای ساده و کلی در صفحه اصلی سایتها یا اسلایدهای مدیریتی سطح بالا برای برنامههای تحول در شرکتهای Fortune 500. اما مغازههای محلی — از آرایشگاههای محله با قفسههای پر از محصولات، باشگاههای ورزشی که بالای داروخانهها هستند و نانواییهای سنتی — همچنان به روشهای قدیمی تبلیغاتی متکی بودند. آنها یا به کمک یک پسرعمو که گوشی موبایل داشت تکیه میکردند یا قراردادهای گرانقیمت با آژانسهایی میبستند که فرض میکردند هر مغازه محلی یک مدیر برند حرفهای دارد. همانطور که در تحلیل قبلی ما دربارهی ادغام دادههای حجیم در مدلهای زبانی اشاره کردیم (مشابه کاری که Google Gemini Notebook اخیراً با ادغام ۱۰۰,۰۰۰ کتاب گوگل پلی انجام داد)، کلید موفقیت در اتصال مدل به دادههای واقعی است. Leadsy دقیقاً همین کار را کرد و اکوسیستم گوگلمپ را به عنوان منبع اصلی داده برای تجارت محلی در نظر گرفت.
بستر رشد در سطح خرد
به گزارش تیم توسعهدهنده، گوگلسرچ و گوگلمپ در واقع زیربنای رشد کسبوکارهای محلی هستند. یک مغازه کوچک (Kirana) یا یک آرایشگاه محله معمولاً مدتها پیش از آنکه وبسایتی برای برند خود بسازد، در لیست گوگلمپ ثبت شده است. مشکل این کسبوکارها هرگز «دیده شدن» یا کشف شدن توسط مشتری نبود؛ بلکه مشکل، جهش از وضعیت «ما در نقشه هستیم» به داشتن یک فیلم تبلیغاتی حرفهای، صدای دوزبانه و یک صفحهی فرود (Landing Page) بود که شماره تلفن صاحب مغازه را در اختیار لیستهای جمعآوری داده (Scraped lists) قرار ندهد. این رویکرد یادآور تلاشهای مشابه برای دیجیتالی کردن کسبوکارهای خرد است، مانند سیستم خودکار Mathondu که عکسهای منوی دستنویس را به اپلیکیشن تبدیل میکرد.
در گذشته، این جهش نیازمند یک تیم تولید کامل، یک تدوینگر، یک گوینده زبان هندی و یک هفته زمان بود. قیمت این خدمات برای برندهای جهانی تعیین شده بود، نه برای یک مغازه محلی. اما استک فنی گوگل در سال ۲۰۲۶ این اقتصاد واحد (Unit Economics) را تغییر داده است. مدل Gemini 3.5 Flash در پلتفرم Vertex AI به قدری ارزان است که میتواند یک لیست کسبوکار را بخواند و تحلیل کند، و مدل Veo 3.1 به اندازه کافی مقرونبهصرفه است که یک فیلم ۸ ثانیهای را با قیمت لیست تولید کند. همچنین استفاده از Cloud Run و Pub/Sub اجازه میدهد این پردازشها در پسزمینه و بدون نیاز به لپتاپهای گرانقیمت با GPU اجرا شوند.
خط لولهی تولید قطعی
Leadsy برای جلوگیری از مشکل توهم (Hallucination) — وضعیتی که در آن مدل با اطمینان چیزی را ابداع میکند — از یک خط لولهی سختگیرانه و «اول شواهد» (Evidence-first) استفاده میکند. استکهای مولد زمانی برای کسبوکارهای کوچک شکست میخورند که شروع به بداهه پردازی کنند؛ مدلی که یک شعبه دوم خیالی، یک تولیدکننده محتوای جعلی (UGC) یا غذایی را ابداع کند که نانوایی اصلاً نمیفروشد، یک ریسک است، نه یک دارایی خلاق. این سیستم از بداهه پردازی امتناع میکند و فقط از دادههای موجود در لیست گوگل، دادههای مپس و وبسایت رسمی مغازه استفاده میکند.
این فرآیند از ۵ بخش اصلی تشکیل شده است:
- Scout: عامل را بر اساس حقایق موجود مستقر میکند. این بخش از گوگلسرچ، مپس و محتوای URL به عنوان «ابزار» استفاده میکند، نه بر اساس «حس و حال» (Vibes)، تا از ابداع آدرسها یا جزئیات جعلی جلوگیری شود.
- Inka: تولید ویدیو را بر اساس عکسهای واقعی مغازه، منو و فریمهای لیست تنظیم میکند. مدل Gemini Image تنها زمانی به عنوان جایگزین برای تصاویر ثابت استفاده میشود که هیچ شواهد بصری قابل استفادهای وجود نداشته باشد؛ سیستم از استخراج فایلهای آماده (Swipe files) یا تولید UGC جعلی خودداری میکند.
- Ledge: به عنوان دروازه کیفیت عمل میکند. این بخش یک بررسی Regex، یک طبقهبندیکننده Gemma و یک داور Gemini را روی متنها اجرا میکند. اگر متن رد شود، یک بار بازبینی میشود؛ اگر دوباره شکست بخورد، هرگز ارسال نمیشود.
- Stella: کیت نهایی را در قالبهای فرمت شده برای متا، واتساپ و گوگل به صاحب مغازه تحویل میدهد.
- Flo: مغز عامل است که بریف (Brief)، متن و دروازه کیفیت را مدیریت میکند تا اطمینان حاصل شود که منابع گرانقیمت برای یک تیتر ساده هدر نمیروند.
معماری فنی بر بستر گوگل
موتور فنی این سامانه بر پایه یک معماری ناهمگام (Asynchronous) و سبک بنا شده تا هزینه کم و پایداری بالا بماند. معماری از یک خط ساده پیروی میکند: مغازه لینک لیست خود را میپasted میکند، flock-api در Cloud Run به عنوان درگاه عمل میکند، Pub/Sub درخواستها را توزیع میکند و flock-worker در Cloud Run کار را انجام میدهد.
Cloud Run (که در منطقه asia-south1 مستقر شده) پردازشهای API و Worker را مدیریت میکند. کارهای کوتاهمدت در API میمانند، در حالی که وظایف طولانیمدت توسط Worker مدیریت میشوند تا نیازی نباشد لپتاپی شبانهروز روشن بماند. Pub/Sub (campaign-steps) ستون فقرات ناهمگام را مدیریت میکند و از تحویل «حداقل یکبار» (At-least-once delivery) استفاده میکند که در آن ویژگی Idempotency در رسیدها قرار دارد. این امر تضمین میکند که کارهای طولانی، مانند تولید ویدیو، درخواستها را برای ۸ ثانیه باز نگه ندارند.
Gemini 3.5 Flash از طریق Vertex AI به عنوان «مغز» برای کپیرایتینگ و بریفنویسی عمل میکند. برای داراییهای بصری، Veo 3.1 فیلمهای ۸ ثانیهای همراه با صدا تولید میکند. برای بهینهسازی بیشتر هزینهها، تیم از ffmpeg استفاده میکند تا از یک کلیپ اصلی، چندین نسبت ابعادی (۴:۵، ۱:۱، ۹:۱۶ و ۱.۹۱:۱) استخراج کند، به جای اینکه برای هر پلتفرم دوباره پیکسلها را تولید کند.
اجزای اضافی شامل Model Armor برای غربالگری متنهای ورودی و جلوگیری از تزریق پرامپت (Prompt Injection)، Gemini TTS برای ترکیب زبان انگلیسی و یک زبان هندی روی یک تصویر، و Lyria برای تولید آهنگهای کوتاه (Jingles) در صورت موجود بودن سهمیه (Quota) است. بکاند توسط Firestore برای رسیدها، Cloud Storage برای فیلمها، Memory Bank برای بافتار طولانی (Long context) و Cloud Trace/OpenTelemetry برای ممیزیهای مورد نیاز در مسیر Fortified Enterprise Fleet پشتیبانی میشود.
اقتصاد «حیاط پشتی»
بر اساس گزارش منتشر شده در dev.to، هزینه کالاهای فروخته شده (COGS) عمدتاً توسط ویدیو تسلط یافته است. تولید دو کلیپ ۸ ثانیهای Veo با صدا تقریباً ۶.۴۰ دلار هزینه دارد (با نرخ ۰.۴۰ دلار در ثانیه)، در حالی که Gemini Flash برای متن تنها چند سنت هزینه دارد و Gemini TTS در حد یک خطای گرد کردن است.
برای یک دموی واقعی به نام Glen’s Bakehouse — یک لیست عمومی که تیم با آنها تماس نگرفته بود — کل هزینه مصرف در Vertex AI دقیقاً ۶.۴۱ دلار (تقریباً ۵۴۵ روپیه) بود. این هزینه واقعی COGS موتور است، نه قیمت فروش یا فاکتور گوگل. این نشاندهنده یک تغییر عظیم در اقتصاد واحد است؛ جایی که مانع ورود از «چه کسی میتواند آژانس استخدام کند» به «چه کسی بهترین عکسها از مغازهاش را دارد» تغییر میکند.
کنترل انسانی در حلقه
Leadsy به طور صریح از انتشار خودکار محتوا خودداری میکند. سیستم یک «کیت» برای متا، واتساپ و گوگل تولید میکند، اما صاحب کسبوکار باید شخصاً آن را بررسی کرده و بگوید «بله» تا محتوا منتشر شود. این کار از تبدیل یک تولید ۶ دلاری به یک اشتباه عمومی پرهزینه در یک صفحه واقعی جلوگیری میکند.
این موتور «کمترین هزینه» در واقع مجموعهای از «امتناعهای استراتژیک» است:
- امتناع از تولید ویدیو تا زمانی که صاحب مغازه تایید کند.
- امتناع از منتظر ماندن برای Veo در مسیر تعاملی کاربر.
- امتناع از فراخوانی دوم Veo برای برش مربع (Square crop).
- امتناع از تولید UGC جعلی برای جلوگیری از هزینههای اخلاقی و مالی.
- امتناع از انتشار خودکار.
- امتناع از پنهان کردن هزینهها؛ اگر Veo ۹۹٪ هزینه COGS است، سیستم این را اعلام میکند.
این رویکرد، نقش هوش مصنوعی را از یک «خلاقِ بداهه» به یک «تولیدکننده اجرایی» تغییر میدهد. با تبدیل لیست گوگل به یک بریف و استک Vertex به یک تیم تولید، عامل هر بار یک نتیجه قطعی تحویل میدهد. برای خواننده، این به معنای بسته شدن «شکاف آژانسی» است. صاحبان کسبوکارهای کوچک دیگر برای ساخت یک تبلیغ دوزبانه به تیم تولید، تدوینگر و گوینده نیاز ندارند؛ آنها فقط به یک لیست تایید شده در گوگل و چند دلار هزینه پردازشی نیاز دارند.
برای مشاهده این سیستم در عمل، میتوانید محیط عمومی (flock-api)، نمودارهای معماری (/architecture) و رصدخانه (/dash) ارائه شده توسط تیم Leadsy را بررسی کنید تا درک کنید چگونه جریانهای کاری عاملمحور از دموها به کاربردهای واقعی در سطح خرد منتقل میشوند.
گام بعدی شما
- اگر صاحب کسبوکار هستید، ابتدا پروفایل گوگلمپ خود را با عکسهای باکیفیت بهروز کنید؛ چون کیفیت خروجی AI مستقیماً به دادههای ورودی شما وابسته است.
- توسعهدهندگان میتوانند معماری
flock-apiرا برای درک نحوه پیادهسازی جریانهای کاری عاملمحور در مقیاس واقعی بررسی کنند. - بررسی کنید که چگونه ترکیب مدلهای ارزان (Flash) برای منطق و مدلهای گران (Veo) برای خروجی، میتواند هزینه محصول شما را کاهش دهد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو