پرش به محتوای اصلی
پرش به محتوای مقاله

زیرساخت ۲۵ دلاری AIdeazz: مدیریت ۱۰ عامل هوش مصنوعی با هزینه صفر

·۱۸ مرداد ۱۴۰۵۷ دقیقه مطالعه۴ بازدید
زیرساخت استارتاپ هوش مصنوعی: هزینه واقعی سرویس‌های اوراکل، گروک و برایت‌دیتا
زیرساخت استارتاپ هوش مصنوعی: هزینه واقعی سرویس‌های اوراکل، گروک و برایت‌دیتا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک پشتهٔ فنی (Tech Stack) واقعی و جزئی برای اجرای عامل‌های AI با هزینه سالانه زیر ۲۵ دلار، که برخلاف ادعاهای کلی، اعداد دقیق مصرف توکن و منابع ابری را افشا می‌کند.

تصور کنید یک استارت‌آپ هوش مصنوعی، ماهانه صدها هزار درخواست را پردازش کند اما صورت‌حساب ابری آن صفر دلار باشد. این دقیقاً همان وضعیتی است که النا رِویچوا، بنیان‌گذار AIdeazz، با مدیریت ۱۰ عامل (Agent) در محیط تولید، به دست آورده است. او موفق شده است کل زیرساخت سالانه خود را با هزینه‌ای در حدود ۲۵ دلار اداره کند.

بسیاری از استارت‌آپ‌های هوش مصنوعی در تلهٔ لایه‌های رایگان و هزینه‌های پنهان عملیاتی می‌افتند و سرمایه‌شان را به سرعت از دست می‌دهند. این چالش‌ها به‌ویژه زمانی تشدید می‌شوند که تله‌های توکن‌های پنهان در APIها باعث افزایش ناگهانی و چند برابری صورت‌حساب‌ها شوند. برای یک بنیان‌گذار مستقل که بودجه‌ای از سرمایه‌گذاران ندارد — رِویچوا یک مادر تنها است که از روسیه به پاناما نقل مکان کرده است — هر دلار هزینه باید مستقیماً از جیب مشتری تأمین شود. این فشار مالی، رِویچوا را مجبور به انضباط معماری شدیدی کرد که تیم‌های ثروتمند معمولاً نادیده می‌گیرند و زیرساخت را به جای یک محدودیت استراتژیک، به عنوان یک هزینه متغیر می‌بینند. موضوع در اینجا صرفاً یافتن ارزان‌ترین گزینه نیست، بلکه درک این نکته است که کجا گزینه‌های «رایگان» به شدت گران می‌شوند.

به نقل از گزارش AIdeazz، ستون فقرات این سیستم بر لایه Always Free در زیرساخت ابری اوراکل (OCI) استوار است. این یک دوره آزمایشی کوتاه نیست، بلکه تخصیص دائمی منابعی است که کل عملیات را پشتیبانی می‌کند.

جزئیات این پشتهٔ محاسباتی شامل موارد زیر است:

  • ۲ ماشین مجازی AMD E4 Flex: هر کدام با ۴ OCPU و ۲۴ گیگابایت رم برای اجرای کانتینرهای داکر (Docker)، APIهای سفارشی و پردازش داده‌ها.
  • ۲ ماشین مجازی Ampere A1 مبتنی بر ARM: هر کدام با ۴ OCPU و ۲۴ گیگابایت رم برای بارهای سبک‌تر، نظارت و سرویس‌های پشتیبان.
  • ۴ حجم ذخیره‌سازی Block Volume: مجموعاً ۲۰۰ گیگابایت برای سیستم‌عامل، ایمیج‌های داکر و داده‌های عامل‌ها.
  • ۱۰ ترابایت انتقال داده خروجی: سقفی سخاوتمند که مانع از پرداخت «مالیات خروجی» (Egress Tax) رایج در سایر ابرهای عمومی می‌شود؛ این استارت‌آپ هرگز به این سقف نرسیده است.
  • ۱ لود بالانسر: با پهنای باند ۱۰ مگابیت بر ثانیه برای مدیریت ترافیک API.
  • ۱ پایگاه‌داده خودکار (Autonomous Database): با ۲ OCPU و ۲۰ گیگابایت حافظه برای داده‌های ساختاریافته، مدیریت کاربران و وضعیت عامل‌ها.

برای ماندن در این محدوده رایگان، رِویچوا از معماری میکروسرویس‌های سخت‌گیرانه استفاده می‌کند. از آنجا که لایه رایگان محدودیت‌های سختگیرانه‌ای دارد، اگر یک عامل به بیش از ۴ OCPU یا ۲۴ گیگابایت رم نیاز داشته باشد، لایه رایگان نمی‌تواند آن را پشتیبانی کند. این موضوع او را مجبور کرده است تا از کدهای بهینه استفاده کند و محاسبات سنگین را به APIهای تخصصی بسپارد.

او حتی برای حفظ منابع پایگاه‌داده اصلی، PostgreSQL را درون داکر در ماشین‌های مجازی اجرا می‌کند تا از مصرف منابع محدود Autonomous Database برای داده‌های خاص هر عامل جلوگیری کند و آن را فقط برای داده‌های حیاتی برنامه نگه دارد. این طراحی مینیمال تضمین می‌کند که زیرساخت بدون نیاز به انتقال به لایه‌های پولی، پایدار بماند.

در بخش استنتاج (Inference) — که شبیه لحظهٔ نهایی آشپزی است، نه دوره آموزش آشپز — این استارت‌آپ به جای تکیه بر یک مدل گران‌قیمت، از استراتژی مسیریابی ترکیبی استفاده می‌کند. یک درگاه API داخلی، مدل را بر اساس پیچیدگی پرامپت و پیکربندی عامل به صورت پویا انتخاب می‌کند.

برای تعاملات سریع و ارزان در تلگرام و واتس‌اپ، از Groq استفاده می‌شود:

  • Llama 3 8B: با هزینه ۰.۰۵ دلار به ازای هر ۱ میلیون توکن (Token) — تکه‌های کوچکی از متن شبیه برش‌های کیک که مدل می‌خورد. مصرف ماهانه معمولاً ۲۵۰,۰۰۰ توکن است که هزینه‌ای حدود ۰.۰۱۲۵ دلار در ماه دارد. این مدل تأخیری زیر ۱۰۰ میلی‌ثانیه دارد که برای تعاملات بلادرنگ با کاربر حیاتی است.
  • Llama 3 70B: برای گفتگوهای پیچیده و چندمرحله‌ای با هزینه ۰.۵۹ دلار به ازای هر ۱ میلیون توکن، که با مصرف ماهانه حدود ۱۰,۰۰۰ توکن، هزینه‌ای معادل ۰.۰۰۵۹ دلار دارد.

مجموع صورت‌حساب سالانه Groq، حتی با احتساب هزینه‌های توسعه و تست، تنها ۱۲.۴۸ دلار بود. هزینه واقعی در محیط تولید تقریباً ۰.۰۲ دلار در ماه است.

برای وظایفی که نیاز به استدلال دقیق‌تر، پنجره‌های متنی (Context Window) بزرگ‌تر یا پیروی دقیق از دستورالعمل‌های خاص دارند، سیستم درخواست‌ها را به Claude 3 Haiku از شرکت Anthropic می‌فرستد:

  • قیمت‌گذاری: هزینه ورودی ۰.۲۵ دلار و هزینه خروجی ۱.۲۵ دلار به ازای هر میلیون توکن است.
  • میزان مصرف: برخی عامل‌های خاص ماهانه حدود ۵,۰۰۰ توکن ورودی و ۱,۰۰۰ توکن خروجی مصرف می‌کنند که مجموعاً ۰.۰۰۲۵ دلار در ماه هزینه دارد.

هزینه سالانه Claude با احتساب توسعه، ۸.۱۷ دلار بود. کلید موفقیت در اینجا «مسیریابی هوشمند» است؛ یعنی پرسش‌های ساده هرگز به مدل‌های گران‌قیمت ارسال نمی‌شوند.

با این حال، طبق گزارش رِویچوا، هزینه اصلی نه در محاسبات، بلکه در اکتساب داده‌هاست. AIdeazz برای مدیریت پروکسی‌ها و حل CAPTCHA از BrightData استفاده می‌کند:

  • پروکسی‌های مسکونی: ۱۵ دلار به ازای هر گیگابایت.
  • Web Unlocker: ۳ دلار به ازای هر ۱,۰۰۰ درخواست برای حل کپچا.

هر بار به‌روزرسانی داده‌ها برای یک مشتری جدید معمولاً حدود ۴۰ دلار هزینه دارد که به صورت رویداد-محور مستقیماً به مشتری منتقل می‌شود. اگر مشتری به‌روزرسانی روزانه بخواهد، این یک هزینه جاری می‌شود و به‌روزرسانی‌های هفتگی ۱۶۰ دلار در ماه هزینه دارد. او هشدار می‌دهد که تکیه بر ابزارهای رایگان استخراج داده (Scraping) در محیط تولید، به دلیل مسدود شدن IPها، داده‌های غیرقابل اعتماد و اتلاف زمان مهندسی، «دستوری برای فاجعه» است.

سایر هزینه‌های جزئی شامل سرویس Resend برای ایمیل‌های تراکنشی (گزارش‌های خودکار و هشدارها) است که هزینه آن ۰.۲۵ دلار به ازای هر ۱,۰۰۰ ایمیل است. با مصرف ۱۰۰ ایمیل در ماه، صورت‌حساب سالانه ۴ دلار بود.

رابط‌های ارتباطی بسته به هزینه متفاوت هستند:

  • Telegram Bot API: کاملاً رایگان است و زیرساخت اجرای این بات‌ها روی ماشین‌های مجازی اوراکل قرار دارد.
  • WhatsApp Business API: خود API رایگان است، اما متا پس از ۱,۰۰۰ مکالمه رایگان ماهانه، هزینه‌ای بین ۰.۰۰۵ تا ۰.۰۱۵ دلار (بسته به کشور و اینکه چه کسی گفتگو را شروع کرده) دریافت می‌کند. این هزینه‌ها به دقت ردیابی و به مشتری فاکتور می‌شوند.

نظارت بر سیستم از طریق Prometheus و Grafana روی همان ماشین‌های رایگان اوراکل انجام می‌شود. اگرچه هزینه مالی مستقیم ندارد، اما زمان زیادی برای پیکربندی و نگهداری سلامت ماشین‌ها، وضعیت داکر، زمان پاسخ‌دهی API و میزان مصرف توکن‌ها می‌طلبد.

باید دانست که صورت‌حساب صفر دلاری اوراکل در واقع رایگان نیست؛ بلکه هزینه آن با تخصص انسانی پرداخت شده است. راه‌اندازی OCI، پیکربندی K3s برای ارکستراسیون روی ماشین‌های مجازی و سخت‌سازی امنیت، هفته‌ها تلاش متمرکز و ساعت‌ها نگهداری هفتگی را می‌طلبید.

رِویچوا اشاره می‌کند که اکثر استارت‌آپ‌ها این بخش را به مهندسان DevOps برون‌سپاری می‌کنند که می‌تواند ماهانه بیش از ۱۰ هزار دلار هزینه داشته باشد. او با تبدیل نقش خود به تیم DevOps، هزینه‌های سرمایه‌ای را به سرمایه انسانی تبدیل کرد. این کار شامل موارد زیر است:

  • زمان DevOps: هفته‌ها برای راه‌اندازی اولیه و چندین ساعت در هفته برای عیب‌یابی.
  • امنیت: مدیریت فایروال‌ها، کلیدهای دسترسی و به‌روزرسانی‌های امنیتی (Patching).
  • مدیریت داده‌ها: مدیریت بک‌آپ‌ها، تکثیر (Replication) و بررسی یکپارچگی داده‌ها.
  • توسعه عامل‌ها: مهندسی پرامپت و تنظیم دقیق (Fine-tuning).

برای کاهش ریسک تغییر شرایط اوراکل یا قطع شدن لایه Always Free، استارت‌آپ قابلیت جابه‌جایی (Portability) شدیدی را حفظ کرده است. تمام عامل‌ها در کانتینرهای داکر با داده‌ها در PostgreSQL استاندارد یا Object Storage اجرا می‌شوند. این امر اجازه می‌دهد تا مهاجرت به AWS EC2/RDS، GCP یا سرورهای اختصاصی با کمترین تغییر در کد صورت گیرد، هرچند تلاش برای مهاجرت قابل توجه خواهد بود.

برای مقیاس‌پذیری فراتر از محدودیت‌های رایگان، استراتژی او به این ترتیب است:
۱. ابتدا بهینه‌سازی کد و معماری عامل‌ها.
۲. انتقال به نمونه‌های محاسباتی پولی OCI (که همچنان قیمت رقابتی دارند).
۳. انتقال به سرورهای اختصاصی برای موارد بسیار سنگین.
۴. انتقال هزینه‌های حاصله به مشتری که تقاضا را ایجاد کرده است.

در مورد گزینه‌های Serverless، رِویچوا از OCI Functions برای منطق اصلی برنامه به دلیل مشکل راه‌اندازی سرد (Cold Start) و وابستگی به فروشنده (Vendor Lock-in) برای عامل‌های Stateful دوری می‌کند. او کانتینرهای داکر با اجرای طولانی را ترجیح می‌دهد و از OCI Functions فقط برای کارهای رویداد-محور مانند پردازش رویدادهای Object Storage استفاده می‌کند.

این رویکرد، روایت عامل‌های هوش مصنوعی را از «چقدر قدرت محاسباتی می‌توانیم بخریم» به «چقدر می‌توانیم معماری را بهینه کنیم» تغییر می‌دهد. این ثابت می‌کند که برای عامل‌هایی با حجم درخواست کم تا متوسط، گلوگاه دیگر هزینه LLM نیست، بلکه انضباط مهندسی مورد نیاز برای مدیریت زیرساخت‌های پیرامونی است.

گام بعدی شما

  • بررسی لایه Always Free در Oracle Cloud برای استقرار نمونه‌های اولیه (MVP) بدون هزینه.
  • پیاده‌سازی یک لایه مسیریابی (Router) برای ارسال درخواست‌های ساده به مدل‌های کوچک (مثل Llama 3 8B) و درخواست‌های پیچیده به مدل‌های پیشرفته.
  • انتقال هزینه‌های متغیر (مانند استخراج داده یا APIهای پیام‌رسان) به صورت مستقیم به مدل قیمت‌گذاری مشتری.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و کاهش هزینه استنتاج در مقیاس صنعتی مراجعه کنید.

چرا این موضوع مهم است؟

این تجربه با تکیه بر تخصص عملی در DevOps، اثبات می‌کند که بهینه‌سازی معماری می‌تواند هزینه‌های استنتاج را تا ۹۹٪ کاهش دهد. این موضوع برای بنیان‌گذاران مستقل (Solo-founders) یک نقشه راه برای بقا در برابر رقبای سرمایه‌دار فراهم می‌کند.

تأثیر برای ایران

به‌دلیل تحریم‌ها، دسترسی به Oracle Cloud برای کاربران ایرانی دشوار است، اما استراتژی مسیریابی مدل‌ها و استفاده از مدل‌های بازمتن روی سرورهای ارزان‌قیمت، برای توسعه‌دهندگان داخلی کاملاً قابل اجرا و سودآور است.

·نگاه ما
تحریریه دات‌هوش

این مدل عملیاتی نشان می‌دهد که در عصر مدل‌های زبانی کوچک (SLM) و بهینه‌سازی شده، گلوگاه استارت‌آپ‌ها دیگر دسترسی به مدل‌های قدرتمند نیست، بلکه انضباط مهندسی در لایه‌های زیرساختی است. رِویچوا با جایگزینی سرمایه مالی با سرمایه انسانی (DevOps)، ثابت کرد که می‌توان بدون جذب سرمایه خطرپذیر، زیرساختی پایدار برای عامل‌های AI ساخت. این یک چرخش از رویکرد «پرتاب پول به سمت GPU» به سمت «معماری دقیق» است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.