پرش به محتوای اصلی
پرش به محتوای مقاله

از صورت‌حساب ماهانه تا هزینه هر گفتگو؛ سازوکار PostHog برای ردیابی توکن‌ها

·۲۶ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه
از صورت‌حساب ماهانه تا هزینه هر گفتگو؛ سازوکار PostHog برای ردیابی توکن‌ها
اشتراک‌گذاری

اگر امروز یک عامل هوش مصنوعی را مدیریت می‌کنید، احتمالاً بخشی از بودجه شما بدون دلیل مشخص در حال سوختن است. تصور کنید یک درخواست ساده از کاربر، به‌دلیل یک حلقه تکرار پنهان، هزینه‌ای معادل ده درخواست دیگر داشته باشد.

این مشکل دقیقاً زمانی رخ می‌دهد که ما از چت‌بات‌های ساده به سمت عامل‌های هوش مصنوعی (AI Agents) — شبیه به کارمندان دیجیتالی که می‌توانند ابزارها را برای انجام یک هدف به کار بگیرند — حرکت می‌کنیم. همان‌طور که در تحلیل قبلی ما درباره‌ی whichllm و اهمیت انتخاب مدل بر اساس بنچمارک‌ها اشاره کردیم، حالا چالش اصلی از «کدام مدل بهتر است» به «هزینه اجرای این مدل در مقیاس واقعی چقدر است» تغییر کرده است. در این میان، مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — همچنان برای بسیاری از تیم‌ها یک نقطه کور مالی است.

در ۱۵ می ۲۰۲۶، شرکت PostHog مجموعه‌ای از ابزارهای تحلیل LLM را منتشر کرد که از طریق SDK مخصوص خود به پروژه‌های پایتون اضافه می‌شوند. طبق مستندات این شرکت، سیستم با جایگزینی کتابخانه استاندارد OpenAI با یک Wrapper (پوشش‌دهنده) عمل می‌کند تا رویدادهای $ai_generation را به‌طور خودکار ثبت کند. این داده‌ها شامل موارد زیر است:

  • هزینه کل ($ai_total_cost): مبلغ دقیق به دلار برای هر فراخوانی.
  • توکن‌های ورودی و خروجی ($ai_input_tokens / $ai_output_tokens): مقدار دقیق توکن (Token) — تکه‌های کوچکی از متن شبیه برش‌های یک کیک که مدل تکه‌تکه می‌خورد.
  • تأخیر ($ai_latency): زمان پاسخ‌دهی به ثانیه.
  • وضعیت HTTP ($ai_http_status): نرخ موفقیت یا شکست درخواست‌ها.

به گزارش PostHog، برای کسانی که از LiteLLM برای مدیریت مدل‌های Anthropic یا Google استفاده می‌کنند، این یکپارچه‌سازی تنها با دو خط کد امکان‌پذیر است.

ارزش واقعی این ابزار در تغییر نگاه از «هزینه هر فراخوانی» به «هزینه هر گفتگو» است. با گروه‌بندی فراخوانی‌ها در قالب ردپاها (Traces)، توسعه‌دهندگان می‌توانند پرامپت‌های «نشکن» یا پرتوقع را پیدا کنند. به نقل از بررسی‌های PostHog، در یک مورد واقعی، کاهش حجم یک پرامپت از ۴۰۰۰ به ۸۰۰ توکن، منجر به کاهش ۸۰ درصدی هزینه‌های آن مسیر خاص شد. این یعنی استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند و شبیه به خودِ آشپزی است — حالا قابل بهینه‌سازی دقیق است.

گام بعدی شما

  • Wrapper جدید PostHog را در محیط تست مستقر کنید تا گران‌ترین حلقه‌های تکرار عامل خود را شناسایی کنید.
  • روند تأخیر P95 را بررسی کنید تا مطمئن شوید انتخاب مدل، تجربه کاربر را تخریب نمی‌کند.
  • پرامپت‌های طولانی را بازبینی کرده و سعی کنید حجم توکن‌های ورودی را کاهش دهید.

اما داستان سخت‌افزاری این بهینه‌سازی‌ها حتی شگفت‌انگیزتر است؛ برای درک رابطه هزینه و سخت‌افزار، به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف ابهامات مالی، به استارتاپ‌ها اجازه می‌دهد مدل‌های تجاری خود را بر اساس داده‌های واقعی استنتاج طراحی کنند. اعتبار این رویکرد در این است که پیش‌بینی هزینه‌ها را از حدس و گمان به علم تبدیل می‌کند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.