اگر امروز یک چتبات صنعتی میسازید که تنها بر پایه پرامپت کار میکند، باید بدانید که سیستم شما در اولین مواجهه با پیچیدگی شکست میخورد. بدون مدیریت صریح گفتگو، هدف کاربر بهسرعت گم میشود و هزینههای API با رشد طول نشستها بهشدت افزایش مییابد.
به نقل از راهنمای فنی منتشر شده در ۲۶ اوت ۲۰۲۶ توسط dev.to، تنها راه حل این است که خروجیهای احتمالی هوش مصنوعی زاینده (Generative AI) را درون ماشینهای وضعیت قطعی (Deterministic State Machines) محصور کنیم.
همانطور که در تحلیل قبلی ما دربارهی نقاط ضعف مدلهای زبانی در انجام تکالیف ساده اشاره کردیم، «بیوضعیتی» (Statelessness) بزرگترین مانع است. مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — در تولید متن آزاد عالی است، اما حافظه ذاتی ندارد. مدل نمیداند آیا پیشتر آدرس ارسال را پرسیده یا تاییدیه بازگشت وجه را گرفته است. مدیریت گفتگو مانند یک داربست عمل میکند تا جایگاههای خالی (Slots) را ردیابی کرده و منطق کسبوکار را اجرا کند، در حالی که مدل فقط بر تولید زبان تمرکز میکند.
لایههای معماری
یک معماری مستحکم از چهار لایه مجزا تشکیل شده است:
- لایه رابط (Interface Layer): مدیریت ورودی کاربر و آداپتورهای پلتفرم.
- لایه NLU: تحلیل قصد کاربر و استخراج موجودیتها.
- مدیریت گفتگو (Dialogue Manager): حفظ وضعیت و تصمیمگیری برای اقدام بعدی.
- لایه LLM: تولید پاسخ نهایی به زبان طبیعی.
در سیستمهای مدرن، مدل زبانی اغلب بخش NLU را از طریق طبقهبندی قصد با نمونههای اندک (Few-shot) و خروجیهای JSON مدیریت میکند، اما مدیر گفتگو همچنان تنها حفاظ (Guardrail) اصلی است. این ساختار دقیقاً همان منطقی است که در بررسی معماری ۴لایه Oxlo.ai برای کنترل حافظه و وضعیت عاملها به تفصیل مورد بحث قرار دادیم.
پیادهسازی وضعیت و ابزارها
ردیابی وضعیت میتواند از یک دیکشنری ساده در پایتون تا یک پایگاهداده گرافی پیچیده متغیر باشد. برای اکثر برنامهها، یک شیء وضعیت در حافظه (In-memory) که با شناسه نشست (Session ID) کلیدگذاری شده، کافی است. مدیر گفتگو این وضعیت را بهعنوان یک بلوک متنی ساختاریافته به پرامپت میفرستد و بر اساس خروجی JSON مدل، جایگاهها را بهروز میکند.
برای جلوگیری از توهم (Hallucination) — وقتی مدل با اطمینان چیزی میگوید که اصلاً وجود ندارد، شبیه دوستی که خاطرهای را اشتباه تعریف میکند — در اقدامات حساس (مثل رزرو پرواز توکیو)، توسعهدهندگان باید از فراخوانی تابع (Function Calling) استفاده کنند. به جای اینکه مدل تاییدیه را جعل کند، باید یک فراخوانی تابع صادر کند که مدیر گفتگو آن را اعتبارسنجی و اجرا نماید. پلتفرم Oxlo.ai از استفاده از ابزار در مدلهای خود پشتیبانی میکند تا مدیر گفتگو بتواند پیش از تایید نهایی، طرحهای (Schemas) خاص برای جستوجوی CRM یا APIهای رزرو را اجرا کند. این قابلیت به کسبوکارهای کوچک اجازه میدهد تا بدون استخدام نیروی جدید، پشتیبانی خود را از طریق چتباتهای یکپارچه مقیاسپذیر کنند.
بهینهسازی هزینه و انتخاب مدل
گفتگوهای چندمرحلهای بهسرعت توکن (Token) — تکههای کوچکی از متن، مثل برشهای یک کیک طولانی که مدل تکهتکه میخورد — را انباشته میکنند و هزینهها را بهصورت نمایی افزایش میدهند. با این حال، Oxlo.ai از قیمتگذاری مبتنی بر درخواست (Request-based) استفاده میکند؛ یعنی هزینه هر فراخوانی API ثابت است، فارغ از طول پرامپت. این یعنی توسعهدهنده میتواند بدون نگرانی از شمارنده توکنها، تمام وضعیت نشست و مثالهای Few-shot را در هر نوبت ارسال کند.
بهرهوری واقعی مستلزم مسیریابی وظایف به مدل مناسب است. طبقهبندیهای ساده باید به مدلهای سبک سپرده شوند و استدلالهای پیچیده برای مدلهای پیشرو رزرو شوند. ابزارهای موجود عبارتاند از:
- Llama 3.3 70B: برای چتهای عمومی و پیروی دقیق از دستورات.
- Qwen 3 32B: برای عاملهای چندزبانه و جریانهای کاری ابزارمحور.
- DeepSeek R1 671B MoE یا Kimi K2.6: برای استدلال عمیق و کمکهای پیشرفته کدنویسی.
- DeepSeek V4 Flash: برای چتهای اسنادی طولانی با پنجره زمینه (Context Window) یک میلیون توکنی.
از آنجا که این مدلها از طریق یک نقطه اتصال (Endpoint) سازگار با OpenAI ارائه میشوند، جابهجایی بین مدلها در هر نوبت تنها با تغییر یک رشته متنی (Model String) ممکن است.
این چرخش معماری، «هوش» بات را از پرامپت به طراحی سیستم منتقل میکند. وقتی مالکیت وضعیت گفتگو در کد باشد، نه در پنجره متنی، پیشبینیپذیری و مقیاسپذیری تضمین میشود.
گام بعدی شما
- پیادهسازی یک الگوی حداقلی برای حفظ وضعیت (State) و انتخاب پویا یا ابزارها در باتهای پشتیبانی.
- تست مدلهای مختلف کتابخانه Oxlo.ai برای بررسی نحوه مدیریت یک طرح JSON واحد جهت بهروزرسانی وضعیت.
- جایگزینی بخشهای استدلالی سنگین با مدلهای Flash برای کاهش تأخیر در پاسخدهی.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو