پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۱۱۲ مقاله منتشر شده

کد عدد اشتباه را گرفت. من باید داستان اشتباه را می‌گرفتم.
آموزش کاربردی

پروتکل لایه‌بندی شواهد؛ راهکار جدید برای توقف توهمات روایتی در سیستم‌های

یک چارچوب ساختاری جدید برای سیستم‌های معاملاتی هوش مصنوعی، «اعداد بد» (خطاهای عددی) را از «روایت‌های بد» (ادعاهای بدون دلیل) تفکیک می‌کند. این پروتکل از ارتقای سطح ادعاها به…

۶ دقیقه خواندن
یادگیری تقویتی با پاداش‌های قابل تأیید: چرا هوش مصنوعی دارد خودش تکالیفش را تصحیح می‌کند
آموزش کاربردی

پژوهش RLVR: جایگزینی بازخوردهای انسانی با تست‌های واحد در کدنویسی

یادگیری تقویتی با پاداش‌های قابل‌تأیید (RLVR) جایگزین بازخوردهای گران‌قیمت انسانی شده و از تست‌های واحد و اثبات‌های ریاضی برای آموزش مدل‌ها استفاده می‌کند. این سازوکار اجازه…

۶ دقیقه خواندن
راهنمای عملی API سازگار با OpenAI در GLM-5.2: تلاش استدلالی، فراخوانی تابع و بازیابی متن طولانی
آموزش کاربردی

راهنمای عملی GLM-5.2: ادغام سه قابلیت کلیدی در جریان‌های کاری پایتون

راهنمای عملی جدیدی نحوه ادغام مدل GLM-5.2 در جریان‌های کاری پایتون را با استفاده از APIهای سازگار با OpenAI نشان می‌دهد. این پیاده‌سازی بر کنترل دقیق تلاش استدلالی، فراخوانی تابع…

۹ دقیقه خواندن
لوگوی Sipcode: ابزاری برای مدیریت هوشمند زمینه Claude Code
آموزش کاربردی

«بهداشت پنجرهٔ زمینه»؛ کلید دستیابی به استدلال دقیق‌تر در مدل‌های زبانی

ابزار متن‌باز Sipcode با بهینه‌سازی بهداشت پنجرهٔ زمینه در Claude Code، نویزهای تکراری و خروجی‌های طولانی ابزارها را حذف می‌کند. داده‌های محصول نشان می‌دهد کاهش این تداخلات، منجر…

۱ دقیقه خواندن
تبلیغ GLM-5.2 با قیمت ارزان: یارانه‌ای، نه کارآمد

درون مکانیسم قیمت‌گذاری GLM-5.2؛ توکن‌های استدلالی پنهان

مدل GLM-5.2 با وجود قیمت پایین‌تر به‌ازای هر توکن، به‌دلیل تولید حجم بالای توکن‌های استدلالی داخلی، تنها ۳۰ تا ۳۵ درصد ارزان‌تر از رقبا تمام می‌شود. این تفاوت نشان می‌دهد که کاهش…

۴ دقیقه خواندن
هوش مصنوعی با یادگیری تقویتی در حال معامله برق برای کسب سود از اختلاف قیمت است.
آموزش کاربردی

شبیه‌سازی آموزشی: یادگیری تقویتی عمیق نوسانات قیمت برق را بهینه کرد

یک پروژه شبیه‌سازی شده نشان می‌دهد که یادگیری تقویتی عمیق چگونه می‌تواند تجارت باتری‌های صنعتی را با پیش‌بینی جهش‌های قیمتی بهینه کند. این سیستم با یادگیری روابط علی میان تقاضای…

۹ دقیقه خواندن۱