پرش به محتوای اصلی

موضوع

مدل‌های بازوزن

Open-source models, open weights, local hosting, licensing

۱٬۲۶۲ مقاله منتشر شده

تست Qwen-AgentWorld-35B-A3B: معیار جدیدی برای استدلال عامل‌محور؟
آموزش کاربردیگزارش تأییدنشده

Qwen-AgentWorld-35B: برتری مدل‌های کوچک در ردیابی وضعیت و ابزار

مدل Qwen-AgentWorld-35B-A3B در ردیابی وضعیت و استفاده از ابزار، عملکردی برتر از مدل‌های بسته و بزرگ‌تر دارد. این مدل با قابلیت بازیابی خطا، گزینه‌ای ایده‌آل برای جریان‌های کاری…

۳ دقیقه خواندن
ابزار Bash برای API گروک: امن، قابل حمل، سازگار با ترموکس
آموزش کاربردی

Bash4LLM دسترسی امن و قابل‌حسابرسی به مدل‌های زبانی را به لینوکس و ترموکس آورد

ابزار Bash4LLM یک پوسته سبک بر پایه Bash برای APIهای Groq است که دسترسی به هوش مصنوعی را در محیط‌های یونیکس و اندروید بدون نیاز به محیط‌های پیچیده پایتون فراهم می‌کند. این ابزار…

۶ دقیقه خواندن
مدل زبانی GPT-2 از صفر در C/CUDA با پس‌انتشار دستی، توکنایزر BPE، FlashAttention، پیش‌آموزش و تنظیم دقیق نظارت‌شده.
آموزش کاربردی

ساخت مدل GPT-2 از صفر با زبان C و CUDA بدون استفاده از کتابخانه‌های ML

پروژه nanoeuler یک خط لوله کامل آموزش مدل زبانی بزرگ را بدون اتکا به فریم‌ورک‌هایی مثل PyTorch پیاده کرده است. این پروژه تمام مراحل از پس‌انتشار دست‌نویس تا تنظیم نظارت‌شده را روی…

۸ دقیقه خواندن
عوامل هوشمند/فناوری: عصر حداکثرسازی توکن تمام شد، زنده‌باد حداکثرسازی توکن
زندگی با AI

صعود «صحت ترکیبی»؛ چرا هزینهٔ توکن حالا به نتیجهٔ مدل گره خورده است؟

استراتژی مصرف انبوه توکن‌ها برای پذیرش هوش مصنوعی، جای خود را به یک ضرورت فنی به نام «صحت ترکیبی» داده است. در مدل‌های جدید، تکرار حلقه‌های پردازشی و صرف هزینهٔ بیشتر برای…

۱۵ دقیقه خواندن