
موتور FreeToken مدل ۷۵۳ میلیارد پارامتری GLM-5.2 را روی یک GPU اجرا کرد
پژوهشگران برکلی و تگزاس با معرفی FreeToken، اجرای مدلهای عظیم ترکیب خبرهها را روی سختافزارهای مصرفکننده ممکن کردند. این موتور با توزیع پویا بین GPU و CPU، سرعت استنتاج را در…










