Reddit r/LocalLLaMA (开源AI)· /u/tabletuser_blogspot·· 4 小时前AI 评分31
GLM-4.7 Flash 量化格式在 Radeon 680M iGPU 上的 benchmark 对比:MXFP4 vs Q4_K_M vs Q4_K_XL
GLM-4.7 benchmark compared MXFP4 vs Q4_K_M vs Q4_K_XL using Radeon 6800H iGPU 680M
AI 导读
在 AMD Ryzen 7 6800H(Radeon 680M iGPU、64GB DDR5)上用 llama.cpp Vulkan 测试 GLM-4.7 Flash 的三种量化版本:MXFP4 MoE 提示处理最快(258.36 t/s),Q4_K_XL 生成最快(13.13 t/s),Q4_K_M 两项均衡(218.22 t/s、12.09 t/s)。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com