Reddit r/LocalLLaMA (开源AI)· /u/ayobluestarr·· 2 小时前AI 评分45
Qwen3.8-Flash-Next 177B 在单张 RTX 5070 12GB + 32GB 内存上跑出 11–15 tok/s
Qwen3.8-Flash-Next 177B running at 11–15 tok/s on a single RTX 5070 12GB + 32GB RAM DDR4
AI 导读
网友在 RTX 5070 12GB + 32GB DDR4 内存上,通过 llama.cpp 专家流式方案本地运行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基准速度约 11.5 tok/s,日常对话达 14–15 tok/s。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com