跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/ayobluestarr·· 2 小时前AI 评分45

Qwen3.8-Flash-Next 177B 在单张 RTX 5070 12GB + 32GB 内存上跑出 11–15 tok/s

Qwen3.8-Flash-Next 177B running at 11–15 tok/s on a single RTX 5070 12GB + 32GB RAM DDR4

AI 导读

网友在 RTX 5070 12GB + 32GB DDR4 内存上,通过 llama.cpp 专家流式方案本地运行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基准速度约 11.5 tok/s,日常对话达 14–15 tok/s。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com