热点事件持续更新
单卡R9700跑Qwen3.8-Flash-Next性能实测
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月2日,Reddit r/LocalLLaMA 一位用户发帖,报告在单张 r9700 显卡上使用 exllamav3 的 rocm 分支运行 Qwen3.8-Flash-Next 的实测情况。具体配置为:模型量化采用 exl3 5.05 bpw,上下文长度 262144,KV cache 使用 q8;112 个专家放在 GPU 上,400 个专家放在 CPU 上;开启 mtp drafting,接受率约 53-54%;另有 102gb 的 bf16 ngram 表从 nvme 流式读取。实测结果显示,在 230k 上下文下,prefill 速度为 863 tokens/s,decode 速度为 35 tokens/s。发帖人询问这一速度是否正常,目前帖中尚无后续结论或他人补充数据,事件暂停留在用户提出疑问的阶段,等待社区回应。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- Reddit r/LocalLLaMA (开源AI)单张 r9700 跑 Qwen3.8-Flash-Next exl3:230k 上下文下 prefill 863 t/s、decode 35 t/s,速度正常吗?
一位用户在单张 r9700 上用 exllamav3 rocm 分支运行 Qwen3.8-Flash-Next(exl3 5.05 bpw),262144 上下文、q8 KV cache,112 个专家在 GPU、400 个在 CPU,开启 mtp drafting(接受率约 53-54%),102gb bf16 ngram 表从 nvme 流式读取。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。