热点事件持续更新
RTX 5070 12GB 本地运行 Qwen3.8-Flash-Next 177B 跑出 11–15 tok/s
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026年10月3日,Reddit r/LocalLLaMA(开源AI)有网友发帖称,在一块 RTX 5070 12GB 显卡搭配 32GB DDR4 内存的配置上,通过 llama.cpp 的专家流式方案成功在本地运行 Qwen3.8-Flash-Next 177B 模型,量化版本为 UD-IQ3_XXS。据该网友提供的基准测试数据,模型运行速度约为 11.5 tok/s;而在日常对话场景下,速度可达 14–15 tok/s。这一结果表明,借助专家流式方案和低比特量化,超大参数量模型也能在消费级单卡加普通内存的组合上获得可用的生成速度。目前事件仅有这一条报道,尚无独立复现结果或其他媒体的进一步验证。
AI 根据报道生成 · 50 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- Reddit r/LocalLLaMA (开源AI)Qwen3.8-Flash-Next 177B 在单张 RTX 5070 12GB + 32GB 内存上跑出 11–15 tok/s
网友在 RTX 5070 12GB + 32GB DDR4 内存上,通过 llama.cpp 专家流式方案本地运行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基准速度约 11.5 tok/s,日常对话达 14–15 tok/s。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。