热点事件持续更新
RTX 5090 上 ninfer 与 llama.cpp 跑 Qwen3.8 27B 速度与质量对比
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月3日,一位网友在 Reddit r/LocalLLaMA 发布实测,在 RTX 5090 上以 Qwen3.8 27B(thinking on xhigh、120k context)为测试对象,用同一提示词对 ninfer 与 llama.cpp 的 4 种配置进行速度与质量对比。结果显示,ninfer 非 NVFP4 版解码速度约 147 tokens/s,而 llama.cpp Q4_K_M 在不开 MTP 时仅约 68 tokens/s,开启 MTP 后可达约 141 tokens/s。据此报道,ninfer 非 NVFP4 版比 llama.cpp(Q4_K_M 无 MTP 配置)快约 2.3 倍,与开启 MTP 的 llama.cpp 速度接近。这是目前唯一的报道,暂无后续进展或质量评分细节披露。
AI 根据报道生成 · 40 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- Reddit r/LocalLLaMA (开源AI)实测对比:RTX 5090 上 ninfer 跑 Qwen3.8 27B 比 llama.cpp 快 2.3 倍,4 种配置同提示词测速与质量
网友在 RTX 5090 上用 Qwen3.8 27B(thinking on xhigh、120k context)对比 ninfer 与 llama.cpp 的 4 种配置:ninfer 非 NVFP4 版解码约 147 tokens/s,而 llama.cpp Q4_K_M 无 MTP 仅约 68 tokens/s,开启 MTP 后可达约 141 tokens/s。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。