跳到正文
热点事件持续更新

RTX 5090 上 ninfer 与 llama.cpp 跑 Qwen3.8 27B 速度与质量对比

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月3日,一位网友在 Reddit r/LocalLLaMA 发布实测,在 RTX 5090 上以 Qwen3.8 27B(thinking on xhigh、120k context)为测试对象,用同一提示词对 ninfer 与 llama.cpp 的 4 种配置进行速度与质量对比。结果显示,ninfer 非 NVFP4 版解码速度约 147 tokens/s,而 llama.cpp Q4_K_M 在不开 MTP 时仅约 68 tokens/s,开启 MTP 后可达约 141 tokens/s。据此报道,ninfer 非 NVFP4 版比 llama.cpp(Q4_K_M 无 MTP 配置)快约 2.3 倍,与开启 MTP 的 llama.cpp 速度接近。这是目前唯一的报道,暂无后续进展或质量评分细节披露。

AI 根据报道生成 · 40 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. Reddit r/LocalLLaMA (开源AI)
    实测对比:RTX 5090 上 ninfer 跑 Qwen3.8 27B 比 llama.cpp 快 2.3 倍,4 种配置同提示词测速与质量

    网友在 RTX 5090 上用 Qwen3.8 27B(thinking on xhigh、120k context)对比 ninfer 与 llama.cpp 的 4 种配置:ninfer 非 NVFP4 版解码约 147 tokens/s,而 llama.cpp Q4_K_M 无 MTP 仅约 68 tokens/s,开启 MTP 后可达约 141 tokens/s。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。