Reddit r/LocalLLaMA (开源AI)· /u/swagonflyyyy·· 4 小时前AI 评分36
Ninfer 推理后端实测:Blackwell 上速度远超 llama-server,达 130-180 t/s
Ninfer Stahp
AI 导读
Reddit 用户在 Blackwell MaxQ 上用 Ninfer 后端运行 qwen3.8-27b-nvfp4(Orcarouter - Dflash2 - MTP-7),速度达 130-180 t/s,明显快于 llama-server,并行解码几乎无降速,并发能力可与 vLLM 比肩。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com