Reddit r/LocalLLaMA (开源AI)· /u/SignatureMoney6648·· 3 小时前AI 评分45
RTX 3090 实测 FreeToken vs llama.cpp:模型装进显存时 llama.cpp 快 2–3 倍,gpt-oss-120b 多并发下 FreeToken 首 token 快 7 倍
FreeToken vs llama.cpp on one RTX 3090: llama.cpp is 2–3× faster when the MoE fits in VRAM. On gpt-oss-120b (63 GB), FreeToken gets the first token out 7× faster at 32 concurrent users.
AI 导读
一位用户在单张 RTX 3090 上对比了 FreeToken 0.1.2 与 llama.cpp 的推理性能,测试输入 1024 token、输出 256 token,并发 1–32。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com