热点事件持续更新
RTX 3090 上 FreeToken 与 llama.cpp 推理性能实测对比
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月1日,Reddit r/LocalLLaMA(开源AI板块)一位用户发布了在单张 RTX 3090 上对 FreeToken 0.1.2 与 llama.cpp 的推理性能实测对比。测试条件为输入 1024 token、输出 256 token,并发数覆盖 1 到 32。结果显示:当模型能完全装进显存时,llama.cpp 的速度快 2–3 倍;而在运行 gpt-oss-120b 这类大模型、多并发场景下,FreeToken 的首 token 生成速度比 llama.cpp 快 7 倍。目前该对比仅为该用户的一次实测报告,尚无后续进展或官方回应的报道。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- Reddit r/LocalLLaMA (开源AI)RTX 3090 实测 FreeToken vs llama.cpp:模型装进显存时 llama.cpp 快 2–3 倍,gpt-oss-120b 多并发下 FreeToken 首 token 快 7 倍
一位用户在单张 RTX 3090 上对比了 FreeToken 0.1.2 与 llama.cpp 的推理性能,测试输入 1024 token、输出 256 token,并发 1–32。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。