跳到正文
热点事件持续更新

RTX 3090 上 FreeToken 与 llama.cpp 推理性能实测对比

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,Reddit r/LocalLLaMA(开源AI板块)一位用户发布了在单张 RTX 3090 上对 FreeToken 0.1.2 与 llama.cpp 的推理性能实测对比。测试条件为输入 1024 token、输出 256 token,并发数覆盖 1 到 32。结果显示:当模型能完全装进显存时,llama.cpp 的速度快 2–3 倍;而在运行 gpt-oss-120b 这类大模型、多并发场景下,FreeToken 的首 token 生成速度比 llama.cpp 快 7 倍。目前该对比仅为该用户的一次实测报告,尚无后续进展或官方回应的报道。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. Reddit r/LocalLLaMA (开源AI)
    RTX 3090 实测 FreeToken vs llama.cpp:模型装进显存时 llama.cpp 快 2–3 倍,gpt-oss-120b 多并发下 FreeToken 首 token 快 7 倍

    一位用户在单张 RTX 3090 上对比了 FreeToken 0.1.2 与 llama.cpp 的推理性能,测试输入 1024 token、输出 256 token,并发 1–32。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。