热点事件持续更新
用户发布Qwen3.8 Flash低比特量化版
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月2日,Reddit r/LocalLLaMA 社区有用户发布 Qwen 3.8 flash 基础模型的低比特量化版本。据该帖子介绍,此量化版本保留了 95% 的 bf16 精度,且在长上下文场景下性能不出现衰减。推理速度约为每秒 40 个 token(40 tok/s),并为运行 256k 上下文和 RoPE 留出了余量。发布者表示仍在继续优化推理性能。目前暂无后续评测或其他进展报道。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 19:27
用户发布Qwen3.8 Flash低比特量化版,保留95%精度,仍在优化推理性能。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- Reddit r/LocalLLaMA (开源AI)网友发布 Qwen 3.8 flash 低比特量化版本
Reddit 用户发布 Qwen 3.8 flash 基础模型的低比特量化版本,保留 95% 的 bf16 精度,且长上下文下性能不衰减。推理速度约 40 tok/s,并为运行 256kl 上下文和 RoPE 留出余量,作者仍在继续优化推理性能。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。