跳到正文
热点事件持续更新

用户发布Qwen3.8 Flash低比特量化版

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,Reddit r/LocalLLaMA 社区有用户发布 Qwen 3.8 flash 基础模型的低比特量化版本。据该帖子介绍,此量化版本保留了 95% 的 bf16 精度,且在长上下文场景下性能不出现衰减。推理速度约为每秒 40 个 token(40 tok/s),并为运行 256k 上下文和 RoPE 留出了余量。发布者表示仍在继续优化推理性能。目前暂无后续评测或其他进展报道。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. Reddit r/LocalLLaMA (开源AI)
    网友发布 Qwen 3.8 flash 低比特量化版本

    Reddit 用户发布 Qwen 3.8 flash 基础模型的低比特量化版本,保留 95% 的 bf16 精度,且长上下文下性能不衰减。推理速度约 40 tok/s,并为运行 256kl 上下文和 RoPE 留出余量,作者仍在继续优化推理性能。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。