跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/Crampappydime·· 2 小时前AI 评分30

网友发布 Qwen 3.8 flash 低比特量化版本

Qwen 3.8 flash for a single spark

AI 导读

Reddit 用户发布 Qwen 3.8 flash 基础模型的低比特量化版本,保留 95% 的 bf16 精度,且长上下文下性能不衰减。推理速度约 40 tok/s,并为运行 256kl 上下文和 RoPE 留出余量,作者仍在继续优化推理性能。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com