Reddit r/LocalLLaMA (开源AI)· /u/Crampappydime·· 2 小时前AI 评分30
网友发布 Qwen 3.8 flash 低比特量化版本
Qwen 3.8 flash for a single spark
AI 导读
Reddit 用户发布 Qwen 3.8 flash 基础模型的低比特量化版本,保留 95% 的 bf16 精度,且长上下文下性能不衰减。推理速度约 40 tok/s,并为运行 256kl 上下文和 RoPE 留出余量,作者仍在继续优化推理性能。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com