跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/soyalemujica·· 2 小时前AI 评分28

多亏 Strata,我在 24GB 显存 + 64GB 内存下从 27B 密集模型换用 Qwen Flash

Thanks to Strata I have quit 27b for Qwen Flash (24gb VRAM plus 64gb ram)

AI 导读

一位用户在 7900xtx 加 64GB ddr5 内存的配置上,借助 Strata 从 27B 密集模型换用 Qwen Flash,即使在 250k 上下文下也能跑到 60t 每秒。该模型在 q8 精度下可容纳更多上下文,指令遵循和前后端任务执行更精准,且不占用全部显存,避免 OOM 报错,同时可边工作边游戏。它在 Windows 11 上运行速度与 Linux 相当,不再需要切换系统。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com