跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/SnooPredictions515·· 2 小时前AI 评分64

Slipstream 发布:64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next

Running 95.5 GiB Qwen3.8-Flash-Next at 41–52 tok/s on a 64GB Mac (1.76x faster than llama.cpp): Slipstream release, 130k context scaling, + Swift variant

AI 导读

作者发布 Slipstream,一个面向 Apple Silicon 的 C++ Metal 推理引擎,支持 SSD 专家流式加载与投机解码,在 64GB Mac 上将 95.5 GiB 的 Qwen3.8-Flash-Next 解码速度从 llama.cpp fork 的 23.1 tok/s 提升到平均 40.8 tok/s(1.76x)。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com