Reddit r/LocalLLaMA (开源AI)· /u/SnooPredictions515·· 2 小时前AI 评分64
Slipstream 发布:64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next
Running 95.5 GiB Qwen3.8-Flash-Next at 41–52 tok/s on a 64GB Mac (1.76x faster than llama.cpp): Slipstream release, 130k context scaling, + Swift variant
AI 导读
作者发布 Slipstream,一个面向 Apple Silicon 的 C++ Metal 推理引擎,支持 SSD 专家流式加载与投机解码,在 64GB Mac 上将 95.5 GiB 的 Qwen3.8-Flash-Next 解码速度从 llama.cpp fork 的 23.1 tok/s 提升到平均 40.8 tok/s(1.76x)。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com