Reddit r/LocalLLaMA (开源AI)· /u/Biomass23·· 10 小时前AI 评分33
vLLM 通过零值填充实现 tp=6 张卡并行
tp=6 can work on vLLM, with padding
AI 导读
vLLM 的 tensor parallel 通常要求 GPU 数量为 2 的幂,一位用户通过给模型权重零值填充使其可被 6 整除,成功在 6 张 7900 XTX 上以 tp=6 运行 Qwen 3.8 27B(BF16,256k 上下文窗口)。单用户生成速度约 50 t/s,8 路并发时合计约 200 t/s,GPU KV cache 达 520,784 tokens。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com