热点事件持续更新
vLLM 通过权重零填充实现 tp=6 卡并行
1 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
2026年10月1日,Reddit r/LocalLLaMA 版块报道,vLLM 的 tensor parallel 通常要求 GPU 数量为 2 的幂。一位用户通过对模型权重进行零值填充,使权重维度可被 6 整除,从而绕过这一限制,成功在 6 张 AMD 7900 XTX 显卡上以 tp=6 运行 Qwen 3.8 27B 模型(BF16 精度),并启用 256k 上下文窗口。性能方面,单用户生成速度约 50 tokens/秒,8 路并发时合计吞吐约 200 tokens/秒,GPU KV cache 可容纳 520,784 tokens。该报道为此事件的唯一信息来源,暂无后续进展。
AI 根据报道生成 · 3 小时前更新
最新进展10月1日 08:39
用户以权重零填充绕过 2 的幂限制,在 6 张 7900 XTX 上跑通 vLLM tp=6。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- Reddit r/LocalLLaMA (开源AI)vLLM 通过零值填充实现 tp=6 张卡并行
vLLM 的 tensor parallel 通常要求 GPU 数量为 2 的幂,一位用户通过给模型权重零值填充使其可被 6 整除,成功在 6 张 7900 XTX 上以 tp=6 运行 Qwen 3.8 27B(BF16,256k 上下文窗口)。单用户生成速度约 50 t/s,8 路并发时合计约 200 t/s,GPU KV cache 达 520,784 tokens。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。