跳到正文
热点事件持续更新

vLLM 通过权重零填充实现 tp=6 卡并行

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

2026年10月1日,Reddit r/LocalLLaMA 版块报道,vLLM 的 tensor parallel 通常要求 GPU 数量为 2 的幂。一位用户通过对模型权重进行零值填充,使权重维度可被 6 整除,从而绕过这一限制,成功在 6 张 AMD 7900 XTX 显卡上以 tp=6 运行 Qwen 3.8 27B 模型(BF16 精度),并启用 256k 上下文窗口。性能方面,单用户生成速度约 50 tokens/秒,8 路并发时合计吞吐约 200 tokens/秒,GPU KV cache 可容纳 520,784 tokens。该报道为此事件的唯一信息来源,暂无后续进展。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. Reddit r/LocalLLaMA (开源AI)
    vLLM 通过零值填充实现 tp=6 张卡并行

    vLLM 的 tensor parallel 通常要求 GPU 数量为 2 的幂,一位用户通过给模型权重零值填充使其可被 6 整除,成功在 6 张 7900 XTX 上以 tp=6 运行 Qwen 3.8 27B(BF16,256k 上下文窗口)。单用户生成速度约 50 t/s,8 路并发时合计约 200 t/s,GPU KV cache 达 520,784 tokens。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。