跳到正文
热点事件持续更新

16GB AMD显卡跑通Qwen 3.8 27B Q4实现100K上下文

1 篇报道1 个报道来源21 小时前更新

先了解这件事

AI 综述

2026年9月29日,Reddit r/LocalLLaMA 用户发布实践指南,介绍在16GB显存的RX 7800 XT上运行Qwen 3.8 27B的Q4量化模型,并实现100K上下文。据该报道,作者使用Vulkan版llama.cpp,配合q8_0/q5_1的KV cache,在100K上下文下解码速度约30 t/s。指南中给出了完整的构建步骤与llama-server启动命令,并引用unsloth/Qwen3.8-27B-GGUF仓库的GGUF模型文件。目前该事件仅有这一篇报道,尚无后续进展或争议信息。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月29日
  1. Reddit r/LocalLLaMA (开源AI)
    在16GB RX 7800 XT上运行Qwen 3.8 27B Q4量化模型的100K上下文实践指南

    作者在16GB AMD GPU上以Q4量化跑通Qwen 3.8 27B,100K上下文下解码约30 t/s,使用q8_0/q5_1 KV cache和Vulkan版llama.cpp。文中给出完整构建与llama-server启动命令,并引用unsloth/Qwen3.8-27B-GGUF的GGUF模型文件。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。