跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/Haunting-Stretch8069·· 21 小时前AI 评分61

在16GB RX 7800 XT上运行Qwen 3.8 27B Q4量化模型的100K上下文实践指南

Qwen 3.8 27B Q4 with 100K context on a 16 GB RX 7800 XT guide

AI 导读

作者在16GB AMD GPU上以Q4量化跑通Qwen 3.8 27B,100K上下文下解码约30 t/s,使用q8_0/q5_1 KV cache和Vulkan版llama.cpp。文中给出完整构建与llama-server启动命令,并引用unsloth/Qwen3.8-27B-GGUF的GGUF模型文件。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com