Reddit r/LocalLLaMA (开源AI)· /u/Haunting-Stretch8069·· 21 小时前AI 评分61
在16GB RX 7800 XT上运行Qwen 3.8 27B Q4量化模型的100K上下文实践指南
Qwen 3.8 27B Q4 with 100K context on a 16 GB RX 7800 XT guide
AI 导读
作者在16GB AMD GPU上以Q4量化跑通Qwen 3.8 27B,100K上下文下解码约30 t/s,使用q8_0/q5_1 KV cache和Vulkan版llama.cpp。文中给出完整构建与llama-server启动命令,并引用unsloth/Qwen3.8-27B-GGUF的GGUF模型文件。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com