Reddit r/LocalLLaMA (开源AI)· /u/Spectra-Global·· 5 小时前AI 评分29
用 FFT 替换 AdamW 优化器状态以削减一半 VRAM 微调显存
We swapped AdamW's optimizer states for a Fast Fourier Transform (FFT) to cut VRAM in half. Anyone else trying non-quantization methods?
AI 导读
微调 8B 和 70B 模型时,团队用 FFT 把 AdamW 优化器状态变换到频域、丢弃低影响频率来压缩状态,VRAM 用量约降低 50%,且不依赖会损害收敛的 8-bit 量化。代价是每步训练因 FFT 运算略慢,但可避免 OOM 崩溃并提升消费级 GPU 上的 batch size。团队已开放内部 Colab 环境和基线权重供外界验证。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com