Reddit r/MachineLearning· /u/Helpful_Minimum_2214·· 3 小时前AI 评分37
FLEET:在奖励最大化任务中用记忆增强搜索替代重复采样
Adding memory to search instead of sampling in reward maximization tasks [R]
AI 导读
FLEET 是一种增强 Best-of-N 生成的算法,它将外部奖励归因到具体 token,并利用 MCTS 在下一轮调整 logits。在 Llama 3.2 3B 上的测试显示,GSM8K 上以一半迭代次数达到采样基线;LiveCodeBench v6 easy split 在同等预算下分数从 0.59 提升至 0.69,仅用 9 次迭代对 32 次。
来源:Reddit r/MachineLearning · reddit.com