跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/empirical-sadboy·· 14 小时前AI 评分37

大模型评测为什么该报告误差棒?

Can we please have some error bars?

AI 导读

一篇 Reddit r/LocalLLaMA 帖子指出,新模型在 benchmark 上仅高几个百分点的提升可能只是测量噪声。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com