Reddit r/LocalLLaMA (开源AI)· /u/vox-deorum·· 4 小时前AI 评分47
CivBench:用《文明5》评测大语言模型,GLM-5.3 领先 Opus-5.5
A benchmark for LLMs playing Civilization V. GLM-5.3 is ahead of Opus-5.5, and Qwen-3.8-27B holds up surprisingly well.
AI 导读
研究者发布受控版 CivBench,让大语言模型在《文明V》中同一组固定开局对局,测试其长程决策能力,GLM-5.3 和 Opus-5.5 均取得文化胜利,GLM-5.3 排名靠前,Qwen-3.8-27B 以科学胜利表现亮眼。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com