跳到正文
热点事件持续更新

闭式轨迹权重手术将Qwen 4B能力迁移至0.8B

2 篇报道1 个报道来源20 小时前更新

先了解这件事

AI 综述

2026年10月6日,Reddit r/LocalLLaMA上一篇开源开发者帖子介绍了一种“闭式轨迹权重手术”方法:在 Qwen 3.5 上进行 4B→0.8B 的能力迁移,全程跳过反向传播,改用正则化最小二乘和谱投影直接求解 MLP 权重更新。据帖子描述,若直接编辑全部 24 层,模型 NLL 会暴涨 64.78%,出现中间层崩溃;改为仅在 0、7、15、23 四个锚点层手术后,模型在 30 个 benchmark 上 held-out NLL 下降 10.8%,HellaSwag 从 54.75% 升至 55.25%。随后同一日,该论坛上一篇新报道称该(报道中称 DynamicTune)方法获得独立验证:无需反向传播或训练 token,在消费级硬件约 12 分钟完成,并称 0.8B 模型在 ARC-Challenge 上达 42.15%,超过 2B 模型。目前事实均来自 Reddit 帖子,暂无官方回应或论文等更多后续报道。

AI 根据报道生成 · 20 小时前更新

事件进展

2 个进展
  1. 10月6日 17:41 · 1 篇报道
    DynamicTune 闭式权重手术让 0.8B 模型在 ARC-Challenge 上超越 2B 模型
    Reddit r/LocalLLaMA (开源AI):0.8B 模型 ARC-Challenge 达 42.15% 超 2B 模型:DynamicTune 免反向传播权重手术获独立验证
  2. 10月6日 16:15 · 1 篇报道
    闭式轨迹权重手术将4B能力迁移至0.8B
    Reddit r/LocalLLaMA (开源AI):闭式轨迹权重手术:将 Qwen 4B 能力迁移到 0.8B 而无需数十亿 token,4 个锚点层如何修复中间层崩溃

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. Reddit r/LocalLLaMA (开源AI)
    0.8B 模型 ARC-Challenge 达 42.15% 超 2B 模型:DynamicTune 免反向传播权重手术获独立验证

    DynamicTune 方法通过闭式线性代数把大模型轨迹迁移进 Qwen3.5-0.8B,无需反向传播或训练 token,在消费级硬件约 12 分钟完成。

  2. Reddit r/LocalLLaMA (开源AI)
    闭式轨迹权重手术:将 Qwen 4B 能力迁移到 0.8B 而无需数十亿 token,4 个锚点层如何修复中间层崩溃

    一名开源开发者在 Qwen 3.5(4B→0.8B)上跳过反向传播,用正则化最小二乘和谱投影直接求解 MLP 权重更新,实现闭式轨迹迁移。直接编辑全部 24 层会让 NLL 暴涨 64.78%,改为仅在 0、7、15、23 四个锚点层手术后,30 个 benchmark 上 held-out NLL 下降 10.8%,HellaSwag 从 54.75% 升至 55.25%。

本事件热度走势

当前热度 6·可比范围峰值 10(10月6日 18:00)·近 24 小时可比范围变化 –

02.557.51010月6日18:0010月7日00:0010月7日07:0010月7日13:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。