快讯|arXiv 2606.07404:单 8 GPU 节点训出 120B 稀疏 MoE,激活参数仅 5.93B

arXiv 2606.07404(2026-06-05):研究者发布 LightningLM 0.1V 训练报告,在单 8 GPU 节点上从 1.78B dense 种子一路训练到 120B 稀疏 MoE(460 routed experts, top-12 路由)。

关键数字:

  • 激活参数 5.93B(占存储的 5%)
  • 训练 loss 1.78(120B scale)
  • 三项核心方法:可逆循环(reversibility)、状态保持生长、单节点经济性
  • 用 TQP(量化基础专家 + 低秩 adapter)将优化器状态从 100B+ 降到 2.26B

对中小团队的意义:百亿级 MoE 不再需要千卡集群,单节点 8 卡就能跑,模型 + tokenizer + 训练代码全部开源。

Leave a Comment