快讯|arXiv 2606.07404:单 8 GPU 节点训出 120B 稀疏 MoE,激活参数仅 5.93B
arXiv 2606.07404(2026-06-05):研究者发布 LightningLM 0.1V 训练报告,在单 8 GPU 节点上从 1.78B dense 种子一路训练到 120B 稀疏 MoE(460 routed experts, top-12 路由)。
关键数字:
- 激活参数 5.93B(占存储的 5%)
- 训练 loss 1.78(120B scale)
- 三项核心方法:可逆循环(reversibility)、状态保持生长、单节点经济性
- 用 TQP(量化基础专家 + 低秩 adapter)将优化器状态从 100B+ 降到 2.26B
对中小团队的意义:百亿级 MoE 不再需要千卡集群,单节点 8 卡就能跑,模型 + tokenizer + 训练代码全部开源。