论文解读|SETA:用稀疏子空间-专家共享解决 LLM 持续学习的稳定性-可塑性两难
持续学习(Continual Learning)是企业级 LLM 落地的最大拦路虎之一。本周 arXiv 2606.07500 提出了 SETA(Mixture of Sparse Experts for Task Agnostic Continual Learning),在 LLaMA-2 7B 和 Qwen3-4B 上同时改善新任务表现和早期任务保留。
问题:稳定性 vs 可塑性
用 LoRA / 全参数对一个基础 LLM 做连续 SFT 多个任务时,两难是:
- 学新任务 → 旧任务性能暴跌(灾难性遗忘)
- 保留旧任务 → 学不动新任务(可塑性不足)
现有方法(EWC / LwF / MoE-LoRA)对所有参数一视同仁,没区分「任务专属知识」和「通用能力」。
SETA 的核心思想
SETA 把参数空间分解为两类专家:
- 独特专家(Unique Experts):每个任务一个,隔离任务特定模式
- 共享专家(Shared Experts):跨任务共用,捕获通用能力
配合两个机制:
- 自适应弹性锚定(Adaptive Elastic Anchoring):在权重层保护共享知识
- 路由感知正则化(Routing-aware Regularization):在路由层保护共享知识
推理时一个统一 gating 网络自动选择正确的专家组合。
实验结果
在多个领域专属 benchmark 上:
- LLaMA-2 7B:相比 SoTA 持续学习方法,整体性能相当或更好,早期任务保留提升明显
- Qwen3-4B:反向迁移(backward transfer)显著——学新任务后早期任务表现反而上升
- 专家数:每个任务 1 个独特 + 1-2 个共享,模型体积不爆炸
落地建议
对正在做「行业 LLM 持续微调」(金融 / 医疗 / 法律 / 客服)的团队:
- 如果已经用 MoE-LoRA 路线,强烈建议试试 SETA 的「独特+共享」专家切分
- 不要简单用 EWC 这种「参数正则」路线,在大模型上效果有限
- 关注路由层的正则化,这是 SETA 比 vanilla MoE 强的地方