论文解读|SETA:用稀疏子空间-专家共享解决 LLM 持续学习的稳定性-可塑性两难

持续学习(Continual Learning)是企业级 LLM 落地的最大拦路虎之一。本周 arXiv 2606.07500 提出了 SETA(Mixture of Sparse Experts for Task Agnostic Continual Learning),在 LLaMA-2 7B 和 Qwen3-4B 上同时改善新任务表现和早期任务保留。

问题:稳定性 vs 可塑性

用 LoRA / 全参数对一个基础 LLM 做连续 SFT 多个任务时,两难是:

  • 学新任务 → 旧任务性能暴跌(灾难性遗忘)
  • 保留旧任务 → 学不动新任务(可塑性不足)

现有方法(EWC / LwF / MoE-LoRA)对所有参数一视同仁,没区分「任务专属知识」和「通用能力」。

SETA 的核心思想

SETA 把参数空间分解为两类专家:

  • 独特专家(Unique Experts):每个任务一个,隔离任务特定模式
  • 共享专家(Shared Experts):跨任务共用,捕获通用能力

配合两个机制:

  1. 自适应弹性锚定(Adaptive Elastic Anchoring):在权重层保护共享知识
  2. 路由感知正则化(Routing-aware Regularization):在路由层保护共享知识

推理时一个统一 gating 网络自动选择正确的专家组合。

实验结果

在多个领域专属 benchmark 上:

  • LLaMA-2 7B:相比 SoTA 持续学习方法,整体性能相当或更好,早期任务保留提升明显
  • Qwen3-4B反向迁移(backward transfer)显著——学新任务后早期任务表现反而上升
  • 专家数:每个任务 1 个独特 + 1-2 个共享,模型体积不爆炸

落地建议

对正在做「行业 LLM 持续微调」(金融 / 医疗 / 法律 / 客服)的团队:

  • 如果已经用 MoE-LoRA 路线,强烈建议试试 SETA 的「独特+共享」专家切分
  • 不要简单用 EWC 这种「参数正则」路线,在大模型上效果有限
  • 关注路由层的正则化,这是 SETA 比 vanilla MoE 强的地方

论文:arXiv:2606.07500

Leave a Comment