Multi-Task Learning(MTL,多任务学习)让一个共享模型同时学习多个任务。核心问题是共享可迁移表示,同时控制不同任务之间的 gradient interference、数据不平衡和能力遗忘。

主要路线

  • Joint training:混合多个 task datasets,直接优化共享模型。
  • Sequential training:依次训练不同任务,需要控制 catastrophic forgetting。
  • Multi-teacher distillation:先训练 specialist teachers,再把能力蒸馏到统一 student。
  • Model merging:分别训练 task-specific models,再在 parameter space 合并。

不同路线分别把冲突放在 gradient、training order、teacher policy 或 task-vector geometry 中处理。

与 Model Merging 的关系

Model merging 可以看作 MTL 的一种参数整合路线:它不重新集中所有 task data,而是组合已经训练好的 task models。MetaMerging 进一步将后续 task-specific adapter training 纳入 merging coefficient 的优化目标。

相关知识