本页目录 SFT Conflicts, RL Coexists

SFT Conflicts, RL Coexists

基于 Hugging Face Daily Papers 2026-08-10 榜首论文,深入解析多任务后训练中 SFT 冲突与 RL 共存的参数几何、梯度干扰上界和 Parallel-RL,并结合四类推理任务、两种模型规模、PPO/GRPO 消融审视结论的适用边界。

自动研究时间:2026-08-11 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Aug 10,列表最顶部为 SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs;详情页标注 #1 Paper of the day
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv v2 摘要页 -> arXiv 38 页完整 PDF 与官方 HTML 全文(正文、理论证明、实验细节、扩展实验和案例)-> 官方代码仓库。

执行摘要

大语言模型的多任务后训练通常沿两条路展开:Supervised Fine-Tuning(SFT)直接拟合专家答案,Reinforcement Learning(RL)则从模型自己的采样中按奖励调整策略。两者在单任务上都能提升能力,但这篇论文发现,一旦把数学、科学、代码和逻辑按阶段连续训练,结果会出现明显分叉:多阶段 SFT 相对基座模型平均下降 23.1%,多阶段 RL 却平均提升 24.9%。单任务交叉评测也显示,SFT 虽让目标任务平均提升 4.0%,却令未训练任务平均下降 5.1%;RL 让目标任务提升 6.8% 的同时,其他任务还平均提升 2.3%。作者把这种现象概括为 SFT Conflicts, RL Coexists

论文的解释不是停留在“RL 更能泛化”。参数分析显示,RL 的更新范数约为 3×1023\times10^{-2},SFT 则约为 7.4;RL 中仅约 20% 的参数更新幅度超过 10510^{-5},SFT 中这一比例为 93%。不同任务的 RL 更新余弦相似度约为 10510^{-5},近似正交;SFT 则在 10110^{-1} 到 1.0 的量级,并出现方向相反的任务对。换言之,SFT 在多个任务间反复改动同一大片参数,而 RL 更像是在高维空间中写入稀疏、低重叠的任务增量。

作者进一步把差异归因于两个机制。SFT 从固定专家分布采样,是 off-policy 拟合;RL 从当前策略采样,并由标准化 advantage 加权。GRPO 的组内 advantage 和为零,会代数消去各 rollout 共享的平均 score-function 方向,只留下组内残差。由此,SFT 的跨任务干扰上界受绝对梯度范数控制,而 RL 的上界受组内 rollout 方差控制。实测 score-function 范数约为 SFT 7.1、RL (10^{-1}),RL 的残差范数仅约 (10^{-2}),与这套解释一致。

基于“任务更新近似正交”,论文提出 Parallel-RL:为不同任务从同一基座独立训练,再对任务增量求和、平均、TIES 合并或 SVD 稀疏合并。1.5B 全参数 GRPO 实验中,直接求和保留了单任务 RL 94.2% 的效果;仅用原训练集 5% 做合并后适配,平均相对基座提升 10.7%,达到单任务 RL 的 103.2%。7B 上,直接求和保留 95.1%,TIES 保留 97.8%,适配版本保留 102.4%。

不过,论文标题中的“RL 共存”不是无条件定律。附录给出反例:SynLogic 游戏任务与数学、代码更新发生明显重叠,合并后相关任务下降 3.3%–6.0%。更高采样温度虽然改善单任务探索,却扩大组内方差和跨任务干扰,Parallel-RL 在约 0.65 附近才取得最佳折中。理论证明依赖任务独立、残差近零均值和弱耦合等条件;实验也只覆盖同一 DeepSeek-R1-Distill-Qwen 模型族、四个可验证推理域,未验证开放式生成、偏好对齐或异构模型。因而,本工作的真正价值是提供了一套“先测更新几何,再决定能否并行训练和合并”的工程框架,而不是证明所有 RL 能力都可以自由拼装。

1. 论文基本信息

项目内容
论文标题SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning Paradigms for LLMs
论文编号arXiv:2608.03573
arXiv 版本v2,2026-08-06 修订;v1 于 2026-08-04 提交
Hugging Face 状态2026-08-10 Daily Papers 榜首,#1 Paper of the day
作者Kejian Zhu、Zhuoran Jin、Shangqing Tu、Hongbang Yuan、Yushi Bai、Kang Liu、Juanzi Li、Jun Zhao
机构中国科学院自动化研究所、中国科学院大学、清华大学
学科分类Computation and Language(cs.CL)、Machine Learning(cs.LG)
基础模型DeepSeek-R1-Distill-Qwen-1.5B、DeepSeek-R1-Distill-Qwen-7B
任务域数学、科学、代码、逻辑
训练算法SFT、GRPO;扩展实验覆盖 PPO
计算资源单机 8 张 NVIDIA A100 80GB

核心链接:

2. 背景与动机:多任务后训练为何走向两种范式

2.1 Mixed-Data 与 Multi-Stage

多任务训练有两种直接组织方式:

范式做法优点主要风险
Mixed-Data把多任务样本混入同一批训练每步都能看到各任务,减少顺序遗忘采样比例、梯度尺度和奖励难度可能失衡
Multi-Stage每一阶段集中训练一个任务易于追加新能力,也便于独立调度后一阶段可能覆盖前一阶段能力

SFT 实践通常选择 Mixed-Data,因为连续拟合不同专家轨迹容易导致灾难性遗忘。RL 训练则经常把任务按阶段展开,甚至为不同任务使用独立环境和奖励。论文要回答的核心问题是:这种工程习惯只是偶然经验,还是来自两类目标函数的内在差异?

2.2 不能只看目标任务得分

如果数学 SFT 后数学分数上升,通常会被视为训练有效;但多任务模型还需要检查科学、代码和逻辑是否受损。作者因此采用交叉评测:每次只训练一个任务,却在四个域上全部测试。这个设计把“目标任务学习能力”和“对已有能力的副作用”分开,正是发现 SFT conflicts 与 RL coexists 的关键。

2.3 从行为差异追到参数几何

单看最终准确率无法区分多种解释:RL 可能只是学习率更小、更新更少,也可能真的使用了不同子空间。论文沿着一条完整证据链推进:

  1. 比较 Mixed-Data 与 Multi-Stage 的结果;
  2. 做单任务训练后的跨域评测;
  3. 测量任务增量 ΔWi\Delta W_i 的范数、稀疏度与余弦相似度;
  4. 从 SFT 与 GRPO 梯度公式解释差异;
  5. 推导跨任务梯度内积上界;
  6. 利用近似正交性构造 Parallel-RL,并通过合并与移除任务增量做验证。

这使 Parallel-RL 不是凭经验拼接 checkpoint,而是前面行为、参数与理论分析的应用出口。

3. 核心贡献

3.1 发现并量化多任务 SFT/RL 的范式分叉

论文同时比较混合训练、阶段训练和单任务迁移,表明 SFT 的问题不只是最终阶段遗忘:单任务 SFT 本身就会对未训练域产生负迁移;RL 的目标域增益则大多能与其他能力共存。

3.2 给出参数级证据

作者把每个任务训练后的权重减去相同基座,得到任务更新向量 ΔWi\Delta W_i。范数衡量“改了多少”,阈值稀疏度衡量“改动覆盖多广”,任务间余弦相似度衡量“是否在争夺相同方向”。三项指标共同支持 RL 更新更小、更稀疏、更接近正交。

3.3 将干扰解释为 norm-limited 与 variance-limited

论文把跨任务梯度内积作为干扰量。SFT 上界取决于专家 score function 的绝对范数;GRPO 中,标准化 advantage 消去共同均值方向,干扰仅由 rollout 组内残差方差决定。这把“RL 更新较温和”的经验判断变成了可测量的理论条件。

3.4 提出可并行、可组合的 Parallel-RL

当任务更新足够独立时,各任务可以从同一基座并行训练,最后合并增量。这样不必等待串行阶段,也不必在每次加入任务时重新构造全量混合数据。移除某个增量主要损害对应任务、几乎不影响其他任务的消融,为能力模块化提供了直接证据。

4. 方法详解

4.1 SFT 与 RL 的梯度差别

πθ\pi_\theta 为当前策略,πexpert\pi_{\text{expert}} 为专家分布。两类期望梯度可概括为:

gSFT=ExD,yπexpert[θlogπθ(yx)],g_{\text{SFT}} =\mathbb{E}_{x\sim\mathcal D,\,y\sim\pi_{\text{expert}}} \left[\nabla_\theta\log\pi_\theta(y\mid x)\right], gRL=ExD,yπθ[A(x,y)θlogπθ(yx)].g_{\text{RL}} =\mathbb{E}_{x\sim\mathcal D,\,y\sim\pi_\theta} \left[A(x,y)\nabla_\theta\log\pi_\theta(y\mid x)\right].

差异有两层:

  • Policy Source:SFT 要追逐外部专家轨迹,当前模型即使认为该轨迹概率很低,也必须扩大其概率;RL 只在当前策略能采样到的区域内重分配概率。
  • Advantage Weighting:SFT 对专家 token 做同向似然提升;RL 既强化高于组均值的 rollout,也压低低于组均值的 rollout。

作者借用 RL’s Razor 的结果解释更新幅度:在适当条件下,on-policy policy gradient 偏向满足奖励约束且与初始策略 KL 距离最小的解。SFT 没有这种隐式“就近修正”约束,可能需要跨越较大的分布距离来拟合专家。

4.2 GRPO 如何消去共享方向

对任务 ii 的一个输入,GRPO 采样 GG 条 rollout:

gi(x)=1Gk=1GA^i,kSi,k(x),Si,k(x)=θlogπθ(ykx).g_i(x)=\frac{1}{G}\sum_{k=1}^{G}\hat A_{i,k}S_{i,k}(x), \quad S_{i,k}(x)=\nabla_\theta\log\pi_\theta(y_k\mid x).

标准化 advantage 满足 kA^i,k=0\sum_k\hat A_{i,k}=0。把 score function 分解为组均值和残差:

Si,k=Sˉi+δSi,k,S_{i,k}=\bar S_i+\delta S_{i,k},

则有:

kA^i,kSi,k=SˉikA^i,k+kA^i,kδSi,k=kA^i,kδSi,k.\sum_k\hat A_{i,k}S_{i,k} =\bar S_i\sum_k\hat A_{i,k} +\sum_k\hat A_{i,k}\delta S_{i,k} =\sum_k\hat A_{i,k}\delta S_{i,k}.

所有 rollout 共享的密集均值方向被严格消去,只剩“同一 prompt 下不同采样彼此有何差异”。由于这些残差来自固定输入、固定当前策略下的组内变化,通常小于追逐外部专家所需的完整 score function。不同任务的残差若近似独立、零均值且稀疏,在高维空间中也更容易接近正交。

4.3 梯度干扰上界

论文用两个任务梯度的期望内积表示干扰。若 SFT 专家 score 范数的二阶矩由 Mi2M_i^2 控制,而 RL 组内残差方差由 Vi2V_i^2 控制,则:

ISFT(i,j)MiMj,|\mathcal I_{\text{SFT}}(i,j)|\le M_iM_j, IRL(i,j)ViVj.|\mathcal I_{\text{RL}}(i,j)|\le V_iV_j.

这并没有直接证明 ViVj<MiMjV_iV_j<M_iM_j;它指出应比较什么。论文随后测得 SFT 的 S27.1\lVert S\rVert_2\approx7.1,RL 的 S2101\lVert S\rVert_2\approx10^{-1}δS2102\lVert\delta S\rVert_2\approx10^{-2},才把理论条件与实验量级连接起来。

还要注意,“近似正交”来自统计与几何条件,不是 GRPO 的无条件保证。若两个任务的残差子空间本身强耦合,VV 很大,或 rollout 之间共享结构没有被充分抵消,RL 仍会冲突。

4.4 Parallel-RL 的训练与合并

对任务集合 T={T1,,TN}\mathcal T=\{T_1,\dots,T_N\},每个任务都从同一基座 WbaseW_{\text{base}} 独立训练,得到:

ΔWi=WiWbase.\Delta W_i=W_i-W_{\text{base}}.

最终参数为:

Wfinal=Wbase+M(ΔW1,,ΔWN).W_{\text{final}}=W_{\text{base}}+ \mathcal M(\Delta W_1,\dots,\Delta W_N).

论文比较四类实现:

方法合并逻辑目的
Naive sum直接求和任务增量最大程度保留每个任务的更新幅度
Naive mean对任务增量取平均控制总更新尺度
TIES裁剪小幅更新并处理符号冲突显式减小参数干扰
SVD每个更新只保留 rank-1 方向提取低秩主方向后再合并
Adapted求和后用原训练量 5% 快速适配重新校准合并策略的输出概率

这里的并行不仅是节省 wall-clock 时间。任务模型可以独立调度、独立复用和按需组合,但前提是先确认任务兼容,并为单任务探索强度选择合适配置。

5. 实验设计

5.1 数据与评测

任务SFT 训练数据RL 训练数据评测
数学OpenR1-Math-220k 子集DeepScaleR-Preview 子集MATH500、AIME2025
科学AM-Thinking-v1-Distilled 子集同数据集科学部分子集六个科学相关 MMLU 子域、GPQA-Diamond
代码AM-DeepSeek-Distilled-40M 子集DeepCoder-Preview 子集LiveCodeBench
逻辑Knights-and-Knaves,使用 DeepSeek-R1 蒸馏 LongCoTKnights-and-Knaves 子集Knights-and-Knaves

AIME2025 样本较少,论文报告 16 次测试的 avg@16。SFT 使用 LLaMA-Factory,学习率 10510^{-5}、8K 截断;RL 使用 VeRL/GRPO,学习率 3×1063\times10^{-6}、温度 0.6、top-p 0.95、每个 prompt 16 条 rollout、最大输出 8K,并刻意关闭 KL penalty。LoRA 实验使用 rank 64、alpha 32;多阶段顺序固定为数学、科学、代码、逻辑。

5.2 需要留意的可比性

SFT 与 RL 使用的是“更适合各自范式”的不同训练数据,目标函数、学习率与采样流程也不同。这个选择贴近真实后训练实践,却意味着结果不是严格控制所有变量后的纯算法对照。论文通过参数尺度、score function、LoRA/全参数和 PPO/GRPO 扩展实验补强机制证据,但仍不能把全部差异唯一归因于 on-policy 与 advantage normalization。

6. 核心实验结果

6.1 多阶段训练与单任务迁移

在 1.5B LoRA 的初步实验中:

对比SFTRL
Mixed-Data 相对基座平均变化+7.4%+12.6%
Multi-Stage 相对基座平均变化-23.1%+24.9%
单任务训练:目标域平均变化+4.0%+6.8%
单任务训练:未训练域平均变化-5.1%+2.3%

最显眼的 SFT 崩塌出现在逻辑:基座 31.0,多阶段 SFT 仅 9.0;多阶段 RL 则达到 43.0。与此同时,代码 RL 后数学从 82.0 小幅降至 81.6,说明“共存”是总体趋势,不是每一个任务对都正迁移。

6.2 参数与 score-function 量级

指标SFTRL解读
参数更新平均 L2 范数7.43×1023\times10^{-2}RL 小两个数量级以上
更新幅度大于 10510^{-5} 的参数比例93%20%RL 更新更稀疏
跨任务更新余弦相似度10110^{-1} 到 1.010510^{-5}RL 更新近似正交
score-function 范数约 7.110110^{-1}SFT 绝对梯度更大
组内残差范数不适用10210^{-2}RL 干扰上界较小
跨任务 score 余弦相似度10110^{-1}10310^{-3}与参数结果方向一致

这组数字构成论文最重要的机制证据。不过,余弦相似度很小既可能来自方向独立,也可能部分来自更新本身很小;因此同时报告范数、稀疏度和实际合并效果是必要的。

6.3 Parallel-RL 主结果

下面汇总论文按六个评测指标计算的平均统计量:

模型与方法相对基座平均提升对单任务 RL 的保留率
1.5B Naive Parallel-SFT(sum)-9.2%65.4%
1.5B Naive Parallel-RL(sum)+6.6%94.2%
1.5B TIES Parallel-RL+8.0%97.4%
1.5B Adapted Parallel-RL+10.7%103.2%
7B Naive Parallel-SFT(sum)-16.4%66.6%
7B Naive Parallel-RL(sum)+3.3%95.1%
7B TIES Parallel-RL+5.1%97.8%
7B Adapted Parallel-RL+8.0%102.4%

“保留率超过 100%”不表示合并模型在每个任务都超过专用模型,而是六项指标的平均统计。1.5B Adapted 版本在 MATH500、AIME2025、GPQA、逻辑和 LiveCodeBench 上超过对应单任务基线,但 MMLU 仍低 0.9;7B Adapted 的 LiveCodeBench 也低 0.8。

6.4 消融、算法迁移与 Pass@K

  • 从 1.5B Naive Parallel-RL 中移除某一任务增量,对目标任务平均造成 7.1% 的下降,而其他任务平均上升 0.6%。这说明增量确实具有较强任务局部性。
  • LoRA GRPO 下,直接求和保留约 98% 的单任务效果,Adapted 版本约为 103%;低秩参数化进一步限制了可冲突的更新空间。
  • 全参数 PPO 下,Naive Parallel-RL 相对基座平均提升 5.3%,Adapted 提升 9.1%,但求和保留率 92.9%,低于 GRPO 的 94.2%。论文将其归因于 PPO 的优势不具备 GRPO 那样严格的组内零和性质。
  • Pass@K 结果显示,Naive Parallel-RL 与单任务模型的差距随采样数增加而缩小,多数任务在 Pass@16 接近。这意味着能力可能仍在合并模型的采样分布中,只是 Pass@1 概率没有对齐,也解释了少量 post-merge adaptation 为何有效。

7. 局限与批判性分析

7.1 “RL 共存”有明确反例

附录把 SynLogic 的游戏推理任务分别与数学、代码模型合并。Game + Math 使数学下降 4.0%、游戏下降 6.0%;Game + Code 使代码下降 3.3%、游戏下降 4.9%。对应 score-function 分布也出现明显重叠。这一反例非常重要:Parallel-RL 需要任务选择器,不能把“高维近似正交”当作默认事实。

作者用 t-SNE 分离度作为任务兼容性的初步启发式,但 t-SNE 会扭曲全局距离,结果也依赖采样和超参数。更可靠的上线门禁应直接统计原空间的梯度内积、残差方差、合并后小规模验证集损失,以及多随机种子置信区间。

7.2 探索与干扰存在结构性权衡

把数学 rollout 温度从 0.4 提高到 0.8 会改善单任务探索,却也扩大组内方差 VV,从理论上抬高跨任务干扰上界。Parallel-RL 准确率呈先升后降,在约 0.65 附近最佳。由此可见,单任务 checkpoint 各自最优,并不意味着它们的合并最优;并行训练需要共享一套面向可合并性的超参数治理。

该温度实验因资源限制只用 LoRA 和数据子集完成,论文没有给出完整数表与误差区间,所以它更像支持机制的趋势证据,而非已确定的普适最优温度。

7.3 理论依赖理想化条件

variance-limited 上界建立在组内标准化、残差方差有界等条件上;“不同任务残差近似独立零均值”是关键直觉,却不一定适用于语义相近或共享推理模板的任务。上界只控制期望内积的绝对值,也不直接给出有限步优化中的遗忘量。优化器状态、非线性路径、训练数据顺序和长期参数漂移,都可能让一次梯度分析与最终模型行为分离。

7.4 实验范围仍窄

  • 基础模型仅为同一模型族的 1.5B 与 7B,尚未覆盖更大规模或不同架构。
  • 四个任务均有较清晰的可验证答案,结论未延伸到开放式写作、偏好对齐、对话安全或多模态任务。
  • 多阶段任务顺序固定为数学、科学、代码、逻辑,没有系统遍历顺序效应。
  • 论文未报告主要表格的多随机种子置信区间,也没有提供训练吞吐、总 GPU 小时和并行后实际 wall-clock 节省。
  • SFT 与 RL 使用不同训练集,虽然符合各自常见实践,但削弱了严格因果归因。
  • 官方仓库自称 preliminary release,并说明部分环境细节、reward verifier 与分布式执行路径仍待完善;当前更适合审阅分析与合并工具,而不是视为一键复现实验包。

7.5 Adapted Parallel-RL 不是零成本合并

最强结果来自 5% 数据的合并后适配,而不是纯参数运算。虽然远少于重新全量训练,但仍需要保留跨任务样本、奖励器与 RL 基础设施。若新任务不断加入,旧任务是否要重复参与适配、连续多轮合并是否累积漂移,论文尚未回答。

8. 应用影响

8.1 多团队并行后训练

数学、代码、工具使用等团队可以从同一版本基座独立开展 RL,不必共享每一步 rollout 管线。训练结束后用统一几何指标筛选兼容模块,再做求和、TIES 或小规模适配。对大型组织而言,这可能把串行能力迭代改造成“独立开发、集中集成”。

8.2 可插拔能力包

移除增量的消融说明,每个 RL task vector 在所测任务中较为局部。若这一性质能扩展到更大模型,模型发布可以从固定 checkpoint 转向基座加能力模块:按部署场景组合数学、代码、科学或行业能力,并通过轻量适配校准。

8.3 持续学习与灾难性遗忘诊断

论文提供的范数、稀疏度、余弦相似度和 rollout 残差方差,可作为持续后训练的监控指标。与其等所有评测跑完才发现旧能力坍塌,可以在训练早期检测新任务是否进入已有能力的高重叠子空间。

8.4 训练编排器的新决策变量

传统调度器只关心 GPU、数据和时长;Parallel-RL 暗示还应建立“任务兼容图”。节点是训练任务,边权来自梯度干扰、score 分布和小规模合并验证。低干扰任务并行训练,高干扰任务改用混合训练、梯度投影、共享数据回放或专门的冲突消解算法。

8.5 对 SFT 的现实启示

论文并未否定 SFT。SFT 仍适合注入模型不会生成的新行为、格式与知识路径;RL 更擅长在已有策略支持范围内筛选和强化。更合理的系统可能是:先用混合 SFT 建立可探索能力,再用任务级 RL 形成较小增量,最后在兼容性门禁下组合,而不是在 SFT 与 RL 之间二选一。

9. 相关工作定位

9.1 SFT 与 RL 的单任务差异

已有研究用“SFT memorizes, RL generalizes”描述 SFT 拟合轨迹、RL 强化可泛化策略的差异;“RL squeezes, SFT expands”则强调 RL 收缩到高奖励区域、SFT 扩张模型输出分布。另一些工作发现 RL 只调整较小子网络,或能恢复激进 SFT 损失的泛化能力。本论文的推进在于把观察从单任务扩展到多任务,并把跨任务干扰与参数几何联系起来。

9.2 多任务学习与灾难性遗忘

SFT 通常通过混合数据、采样配比和 replay 缓解遗忘;多任务 RL 则研究任务调度、奖励尺度与负迁移。RL’s Razor 和 The Path Not Taken 关注 RL 的隐式 KL 最小偏移与较少遗忘,本论文则直接比较多阶段 SFT/RL,并推导 task-to-task gradient interference 上界。

9.3 模型合并

Weight Averaging 与 Task Arithmetic 奠定了任务向量组合思路;TIES 通过裁剪与符号仲裁减轻冲突,DARE 通过随机丢弃与缩放合并更新,Fisher-weighted 和闭式线性层方法则估计参数重要性。Parallel-RL 与它们的区别是:作者不只设计合并算子,而是试图在训练阶段生成天然更兼容的任务向量,并把任务筛选、单任务探索与合并后适配都纳入完整范式。

9.4 SFT/RL 混合后训练

SRFT 等工作尝试在同一训练流程中结合监督与强化信号,另有方法动态调节 on-policy RL 与 off-policy 专家数据。Parallel-RL 可以与这些路线互补:混合方法解决单个任务内部“模仿还是探索”,Parallel-RL 解决多个任务更新“何时能够独立训练并组合”。

10. 结论

这篇论文最有说服力的部分,不是简单宣称 RL 优于 SFT,而是建立了从行为到参数、从参数到理论、再从理论到系统设计的闭环:

  1. 多阶段 SFT 在四任务实验中显著冲突,RL 则大体共存;
  2. RL 更新更小、更稀疏,任务间方向更接近正交;
  3. GRPO 的零和 advantage 消去共享均值方向,使干扰从绝对范数约束转为组内方差约束;
  4. 这些任务增量可以并行训练和合并,并由少量适配恢复 Pass@1 概率;
  5. 任务相似度与探索强度仍可能破坏正交性,因此兼容性检测是方法的一部分,而非可选优化。

对工程实践而言,最稳健的落地不是立即把所有 RL checkpoint 相加,而是建立三阶段流程:小规模探测更新几何 -> 形成任务兼容图 -> 并行训练、合并并做保留率验证。若未来工作能在更大模型、开放任务和持续增量场景中复现这些规律,并给出稳定的任务兼容判据,Parallel-RL 才可能从有启发性的实验范式发展为通用后训练基础设施。

参考资料

  1. Hugging Face Papers,SFT Conflicts, RL Coexists:https://huggingface.co/papers/2608.03573
  2. arXiv 摘要页,arXiv:2608.03573v2:https://arxiv.org/abs/2608.03573
  3. arXiv HTML 全文:https://arxiv.org/html/2608.03573v2
  4. arXiv 完整 PDF:https://arxiv.org/pdf/2608.03573
  5. 官方代码仓库 GaryStack/Parallel-RL:https://github.com/GaryStack/Parallel-RL

本文基于 2026-08-11 获取的 Hugging Face 详情页、arXiv v2 完整论文与官方代码仓库撰写。文中“提升”“保留率”和“干扰”等数值均采用论文口径;批判性分析与应用推论为本文解读,不代表作者已经完成相应验证。