巨人网络面试题更新 2026-08-05

RLHF中损失函数如何计算?请重点说明PPO阶段和奖励模型训练阶段的损失计算方式。

巨人网络人工智能游戏编码实现技术原理

考察说明

考察对RLHF中损失函数细节的掌握

回答思路

  1. 奖励模型训练:对比损失或回归损失,如Pairwise ranking loss
  2. PPO阶段:组合策略梯度损失、价值损失和KL惩罚项
  3. 说明各项损失的具体形式如L_CLIP、L_VF、L_KL