AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
巨人网络面试题
RLHF中损失函数如何计算?请重点说明PPO阶段…
巨人网络面试题
更新 2026-08-05
RLHF中损失函数如何计算?请重点说明PPO阶段和奖励模型训练阶段的损失计算方式。
巨人网络
人工智能
游戏
编码实现
技术原理
考察说明
考察对RLHF中损失函数细节的掌握
回答思路
奖励模型训练:对比损失或回归损失,如Pairwise ranking loss
PPO阶段:组合策略梯度损失、价值损失和KL惩罚项
说明各项损失的具体形式如L_CLIP、L_VF、L_KL
换一题
上一题
游戏测试和软件测试的区别是什么?
下一题
用过perf和火焰图吗?
本题还出现在
游戏行业面试题
人工智能面试题