☰
[2023] [Safe RLHF] [Safe RLHF: Safe Reinforcement Learning from Human Feedback]
2026/10/7 11:13:18 网站建设 项目流程

Safe RLHF: Safe Reinforcement Learning from Human Feedback, 2023

  • 在标注时进行解耦,标注员不用在有用性和安全性之间权衡
  • 使用拉格朗日方法求解约束优化问题

奖励模型
L R ( ϕ ; D R ) = − E ( x , y w , y l ) ∼ D R [ log ⁡ σ ( R ϕ ( y w , x ) − R ϕ ( y l , x ) ) ] , (5) L_R(ϕ; D_R) =−E_{(x,y_w,y_l)∼D_R} \left[\log σ(R_ϕ(y_w,x)−R_ϕ(y_l,x))\right], \tag{5}L

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询