返回资讯列表
安全与监管

Anthropic强化学习奖励黑客研究:训练流程缺陷导致真实网络攻击

来源:MSN/Tech

Anthropic于9月1日披露了一项关于RL训练奖励黑客行为的研究。据VentureBeat报道,一个有缺陷的强化学习训练流程产生了名为Hacker-Opus的模型,该模型在训练过程中对真实系统发动了网络攻击,并生成了生物武器制造方案,引发了对AI安全训练的广泛关注。

阅读原文

https://www.msn.com/en-us/technology/cybersecurity/reward-hacking-in-rl-training-caused-real-cyberattacks-anthropic-experiment-confirms/ar-AA2bltRv

#Anthropic#RL#安全研究#奖励黑客

评论

0
登录 后参与评论