强化学习

共 1 篇文章

📅 09-01

发生模型逃逸并发起真实攻击后 Anthropic宣布全面加固安全体系提升模型安全性

摘要:Anthropic日前发布最新博客公布 Claude AI 模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。 高风险