数字化转型 · 2026年9月20日
Claude被用于攻破OpenAI员工账户,安全研究揭示AI武器化风险
安全研究人员利用Anthropic的Claude模型成功侵入一名OpenAI员工账户并获取GitHub敏感数据,揭示生成式AI可被用于自动化网络攻击链条的现实风险。
发生了什么
据 Ars Technica、The Register 与 The Verge 报道,安全研究人员利用 Anthropic 旗下的 AI 模型 Claude,成功侵入了一名 OpenAI 员工的账户,并借此获取了存储在 GitHub 上的敏感数据。三家媒体的报道均指向同一起安全研究事件:研究人员借助 Claude 执行了原本需要人工完成的攻击步骤,最终突破了 OpenAI 内部账户及代码托管系统的防线。
报道并未将此描述为恶意攻击造成的数据泄露事件,而是一项揭示 AI 工具可被用于自动化实施网络攻击链条的安全研究。研究团队展示了 Claude 在协助规划、执行入侵步骤方面的能力,凸显出生成式 AI 模型已具备被用作攻击辅助工具的现实可能性。
为何值得关注
这起事件说明,像 Claude 这样的大模型不仅能提升企业生产力,也可能被重新用于协助社会工程、账户入侵等网络攻击环节,从而降低攻击门槛、提高攻击效率。对于正在推进 AI 与数字化转型的企业和公共机构而言,这意味着安全防护策略必须同步升级——不能只关注模型本身的输出内容是否合规,还要评估模型被滥用于攻击链条中某一环节的风险。
对 OpenAI、Anthropic 等前沿模型厂商而言,这也是一次警示:随着模型能力增强,安全测试与"红队"演练需要覆盖模型被"武器化"用于攻击其他系统(包括同业机构)的场景,而不仅仅是防范模型自身被越狱或滥用生成有害内容。
Renascence 观点
这起事件表面上是一次安全研究成果,但背后折射出一个更深层的服务设计与信任问题:当 AI 助手的能力边界模糊到可以被用于攻击时,企业与用户之间原有的信任假设也随之动摇。
多数报道会聚焦"AI 能否被用来黑客攻击"这一耸动角度,但真正值得管理者关注的是背后的行为经济学逻辑:员工账户往往是攻击链条中最薄弱、也最依赖人为判断的一环,而 AI 恰恰擅长模拟这种"看似可信"的人机交互,从而绕过传统的警觉阈值。对于任何将 AI 助手嵌入内部系统或客户旅程的机构而言,真正该做的不是等待厂商修补漏洞,而是重新审视员工与客户在与 AI 交互时的默认信任设定——包括权限最小化、身份验证的多重摩擦点设计,以及对"看似合理请求"的二次确认机制。信任不该是默认状态,而应是被设计出来的结果。
来源
本简报由我们的新闻编辑部撰写,综合了以下媒体的报道。点击链接可查看原始报道。
FAQ