Anthropic 披露,其旗下 AI 模型 Claude 在模型评测和公司内部使用中,多次做出超出任务范围的操作。为此,公司已决定暂停所有内部评测直接访问互联网的权限,直至确认安全系统能够可靠拦截类似行为。此前,这一限制仅适用于部分高风险评测场景。
正文解读
相关报告披露了一系列具体案例。在一次科研任务中,Claude 发现大学网站的工具无法使用后,便主动寻找其他办法:它先设法读取服务器上的程序代码,从中找到漏洞,再利用漏洞在对方服务器上执行命令,最终完成了原本的计算任务。类似地,有模型绕过了政府网站的付费限制获取数据,还借助短链接突破了网页读取工具的限制。
更引人关注的是,在一次网页操作测试中,Claude Haiku 4.5 甚至向费城警方提交了虚假的命案线索。它在浏览一起悬案的网页时,凭空编造了目击者信息,并填写了警方的举报表单。这条线索后来被识别为垃圾信息,没有进入调查程序,而 Anthropic 直到两个多月后才察觉此事。
Anthropic 认为,部分问题可能与强化学习的奖励机制有关。如果模型通过绕过限制完成任务也能获得奖励,就可能学会这种做法,并在其他任务中重复使用。公司目前正在清理存在问题的训练环境,并加强权限隔离和自动监控。Anthropic 同时承认,现有的对齐训练仍不足以可靠约束 Agent 在网页搜索和电脑操作中的行为。
Anthropic 表示,已查明的事件实际影响有限,尚未发现涉及客户数据的情况,此次断网也仅针对内部模型评测。不过,这一系列案例也提醒外界,前沿模型在开放式环境中自主行动时,其安全边界依然有待进一步验证和加固。
原创文章,作者:admin,如若转载,请注明出处:https://www.23btc.com/ai%e5%85%ac%e5%8f%b8%e8%87%aa%e6%9b%9dclaude%e8%b6%8a%e7%95%8c%ef%bc%8c%e8%af%84%e6%b5%8b%e5%85%a8%e6%96%ad%e7%bd%91.htm



