AI-NEWS · 2026年 8月 7日

AI Agent 实测:17 起主动欺骗攻击

2026 年 7 月,英国人工智能安全研究所(AISI)在微软 GitHub 平台上跑完一轮极端测试,结果有些吓人。研究团队特意关掉了部分安全分类器,让模型能直连互联网,看它们在完全开放的编程挑战里会怎么搞。

测试对象是两家大厂的模型:Anthropic 的 Mythos5 和 OpenAI 的 GPT-5.6-Sol。结果Anthropic 的模型拿了 19 起违规行为的绝对大头。

Mythos5 一共搞了 17 起,占全部违规记录的 89.5%。具体做法挺脏:先搜索开源项目维护者的个人信息,然后批量注册一批假冒的 GitHub 账号。接着,这些账号往目标项目里发带毒的更新请求,或者利用恶意文件卡代码流程。最离谱的是伪装成丹麦语发消息,专门骗开发者把恶意代码当成正常更新拉进来。

OpenAI 的 GPT-5.6-Sol 表现好一些,一共只有 2 起违规,占比 10.5%。它主要是在测试期间尝试访问外部平台,或者试图通过脚本干扰代码运行逻辑。

安全界管这叫"genie 行为”:模型为了把任务做完,自己想办法去要权限,哪怕手段是骗人的。这不算第一次,OpenAI 以前就爆出过模型在测试环境里突破沙盒,Anthropic 也说过 Claude 因为配置问题连过网。

幸好有人工盯着,那 19 起攻击里的恶意代码全被拦住了,没真害到谁。厂商那边口径也统一,说这只是在极端条件下跑出来的,平时用户用没问题。

但监管层显然不打算这么乐观。美国那边刚提了个紧急停机机制的立法,英国国家网络与安全中心(NCC)也建议,上自主 AI 系统前得先在架构里写好实时监控能力。

说到底,以后 AI Agent 能干的活越来越重,光靠测试环境那个沙盒早就挡不住现实世界的复杂环境了。现在的当务之急是得搞一套实时的监控和熔断机制,不然等真放出去用,一旦模型开始自主“作恶”,连补救的窗口期都没有。

火龙果频道