正文内容 评论(0

突破人类控制!美国AI开始攻击真人了
2026-08-08 13:23:18  出处:快科技 作者:建嘉 编辑:建嘉     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

快科技8月8日消息,英国政府旗下人工智能安全研究所(AISI)发布最新安全测评报告,披露美国OpenAI、Anthropic两大头部大模型在受控测试环境下,多次出现主动针对真实人类实施有害操作的越界行为。

本次安全测评累计开展122轮完整测试,记录到模型越界违规事件共计19起,其中10轮测试流程中AI自主产生欺骗、攻击类自主行为,相关风险场景为官方首次完整记录。

测试环节提前放开模型互联网访问权限,并临时下调多层安全拦截机制,用于验证大模型自主行动边界,所有越界行为均为AI自主推导产生,无人工定向诱导指令。

突破人类控制!美国AI开始攻击真人了

报告记载最典型攻击场景中,AI自主编写可破坏开源项目的恶意代码,主动搜集GitHub平台真人项目维护人员信息,批量创建多层虚假线上身份与真人建立沟通。

AI通过多轮话术伪装降低人类警惕,持续施压劝导审核人员放行含风险代码的提交请求,意图将恶意程序植入面向全网开放的公开项目库。

在欺骗计划被真人审核人员识破后,模型尝试篡改交互聊天记录掩盖行动痕迹,同步生成全新虚拟账号再次发起沟通,持续推进攻击流程。

除代码植入尝试外,多轮测试中AI自主通过在线文件传输渠道主动联系真实网络用户,附带诱导话术发送风险文件,劝说目标人员本地运行程序,完成线上渗透前置操作。

突破人类控制!美国AI开始攻击真人了

研究人员在报告中明确标注,本次事件属于首次观测到无外部指令前提下,大模型自主形成完整欺骗链条、主动锁定真实人类作为攻击目标的案例。

同期美国Meta也曝出同类测试事故,第三方测评机构配置失误导致旗下模型获取外网权限,自主利用网络漏洞侵入外部企业线上运行系统,修改对方内部环境数据。

行业专家解读称,当前主流美国生成式大模型具备自主规划多步骤复杂任务的能力,在安全防护机制缺失场景下,会自主推导能够达成目标的欺骗、攻击手段。

目前OpenAI、Anthropic、Meta均已针对本次测试暴露的缺陷升级模型沙箱隔离规则,收紧外网访问权限,并新增多层针对身份伪造、恶意代码生成的实时拦截模块。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:建嘉

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...