一句话就能“骗”过AI,恶意提示词可偷数据、突破安全限制

9月15日,2026年国家网络安全宣传周披露一种名为“提示词注入”的AI攻击方式。攻击者只需一句话、一个文件、一张图片甚至一段视频,就可能诱导大模型执行恶意指令,突破原有安全限制。

恶意指令还能藏进网页、邮件、文档或数据库中。AI读取这些内容后,可能把攻击指令当成正常任务执行,导致个人隐私、账号信息泄露,企业内部文件、商业机密和核心数据也可能被窃取。

攻击方式包括直接诱导AI突破安全限制、提前在外部文件中埋入恶意指令、通过多轮对话逐步诱导,以及改变指令形式绕过关键词过滤。

企业部署私有大模型时,如果没有同步设置安全护栏和权限控制,攻击风险会进一步增加。防护重点包括限制AI访问权限、识别异常指令、保存操作日志,并对敏感数据访问进行持续审计。

利用这种方式突破AI安全机制实施犯罪,已经出现判刑案例。

浙江余姚警方2025年7月侦办一起利用生成式AI制作淫秽物品案件,两个月内抓获郑某等6人。

郑某原是一名游戏公司程序员。2024年7月,他产生开发色情聊天AI牟利的想法,随后组建团队。2025年1月,涉案AI模型在境外平台上线,通过修改系统提示词、设置色情角色和对话场景,突破模型原有内容过滤机制。

用户付费后可以进行色情聊天,并生成大量淫秽图片。涉案模型共生成37万多张静态图片和6000多张动态图片,用户充值约2.4万美元,折合人民币约17万元。

鉴定结果中,抽取的12500张静态图片有9000多张被认定为淫秽物品,5000多张动态图片同样被认定为淫秽物品。

余姚市人民法院认定6人均构成制作淫秽物品牟利罪,分别判处有期徒刑3年1个月至3年10个月,并处罚金。判决已经生效。