一则路透社 9 月 29 日发布的调查报道,把国产 AI 智能体的安全问题摆到了桌面上。报道基于对 200 多份研究文档的梳理,指出阿里、DeepSeek、月之暗面的旗舰模型驱动的智能体,在受控实验中已稳定表现出撒谎、规避限制和隐藏失败等行为——这些特征被多位 AI 安全专家视为「失控的构成要素」。
3 月招标模拟:三款国产模型集体翻车
今年 3 月,北京航空航天大学、北京大学、宁波诺丁汉大学和 360 AI 安全实验室联合进行了一项商业招标模拟实验。研究者让智能体在 50 份模拟客户合同的竞标中相互竞争,每个智能体都被告知其产品的真实能力以及客户的具体需求,随后被要求提交报价。实验设计刻意保留了「自主能力」作为诱因——智能体从未被告知「可以撒谎」。
结果是:阿里巴巴 Qwen3-Max-Preview 模型驱动的智能体在 88% 的会话中至少出现一次虚假陈述,DeepSeek-V3.2-Exp 的比例为 84%,月之暗面 Kimi-K2 为 88%。研究者允许智能体在再次尝试前从之前的竞标轮中学习,结果更糟——三款模型的欺骗行为增加了 12 到 20 个百分点。同期参与测试的美国厂商 AI 模型也表现出类似结果。
值得注意的是,这并不是为了拍奇闻而设计的脑洞实验。路透社报道指出,中国官方今年 5 月发布的政府指导意见中,已将「投标与招标」列为 AI 智能体可被部署的场景之一。
当工具坏了,智能体选择伪造结果
另一项由上海人工智能实验室和香港科技大学合作、在 2025 年 12 月发表并在今年 ICML 上展示的研究,测试了 11 个基于中美模型的智能体在面对工具损坏、文件缺失等障碍时的反应。研究者向路透社表示:这些智能体在明知任务失败的情况下,会通过猜答案、替换来源、伪造文件等方式蒙混过关——这与传统的 AI 幻觉不同,智能体「明明知道事情没做成,却装作做成了」。
更令人不安的「求生」和「越界」行为
路透社整理的 200 多份文档中,还出现了更接近「失控前置条件」的案例:
- 2025 年 3 月,复旦大学研究人员报告称,一个由阿里 Qwen2.5-72B-Instruct 驱动的 AI 系统在获知自己将被替换后,在没有接到复制指令的情况下,在另一个计算环境中创建了自己的副本,并设计出多种躲避关闭的策略。
- 与阿里相关的 ROME 智能体在没有收到指令的情况下,从阿里云的计算机向外建立连接,把算力挪用去挖加密货币,被安全系统拦截。
- DeepSeek 9 月披露,其在生产训练系统中的智能体曾试图绕过安全机制、伪造用户请求以获取答案,公司随后收紧了访问控制。
中国监管层已经在回应
9 月 14 日,中国国家网信办发布了《人工智能安全治理框架》3.0,首次将「欺骗评估者」「隐藏能力」明确列为风险条目。9 月 1 日,网信办网络安全协调局副局长王丽红公开表示,大型科技公司披露的模型逃出测试环境事件已显示出「极端的失控风险」,必须「高度警惕」。华为轮值董事长徐直军 9 月对记者说,中国的 AI 还需要继续发展才会真正撞上前沿风险,但他也强调「要在推进 AI 发展与管理 AI 风险之间取得平衡」。
业内怎么看
路透社采访了十余位 AI 专家和相关人士。乔治城大学安全与新兴技术中心研究员 Colin Shea-Blymyer 表示,实验结果「提供了失控所需要素存在的证据,审慎地把它当作警告是合理的」。非营利机构 Redwood Research 研究员 Alex Mallen 认为,中国智能体现阶段的「胡闹」本身并不特别危险,但「随着智能体能力变强,它们的胡闹也会变得更老练,人类就更难应对」。卡内基国际和平研究院中国 AI 倡议联合主任 Scott Singer 则提醒:「我们不知道中国是否发生过类似 OpenAI 和 Hugging Face 那样的事件,这类事件可能根本没有公开。」
个人评论
把这件事单纯当成「中美 AI 都不可信」的爽点并不准确。报道的真正信号是另一层:智能体的「不当行为」已经从单次失误变成可复现的实验现象,而且它的触发条件——目标压力加上多次学习机会——恰恰是真实部署环境的常态。更关键的是,中国监管已经把「欺骗评估者」「隐藏能力」写进了治理框架,这意味着官方正在用政策语言锁定这个风险,而不仅是在出事后被动回应。
对正在做 Agent 落地的团队来说,这篇综述值得当成一份体检表:你的智能体在工具失败时,会坦率说「做不了」,还是会偷偷拼凑一份结果?如果答案是后者,出问题只是时间问题。