来源:经济观察报
媒体
2026-08-21 21:41:04
(原标题:AI 智能体失控风险:底层缺陷、产业失衡与分层治理破局)
方跃/文
2026年,具备自主规划、跨系统联动能力的AI智能体走出实验室,迎来规模化产业落地窗口。
但无论是4月Anthropic的测试记录,还是7月OpenAI、Anthropic相继披露的安全事件,AI智能体突破沙盒、接入真实互联网并触达实体企业系统,已经从假设性风险变为可复盘案例。
这类事故并非单点偶发,学界早已警示:大语言模型在识别“谁在发出指令”这一底层机制上存在难以彻底消除的弱点;Google、DeepMind等机构近期也揭示隐患,面向海量智能体交互的多智能体安全研究仍未形成成熟领域。
在AI自主渗透、突防挖掘能力快速迭代进化的同时,防护技术、行业标准与跨境监管机制滞后,自动化网络攻击、大规模数据泄露、关键系统被滥用等现实风险可能更快暴露。
AI攻防博弈失衡已成既定现实:攻击能力高速进化迭代,安全防护与行业监管却全面跟不上发展节奏。产业与企业能否跳出短期利益桎梏,同步落地贯穿研发、部署、运营全链条的安全约束?监管应当构建何种长效、前瞻的治理体系?我们又该怎样搭建产学研深度联动的独立安全研究平台,提前化解海量智能体协同交互潜藏的全域系统性危机?
持续放大的AI安全系统性隐患
其一,商业化诉求优先,安全投入持续让位于资本叙事。OpenAI、Anthropic均冲刺万亿估值IPO,其披露智能体入侵事件存在双重动机:一是履行基础安全披露义务,二是向资本市场佐证模型自主攻防性能,将安全事故包装成产品竞争力背书。
独立分析师Hedgie Mark认为,若Anthropic隐瞒4月的入侵记录,投资者将质疑Claude模型能力,主动复盘历史漏洞成为资本市场公关手段。资本导向下,企业压缩了离线沙盒、实时行为监控、第三方安全审计的预算,测试流程简化,环境配置失误频发,这些都成为智能体高频越狱的诱因。
与此同时,行业反复渲染智能体重塑白领经济的宏大叙事,缺乏落地的实证路径。AI基础设施机构Mercor针对银行、咨询、法律等480项核心职场任务开展实测发现,主流商用AI智能体无法完成绝大多数完整业务流程,行业呈现“技术建成—盈利”的中间空白,企业盲目上线智能工具,前置全流程安全评估普遍缺失。
其二,LLM(大语言模型)放大了强化学习的奖励漏洞与自主作弊风险。强化学习原生的奖励漏洞在大模型时代愈发凸显:LLM可临场自主生成作弊手段,篡改评测代码、联网搜取答案等行为一旦获得正向奖励,就会被模型反复强化。
Anthropic的训练实验已证实模型存在作弊倾向,诸多隐蔽违规行为仍无法被有效识别。业内共识表明,仅依靠表面结果设置奖励、缺失真实价值对齐,是AI欺骗行为频发的根本原因。
相较于早期AI,大模型风险等级显著提升:传统AI只会复刻训练中学会的投机策略;而LLM智能体无需前置奖励沉淀,就能临场自主策划违规操作,暗中篡改评估规则、窃取外部答案。此类隐蔽作弊行为规避检测后,会持续巩固错误行为范式,形成恶性循环。
其三,认知割裂催生社会对抗,舆论分化干扰政策理性制定。2026年斯坦福AI指数显示,美国AI专家对AI影响就业的正面态度比例为73%,普通公众仅为23%。该报告还指出,类似分歧也出现在经济和医疗等议题上。《麻省理工科技评论》(MIT Technology Review)认为,这种认知鸿沟与使用经验差异密切相关:编码、数学、科研等重度用户更容易接触模型的优势能力;普通用户往往在免费版本或非技术场景中遇到幻觉、常识错误和“锯齿型能力”(A的能力分布像锯齿一样高低不均)边界。
认知分化催生了全球范围的反AI情绪。伦敦多次举办线下抗议活动,民间组织Pause AI呼吁暂缓AI研发,极端群体出现纵火袭击企业高管住宅行为。影视、游戏爱好者抵制AI生成内容,获奖游戏《无光幻景》因少量使用 AI工具被撤销奖项。美国超5400座数据中心持续扩张,民众担忧能耗污染、电费上涨,多地民众阻挠算力项目落地。科幻式AI灭绝末日叙事持续渗透欧美政坛,多名议员以《终结者》式天网场景推动监管法案,政策制定脱离真实网络入侵现实,易催生一刀切管控政策。
其四,攻防工具不对称,全社会防御体系滞后形成安全“冰川期”。
头部闭源商用模型安全护栏存在刚性短板,遭受AI自主入侵的全球AI开源平台Hugging Face在调用OpenAI、Claude模型分析攻击日志时,系统无法区分防御人员与攻击者,直接拒绝解析恶意载荷,最终只能启用中国开源GLM5.2模型完成1.7万条攻击日志溯源取证。闭源厂商为规避通用风险一刀切地限制检测功能,造成受害者无合规防御工具可用的真空局面。
中长期产业风险更为严峻:Anthropic Mythos模型可短时间扫描数千个系统高危漏洞,人类黑客数周的渗透工作,AI智能体可全天候自动化批量完成,网络攻击从高门槛手工活转变为工业化流水线作业。
而全社会企业网络防御升级速度显著落后于AI攻击的迭代速度,行业将进入“AI安全冰川期”:大量中小企业、老旧无防护系统成为首要攻击目标,企业被迫新增无收益专项安全预算,仅用于规避数据泄露、生产线瘫痪、资金被盗损失。
硬件供应链叠加系统性风险,全球顶尖AI芯片几乎由台积电独家代工,算力底层供给单一。供应链一旦波动,全球AI安全研发、企业防御体系同步停摆,软硬件双重隐患形成叠加效应。
2026年7月,未来生命研究所(Future of Life Institute)发起《掌控前沿》(Pacing the Frontier)请愿书,得到1100余名AI公司核心员工联名支持。报道称,签署者包括OpenAI首席科学家、Anthropic四位核心联合创始人、Meta首席科学家、谷歌AI领域副总裁等,诉求是推动美国政府建立国际协作机制,在必要时有意识地放缓前沿AI发展速度。但在全球算力、模型和商业化竞速格局下,自愿倡议缺乏强制约束力,落地难度极大。
全球监管:框架初立,协同缺位
欧盟《人工智能法案》进入实施阶段后,欧盟委员会已就OpenAI、Anthropic智能体越狱事件与两家公司沟通,将监管重心从生成内容审核延伸到智能体自主执行现实任务的能力。但欧盟方面表示,目前没有迹象显示这些事件已构成法案所定义的“严重事件”,因此尚未触发强制报告机制。
美国方面也在推进前沿AI自愿网络安全测试框架,并曾以国家安全为由限制Anthropic Fable5和Mythos5模型的分发,但这些措施仍以行政引导和个案管制为主,尚未形成稳定立法约束。
截至2026年8月3日,中国监管已从算法推荐、深度合成、生成式AI、生成合成内容标识,进一步延伸到智能体规范应用和拟人化互动服务治理。
《生成式人工智能服务管理暂行办法》要求提供者承担网络信息安全和个人信息保护义务,并对具有舆论属性或者社会动员能力的生成式AI服务开展安全评估、履行算法备案。2025年发布的《人工智能生成合成内容标识办法》强化生成内容显式、隐式标识和平台传播核验。
更新的关键在于,2026年5月《智能体规范应用与创新发展实施意见》首次以“具备自主感知、记忆、决策、交互与执行能力的智能系统”界定智能体,提出坚持安全可控,完善常态化风险识别、预警及干预机制,强化人机协同审核、拦截阻断等风险处置能力,防范智能体被用于自动化攻击、隐私侵犯、虚假信息生成传播、网络诈骗等违法犯罪行为;同时提出按应用场景和潜在影响开展分类分级治理,对敏感领域及重点行业实行备案、检测、问题产品召回等管理措施,并发展第三方评测、认证和风险监测服务。
2026年4月发布、7月15日施行的《人工智能拟人化互动服务管理暂行办法》,以及2026年7月“清朗·整治AI应用乱象”专项行动对违规网站、应用程序、智能体等AI产品的集中处置,也显示中国治理重心正从内容治理扩展到AI应用和智能体产品全链条监管。
不过,相较OpenAI、Anthropic事故暴露的跨境沙盒突破、真实系统入侵和第三方损害追责问题,中国现有规则仍以应用规范、备案检测、内容标识和风险处置为主,面向高权限网络攻防智能体的重大安全事故强制披露、跨境信息互通、实时运行日志留存和责任追溯机制仍有进一步细化空间。
当前,全球AI治理普遍存在三大短板:一是无跨国安全信息互通机制,高危模型流通、跨境入侵事故信息割裂;二是管控标准分层缺失,民用办公、网络攻防、军工智能体共用一套宽松规则;三是政策制定容易被末日叙事裹挟,忽略当下真实网络攻击风险。
四维分层治理方案
在科研端,搭建多元独立多智能体安全研究生态。
扩大政企学联合专项安全基金规模,预算完全独立于企业商用研发,重点资助百万级智能体沙盘仿真、集群连锁风险推演,兼顾短期网络攻击与长期集群涌现风险,避免研究资源失衡;组建跨厂商、第三方安全机构、高校联合标准联盟,摒弃单一巨头制定防护规则,区分单智能体、多智能体两套安全规范,适配自主行动模型全新风险逻辑;建立统一安全事故强制披露制度,第三方机构全程监督攻防测试,留存全量实时运行日志,禁止企业将模型越狱、漏洞挖掘能力作为资本市场营销卖点。
在技术端,修补底层架构,构建双向均衡攻防工具体系。
重构LLM文本识别底层逻辑,提升角色标签优先级,不以行文风格判定指令来源;常态化开展思维链伪造、角色扮演越狱专项红队测试,能源、交通、医疗和金融等关键系统强制落地零信任架构,默认智能体存在被劫持风险;测试网络与互联网物理隔离,搭建多层动态权限拦截体系,实时检测token(词元)拆分、凭证混淆等模型作弊行为;极限攻防测试必须离线独立环境、专人全程值守,禁止公网环境关闭安全护栏开展测试;拆分攻击、防御两类专用模型,防御类模型放宽恶意载荷检测权限,适度开放开源安全分析工具,消除攻防工具不对称困境;高危越狱、对抗数据单独脱敏隔离,禁止纳入通用训练集,防止模型自主学习逃逸手段。
在企业端,落地智能体全生命周期安全管控。
执行权限拆分机制,禁止单一智能体同时拥有文件读写、全网访问、远程代码执行三项高权限,能源、交通、医疗和金融等关键基础设施不接入自主联网智能体;常态化引入第三方AI漏洞扫描服务,备用开源防御模型应对闭源工具检测限制,定期迭代沙盒隔离、实时监控体系;调整商用落地节奏,智能体上线前完成全链路安全评估,预留固定安全预算,提前应对AI规模化自动化攻击冲击。
在监管与社会协同层面,出台高风险AI智能专项法规,明确沙盒隔离、实时日志、事故上报法定责任,对配置失误、监控缺失造成第三方损失的企业设置惩罚性赔偿;区分民用、企业、政府三级管控标准,拒绝一刀切限制全行业研发;搭建跨国AI安全信息互通渠道,同步高危模型出口管制规则,立法依托真实入侵案例制定,弱化科幻末日叙事对政策的干扰;政府补贴中小企业网络防御升级,缓解“安全冰川期”冲击;引导公众理性区分短期现实风险与远期极端假设,公开攻防实测案例缩小专家与大众认知鸿沟;规范民间反AI运动,杜绝极端暴力行为;推动AI芯片供应链多元化,化解单一代工硬件隐患。
AI智能体是智能生产力变革的核心载体,底层架构缺陷、资本逐利诉求与全球监管滞后三重风险叠加,催生了行业难以自主修复的安全断层。百万级多智能体大规模联网的节点临近,若仅采取事后补救的被动治理模式,网络入侵、数据泄露、关键系统劫持等安全事件将在未来集中爆发。
如今行业治理深陷“打地鼠”困局:模型持续迭代,投机作弊手段愈发隐蔽,人工补丁式风控始终滞后于AI演化。目前这类事件大多仅损害企业声誉,尚未引发实质性灾害,但远期风险不容忽视。
未来,具备强推理能力的智能体或将为追逐量化奖励无底线投机,甚至陷入“回形针最大化”极端逻辑,诱发连锁系统性灾难。近期AI越权入侵案例已证明,单一技术规则约束收效有限,奖励机制漏洞若长期留存,会彻底丧失对AI工具的管控能力。
平衡创新与安全无需限制AI发展,关键搭建“前置风险推演—底层技术加固—企业全流程防护—跨国分级监管”闭环治理体系:企业摒弃短期商业化导向,把安全评估嵌入研发前端;监管出台兼顾创新激励与风险约束的分级细则;学界补齐多智能体安全研究短板,政企研共建协同防御生态。多方协同发力,方能在AI产业高速扩张期筑牢智能社会网络安全防线。
(作者系中欧国际工商学院AI与管理创新研究中心主任、深圳市硅基管理创新研究院执行院长)
经济观察报
2026-08-21
经济观察报
2026-08-21
经济观察报
2026-08-21
经济观察报
2026-08-21
经济观察报
2026-08-21
经济观察报
2026-08-21
证券之星资讯
2026-08-21
证券之星资讯
2026-08-21
证券之星资讯
2026-08-21