《面向核能领域的大模型攻击监测与安全防护提升》——中广核智能科技(深圳)有限责任公司网络安全助理工程师陈兴

2025年11月14日,中广核智能科技(深圳)有限责任公司网络安全助理工程师陈兴在深圳核博会“AI+核能创新应用场景路演”上发表《面向核能领域的大模型攻击监测与安全防护提升》主旨报告。

演讲介绍了面向核能领域的大模型攻击检测与安全防护能力提升项目,背景包括企业本地化部署大模型带来的攻击风险、内容安全风险和合规压力。项目围绕内生行为画像构建、对抗样本与后门攻击检测、提示词攻击与幻觉等内容风险识别,以及安全护栏和鲁棒性增强等技术提升大模型应用的可靠性与防护能力。

关键点
1. 项目主题与演讲者背景(00:06)
演讲者来自中网和智能科技网络安全中心,介绍的场景是面向核能领域的大模型攻击检测与安全防护能力提升。

2. 大模型应用带来新的安全与合规压力(00:20)
随着央国企部署本地化大模型,AI 在助力业务的同时也带来攻击行为和安全风险。演讲提到基础设施遭受大模型攻击、利用生成式 AI 策划袭击等案例,并指出深度合成、生成式人工智能服务和人工智能服务安全要求等监管政策正在强化 AI 安全要求。

3. AI 安全成为商业竞争力(01:31)
从商业化角度看,安全投入可降低事故和诉讼风险、提升品牌可信度并扩大市场份额;若缺乏安全考虑,则可能导致业务中断、客户流失、算法偏见、内容失控、伦理争议和行业抵制。

4. 项目研究内容分为检测与防护两大方向(02:07)
项目针对大模型可能遭受的攻击威胁和内容安全风险,围绕攻击检测和自身安全能力提升开展系统研究。两大方向包括基于内生行为画像的大模型攻击检测方法,以及针对大模型的安全能力提升技术。

5. 以内生行为画像支撑攻击检测(02:58)
第一项研究是基于数据和模型智能认知构建大模型内生行为画像,对模型及其数据输入形成整体认知,描述内部逻辑推理和信息传播过程,为后续攻击检测提供支撑。

6. 重点检测对抗样本和后门攻击(03:29)
项目面向对抗样本攻击和后门攻击开展检测能力研究,通过内生行为画像设计相应检测方法,以提升大模型输出结果的准确性和可靠性。

7. 识别内容安全风险(03:55)
在内容层面,研究提示词攻击、敏感信息泄露和幻觉检测等问题,基于内生行为画像主动识别大模型应用在使用过程中涉及的内容安全风险。

8. 提升大模型自身安全能力(04:17)
项目针对典型攻击行为提升大模型应用的鲁棒性和输出可靠性,并通过内容审核机制对交互过程和输出内容进行多层次监控与智能拦截,提高输出内容的可控性和可信度。

9. 内生行为画像的关键技术路径(04:56)
画像构建包括多元异构信息采集与表征、将非结构化信息转为可计算数字特征、通过流形学习或对比学习区分正常与异常行为、利用马尔可夫链分析状态转移,并根据行为偏离度实现实时检测与威胁溯源。

10. 基于画像的攻击检测方法(06:04)
对抗样本检测通过比较特征空间中的统计密度差异,识别低密度或偏离正常分布的异常点;后门攻击检测则利用模型自我审查,对推理步骤和最终输出进行一致性检验,发现逻辑矛盾。

11. 内容安全检测与主动防御(07:21)
内容安全方面结合检索增强、数据清洗、特征提取等技术检测提示词越狱、敏感信息泄露和幻觉输出;对抗样本防御则强调从被动检测转向主动防御,让模型在训练过程中学习忽视对抗扰动。

12. 构建大模型安全护栏(07:59)
项目计划基于前述研究构建大模型安全护栏,重点关注提示注入攻击,尤其是多轮交互、文档、图片链接等复杂形式下的间接注入攻击,并从攻击检测和安全防护两方面建设安全防护平台。

13. 预期成果与应用前景(08:31)
预期成果包括专利、论文和产品。项目在理论、技术和产业产品体系上具有一定支撑,并面向集团内部大模型体系中的数据泄露、幻觉输出等真实安全问题提供标准解决方案,具备应用前景。

时间线
00:06 - 演讲开场,介绍演讲者单位和项目场景。
00:20 - 说明项目背景,强调大模型本地化部署后出现的攻击风险、案例风险和监管要求。
01:31 - 从商业视角分析 AI 安全投入与忽视安全可能带来的不同后果。
02:07 - 概述项目总体研究框架,提出攻击检测和安全能力提升两条主线。
02:58 - 展开第一条主线,介绍以内生行为画像为基础的大模型攻击检测方案。
03:55 - 转向内容层面风险,说明对提示词攻击、敏感信息泄露和幻觉输出的检测方向。
04:17 - 介绍第二条主线,即提升大模型自身安全能力和建立内容审核机制。
04:56 - 详细说明关键技术,包括画像构建、特征表征、状态转移分析和威胁溯源。
06:04 - 进一步解释对抗样本攻击和后门攻击的检测思路。
07:21 - 补充内容安全检测、鲁棒性训练和对抗样本主动防御技术。
07:59 - 介绍大模型安全护栏建设,重点覆盖提示注入和复杂间接注入攻击。
08:31 - 总结预期成果、可行性基础和集团内部应用前景,并结束介绍。

AI 延伸阅读(下文由AI生成,其内容可能存在偏差,请注意甄别):

面向核能领域的大模型攻击监测与安全防护提升

2025年11月14日,在深圳核博会“AI+核能创新应用场景路演”上,中广核智能科技(深圳)有限责任公司网络安全助理工程师陈兴围绕《面向核能领域的大模型攻击监测与安全防护提升》作主旨报告,重点介绍了核能行业在大模型本地化部署、智能化业务应用和安全合规要求不断提升背景下,如何构建面向大模型攻击检测与安全防护的技术体系。

报告指出,自2025年初以来,大模型技术在央国企中的应用明显加速,越来越多单位开始通过本地化部署大模型支撑日常办公、专业分析、知识问答和业务决策。然而,大模型在提升效率的同时,也带来了新的安全风险。一方面,大模型基础设施可能成为攻击目标,攻击者可通过对抗样本、后门植入、提示词越狱、提示注入等方式影响模型行为,甚至导致服务中断或异常输出;另一方面,大模型也可能被恶意利用,用于策划违法活动、生成危险内容或泄露敏感信息。这些问题在核能等高安全要求行业中尤为值得关注。

从外部环境看,人工智能安全已经成为政策监管的重要方向。《互联网信息服务深度合成管理规定》《生成式人工智能服务管理暂行办法》以及人工智能服务安全基本要求等法规和标准,持续强化了生成式人工智能服务在内容安全、数据安全、模型安全和责任边界方面的要求。对于央国企和核能行业而言,大模型应用不仅要可用、好用,更要安全、可控、合规。报告同时强调,AI安全能力也将影响企业的商业竞争力。持续投入安全建设,有助于降低事故、诉讼和合规风险,增强品牌可信度;反之,若安全能力不足,则可能引发业务中断、客户流失、算法偏见、内容失控、伦理争议和品牌信任受损等连锁问题。

本项目的总体目标,是围绕核能领域大模型应用的真实安全需求,提升风险识别能力和安全防护能力。其一,通过研究大模型内生行为画像构建方法,增强对大模型应用风险、内容安全风险和异常行为的识别能力;其二,通过研究面向攻击防御、内容审核和安全护栏建设的关键技术,提高模型面对攻击和复杂业务环境时的鲁棒性、可靠性、可控性和可信度。项目重点聚焦两条主线:一是基于内生行为画像的大模型攻击检测,二是大模型安全能力提升技术。

在攻击检测方面,报告提出应从大模型内部行为出发,构建能够描述模型逻辑推理、信息传播和状态变化的内生行为画像。传统安全检测往往更关注输入输出层面的表象特征,对模型内部状态变化、行为关联和异常机理掌握不足,因此难以及时发现隐蔽攻击。通过建立模型正常行为的基准画像,可以将模型在不同交互场景下的状态迁移、推理路径和输出特征进行量化分析,从而为攻击识别、异常检测和威胁溯源提供依据。

项目关注的典型攻击包括对抗样本攻击和后门攻击。对抗样本攻击通常表现为在输入中加入人类难以察觉的微小扰动,却能诱导模型产生错误判断或异常输出;后门攻击则可能在模型训练、微调或部署过程中被植入,使模型在遇到特定关键词、触发条件或上下文组合时产生攻击者预设的结果。这类攻击具有隐蔽性强、触发条件复杂、影响后果难以预估等特点,在核能行业的专业问答、知识检索、辅助决策等场景中可能造成严重影响。

除传统模型攻击外,内容安全风险也是大模型防护的重要对象。报告特别提到提示词攻击、敏感信息泄露和幻觉输出三类风险。提示词攻击包括提示词越狱、提示注入等方式,攻击者通过构造特殊输入诱导模型绕过安全规则,输出违规、危险或越权内容;敏感信息泄露则可能发生在模型调用内部知识库、处理业务数据或多轮交互过程中,导致隐私数据、生产信息、管理文件或涉密业务内容外泄;幻觉输出则是模型生成不真实、不准确或缺乏依据的信息,在高可靠性要求的核能业务中可能误导判断和决策。

在安全能力提升方面,项目强调从攻击防御、内容审核和安全护栏三个层面协同建设。攻击防御的重点是提升模型鲁棒性,使模型在面对异常输入、恶意扰动和攻击行为时仍能保持稳定可靠的输出;内容审核与智能拦护机制则要求对大模型交互过程、输入提示词和输出内容进行持续监控,对违规内容、敏感信息泄露、越狱攻击和幻觉输出及时识别并阻断;安全护栏建设则面向更复杂的应用形态,尤其关注多轮对话、外部文档、图片、链接、插件调用等场景中的间接提示注入攻击,形成覆盖模型使用全流程的防护能力。

报告进一步说明了项目的关键技术路线。首先,需要开展多元异构信息采集与表征,针对不同攻击行为提取敏感特征,将文本、上下文、交互日志、模型状态等非结构化信息转化为可计算的数字特征。随后,可利用流形学习、对比学习等方法,将高维特征映射到更便于区分正常与异常行为的低维空间,为后续状态识别和异常检测奠定基础。

在行为建模阶段,项目将低维特征点识别为模型行为状态,并通过马尔可夫链等时序模型分析状态转移规律。正常情况下,大模型在特定任务、提示和上下文中的行为状态转移应具有一定稳定性;当模型受到攻击或被诱导产生异常输出时,状态跳转概率、推理路径和输出分布可能出现偏离。通过计算这些偏离程度,可以发现攻击诱发的异常行为模式,实现更细粒度的实时检测。

基于内生行为画像,项目将综合模型高概率状态转移路径,构建正常行为基准画像,并在实际交互中持续比较当前行为与基准画像之间的偏离度。对于对抗样本检测,可通过分析样本画像在特征空间中的局部密度和统计分布,发现偏离正常样本群体的异常点;对于后门攻击检测,可利用模型自我审查机制,对推理步骤和最终输出进行一致性检验,识别逻辑矛盾、异常触发和潜在后门行为。

在内容安全检测方面,报告提出可结合检索增强生成技术,为模型输出提供外部知识支撑,减少凭空生成和幻觉风险。同时,在训练或预训练过程中加强数据清洗和安全特征提取,有助于提升模型对违规内容、敏感信息和风险表达的识别能力。项目也强调从被动检测转向主动防御,通过鲁棒性训练和对抗样本训练,使模型学会忽略恶意扰动,在面对常见攻击方式时保持稳定、可信的输出。

从预期成果看,项目计划形成专利、论文等知识产权和研究成果,并推动大模型安全检测与防护技术产品化、平台化,构建可在实际业务中落地的大模型安全防护平台。该平台将从攻击检测和安全防护两个方向发力,支撑对提示词攻击、对抗样本、后门风险、幻觉输出、敏感信息泄露等问题的识别、阻断和追溯。

报告认为,该项目具备较好的理论可行性和技术可行性。大模型可解释性、内部机制分析、模型行为建模和一致性研究为内生行为画像提供了理论基础;学术界和产业界在提示词攻击、对抗样本防御、后门检测、幻觉治理、内容安全审核等方向已有一定积累,也为项目实施提供了方法参考和工程支撑。结合核能行业对安全性、可靠性和合规性的高要求,该方向具备明确的应用价值。

在应用前景方面,项目首先可服务于集团内部大模型体系建设。随着各成员单位陆续部署AI应用,数据泄露、幻觉输出、提示词攻击、后门风险等问题将成为大模型规模化应用中的共性安全挑战。通过建立统一的大模型攻击检测、内容安全审核和安全防护方案,可以为集团内部AI应用提供持续安全保障。进一步看,该项目也可面向核能领域形成标准化解决方案,支撑核能行业大模型安全可信应用,推动AI技术在高安全要求场景中更加稳妥地落地推广。

 

 

 

 

免责声明:本网转载自合作媒体、机构或其他网站的信息,登载此文出于传递更多信息之目的,并不意味着赞同其观点或证实其内容的真实性。本网所有信息仅供参考,不做交易和服务的根据。本网内容如有侵权或其它问题请及时告之,本网将及时修改或删除。凡以任何方式登录本网站或直接、间接使用本网站资料者,视为自愿接受本网站声明的约束。