国家标准项目《自动化系统与集成 智能信息系统 大模型生成内容安全风险分类体系》由 TC159(全国自动化系统与集成标准化技术委员会)归口,TC159SC5(全国自动化系统与集成标准化技术委员会体系结构、通信和集成框架分会)执行 ,主管部门为中国机械工业联合会。
主要起草单位 西北工业大学 、中国轻工业信息中心 、中国电信集团有限公司 、中国联合网络通信有限公司研究院 、武汉大学 、哈尔滨工业大学(深圳)(哈尔滨工业大学深圳科技创新研究院) 。
| 35 信息技术、办公机械 |
| 35.240 信息技术应用 |
一、范围 本文件规定了智能信息系统中大模型生成内容安全风险的分类原则、分类方法、分级方法、及其使用指南。 本文件适用于智能信息系统中大模型生成内容的安全风险识别、安全评估、以及安全事件的分类与报告。 二、主要技术内容 1.术语和定义,明确20余个核心术语,涵盖: ?基础概念:大语言模型、生成内容、生成内容安全风险、内容模态等; ?内容风险类型:违规违法内容、虚假内容、误导性内容、敏感信息、危险操作内容、有害内容等; ?工业场景术语:工艺参数、控制指令、操作建议等; ?风险管理术语:风险分类、风险分级等。 2.分类原则 提出6项分类原则: ?科学性原则:分类依据明确,类别划分具有理论基础; ?完备性原则:覆盖主要生成内容安全风险类型; ?互斥性原则:同级类别之间边界清晰、互不重叠; ?可扩展性原则:预留新兴风险纳入空间; ?实用性原则:便于实际风险识别和评估; ?内容聚焦原则:聚焦生成内容本身,不涉及系统层面风险。 3. 4.安全风险分类方法,建立按内容危害类型分类的框架: 代码 一级类别 二级类别数 三级类别数 说明 A 违规违法内容风险 4 10 内容违反法律法规、公序良俗 B 虚假误导内容风险 3 7 内容不真实或产生误导 C 信息泄露内容风险 3 6 内容泄露敏感/受保护信息 D 危险操作内容风险 3 7 内容可能导致物理/系统危害 E 社会危害内容风险 3 5 内容对社会产生不良影响 合计 16 35 其中7个为工业场景特有风险 A类 违规违法内容风险(10个三级类别) ?A.1 违法信息:危害国家安全、煽动民族仇恨、宣扬恐怖主义等; ?A.2 暴力色情:暴力恐怖内容、色情低俗内容等; ?A.3 歧视仇恨:种族歧视、性别歧视、其他歧视等; ?A.4 侵权内容:著作权侵权、商标侵权等。 B类 虚假误导内容风险(7个三级类别) ?B.1 事实性错误:幻觉/捏造事实、过时/失效信息; ?B.2 专业误导:错误医疗建议、错误法律建议、错误工艺建议[I]; ?B.3 舆论误导:虚假新闻/谣言、伪科学内容。 C类 信息泄露内容风险(6个三级类别) ?C.1 个人隐私:个人身份信息泄露、个人敏感信息泄露; ?C.2 商业秘密:商业机密泄露、工艺Know-how泄露[I]; ?C.3 系统信息:系统配置信息泄露、安全策略信息泄露。 D类 危险操作内容风险(7个三级类别)[工业场景重点] ?D.1 危险指令:设备损坏指令[I]、人身伤害指令[I]、环境污染指令[I]; ?D.2 错误参数:工艺参数错误[I]、控制参数错误[I]; ?D.3 恶意代码:可执行恶意代码、注入攻击载荷。 E类 社会危害内容风险(5个三级类别) ?E.1 价值观危害:不良价值观传播、意识形态渗透; ?E.2 社会秩序:社会恐慌内容; ?E.3 认知操纵:大规模舆论操纵、身份冒充欺骗。 注:[I]表示工业场景特有或重点关注的风险类别 5.安全风险分级方法,建立四级分级体系: ?I级(特别重大):危害国家安全、社会稳定,造成群体性人员伤亡; ?II级(重大):严重影响多个组织,造成人员重伤或严重经济损失; ?III级(较大):对单个组织造成重大损失,造成人员轻伤或设备损坏; ?IV级(一般):影响个别用户,造成有限损失; 分级评估要素包括: ?危害程度(35%):对人员安全、财产、信息的直接损害程度; ?影响范围(25%):受影响的人员数、组织数、地理范围; ?内容传播性(20%):内容被传播、复制、引用的可能性; ?可逆性(10%):危害后果能否恢复或挽回; ?发生可能性(10%):风险内容被实际使用的概率。 安全风险分类体系使用指南,提供分类体系的应用方法,包括: ?风险识别流程; ?场景判定(通用场景[G]或工业场景[I]); ?风险报告格式与内容要求。 6.附录 ?附录A(资料性):面向智能信息系统的大模型生成内容安全风险类别典型示例; 附录B(资料性):大模型生成内容安全风险分类体系在工业场景应用说明。