一、 总则
1. 为落实本公司算法安全主体责任,建立健全算法安全常态化监测体系,及时发现、预警和处置算法推荐服务及大模型应用中的安全风险,依据《中华人民共和国网络安全法》《中华人民共和国数据安全法》《中华人民共和国个人信息保护法》《互联网信息服务算法推荐管理规定》《生成式人工智能服务管理暂行办法》等法律法规及公司《算法安全管理办法》,制定本规范。
2. 本规范适用于本公司所有已上线运行及试运行的算法推荐服务、大模型生成服务及其支撑系统,覆盖算法设计、开发、测试、上线、运营及下线全生命周期中的持续安全监测活动。
3. 算法安全常态化监测遵循“全覆盖、实时性、可追溯、闭环管理”原则,对信息安全、数据安全、用户个人信息安全及算法自身安全实施7×24小时不间断监测,确保风险早发现、早报告、早处置。
二、 组织与职责
1. 算法合规部是算法安全常态化监测的归口管理部门,履行以下职责:
(一) 制定并维护本规范,指导各业务线开展日常监测工作;
(二) 建设、运维算法安全智能管控平台,部署监测策略与告警规则;
(三) 执行7×24小时实时监测,对异常情况进行初步研判与记录;
(四) 每月编制《算法安全监测报告》,报送首席算法安全官及技术总监;
(五) 发现重大安全事件时,按照《算法安全事件应急预案》启动应急响应。
2. 各算法业务部门指定算法安全接口人,配合算法合规部完成本业务线算法的监测数据对接、异常排查与整改工作,并确保监测措施在实际业务中有效落地。
3. 技术保障岗人员负责监测工具的配置与优化、对抗攻击检测、模型鲁棒性自动化测试等具体技术操作;安全合规岗人员负责监测结果的合规性判定、违规线索的初步调查与证据固定。
三、 监测内容与要求
1. 信息安全监测
a) 监测范围:算法推荐分发及大模型生成的文本、图片、视频、音频、直播、交互对话等所有形态信息内容。
b) 监测目标:
i. 色情、暴力、恐怖、赌博、毒品等违法违规内容;
ii. 虚假信息、谣言、扰乱社会秩序的内容;
iii. 侵犯著作权、商标权等知识产权的信息;
iv. 违反《广告法》的虚假广告、误导性营销内容;
v. 大模型越权、伪造、政治敏感及违反公序良俗的输出;
vi. 其他法律法规禁止传播的信息。
c) 技术保障措施:
d) 部署基于多模态的智能内容安全引擎,对全量信息实施机器审核,支持对文本、图像、视频进行实时涉政、涉黄、涉暴识别;
i. 对高热内容、高互动量内容设定动态阈值,自动触发人工复校,确保准确率;
e) 建立信息源白名单与动态信誉评价机制,对信源进行分级可信度评估,自动阻断高风险来源内容进入推荐或生成通道;
i. 启用智能“熔断”机制,当某类话题、关键词或内容片段的告警量突破阈值时,自动暂停相关推荐或生成服务,直至人工确认安全后恢复;
f) 针对大模型,强化输入与输出的双向安全过滤,检测和拦截越权指令、角色伪造、诱导生成违法内容等攻击行为;
i. 日志记录所有内容安全判定结果与人工处置动作,确保可审计。
2. 数据安全监测
a) 监测范围:算法训练数据、微调数据、日志数据、用户行为埋点数据、模型参数数据及与之相关的存储与传输环节。
b) 监测目标:
i. 数据未授权访问、越权查询、批量导出(拖库)等异常操作;
ii. 敏感数据明文传输、违规出域、跨境等行为;
iii. 数据完整性破坏、异常篡改;
iv. 第三方数据接口调用过程中的安全风险。
c) 技术保障措施:
d) 实施数据分类分级,对个人信息、商业秘密等高敏感数据采用加密存储与脱敏处理;
e) 搭建算法开发数据安全沙箱,严禁原始敏感数据离开安全域,训练环境与外网物理隔离或逻辑隔离;
f) 部署数据库审计系统与API流量分析系统,对数据的访问、导出、修改行为进行实时记录,基于行为基线建立异常检测模型,对批量下载、非工作时间访问、异常IP访问等行为即时告警;
i. 对大模型训练过程中的数据处理管道进行安全检测,防止数据污染与投毒;
ii. 日志及备份数据同样纳入监测范围,防止利用备份恢复进行的数据窃取。
3. 用户个人信息安全监测
a) 监测范围:算法推荐及大模型服务中涉及的用户个人信息收集、存储、使用、加工、传输、提供、删除等全过程。
b) 监测目标:
i. 违规收集、超范围使用用户个人信息;
ii. 用户画像标签中直接使用或泄露可以别个人身份的信息;
iii. 模型输出中含用户个人信息或可反推至特定个人的信息;
iv. 用户行使查阅、更正、删除、注销等权利的响应是否合规;
v. 个性化推荐关闭、不感兴趣等选择权功能是否正常有效。
c) 技术保障措施:
i. 严格遵守“最小必要”原则,在用户个人信息进入算法训练或推理阶段前,强制执行去标识化、泛化处理,禁止使用精确位置、设备唯一序列号、身份证号等高敏字段直接参与模型运算;
d) 在推荐接口及大模型输出端部署个人信息安全网关,基于正则、NER模型等实时检测输出内容中是否存在姓名、手机号、地址、证件号等个人敏感信息,一经发现自动拦截或脱敏;
e) 对用户删除数据后的残留情况进行定期自动扫描,确保在规定期限内完成清理,并记录清除结果;
f) 利用模型反推风险检测工具,周期性对用户画像、生成内容进行模拟反推攻击,评估隐私泄露风险并加固防护;
g) 监测用户关闭个性化推荐、标签删除等功能的有效性,确保用户权益功能不被绕过。
4. 算法自身安全监测
a) 监测范围:算法推荐模型、大语言模型的鲁棒性、公平性、可解释性、对抗性风险以及服务接口安全。
b) 监测目标:
i. 算法模型被对抗样本、恶意提示注入、越狱攻击等干扰导致的异常输出;
ii. 模型输出分布发生显著漂移,可能反映出模型退化、数据偏移或被投毒;
iii. 模型服务被恶意高频调用、挖掘模型特性等滥用行为;
iv. 算法漏洞、后门以及未按《互联网信息服务深度合成管理规定》进行AI标识的情况;
v. 模型生成内容中的偏见、歧视及非预期有害性。
c) 技术保障措施:
d) 搭建算法鲁棒性自动化测试平台,定期(每日)向在线服务模型注入标准化对抗样本、典型越狱提示、恶意角色扮演等攻击载荷,评估模型防护能力并生成测试报告;
e) 持续监控模型决策(生成)的关键输出分布,对异常波动(如敏感类别输出突增、拒绝回答率陡降等)设置基线阈值告警,自动触发深度排查;
f) 建立模型异常行为全息回放与分析系统,完整记录每次请求的输入、输出、模型中间状态,支持事后追溯和漏洞成因分析;
g) 对算法API接口执行强认证鉴权、调用频率限制、输入输出长度与格式约束,防范恶意爬取、模型盗用及拒绝服务攻击;
i. 针对深度合成内容,自动化检测是否添加符合要求的显式及隐式AI标识,监测标识被恶意去除的情况并告警;
h) 定期使用偏见与公平性测评数据集对大模型输出进行评测,发现歧视性、仇恨性内容趋势及时修正。
四、 监测方式与频率
1. 监测方式
a) 采取自动化系统监测与人工抽样复核相结合的方式。自动化监测依托“算法安全智能管控平台”实现,人工复核由算法合规部安全合规岗按月制定抽查计划,重点针对自动化判定的边缘案例、新高风险类型及用户投诉涉及内容进行。
2. 监测频率
a) 内容安全、接口调用异常、数据异常访问等实行实时流式监测;
b) 模型鲁棒性对抗测试、个人信息残留扫描等批处理检测任务每日至少执行一次;
c) 模型输出分布漂移检测每6小时统计一次窗口数据并评估;
d) 数据集偏见与公平性测评、全面数据安全合规扫描每月至少进行一次。
3. 监测窗口覆盖所有时间,通过值班制与自动化值守确保7×24小时不间断,非工作时间的告警由系统自动关联应急响应中心值班负责人。
五、 异常发现、报告与处置
1. 异常发现
a) 所有监测产生的告警经算法安全智能管控平台去重、分级后,推送至对应处理人员。一线值班人员须在接到告警后10分钟内进行首次确认。
2. 报告与研判
a) 经确认的有效异常事件,立即按照《算法安全事件应急预案》中的分级标准判定事件等级(Ⅰ级/Ⅱ级/Ⅲ级),并向应急响应中心负责人报告。同时,记录事件详细信息至监测平台,不得拖延或隐瞒。
3. 联动处置
a) 确定为安全事件的,即刻转入应急处置程序,包括但不限于:暂时下线风险内容、熔断相应服务、回滚模型版本、阻断异常IP等;安全合规岗同步固定证据、启动调查。处置过程同步更新监测日志。具体流程按《算法安全事件应急预案》执行。
六、 监测报告与存档
1. 算法合规部每月5日前编制上月《算法安全监测月报》,内容至少包括:各项监测指标统计、告警总数与有效事件数、事件处理情况、模型表现趋势、未完成整改项以及改进建议。
2. 月报经算法合规部负责人审核、首席算法安全官批准后,报送公司技术总监及相关业务负责人,并作为算法安全档案存档,保存期限不少于三年。
3. 所有监测日志、告警记录、处置工单、对抗测试报告、合规扫描结果等均纳入监测平台集中存储,确保可检索、可追溯,支撑内部审计与外部检查。
七、 附则
1. 本规范由算法合规部负责解释和修订。如遇法律法规或监管要求变化,应及时修订本规范以满足合规要求。
2. 本规范自发布之日起生效,公司原有相关监测要求与本规范不一致的,以本规范为准。
3. 本规范为内部制度文件,全体员工应严格遵照执行,违者按《算法违法违规行为处置细则》追责。