

2023年8月15日,《生成式人工智能服务管理暂行办法》施行,我国生成式人工智能进入“有法可依”阶段;2025年9月1日《人工智能生成合成内容标识办法》施行,结合既有的《互联网信息服务深度合成管理规定》《互联网信息服务算法推荐管理规定》,以及《中华人民共和国网络安全法》《中华人民共和国数据安全法》《中华人民共和国个人信息保护法》等互联网、数据及信息相关法律法规,一张覆盖“数据—模型—内容—标识”的行政监管网已经成型。
2026年以来,随着人工智能技术的快速商业化落地,全国范围内对其的监管力度显著加强,涉人工智能企业行政处罚案件数量呈现增长趋势。对相关企业而言,监管合规已不是“可选项”,而是业务能否健康发展的“生存线”。
本文从企业监管合规视角,梳理两类最高频的风险点,并给出可落地的合规建议,以供对照自查。
一、风险点一:训练数据合规——“喂错料”,企业担责任
生成式人工智能靠海量数据“喂养”,因此,训练数据的合法性直接决定生成的内容是否合规。《生成式人工智能服务管理暂行办法》第7条明确要求,生成式人工智能服务提供者应当依法开展预训练、优化训练等训练数据处理活动,使用具有合法来源的数据和基础模型;涉及知识产权的,不得侵害他人依法享有的知识产权;涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形;采取有效措施提高训练数据质量,增强训练数据的真实性、准确性、客观性、多样性;遵守法律、行政法规的其他有关规定和有关主管部门的相关监管要求。
实务中最典型的三类风险:
1.敏感个人信息未做合规评估
凡是纳入训练的人脸、声纹、健康、金融账户等敏感信息,应当先行取得个人的“单独同意”,并进行个人信息保护影响评估(PIA),不能“先训练、后补票”。2025年“护网”专项工作中,一家主营业务为对外提供人工智能模型训练基础数据(算料)的科技公司,在处理人脸等生物识别类敏感个人信息前,未按照《中华人民共和国个人信息保护法》有关规定进行个人信息保护影响评估(PIA),被属地公安机关依据《中华人民共和国个人信息保护法》行政处罚并责令整改。
2.数据来源不可追溯
开展训练语料获取工作,应当区分来源落实合规义务。开源语料的获取与使用须严格遵循开源许可协议的约定,自采语料应当留存完整、可追溯的采集记录,商业语料需具备书面的交易合同与合规承诺。若采购的数据本身侵犯商业秘密,买受人未尽合理注意义务而继续使用或传播的,可能被认定为共同侵权;采用网络爬虫等技术手段抓取互联网数据的,需遵守目标网站的robots协议及相关访问限制,不得规避、破坏技术保护措施或未经授权抓取数据。
3.语料内容本身违规
根据《网络安全技术 生成式人工智能服务安全基本要求》(GB/T 45654-2025)等相关国家标准,训练语料须做“来源安全”与“内容安全”双筛查:对拟采集的数据来源,若违法不良信息占比超过5%,则不应采集该来源;对已采集的数据,若核验发现违法不良信息占比超过5%,则不应使用该数据用于模型训练。我国法律法规及政策要求阻断的信息(如涉密、违禁内容),则一律不得作为语料。另一类常被忽视的风险是“用户对话数据回流”——用户在与AI交互中无意输入的姓名、地址、人脸等个人信息,若被直接当作后续训练语料,同样需要取得个人授权。
中央网信办分别于2025年和2026年部署了两次AI领域专项行动,对训练语料安全问题持续开展整治。2025年“清朗·整治AI技术滥用”专项行动将“训练语料管理不严”列为六类重点整治问题之一。2026年“清朗·整治AI应用乱象”专项行动将“大模型训练语料安全问题”列为七类重点整治问题之一。
训练数据合规建议:
● 建立训练数据台账,按“公开/内部/敏感/核心”分级管理;
● 敏感个人信息训练前完成PIA并取得单独同意,原始数据须不可逆脱敏(脱敏+加密+权限隔离);
● 保留全部语料来源授权文件与采集记录,做到“来源可追溯、去向可核查”;
● 引入第三方训练/云平台时签署数据保护协议(DPA),审查其安全资质与认证;
● 在提示词与训练流程中嵌入合规约束,定期开展语料安全抽检。
二、风险点二:内容安全与标识——“生成即责任”
《生成式人工智能服务管理暂行办法》第12条要求,生成式人工智能服务提供者应当按《互联网信息服务深度合成管理规定》对图片、视频等生成内容进行标识,《人工智能生成合成内容标识办法》进一步把显式标识和隐式标识的要求落到操作层面。企业既是内容的“生产者”,也是平台的“守门人”。
实务中最典型的三类风险:
1.内容审核缺位
“完全自动生成、无审核发布”的流程在当下已不可行,企业应对生成内容进行内容审核,不得触碰法律红线。2024年5月29日,重庆某区网信办依法对属地某AI写作网站运营主体某公司未尽到审核管理义务、履行主体责任不到位的行为作出行政处罚。该企业运营的某AI写作大师网站违规生成法律法规禁止的信息,未尽到主体责任义务,违反了《中华人民共和国网络安全法》《生成式人工智能服务管理暂行办法》等相关法律法规。重庆某区网信办依据《中华人民共和国网络安全法》第六十八条的规定,给予其行政警告处罚,并责令该公司限期全面整改,加强信息内容审核,健全信息内容安全管理相关制度,暂停网站信息更新及AI算法生成式写作功能15日。
2.生成内容未标识
根据《人工智能生成合成内容标识办法》第4、5条规定,文本、图片、音频、视频等生成内容须添加可被用户明显感知的“显式标识”,并在文件元数据中嵌入“隐式标识”,平台传播时亦须核验并补标。任何组织和个人不得恶意删除、篡改、伪造、隐匿标识。2025年,在上海“亮剑浦江·2025”行动中,多家企业因未获同意克隆他人声纹信息、生成包含公众人物形象的虚假图片、生成“开盒教程”及色情低俗内容等,被有关部门以严重侵犯个人信息权益及危害网络生态为由立案查处。
3.虚假信息与侵权内容外流
若AI生成内容含有《中华人民共和国广告法》禁止的绝对化用语(“国家级”“最佳”等)、虚假功效或虚构用户评价,可能存在虚假宣传的违法行为,被市场监管部门处罚;生成物若与权利人作品构成实质性相似,还可能面临行政监管与民事侵权的双重责任。重庆某市场监管局查处重庆首例AI虚假广告案——某企业用AI虚构消费者排队抢购新能源汽车的“火爆场景”视频并通过公众号传播,既构成虚假宣传,又因仅以“#AI#”话题标签替代规范标识、未履行AI内容显著标识义务,被依法处罚。
内容安全与标识合规建议:
● 搭建“AI生成 → 关键词过滤 → 人工分级抽检 → 终审发布”四层审核机制;
● 严格按《人工智能生成合成内容标识办法》落实显式标识/隐式标识,下载、复制、导出功能确保文件带标;
● 在用户协议中明确标识方法与样式,提示用户主动声明;
● 建立违规关键词库、拒答测试题库并定期更新,覆盖主要安全风险;
● 对提示词(Prompt)设计加入合规约束,从源头降低违规概率;
● 建立知识产权投诉举报渠道,收到侵权通知及时采取屏蔽、停止生成等措施。
三、不可忽略的“上线前”义务
除上述两个风险点,企业在产品上线前还应系统自查以下要求:
安全评估与算法备案:具有舆论属性或社会动员能力的服务,须按《生成式人工智能服务管理暂行办法》第17条通过安全评估并履行算法备案、变更、注销手续。
行政许可:开展相关业务按照法律、行政法规规定需取得许可的(如《互联网信息服务业务经营许可证》等),应依法取得。
制度配适新规:部分企业的内部合规制度仍沿用旧版标准,未能依据近两年密集出台的标识、评估要求完成迭代,制度滞后本身就是风险。
结语
人工智能企业的竞争,短期看模型,长期看合规。在监管从“原则引导”全面转向“实质执法”的背景下,把合规嵌入产品研发与运营的全生命周期,远胜事后被动应对处罚。建议各企业对照前述清单,完成专项合规体检——这不仅是防范行政处罚的必要举措,更是赢得客户信任与监管认可的入场券。