一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

大模型厂商利用用户输入信息训练AI的合规策略

时间:2026-07-29 16:22:57 编辑:袖梨 来源:一聚教程网


大模型厂商使用用户输入信息训练AI的合规策略




引言



模型开发者需要使用海量语料训练生成式人工智能,以增强模型的表现能力。然而,人们享受人工智能便利的同时,厂商利用用户输入数据训练模型所引发的数据泄露也曾成为舆论焦点,例如韩国三星集团员工使用ChatGPT造成商业信息泄露。



对于优化模型表现能力、改善交互质量而言,用户输入及反馈数据对人工智能企业具有一定价值;与此同时,确保用户输入数据得到合法合规收集也不可忽略。本文以各大AI产品的隐私政策为切入点,讨论收集用户输入信息的合规要点,为人工智能企业依法收集相关数据提供参考。



大厂如何使用用户输入数据训练模型?



对于用户输入数据的收集,市面上主要AI产品是怎样规定的?笔者搜集的隐私政策涉及国外的ChatGPT、Gemini、Claude,也涉及国内的kimi、通义千问、文心一言、讯飞星火、百川智能、豆包、智谱清言、腾讯混元:



1.模型会收集哪些用户数据?



(1)用户输入的文本、语音、图片等信息属于收集内容



上述国内大模型厂商对交互期间输入信息的收集,均会在用户协议或隐私政策中向用户明确说明。收集范围并不总是限于基本文本,例如通义千问、讯飞星火还包括文档或网址信息、图片信息、语音信息、语音转文本信息等。



(2)用户对模型生成内容提供的反馈信息



为提升输出质量,文心一言、讯飞星火、百川智能会采集用户对输出内容作出的点赞、踩等评价。豆包还会收集点击、浏览、编辑等用户行为操作记录。


 

(文心一言隐私政策)


 

(通义千问隐私政策)



2.模型收集用户输入数据的目的是什么?



对于收集目的,国内各大模型厂商均作出了告知,相关表述大体包括训练与优化模型、改进产品、提升对话质量和响应速度、增强理解输入内容的能力等,彼此差异不大。



相比之下,Claude对收集目的说明得更加细致:其把输入与输出信息作为一种数据类型,并作出针对性披露,部分内容如下图:


 

(Anthropic隐私政策)



由此可见,市场上多数模型厂商会借助隐私政策或用户协议获得用户同意。相较于部分产品暗中使用用户输入数据训练模型,上述产品在用户协议或隐私政策中如实披露,或许更容易获得用户好感,也为以后可能发生的数据泄露事件留下了合规解释空间。



用户协议或隐私政策虽能使大模型厂商取得用户同意,用户输入却可能涉及个人信息,乃至对个人权益产生重大影响的敏感个人信息。模型训练开始前,通义、kimi、腾讯混元等一众厂商承诺先对收集的个人信息作去标识化处理,防止特定个人身份被识别;讯飞星火、智谱清言更指出会进行匿名化处理。然而,匿名化技术可能难以实现,其标准也不太清晰;经过去标识化的信息依旧属于个人信息范畴。要求单独同意又可能降低用户体验,并使产品研发成本上升。考虑当前人工智能行业的发展与监管实际,较好的选择可能是让用户能够关闭/拒绝模型对用户数据的收集和使用。


 

(腾讯混元隐私政策)



(讯飞星火隐私政策)


2.拒绝方式



现有AI产品的实践可归纳出三种思路,用来应对用户拒绝大模型收集、处理其输入数据的情况:



第一,文心一言、讯飞星火、百川智能采取提醒方式,要求用户谨慎输入,不要提交不愿被用于训练的内容;这样做会影响部分功能的使用。


 

(文心一言隐私政策)



(百川智能隐私政策)



(讯飞星火隐私政策)



第二,设置用于拒绝处理的关闭按钮。



国内大模型中,笔者通过未完全测评发现智谱清言、豆包设有关闭/拒绝方式。其中智谱清言明确允许使用者以电话与邮箱联系,拒绝厂商收集输入信息并用于模型训练。


 

(智谱清言隐私政策)



豆包则设置了两类途径:语音信息的授权可依次进入“设置”-“账号设置”-“改进语音服务”撤回;其他信息的授权则可通过邮箱联系撤回。


 

(豆包隐私政策)



国外的ChatGPT与Gemini同样设置了关闭途径:



ChatGPT有两种处理方式:登录用户/已注销用户以及苹果或安卓用户,可在设置内关闭“improve the model for everyone”按钮;也可以进入“privacy portal”,点击“不要训练我的数据”来提交请求。


 

(OpenAI隐私政策)




Gemini可以选择“关闭”或“关闭并删除”应用活动记录。在删除后,Gemini不会审核日后的对话记录或将其用于改进机器学习模型,但也不会清除已经审核或批注过的对话,并且这些对话最长会保留3年。值得注意的是,即使用户未关闭应用活动记录,Gemini也提供了保存期限的选项(3个月、18个月、36个月)。



围绕数据最小化、用户控制、透明度、可责性等方面的详细说明,出现在谷歌于2024年6月发布的《谷歌生成式人工智能与隐私政策建议工作计划》中。



第三,opt in是Claude采取的方式。



用户输入内容在默认情况下不会被Claude用于训练模型,训练只会发生于三种例外:(1)您的对话被标记为信任与安全审查,包括供我们的信任和安全团队使用的训练模型;在符合 Anthropic安全使命的前提下,我们可能使用或分析它们,以提升检测和执行使用政策的能力,或(2)您已通过反馈机制等方式明确向我们报告材料,或(3)您已经明确选择让自己的输入和输出用于训练目的。


 

(Anthropic隐私政策)



统一的“同意告知”是国内大模型厂商以用户输入数据训练模型时主要采用的合规路径,通常通过用户协议或隐私政策实现;厂商同时声称以去标识化/匿名化措施保护个人信息。少数厂商另外提供关闭方式,让用户输入内容停止被收集。国外部分AI产品也能带来合规思路,例如Claude所采用的opt in。



大模型利用用户输入数据的合规要点



以下建议以《生成式人工智能服务安全基本要求》(以下简称《基本要求》)国家标准和《生成式人工智能服务管理暂行办法》(以下简称《暂行办法》)为依据,参考电子商会《生成式人工智能数据应用合规指南》(以下简称《合规指南》)团体标准,并结合国内外实践提出:



1.履行“告知-同意”义务



(1)告知



用户输入内容会被用于优化服务、改进产品、训练模型等事项,大模型厂商应在隐私政策中向用户作出明确告知。



此外,按照《基本要求》,服务若通过交互界面提供,应将三类内容放在服务协议等使用者易于查看的位置公开:所采集个人信息及其服务用途,所用模型、算法等方面的概要信息,以及服务的局限性。



在服务局限性方面,多数厂商既未设置关闭选项,又以一揽子同意的形式收集个人信息,用户只能通过不输入内容来防止其输入数据成为训练语料,此时厂商应说明这样做将导致部分或全部服务无法使用。在模型、算法信息方面,上述国内大模型中只有豆包公开了“算法及模型备案公示说明”,其他厂商可加强相关告知,进一步提高透明度。



最后,厂商针对个人信息的收集及用途,需要依照《个人信息保护法》履行一般告知义务,向使用者说明行权方式、存储期限、收集方式、目的和种类等。由于用户输入信息的种类与内容事前无法确定,只能如前所述在隐私政策中作概括告知。Gemini则把输入信息作为一种数据类型,明确其收集目的并开展针对性披露,这种做法具有一定参考价值。



(2)同意



按照《基本要求》,使用者输入信息被当作语料时,使用者授权记录应当具备。该要求同时明确:语料含有个人信息的,使用前须取得对应个人同意,或者存在法律、行政法规规定的其他情形;若包含敏感个人信息,则使用前须取得对应个人单独同意,或者符合上述其他情形。



提供者只有具备其他合法性基础,才可例外处理;否则,依据《合规指南》,在未明确告知并取得使用者同意的情况下,不得擅自把使用者输入信息用于后续模型训练。



不少产品会让用户同意用户协议/隐私政策,以此取得个人同意。问题是,面对敏感信息个人由用户输入并被处理的情形(例如AI形象照产品),大模型厂商只依赖隐私政策获得用户同意,可能并不足够。



此外,《合规指南》规定,除非获得使用者同意或具备其他合法性基础,提供者不得违法向他人提供使用者的输入信息和使用记录。用户输入信息会被采集用于训练大模型,这些信息可能经算法内化为模型自身能力,随后在与其他用户交互时输出相关内容,进而形成公开个人信息的情形。



但需要说明,在语言大模型的环境中,与以往app/小程序收集敏感个人信息的场景显著不同,语言大模型厂商未必主动寻求从用户输入信息中获取敏感个人信息。



若继续采用以往的单独同意模式,语言大模型厂商未必能确定弹窗时点,因为无法判断用户何时会输入敏感个人信息;用户也未必愿意受到反复弹窗的打扰。



因此,对于处理敏感个人信息是否需要弹窗,我们认为仍应让子弹再飞一会,观察监管态度以及语言大模型的发展情况后,才能得出结论。但至少在当前,这可能并非重要或紧急事项。



当然,以去年爆火的妙鸭相机为例,大模型厂商明知将处理用户输入的人脸敏感个人信息;对此,我们非常建议以“弹窗”等形式,由厂商取得用户的单独同意。



2.保护义务




《暂行办法》第十一条对提供者提出三项禁止要求:不得非法向他人提供使用者的输入信息和使用记录,不得非法留存能够识别使用者身份的输入信息和使用记录,不得收集非必要个人信息;同时,提供者应依法履行对上述信息和记录的保护义务。



实践中的大模型厂商需要作出保证:使用者输入信息进入训练前须完成去标识化/匿名化技术处理;上述信息既不用于识别特定身份,也不会被非法留存至能够识别身份。



此外,善意提醒也是厂商应履行的义务:应在隐私政策里告诫用户,不愿用于训练的数据内容要谨慎输入,从而避免权益侵害、数据泄露等问题。



3.拒绝方式



针对收集使用者输入信息用于训练,《基本要求》规定:1)关闭输入信息用于训练的方式应提供给使用者,例如语音控制指令或选项;这一方式须便捷,若采用选项,从服务主界面抵达该选项的操作不得超过4次点击;2)使用者应被显著告知输入信息的收集状态,以及1)所述的关闭方式。



如前所述,国内的豆包、智谱清言与国外的ChatGPT、Gemini均采用opt out,为用户设置关闭选项,Gemini还允许未关闭的用户选择保存期限。Claude的不同之处在于采用opt in,只有符合规定的三种情况才能使用用户输入数据,否则不得训练模型。因此,依据《基本规定》和行业实践,我们认为厂商应设置关闭选型,尽管国内多数厂商尚未落实;Gemini的隐私政策在这一基础上更加完备,值得参考。




结语



数据“喂养”在大模型飞速发展的当下极为重要,与个人信息保护的冲突却也必然发生。上述建议只是从既有实践和现行规范出发的一得之愚,用户输入信息如何合规利用,仍有待继续探索。人工智能固然需要发展空间,但明确不能野蛮生长;舆论与监管的双重声讨之下,大模型厂商的收集行为必定会走向更加规范。

热门栏目