指南AI访谈知情同意隐私保护数据最小化

AI 访谈怎样做好知情同意与隐私?从数据流而非勾选框开始

把 AI 角色、记录媒介、目的、访问、保存、共享、退出和意外披露写进分层告知,并用逐数据对象台账、最小化与重新识别审查落实承诺。

最近更新 2026年9月2日 13 分钟 阅读

AI 访谈的知情同意不是“开始前勾选一次”,而是让参与者在整个数据生命周期中能够预期:谁在研究、为什么邀请、AI 做什么、会记录什么、谁能访问、数据会去哪里、保存多久、怎样跳过或退出,以及哪些个体信号会被处理。只有告知,没有数据最小化、权限、删除和意外披露流程,保护仍停留在文案;只有安全措施,却没有让人理解和自愿选择,也不是充分同意。

不同地区、机构和研究类型的法律、伦理与合同要求不同,员工、未成年人、医疗、金融和跨境项目还可能有额外规则。本文提供研究设计框架,不给出具体法律结论。上线前应由有权限的法律、伦理、隐私、安全和领域负责人根据当前数据流与当地要求审查。

先画数据流,再写同意文案

团队应从邀请到删除列出每个数据对象,而不是笼统写“我们会保护您的信息”。一场 AI 语音访谈可能同时产生:招募名单、唯一邀请链接、资格答案、同意记录、原始音频、自动转写、对话上下文、模型输入输出、人工批注、主题编码、引用片段、激励记录、回访联系方式、聚合报告和系统日志。

每个对象至少回答八个问题:为什么需要、收集哪些字段、来源是谁、经过哪些系统或供应商、谁能访问、如何关联、保存多久、何时删除。若团队说不清原始音频是否在转写后保留,就无法向参与者作出真实承诺;若供应商配置会将内容用于模型训练或产品改进,也不能用一句“AI 仅辅助分析”带过。

短版告知至少回答十个关键问题

  1. 研究主体和可联系的负责人是谁。
  2. 研究目的、邀请原因和参与者要做什么。
  3. 预计时长、文字、语音、视频、屏幕或其他记录范围。
  4. AI 是否负责提问、追问、转写、翻译、摘要、编码或质量检查。
  5. 哪些信息明确不需要,参与者应避免披露什么。
  6. 原始记录、转写、分析与引用分别由谁访问和接收。
  7. 是否经过外部服务、跨地区处理或用于训练及改进模型。
  8. 每类数据保存多久、怎样删除,以及删除的现实限制。
  9. 参与自愿、可跳过、暂停或退出,不参与会不会带来后果。
  10. 问题、隐私请求、投诉、风险或紧急情况使用什么渠道。

美国卫生与公众服务部人类研究保护办公室将同意描述为披露信息、促进理解与保持自愿的过程,并明确签署文件本身不等于充分同意。一个实用做法是先给一屏关键事项,再提供完整说明;让不熟悉项目的人复述 AI 角色、访问者、保存和退出,而不是只检查他是否点了同意。

匿名、去标识化、假名化和保密不能混用

匿名意味着研究方不能合理地把数据连回个人,带唯一邀请、激励或回访的项目通常很难在收集阶段真实匿名。去标识化是删除或泛化姓名等识别信息,情境仍可能重新识别。假名化用代码替代直接身份,但连接表仍存在。保密是通过承诺、权限和流程限制披露。

因此,不要把调查描述成无法关联个人。更准确的表述可能是:“邀请名单与访谈内容分开保存;分析副本移除直接身份;只有指定研究人员在必要时使用连接键;管理者只收到达到报告门槛的聚合结果。”保护能力必须与真实系统配置一致。

一百二十名员工案例:不问姓名仍可能识别个人

下面是一个示例性案例。某组织邀请一百二十名员工讨论跨团队协作,六个部门各二十人。研究没有在访谈正文中询问姓名,但招募名单保留部门、岗位层级和任期,十八名自愿回访者还在独立表单留下联系方式。初稿报告按部门、岗位层级和“入职不足一年”交叉切分。

某部门“高级岗位且入职不足一年”的结果单元只有三人,其中一段引用提到一个只有一位成员负责的迁移项目。即使删除姓名,同事也很容易从部门、任期、角色和项目语境推断说话者。风险来自字段组合和原话,不是只有姓名字段。

团队据此取消该三人单元的独立比例,将任期合并到更大范围,并删除不影响结论的项目名;引用改为转述共同机制,只有在更大人群中反复出现且无法合理识别时才使用原话。十八份回访联系方式保留在访问更严格的独立表,报告分析表只保存随机代码。即便设置最小报告单元,这也不是匿名保证;独特事件和组织知识仍需逐条审查。

数据最小化要在提问、媒介和保存三个层面实施

提问最小化:每个敏感字段都写明它将改变哪个分析或决策。只需了解企业规模时,不必询问公司全名;只需地区时,不必收精确地址。密码、验证码、完整证件、完整账户、第三方身份和无关健康财务信息应明确禁止索取。

媒介最小化:只需文字证据时,不默认保存声音和面孔;只需观察手部操作时,不拍摄家庭环境。屏幕共享前提醒关闭通知并使用示例数据。AI 大纲遇到敏感内容不继续追问,只按批准规则转场。

保存最小化:原始媒介、转写、连接键、编码和聚合结果有不同保留期。英国信息专员办公室关于 AI 和数据保护的指导将目的、保留、共享、用途限制和最小化作为关键事项,也指出“以后可能有用”不能自动证明现在有必要收集或保留。该指导正随英国法律变化接受更新,具体义务必须核对最新适用规则,但防止用途蔓延的方法原则依然清楚。

把 AI 的每个角色逐项说清楚

“本研究使用 AI”信息不足。参与者需要知道 AI 是根据大纲生成追问、把语音转成文字、翻译、摘要、推荐主题,还是输出可能影响个人的判断。还要说明研究者是否看原始内容、自动结果是否人工复核、错误怎样纠正,以及对话是否被用于训练或改进外部或内部模型。

NIST 的生成式 AI 风险管理资料建议在重要交互前记录并向用户说明 AI 互动,系统清单还应包含数据来源、已知问题、人类监督、敏感数据和底层模型版本。对于访谈项目,这意味着“同意版本—大纲版本—模型或服务版本—数据用途”应能对应,不能只保存一个勾选时间。

目的改变不能被旧同意无限覆盖

最初目的若是“汇总本次服务改进”,后来想把原始对话用于训练通用模型、员工绩效、销售线索或产品资格判断,就已经改变参与者能够合理预期的用途。团队应暂停新用途,重新做法律和伦理评估,判断是否兼容、需要重新告知或重新同意;不满足条件时就不使用。

不要在长文末尾放一句“也可能用于其他用途”试图无限扩张授权。告知应具体到参与者能够理解为什么可能愿意或不愿意。目的、共享对象、保存期或风险发生实质变化时,保留新的版本和适用人群。

退出和删除必须写现实可执行的边界

参与者应知道如何在访谈中暂停、跳过或结束,也应知道访谈后在哪个时间点前可以提出删除。若内容已经不可逆地进入不含连接键的聚合统计,或依法必须保留部分记录,应提前准确说明。不能承诺“随时删除所有数据”,实际却没有办法找到相关副本。

删除流程要覆盖主存储、导出、转写、标注、备份策略和供应商端处置,并记录完成。研究团队还应决定退出是否影响已经支付的合理激励;不能用扣除激励惩罚中途停止,从而削弱自愿性。

员工、儿童和高风险情境需要额外保护

员工即使看到“自愿”,也可能担心直属主管知道谁拒绝或说了什么。招募和分析应与绩效管理分离,管理者不查看个体响应,报告控制小单元和可识别引用。抽奖、工作时间或上级邀请也要评估是否形成不当压力。

涉及儿童时,不能只取得监护人许可就忽略儿童本人的适龄说明和意愿。UNICEF 的证据伦理政策强调伦理审查、保护、风险管理、有意义的同意或同意表达、保密、隐私和数据管理。儿童拒绝或停止应被尊重,具体做法由当地法律、年龄、能力、机构和风险决定。

涉及创伤、医疗、金融困难、违法或安全事件时,应由相应专业人员制定停止、支持和升级流程。AI 不得自行承诺保密例外、紧急响应或专业建议。参与者必须知道问卷或访谈是否有人实时查看,以及紧急情况应使用的正式渠道。

开放文本和自动摘要有两次隐私风险

第一次风险发生在原始披露:参与者可能主动说出姓名、公司、客户、地址、账户或第三方事件。系统应提醒避免无关信息,对高风险模式设置安全拦截,并允许参与者回看或更正。第二次风险发生在摘要:模型可能保留独特细节,或把多条线索组合成更易识别的人物画像。

去标识化不能只跑一次姓名替换。应检查直接标识、准标识、独特事件、引用必要性和小单元,人工复核所有外发原话。自动摘要只作为分析索引,不能因措辞更顺畅就越过原始同意范围。

一份可审计的数据台账

项目台账可按行记录“数据对象”,按列记录目的、字段、来源、法理或伦理依据、系统、供应商、地区、访问角色、连接键、保留期、删除方法、同意版本和风险负责人。上线审查不是问“有没有隐私政策”,而是逐行确认告知与实际处理一致。

还要定期抽查权限、异常导出、未按期删除、模型或供应商变更和参与者请求。发生偏差时记录影响范围、补救和是否需要通知。报告只输出决策所需的最少聚合结果,不把完整原始数据默认交给所有项目成员。

发布前检查清单

  1. 邀请、身份、同意、媒介、转写、模型、编码、引用、回访和删除数据流已画清。
  2. 短版关键事项可让陌生读者复述 AI 角色、访问、保存和退出。
  3. 匿名、去标识化、假名化与保密用词符合真实能力。
  4. 每个字段、媒介和保留期都有具体研究用途,没有用途就删除。
  5. 供应商、跨地区处理、模型训练与产品改进用途准确告知。
  6. 联系方式、连接键和内容分离,访问遵循最少权限。
  7. 小单元、准标识和独特引用经过重新识别风险审查。
  8. 拒答、退出、删除、投诉、敏感披露和紧急支持均可执行。
  9. 新用途和重大配置变化重新评估,不用旧勾选无限覆盖。
  10. 同意、大纲、模型、处理和报告版本可对应并接受审计。

媒介数据对象可结合文字、语音与视频访谈选择;追问禁区和停止条件写入AI 访谈大纲;数据库层面的键、身份与回答分离参考调查数据库结构,版本与删除记录使用数据版本和血缘。最可靠的同意文案不是写得最全面,而是每一句都能在真实系统、权限和删除操作中得到证明。

同意与隐私依据