一份可用的 AI 访谈大纲,不是问题列表,也不是一句“像资深研究员一样追问”的提示词;它是一份可测试的访谈合同。合同应为每个研究主题写明研究者想知道什么、参与者先回答哪个具体经历、什么信息缺失时可以中性追问、哪些回答已经足够、何时转场或停止,以及哪些敏感内容禁止索取。这样才能在保持半结构弹性的同时,让不同对话具有可比较的证据。
AI 能快速根据回答生成下一问,也更容易把研究假设带进问题、重复索取细节、误解参与者或自信地补全没有说过的因果。大纲的目标不是让 AI “聊得像人”,而是限制它只围绕参与者提供的内容获取可核验经历,并把不确定、拒答和反例保留下来。
先分开研究问题与访谈问题
研究问题是团队要解决的未知,例如“首次申请中止的主要决策路径是什么”;它不应直接变成“你为什么放弃申请”。后一个问法要求参与者一次给出完整因果总结,容易得到事后合理化。更好的主问是:“请从你最近一次开始申请说起,当时想完成什么?后来发生了什么?”
英国政府服务手册也区分团队要学习的研究问题与真正问给参与者的问题,并建议深度访谈使用开放、中性的起始问题,聚焦故事和真实例子。团队先把所有利益相关者的问题归并和排序,再选访谈能够回答的部分;销量预测、发生率和因果效果不应因为用了 AI 访谈就被偷偷放进范围。
每个主题写成六段式大纲合同
- 主题目标:研究者希望获得哪类机制或证据,不直接展示给参与者。
- 进入条件:什么经历或回答出现时进入该主题;不适用者如何跳过。
- 主问题:用开放、中性语言邀请最近一次具体事件。
- 证据缺口:时间、对象、行动、选择、原因、结果和原话中缺了什么才追问。
- 反例与对比:以前成功经历、替代方案或没有遇到该问题的人怎样不同。
- 完成与停止:已获得哪些信息即可转场,何时因拒答、痛苦、敏感或时长结束。
例如,流失主题的目标是还原最后一次任务到替代行为的路径。主问是“最后一次打开服务时,你原本要做什么?”证据追问依次补齐看到什么、做了什么、怎样求助、何时决定停止、随后用了什么;若参与者说“我不记得”或不愿透露公司细节,接受答案并转场,不应换三种措辞继续逼问。
用“证据包”判断该不该继续追问
一段完整经历至少包含情境、行动、理由和结果。情境说明时间、目标和约束;行动说明实际做了什么;理由尽量使用参与者自己的理解;结果包括是否完成、替代方案和影响。AI 在每轮只检查证据包缺口,然后提出一个最小追问,而不是把预写问题全部问完。
如果参与者说“太麻烦了”,可以问“你说麻烦,具体是从哪一步开始?”如果他说“上传后一直报错,我试了两次就改用邮件”,情境、行动与替代已较清楚,下一问可聚焦错误怎样影响决定。不能问“是不是上传按钮太难找”,因为按钮位置尚未由参与者提出。
追问按五种功能分类
- 澄清:“你说的‘他们’指谁?”只解决指代和含义。
- 过程:“看到提示后你先做了什么?”还原顺序,而非要求总体评价。
- 证据:“能回忆当时提示的大意吗?”获得原始表达,允许记不清。
- 对比:“以前顺利完成时有什么不同?”帮助区分稳定障碍与偶发事件。
- 确认:“我理解为你先尝试重传,仍失败后改用邮件,对吗?”只总结已说内容并允许纠正。
美国人口普查局访员手册强调使用中性追问,并在回答达到问题目标后停止不必要追问。AI 大纲同样要写“不要问什么”:不预设情绪,不表示某种答案更合理,不用“很多人都觉得”制造从众,不把参与者的推测升级成事实,也不因沉默自动连发多个问题。
大纲中必须标记主动询问与自发提及
团队若怀疑价格导致流失,可以在所有访谈中设置中性的决策因素主题,但不能一开始就问“价格是不是太高”。参与者在主叙述中主动提到价格,与研究者展示价格列表后选择价格,不是相同证据。分析表应记录主题是自发出现、由中性追问获得,还是由明确提示后确认。
这一区分能防止错误计算“提及率”。十二个人中八个人在被问“价格是否太高”后表示同意,不能写成“三分之二自发因为价格流失”。定性访谈本来也不适合估计总体发生率;被提示的频次更多反映大纲覆盖,不能直接当作市场比例。
二十四场预测试:怎样比较两版 AI 大纲
下面是一个示例性预测试。团队招募二十四名近期中止同一申请流程、符合相同筛选条件的参与者,随机分到旧版问题清单与新版六段式合同,各十二人。两版目标时长、介绍与五个必需主题相同:原始任务、中止触发、尝试恢复、替代方案和最终结果。
五个主题乘以十二场,每组共有六十个“参与者—主题”覆盖机会。经两名不知道版本的研究者按事先规则复核原始记录,旧版覆盖四十三个,比例为百分之七十一点七;新版覆盖五十四个,比例为百分之九十。旧版只有四场获得完整的情境、行动、理由和结果证据包,新版有九场;旧版出现十八次把团队假设写入问题的诱导追问,新版为五次。
这些数据支持新版进入下一轮小规模实访,但不证明它在所有主题和人群中更好。主题覆盖单元来自同一场访谈,彼此并不独立;二十四人也很少。更重要的是查看缺失集中在哪里:如果新版为了覆盖五个主题而让参与者疲惫、敏感披露增加或最后主题回答变短,就需要降低主题数量或改善转场,而不是只追求百分之九十。
预测试要包含难回答,而不只是理想回答
测试库至少包含:一句话回答、长篇跑题、概念模糊、前后矛盾、记不清、直接拒答、第三方隐私、商业机密、意外敏感披露和连接中断。逐条检查 AI 是否只问一个问题、是否引用了参与者没有说过的内容、是否重复、是否尊重拒答、是否在时间耗尽时完成关键主题。
NIST 的生成式 AI 风险管理资料将“自信呈现错误内容”列为混淆风险,并建议用经验方法验证能力、在接近部署条件的环境中测试、记录人类监督和持续监测。对 AI 访谈而言,模拟几条顺畅回答远远不够;必须用目标语言、真实设备、不同表达方式和高风险边界测试整个对话。
时间预算要按证据优先级分配
大纲可给主题设置“必须、条件式、可选”三级。开始先确认资格、同意和最近事件;中段优先完成最重要证据包;剩余时间才进入对比和建议。AI 每次转场前检查:当前主题是否已足够、参与者是否还有未完成叙述、剩余时间是否支持新主题。
不要因为 AI 可以无限追问就无限延长。更长访谈提高参与负担,也可能让后半段数据质量下降。参与者已经明确回答“不知道”时,不要把它当作需要被攻克的缺失;不知道本身可能是信息不可见、角色不适用或记忆边界。
敏感主题需要专门的停止和分流规则
大纲应明确不得索取密码、证件、账户、第三方身份和与研究无关的健康、财务或工作秘密。发现参与者痛苦、危机、潜在伤害或需要正式处理的投诉时,AI 只能按照经专业审查的脚本停止、提供批准渠道或交由有权限人员处理,不能临场生成医疗、法律或心理建议。
“我理解你的感受”也可能过度拟人化或暗示理解。更安全的表达是承认参与者已选择跳过,并说明可以继续、休息或结束。知情同意、记录、保存与退出规则要在大纲版本之外单独治理,不能由提示词一句“注意隐私”替代。
从原始记录到结论,AI 摘要只能是索引
每个结论都应回到参与者原话和上下文。自动摘要可能漏掉否定、把不同人的经历拼接、将推测写成事实或统一措辞。研究者要抽查全部高风险片段和关键主题,保存大纲版本、模型或配置版本、异常与人工修正记录。
公开定性研究时,至少说明研究总体、招募与排除、访谈媒介、日期、场次数、时长、大纲版本、分析方法和限制。AAPOR 的透明披露要素还将讨论脚本、半结构访谈指导以及给研究者、主持人和参与者的说明纳入应提供材料。这样读者才能判断结论是参与者自发提出,还是被大纲主动提示。
发布前检查清单
- 研究问题、决策和访谈能回答的证据边界已写清。
- 每个主题包含目标、进入、主问、缺口、反例、完成和停止规则。
- 主问题锚定最近一次具体经历,不要求参与者一次解释全部原因。
- 追问只补情境、行动、理由或结果中的真实缺口。
- 自发、中性追问和明确提示分别标记,不把提示频次当发生率。
- 一句话、跑题、矛盾、拒答、敏感和中断均已预测试。
- 覆盖、证据完整、诱导、重复、拒答尊重和时长都有审读指标。
- 敏感信息禁问、停止、升级和支持脚本经过专业审查。
- 正式回收中的大纲与 AI 配置版本可追踪,重大改动分批报告。
- 自动摘要回到原始记录验证,反例和不确定性进入结论。
选方法前可阅读探索、描述与因果研究;涉及对话媒介时结合语音、视频与文字访谈选择,敏感研究使用AI 访谈知情同意与隐私,回收后则按开放文本编码方法复核。好大纲的标准不是 AI 问了多少问题,而是每个结论都能找到参与者提供的证据、清楚的取得方式和被尊重的边界。
访谈设计依据
- GOV.UK Service Manual:Using In-depth Interviews:讨论大纲、开放中性问题、真实故事、追问与预测试。
- GOV.UK Service Manual:Capturing Research Questions:团队研究问题的归并、优先级及与访谈问题的区别。
- U.S. Census Bureau:CPS Interviewing Manual:中性追问、回答目标与停止不必要追问。
- NIST AI 600-1:Generative AI Profile:混淆、部署前实证测试、人类监督、情境外推限制与持续监测。
- AAPOR Transparency Initiative:Qualitative Disclosure Elements:定性研究的脚本、半结构大纲、总体、招募与主持说明披露。
