三款饮料概念总按 A、B、C 展示,A 的购买考虑率最高。团队据此准备保留 A,却发现 A 同时总是第一个出现:它可能享受注意力最充足的新鲜感,C 则承受比较和疲劳。再跑一轮时简单打开“随机”,三款顺序虽然变化,导出却没有保存每个人实际看到的顺序。结果依然不能解释。
问卷随机化不是一个通用开关。设计者必须先回答:要分散的是列表位置影响、要估计的是不同问法或材料的因果差异,还是要从总体抽取可推断的样本?这三件事使用“随机”一词,却有不同随机单位、数据字段和分析结论。随机呈现不会自动产生代表性样本,随机抽样也不会自动消除题目顺序效应。
三个“随机”分别回答三个问题
| 设计 | 随机单位 | 能帮助回答什么 | 不能证明什么 |
|---|---|---|---|
| 顺序随机/轮换 | 选项、题目或题组的位置 | 避免某个项目总占据有利或不利位置;可测顺序效应 | 受访者是否代表目标总体 |
| 问卷内随机实验 | 受访者、会话或自然群组 | 不同问法、信息、概念或刺激造成的结果差异 | 实验结果能否外推到未覆盖人群 |
| 概率抽样 | 总体中的个人、地址、机构等抽样单位 | 在已知纳入概率和适当估计下推断目标总体 | 问法或位置是否导致观察差异 |
还有第四种常见操作:从十二项功能中给每人随机抽四项评价。它减少单人负担,却让每项的分析基数从总样本变成被抽中的子样本;它不等同于只改变十二项的显示顺序。
随机之前,写出要控制的干扰因素
随机化有成本:它增加版本、测试路径和分析复杂度。因此不要因为平台提供功能就全部打乱。先在设计表中写“对象—干扰—随机单位—固定项—保存字段—主要比较”。例如:
- 品牌认知多选列表:担心网页顶部项目更易被看见,随机普通品牌的选项位置;
- 三款完整概念:担心先看者新鲜、后看者疲劳,随机概念题组顺序;
- 价格文案实验:要估计“每月”与“每天折算”框架的影响,按受访者随机分到一个版本;
- 追踪调查核心指标:要与上期保持同一上下文,不随机关键题序,除非把方法变更纳入桥接设计。
若干扰因素可以直接控制,例如语言、客户层级或招募渠道,应考虑先分层/分块,再在层内随机。NIST 的随机区组设计说明概括为:能分块的先分块,剩余干扰再随机。它最初面向实验过程,但原则同样适用于问卷实验——避免某一材料版本恰好都分给企业客户或某一渠道。
哪些选项可以打乱,哪些必须钉住
适合随机的通常是语义上并列、没有自然次序、每项都应获得近似展示机会的类别,例如品牌、购买渠道或彼此独立的产品属性。以下项目一般不应与普通项一起洗牌:
- 年龄段、收入档、频率、同意度等有序类别;
- “其他,请说明”“以上都不是”“不知道”“拒绝回答”等特殊状态;
- 从宽泛到具体的漏斗题,以及后题依赖前题定义的序列;
- 时间线、流程步骤或必须按阅读顺序理解的材料;
- 用于趋势比较且历史上固定顺序的核心指标,除非明确评估断点。
Pew Research Center 的问卷题目设计说明指出,网页自填列表常见首因效应,电话访问则可能出现近因效应;随机或轮换不能消除顺序影响,而是把它分散到各项目。有序量表通常保持顺序,因为类别位置本身传递从低到高的认知结构。
随机选项也不能修复不完整列表。若关键答案根本没有出现,均匀洗牌只会均匀地制造错误。先确保选项穷尽、互斥且符合目标人群语言,再处理位置。
三概念完整轮换:720人如何分到六种顺序
回到 A、B、C 三款饮料概念。若每人都要看三款并分别评价,全部可能顺序为:
| 序列 | 目标人数(N=720) | 第一位 | 第二位 | 第三位 |
|---|---|---|---|---|
| ABC | 120 | A | B | C |
| ACB | 120 | A | C | B |
| BAC | 120 | B | A | C |
| BCA | 120 | B | C | A |
| CAB | 120 | C | A | B |
| CBA | 120 | C | B | A |
这样每个概念在第一、第二、第三位各出现240次,每一对前后次序也得到平衡。随机分配的实际人数不必机械等于120;若研究要求精确平衡,可以使用预先生成的随机序列块,但不能让现场人员按喜好挑下一个序列。
分析时至少保留概念、位置、前一个概念、完整序列和评分。先看概念主效应,再检查位置与概念是否交互。若 C 只在第三位明显下降,报告应披露疲劳或比较上下文,而不是把所有顺序混合后宣称 C 本身较差。
组内展示和组间展示不是谁都更高级
组内设计让同一人评价 A、B、C。优点是每个人成为自己的比较基准,所有概念获得720份评价;缺点是任务更长,前一材料会影响后一材料,受访者还可能猜到研究目的。
组间设计把720人随机分成三组,每人只看一个概念,每个概念约240份评价。它降低疲劳和材料间污染,更接近独立接触;但每个概念基数更小,组间个体差异带来更多不确定性。若最终市场情境是消费者只看一款完整方案,组间设计往往更贴近实际;若决策需要同一目标客户做相对取舍且材料短,组内设计可能更有效率。
不要先按渠道收完 A,再隔天收 B、C。即使每组人数相等,日期、渠道构成或市场事件也会与概念完全重合。随机分配应在资格确认后、结果测量前执行,并保持同期招募。
随机实验为何能支持因果解释
如果合格受访者在同一时期以不可预知方式被分到文案 X 或 Y,除文案外流程保持一致,那么足够样本下,两组在已测和未测背景特征上有机会保持可比。组间结果差异才可以归因于被操纵内容,并伴随不确定性区间。World Bank 的《Impact Evaluation in Practice》把随机分配作为构造处理组和反事实对照组的方法之一。
这仍有边界。随机分配的是进入研究的受访者,不会把来自公开链接的便利样本变成所有消费者的概率样本;结果只能稳健说明这批研究对象在这些材料和测量条件下的平均差异。若有人绕过分配、反复打开直到看到喜欢的版本,或不同组使用不同渠道,因果解释也会受损。
Pew 的问卷实验说明展示了随机改变问法、答案选项和问题顺序如何用于识别呈现差异。关键不是“页面出现了两个版本”,而是受访者被随机分配,其他条件可比,且分析没有在看到结果后只报告有利版本。
随机抽四项时,先按项目基数设计样本
若有12项功能,每人等概率不放回抽4项,总样本720,那么每项的期望评价数是:
720 × 4 ÷ 12 = 240
这只是期望,不保证每项恰好240。研究者应以约240而非720计算单项精度,并监控实际基数。若其中三项是必测核心,可固定展示三项,再从其余九项抽一项;此时核心与非核心拥有不同纳入概率,必须在数据字典中写明,不能直接比较原始回答数。
抽取还会改变共现信息:两项很少同时展示,就难以估计同一人对它们的相关或偏好差。需要做组合取舍时,应设计共同出现概率,而不是只保证单项次数。
分层、集群和重复进入要在分配前决定
小样本实验中,可按最重要且事先已知的变量分层,例如客户类型和语言,在每层内将 X、Y 近似均衡分配。分层过多会产生大量小格,使规则脆弱;只选择强烈关联主要结果或业务上必须平衡的少数变量。
当同一团队成员会相互讨论材料时,按个人随机可能造成污染,可考虑按团队随机,但分析也要承认有效随机单位是团队而非个人,所需群组数通常成为约束。重复访问则应保持同一人的原分配,不能每刷新一次重新抽签;用于持久化的标识和隐私处理需在设计阶段确定。
没有这些字段,随机化就无法审计
randomization_scheme_version:使用哪版规则和材料;assignment_unit_id:个人、会话、客户还是群组;assigned_arm与actual_exposure:分到什么、实际显示什么;display_order与subset_ids:完整位置和被抽项目,而非只存最终答案;assigned_at、资格状态、分层变量和招募来源;- 任何人工覆盖、重新分配、加载失败及其原因。
主要分析通常先按原始分配比较,以保留随机设计;实际曝光字段用于诊断执行偏差,不能因为某组效果不理想就随意排除未完整看到材料的人。详细纳入、排除、主要指标和交互检验应在收集前分析计划中登记。
发布前不要用“50/50看起来差不多”验收
先用测试会话证明每个版本可达、固定项不被洗牌、依赖题始终在来源题后、材料和导出标识一致、返回与断点续答不触发重分配。再用足够多的模拟或试投分配检查:
- 不存在永远为零或异常少的版本;
- 各层中的分配规则符合规格;
- 概念位置和前后组合达到设计覆盖;
- 渠道、日期、设备没有被程序性地绑定到某一版本;
- 每个实验臂都有独立且一致的结束、质量与导出流程。
真正随机的小批量出现47/53并不自动表示程序错误,强求每十个人精确五五分也可能暴露可预测分配。验收要检查机制和长期覆盖,并将允许的不平衡与停止条件预先写清。
在问卷派中,先配置设计,再验证分配记录
使用问卷派配置选项、题组或材料的随机展示时,应先明确随机单位、固定项、抽取数量和是否分层,再用预览与测试答卷核对实际顺序及导出。平台执行随机规则,研究者仍需决定该规则能回答哪个问题、每个版本要多少有效样本,以及中途修改材料后旧数据能否合并。
随机化方案真正完成时,团队应能从任意一行答卷重建:这个人为何有资格、何时按哪版规则分到哪个臂、实际看到哪些材料及顺序、哪些结果进入主要分析。若只能看到最终评分而不知道展示历史,随机开关虽然亮着,研究设计仍然不可复核。
