“这组数据用 T 检验还是卡方检验?”通常问早了一步。统计检验只判断数据与某个零假设及其模型有多不相容;它不会替研究者决定究竟关心均值差、比例差、整段分布、个体内变化,还是达到业务门槛的概率。先选检验、再解释软件输出,很容易得到数学上可算、业务上答非所问的结论。
更可靠的顺序是:先用一句话写出要对谁、比较什么、用哪个效应量做决定;再还原数据来自独立样本、同一人前后、门店聚类还是复杂抽样;最后才依据结果尺度、样本稀疏程度和模型假设选估计方法与检验。检验应与报告中的效应量和区间成套出现,不能只交付一个 P 值。
先写“分析处方卡”,六个空格少一个都先别跑
- 目标总体:结论要描述实际答题者、现有客户,还是某地区全部潜在消费者?样本如何进入调查?
- 研究问题:是描述、组间比较、同一对象变化、变量关联、预测,还是因果效果?
- 主要结果与估计量:比例差、风险比、均值差、中位数差、优势比、相关系数或模型预测误差,哪一个直接对应行动?
- 观测关系:各行是否独立,同一人是否重复回答,人是否嵌套在门店、班级或家庭中?
- 抽样与分配:是概率抽样、配额/便利样本,还是随机实验?有无分层、聚类、权重和随机组?
- 决策规则:多大的差异才有业务意义,用什么区间或错误代价判断,哪些结果是主要、次要或探索性?
例如,“比较 A、B 两版落地页在本次随机分配用户中的问卷完成比例,主要效应是 B 减 A 的百分点差,95%区间若仍包含0但已排除业务要求的8个百分点提升,则不放量。”这张卡已经限定了人群、结果、估计量、设计和行动。相比之下,“检验 A/B 是否显著”没有说明差异多大才值得上线,也没有说明谁能被外推。
500人实验里,P 值之前先算9.2个百分点
假设500名符合条件的用户被等概率随机分到两个邀请版本,每组250人。A 版有112人完成问卷,完成比例44.8%;B 版有135人完成,完成比例54.0%。首要结果不是“显著/不显著”,而是:
绝对比例差 = 54.0% − 44.8% = 9.2 个百分点
相对比值 = 54.0% ÷ 44.8% ≈ 1.21
在简单独立随机分配、普通大样本近似下,绝对差的95%区间约为0.5至17.9个百分点。这个区间说明数据支持的提升幅度仍很宽:最小端可能只有半个百分点,最大端接近18个百分点。若上线成本要求至少提升8个百分点,结果虽然刚好排除零,却没有排除低于业务门槛的效果;继续收集、结合成本决策或接受不确定性,比喊“统计显著”更诚实。
这类两个独立比例可用差值及区间,并配合两比例检验或列联表卡方检验;期望频数很小可考虑 Fisher 精确检验。检验给出的不是效应大小,所以仍要报告每组分母、比例和差值。若希望控制预先存在的协变量,可用适当回归模型,但应输出边际比例差或其他业务可读效应,而不是只抄一列系数。
随机分配支持的是两个邀请版本对本次实验样本的因果比较;它不会自动让这500人成为全部客户的代表。反过来,概率抽样有助于描述总体,却没有随机分配就不能把观察到的用户组差异直接解释为某功能造成。抽样外推和处理因果是两道不同的门。
同一份“满意度”变量,四种设计会改变分析单位
| 实际问题 | 数据关系 | 首选报告 | 常见候选方法 |
|---|---|---|---|
| A、B 两批不同用户的平均量表得分是否不同 | 两组独立 | 各组分布、均值差与区间 | Welch T 检验或线性模型;必要时稳健/重抽样方法 |
| 同一批用户升级前后得分如何变化 | 个体配对 | 每人的变化值分布、平均或中位变化 | 配对 T 检验、适合目标的符号/符号秩或纵向模型 |
| 用户分别属于20家门店,比较门店方案 | 门店内聚类 | 方案差和考虑门店后的区间 | 聚类稳健方差、多层模型或按分配单位分析 |
| 按地区分层并对稀有人群过度抽样 | 复杂调查样本 | 加权估计与设计型区间 | 纳入权重、分层和聚类的调查分析方法 |
把同一用户前后两行当作独立样本,会丢掉个体内相关信息并错误计算不确定性;把门店随机实验中的500名顾客当作500个独立随机单位,会夸大有效信息量,因为真正独立分配的可能只有20家门店。先找“谁被随机、谁被重复测量、谁共享环境”,比先判断正态性更重要。
复杂抽样的错误尤其隐蔽:加权比例可能算对,标准误却仍按简单随机样本计算。CDC 的NHANES 方差估计教程明确区分,权重会影响参数估计,分层、聚类与不等权则会影响标准误、检验统计量和置信区间。只在普通卡方或 T 检验前加一列权重,并不一定完成了调查设计分析。
变量尺度只缩小候选范围,不能独自指定答案
二元结果如是否完成、是否购买,优先选择业务可解释的绝对比例、比例差或风险比;需要控制变量时可用二项结果模型,再把模型结果转为预测概率或边际效应。优势比不等于风险比,结果常见时尤其不宜混说。
名义类别如首选品牌,可用频数、比例和列联表描述;检验独立性可考虑卡方,稀疏小表可考虑精确方法。若类别有多个且要控制协变量,可用多项模型。先确认“其他”“不知道”和缺失是否属于分析类别。
有序等级如单个五点满意题,至少展示各档比例。若问题是整段回答倾向是否不同,可考虑有序模型或秩方法;若明确把量表得分作为近似连续指标,则要说明估计的是平均得分差并检查分布与稳健性。方法名称不能替代对估计目标的说明。
“数据不正态,所以改用 Mann-Whitney 检验中位数”是常见误区。BMJ 的方法说明指出,Mann-Whitney 并非一般意义上的中位数检验,分布形状或离散程度变化也可能影响结果。若真正关心中位数差,就直接估计中位数及其区间,或使用与该目标匹配的重抽样、分位数方法;不要把秩检验的 P 值改名成“中位数显著不同”。
连续、时长或金额可报告均值、中位数、分位数和分布图,再根据目标选择均值模型、稳健标准误、变换、分位数回归或重抽样。长尾不自动禁止均值:预算问题可能恰恰关心人均成本;它只是要求检查极端值、样本量和模型对推断的影响。
比较、关联和预测回答的不是同一个问题
“高频用户满意度更高”可以是描述性关联:相关系数、分组差异或回归系数能量化共同变化,但使用频率可能同时受产品价值、用户资历和选择进入影响,不能仅凭显著关联说“提高频率会提升满意度”。若目标是因果效果,需要随机化、自然实验或明确且可辩护的因果识别设计。
“哪些变量预测续约”则关心样本外预测表现,不应只按每个系数的 P 值筛变量。要区分训练和验证,选择损失函数或判别指标,并检查校准、过拟合与数据泄漏。解释效应和预测准确度可以使用相似模型,却有不同的评价标准。
同样,完成者的后测满意度不能随意作为 A/B 邀请实验的效果。如果邀请版本同时影响谁完成,那么“只在完成者中比较满意度”就条件化在一个受处理影响的结果上,两组完成者可能不再可比。应让主要结果和测量时点在设计阶段确定,而不是回收后挑选有数据的人。
多看20个指标,至少一个“显著”并不稀奇
若团队在10个人群中比较20项指标,就进行了大量机会性检验。即使所有零假设都成立,仍可能随机出现小 P 值。解决方法不是把所有结果都塞进同一张校正表,而是先在回收前分析计划中区分一个或少数主要结果、有限次要结果和探索性发现。
对必须共同做决定的一组检验,可根据目的控制家族错误率或错误发现率;探索性结果应标明需要复现。不要先跑完再把最小 P 值命名为“主要发现”。分组分析还要检查每组实际基数和交互作用:一组显著、另一组不显著,并不等于两组效果显著不同。
一份可发布的结果至少回答七件事
- 分析总体、纳入排除、每组未加权人数和必要的加权基数;
- 结果变量、单位、编码方向、缺失与“不适用”的处理;
- 效应量及其方向,例如增加9.2个百分点,而非只写存在差异;
- 置信区间或其他不确定性表达,以及业务行动阈值;
- 独立、配对、聚类、分层、权重和随机分配如何进入方法;
- 模型假设、异常值、稀疏单元和替代方法下结论是否稳定;
- 主要与探索性分析的边界,以及多重比较如何处理。
ASA 的统计显著性与 P 值声明强调,P 值不衡量效应大小或结果重要性,决策也不应只由是否跨过某个阈值决定。NIST/SEMATECH 的工程统计手册则可作为继续核对分布、比较、建模和假设诊断的系统入口。
在问卷派中,可以先核对题目编码、分母、筛选路径、权重字段与交叉分布,再导出到能正确处理配对、聚类或复杂抽样的统计环境。AI 可以帮助列出候选方法和解释结果,但输入里必须包含分析处方卡的六项信息;如果只提供一列数字和一句“看是否显著”,任何自动推荐都可能在替你猜研究问题。
最终标准很朴素:报告中的那一个数字,是否正好量化了决策者问的差异;它的区间是否遵守数据真正的独立单位和抽样设计;换一个合理方法时,行动是否保持一致。满足这三点,检验名称才有意义。
