指南缺失数据项目无回答插补问卷分析

问卷缺失数据怎么处理?先分清未展示、拒答和中断

沿着一道售后满意度题重建空值产生过程,区分结构性未展示、项目无回答、答卷中断和整份无回答,再选择分母、权重、插补或敏感性分析。

最近更新 2026年9月2日 11 分钟 阅读

数据表里同样是空白,可能表示四件完全不同的事:这道题按逻辑从未展示;受访者看到后拒绝或无法回答;答卷在到达该题之前中断;被抽中的人根本没有参与调查。缺失处理如果从“空白统一填什么”开始,就已经把产生过程抹掉了。

正确顺序是先重建谁本来应该提供哪项信息、空值在哪一步产生、缺失与哪些已知特征相关,再选择有效分母、完整案例、权重调整、插补或敏感性分析。插补不是找回真实答案,而是在清楚假设下生成可用于估计的值;它不能把未观察变成已观察,也不能自动消除偏差。

用一棵分母树还原售后满意度中的空白

假设调查共有1000名合格访问者,其中800人完成问卷。售后满意度只向过去90天实际联系过客服的人展示:

1000 名合格访问者
├─ 200 名未完成或未开始
└─ 800 名完成者
   ├─ 500 名过去90天未联系过客服 → 题目未展示
   └─ 300 名联系过客服 → 应回答满意度
      ├─ 250 名给出1至5分
      ├─ 30 名选择“不知道/记不清”
      └─ 20 名看到题目但未回答

如果问题是“实际客服使用者对最近一次服务的满意度”,最直接的描述性分母是250名给出有效量表回答的人,同时披露300名应答者中50名没有形成评分。500名未使用客服的人不是满意度缺失,更不能填成0分;他们对这道题属于结构性不适用。

若报告写“800名完成者中31.25%满意”,就把未接触客服的人放进了错误分母。若只写“有效回答者中80%满意”,又隐藏了六分之一应答者未给出评分。分母树让两个问题分开:有效回答者表达了什么,以及没有评分的人是否可能与他们不同。

给每种未观察状态单独编码

结构性未展示来自合法跳转或研究设计,例如只向购买者询问购买体验。它说明该问题不适用于此人,通常不应被插补成一个体验评价。

项目无回答是受访者完成了其他内容,却没有提供某一道题的有效值,包括拒答、不知道、设备故障或回答被编辑规则判为无效。拒答与不知道最好分别保存,因为前者可能与敏感性有关,后者可能暴露知识或记忆边界。

答卷中断常呈连续形态:某个页面之后全部为空。它既影响后部题目,也可能与问卷长度、设备、题目敏感或参与动机有关。把所有部分答卷删除,会同时丢掉中断前的有效信息,并可能让留下的人更像高投入群体。

单位无回答是被抽中或被邀请的合格单位没有提供可用答卷。数据文件里往往没有一整行可供逐题插补,因此通常需要联系抽样框信息、响应概率、权重调整或跟访研究。美国人口普查局的SIPP 方法说明也明确区分单位无回答和项目无回答:前者主要通过权重调整,后者可使用编辑或统计插补等方法。

处理后缺失则是原值因超出允许范围、隐私保护或质量规则而不进入分析。应保留原始状态和处理原因,不能让它与受访者主动不答混为一谈。

缺失画像要同时看题目、位置、人群和时间

每个关键变量至少计算三个数:本来应该回答的人数、有效回答人数、按原因拆分的未回答人数。美国人口普查局关于题目回答率的口径同样以“需要回答该题的单位”为分母,而不是把所有样本一概放入。

随后把缺失分布映射到:

  • 问卷位置与前一页面,识别从某个敏感或高负担模块开始的中断;
  • 设备、浏览器、语言、渠道和问卷版本,排查技术或翻译问题;
  • 已知的人群与行为变量,判断缺失是否集中于某类参与者;
  • 回收日期和批次,检查某次配置、招募或提醒改变;
  • 核心结果的可观察代理,例如未给满意度的人是否更常投诉或更早流失。

这些比较不能证明缺失者真正会给什么答案,却能排除“缺失完全没有结构”的轻率假设,也能指导模型需要纳入哪些辅助变量。

把 MCAR、MAR 和 MNAR 翻译成可检查的问题

统计教材常把缺失机制分为完全随机缺失、随机缺失和非随机缺失。实际工作中不要只给数据贴缩写,而要问处理成立需要什么假设。

完全随机缺失(MCAR)要求缺失既不依赖已观察信息,也不依赖未观察答案。例如一次与受访者特征无关的短暂随机系统故障可能接近这种情况。若成立,只分析完整案例主要损失精度,不一定产生系统偏差;但现实问卷很少能仅凭一张表证明它成立。

随机缺失(MAR)指在控制已观察变量后,缺失不再依赖那个未观察答案。比如年轻、移动端用户更容易中断,而年龄和设备已被完整记录;模型在充分控制这些变量后处理缺失。这仍是不可由数据完全验证的假设,只是让可观察信息承担解释。

非随机缺失(MNAR)意味着即使控制已观察信息,缺失仍与未观察答案本身有关。收入越高的人越不愿报收入,极不满意者直接退出而不评分,都可能属于这种情况。常规完整案例或普通插补不能自动解决,通常要通过外部信息、跟访、选择模型或情景敏感性分析表达不确定性。

Census 当前的缺失数据研究说明强调,插补和权重调整会利用非缺失调查信息或其他数据,且需要统计模型与领域经验。这也说明“选一个算法”不等于缺失机制已经被解决。

五种常见处理方式,分别解决不同问题

有效或完整案例分析只使用所需变量都有值的记录,简单且容易复算。缺失很少、对决策不敏感或机制近似无结构时可以作为主要或基准分析;当缺失集中于特定人群时,它可能改变样本,也会让不同模型的基数不断变化。

按指标使用可用回答让每张描述图利用该题现有的有效值,能保留更多数据。代价是图表间分母不同,相关或多变量分析也不能随意拼接。每个结果必须显示实际基数。

把“不知道”作为有意义状态适合认知、信息知晓或资格本身就是结论一部分的题。例如对政策是否了解,“不知道”可能是真实结果;但对连续收入,把拒答编码成一个数值类别并不能完成分析。

权重调整主要用于整份无回答或样本响应倾向不平衡,借助抽样框与已知特征让响应者代表更完整的目标总体。它只能修正纳入模型的已知维度,响应者与未响应者在未观察因素上的差异仍可能存在。

插补用逻辑规则、相似记录或模型为部分缺失生成一个或多个可能值。单一均值填补会压低变异、扭曲相关性,通常不适合作为通用方案;多重插补通过生成多套合理数据并合并估计来反映部分插补不确定性,但结果仍取决于模型、变量和机制假设。所有插补值要有标记,不能与受访原报值混在一起。

用极端情景判断缺失是否足以改变行动

回到售后满意度例子。250名有效回答中有200名满意,即80%;另有50名应回答但未评分。若把50名全部假定满意,总体是250除以300,约83.3%;若全部假定不满意,则是200除以300,约66.7%。这两个极端并非对缺失者的真实估计,而是回答一个决策问题:在任何可能边界下,结论是否仍然相同?

如果团队的行动阈值是满意率75%,那么缺失假设会让决定翻转,不能只报告80%。下一步应比较缺失者的渠道、投诉和使用特征,考虑跟访或更合理的模型,并把情景结果放在结论旁。若所有合理情景都支持同一动作,则无需为了技术复杂而强行采用最复杂插补。

对模型分析,可以比较完整案例、预设插补、不同辅助变量和非随机偏移情景;对追踪研究,还要测试退出者比继续者更差或更好的合理范围。敏感性分析的重点不是生成很多数字,而是指出哪一项未验证假设会改变决策。

先减少可避免的缺失,再讨论如何补

结构性未展示应由清晰跳转产生,并在数据中保留“有资格回答”的标记。关键指标放在受访者仍有精力的位置,题目使用可回忆的参考期;敏感问题说明用途、提供合理拒答,并避免无必要地设为必答。多语言和移动端要经过预测试,正式回收前检查导出编码是否能区分未展示、不知道、拒答和中断。

还应记录邀请与答卷的样本流,而不是只保存完成者。没有合格邀请数、接触结果和基本抽样框变量,就很难诊断单位无回答。若业务只关心现有用户且完全没有未响应者信息,也应承认权重能做的有限。

在问卷派中,可通过问卷逻辑记录题目适用人群,回收后区分完整、部分与质量排除,并在分析时显示指标真实基数。AI 辅助分析不应自行把空白解释成0、否定或中立,也不应在没有模型说明时静默填补。处理决定应回写到调研数据代码本回收前分析计划,使同一指标在图表与报告中使用一致分母。

最终报告至少披露:目标总体与应答基数、关键变量的缺失原因与比例、主要处理方法及假设、插补或权重使用的变量、插补标记与比例、和替代处理相比结论是否变化。没有一种方法能让缺失消失;成熟的分析是让读者看见缺在哪里、结果依赖什么,以及证据仍可能错到什么程度。

缺失处理的方法依据