指南数据清洗无效答卷异常值数据质量

问卷数据清洗怎么做?从原始答卷到分析数据集

通过六份异常答卷说明哪些值可以修正、哪些只能标准化或标记、什么时候才能排除,并建立保留原值、清洗日志和敏感性结果的完整交付流程。

最近更新 2026年9月2日 10 分钟 阅读

问卷清洗最危险的动作,是打开原始 Excel,凭感觉删掉“看起来不认真”的行,再把文件另存为“clean_final”。数据变整齐了,研究者却无法回答删了什么、为什么删、重新运行能否得到同一结果,以及这些决定是否恰好让核心指标更好看。

可靠的清洗不是寻找一份“完美数据”,而是从不可变原始答卷生成一个可解释的分析层。每个被处理的值最好同时保留四类信息:原始值、标准化或修正后的值、触发的质量标记、最终纳入决定。修正、标准化、标记、排除和插补是不同动作;只有明确证据和预先规则支持时,才从前一种升级到后一种。

先给六份异常答卷分诊,不要急着删除

假设一份购买体验调查出现以下记录:

  1. 答卷 A 与 B 的联系方式相同,相隔两分钟提交,但 A 在支付失败后中断,B 从断点重新完成;
  2. 答卷 C 只用70秒完成,别人中位时长是6分钟,但它走的是最短跳转路径,所有事实题与开放说明都连贯;
  3. 答卷 D 的月消费额为“50000”,开放回答写“约500元”,可能是单位或多输两个零;
  4. 答卷 E 在所有满意度矩阵中都选择最高分,同时具体描述了三处不满;
  5. 答卷 F 自称从未购买,却出现了只向购买者展示的售后题答案;
  6. 答卷 G 的开放题是无意义字符,并伴随极短时长、多个互斥事实冲突和机械选项模式。

它们需要的处理不同。A 与 B 可能是重试,不是两名重复受访者;应根据提交标识、会话和有效完成规则保留一份并记录合并。C 的速度只是信号,路径合理时不能仅因低于统一秒数排除。D 在没有来源可核实时不能把50000直接“修成”500,应保留原值、标记单位冲突,并在主要分析中按预设规则处理。E 可能是真实的总体满意与局部不满并存。F 更可能是跳转或数据合并故障,需要先查系统。G 才具有多个相互支持的低质量信号,排除理由明显更强。

分诊的目的不是为每种异常背一个固定答案,而是要求处理强度与证据强度匹配。单一异常通常先标记,多个独立信号且缺乏合理解释时,才考虑排除整份答卷。

四种清洗动作必须分开记录

标准化改变表示方式而不改变已知含义,例如把“上海市”“上海”映射到同一地区代码,把日期统一为 ISO 格式,或把“不知道=-8”转成带原因的缺失。原值仍保留,映射表有版本。

修正替换一个有充分证据证明错误的值。证据可能来自原始记录、受控回访或确定的系统故障,而不是“这个数不常见”。修正应生成 edited_value、原因、规则编号和责任人,不能覆盖 reported_value

标记表达风险或状态,不直接改变答案,例如 flag_fast_pathflag_duplicate_candidateflag_logic_conflict。标记可以服务人工复核、组合规则或敏感性分析。一个答卷可以有多个标记,也可以被标记后仍保留。

排除改变分析样本,应有明确的适用层级:只排除一个无效题值、某个分析模块,还是整份答卷。开放题无意义不必自动让所有封闭题作废;反之,伪造资格或整份机械作答可能影响全部数据。插补则是处理缺失的统计步骤,不应被包装成“修复真值”;复杂插补需要另行说明假设与不确定性。

第一遍只检查结构:数据有没有按问卷设计落下来

结构检查应在评估受访质量之前进行,因为系统错误可能制造大量“可疑回答”。逐项验证:

  • 答卷、问卷版本、回收批次和参与标识是否唯一且能关联;
  • 类别值是否属于当时版本的允许选项,数值、日期和文本类型是否正确;
  • 跳转未展示的题是否意外有值,本应展示的关键题为何为空;
  • 多选数量、矩阵行、随机组和循环实例是否完整;
  • 开始、结束和页面时间戳顺序是否可能,时区是否一致;
  • 不同渠道导出是否使用同一字段和编码,试投数据是否混入正式批次。

若同一跳转下出现成批异常,优先怀疑配置或解析,而不是一批人同时撒谎。修复数据的同时要修复上游,并记录哪些批次受影响。美国人口普查局面向官方统计的数据编辑与插补标准 C2列出的检查也包括缺失、重复、异常、跳转、范围和跨变量一致性,并要求验证处理系统按规范工作。

第二遍评估回答质量:每个信号都要写清边界

重复候选不能只靠 IP 地址。公司、校园和家庭可能共享网络;同一人也可能因页面重试留下两次提交。应组合受控身份标识、设备或会话、时间、资格信息和答案相似度,再按研究单位决定保留规则。删除前确认不是追踪波次或同一家庭中的不同合格成员。

时长要按实际路径和设备解释。只回答十题的人不能与走完整六十题的人共用阈值。可以为页面或模块估计合理阅读与操作时间,结合极端分位、跳转长度和其他信号;阈值应来自预测试或本项目分布,不从另一份问卷照搬。

直线与机械模式在长矩阵中可能反映低投入,也可能反映真实强烈态度或题目冗余。检查反向题并非万能方案,因为反向措辞本身可能引入误解。更有力的证据是跨多个不相关模块的机械模式、极短页面停留与事实矛盾共同出现。

逻辑矛盾需要区分事实与态度。年龄与出生年严重不符可能是数据错误;“总体满意但对客服不满”完全可能同时成立。不同参考期也会产生表面矛盾。规则应写出哪两个变量、在什么时间和条件下确实不可能共存。

开放文本要结合题目目的、语言和长度。“没有”可能是对“还有什么建议”的完整回答;复制题干、随机字符或与所有问题无关的推广内容更可疑。AI 可以辅助聚类和发现重复,但排除边界仍需人工抽查,尤其是少数语言、辅助输入和专业术语。

异常值先问四个问题,再决定保留、截尾或设缺失

看到极端消费额、使用次数或年龄时,先判断:它是否违反硬范围?单位是否一致?能否从其他字段或原记录验证?它对目标总体是否可能真实存在?高价值客户、重度用户和罕见事件恰好可能是研究最重要的人群,不能因为影响均值就删除。

若数值明确不可能且无法恢复真值,可保留原值并把分析值设为带原因的缺失;若真实但会过度影响特定模型,可以预先采用稳健统计、转换或截尾,并同时报告未经处理的分布。每一种处理都要比较核心结论是否改变。清洗的目的不是让分布更接近钟形,而是让分析与测量过程一致。

把规则写成决策表,再写成可重复运行的处理

一条清洗规则至少包含:规则编号、对象层级、输入字段、触发条件、阈值依据、动作、例外、人工复核方式、预期影响和版本。例如:

QC-07 路径校正时长
对象:整份答卷
触发:实际页面停留总时长低于对应路径预测试第 1 百分位
动作:增加 fast_path 标记,不单独排除
升级:同时命中事实矛盾与无意义开放文本时进入人工复核
例外:辅助技术、已知自动填充或经核实的高熟练受访者
输出:保留原时长、路径长度、阈值版本和最终决定

规则冻结后通过脚本、查询或受控规则引擎从原始层生成清洗层。不得靠筛选 Excel 后手工删行。世界银行 DIME Analytics 的数据清洗指南同样强调,对错误提交、重复和试投混入等处理应能通过代码重新运行,清洗还要把数据和处理知识记录到足以复用。

清洗完成不等于只交一份 clean.csv

一套可审查的交付至少包含:

  • 只读原始快照及问卷版本,不因后续决定被覆盖;
  • 分析数据集,区分原值、标准值、编辑值和派生值;
  • 答卷级与变量级质量标记,保留触发规则;
  • 排除清单及层级、原因和复核结果;
  • 规则表、可执行处理和运行日志;
  • 每条规则的命中数、编辑率、插补率及样本流失;
  • 包含全部边界样本与按主规则排除后的核心结果对比。

Census C2 标准要求保留未编辑值及编辑或插补后的标记,并记录变化分布、问题和解决方式。商业研究不需要照搬官方统计机构的全部制度,但原值与处理结果并存、规则可测试、影响可监控,是同样适用的底线。

最后检查清洗是否改变了“研究代表谁”

按规则排除后,重新比较设备、渠道、地区、语言、年龄段、使用经验或其他关键样本结构。若移动端、低数字技能者或某招募渠道被大量排除,可能是作弊集中,也可能是问卷对这些人更难用。此时需要回看预测试、页面时长和原始路径,不能因为排除后数据更整齐就结束。

对主要指标至少生成三种结果:未应用争议质量规则、应用主规则、采用合理替代阈值。若方向和行动建议稳定,结论较稳健;若差异明显,就把规则敏感性写进报告,并降低确定程度。不要只发布最符合预期的一版。

问卷派可以在回收与分析过程中帮助查看时长、逻辑、开放回答和重复特征,并保留质量标签以缩小复核范围。平台给出的自动信号仍需结合问卷路径、样本来源和本项目规则解释。更专门的反作弊组合可继续阅读低质量问卷答卷的识别方法,缺失机制和插补则应在问卷缺失数据处理中单独决策。

清洗结束时,团队应能逐条回答:这个值原来是什么,哪条规则对它做了什么,为什么,谁复核过,重新运行是否一致,对样本和结论产生多大影响。回答不了这些问题的“干净数据”,通常只是看不见处理痕迹的数据。

清洗与质量规则来源