问卷加权不是把样本“修成有代表性”,而是依据抽样设计、响应过程和可信的总体信息,改变每条记录对估计的贡献。它能纠正已知且可测量的入样差异,例如研究者主动超额招募小区域,或某类客户响应率较低;它不能补回样本框完全漏掉的人,也不能修复错误题目、虚假回答和未被加权变量捕捉的自愿参与偏差。没有明确目标总体与可靠基准时,不加权通常比随意指定权重更诚实。
正式权重往往不是一步计算,而是一条链:先用抽中概率形成基础权重,再对无响应做调整,最后把样本校准到已知总体。美国人口普查局的 SIPP 权重说明就包含基础权重、聚类内子抽样、无响应、多面板合并和后分层校准等环节。业务调查不一定需要如此复杂,但必须知道自己省略了哪一环,以及省略后还能声称什么。
先判断是哪一种失衡
权重能否工作,取决于失衡如何产生。设计失衡是研究者有意让某组更容易被抽中,例如为了比较新客户与老客户,各收四百份,而总体中两组占比并不相等;这种差异有已知设计依据,通常应该在估计总体时还原。无响应失衡是抽中的人具有不同参与概率,如果抽样框中已知响应者与未响应者的辅助信息,可以在相似组内调整。
覆盖失衡更难:只有线上渠道时,完全离线的人没有进入样本的机会;若数据中也没有与这种遗漏相关的充分变量,事后校准年龄和地区不能重建他们的答案。自愿报名样本还可能在兴趣、信任、时间和观点强度上与总体不同。即使人口结构被配平,组内仍可能偏。Pew Research Center 对在线自愿样本的实验发现,更大的样本量主要缩小随机波动,并不会自动消除系统性选择偏差;不同加权方法的复杂度也不保证准确性更高。
因此,动手前应把问题归入以下一类:
- 已知不等抽中概率:保留设计权重,不能把各记录默认当作等概率。
- 抽中后响应不同:用抽样框中的辅助变量建立无响应调整,但说明模型假设。
- 样本结构偏离可信总体:可做后分层或迭代比例调整,前提是变量定义一致。
- 总体或基准未知:只报告样本内结果、分组范围与限制,不用自定配额制造总体估计。
一个八百份案例:原始百分之五十八为什么变成百分之六十四
以下是一个示例性计算。某订阅产品准备估计全部在用付费客户未来三个月的续约意向。客户数据库显示,新客户占百分之三十、老客户占百分之七十。为了分别分析新客体验,团队有意回收新客户四百八十份、老客户三百二十份;在样本中,新客户有二百四十人表示会续约,比例为百分之五十,老客户有二百二十四人表示会续约,比例为百分之七十。
直接合计得到四百六十四除以八百,即百分之五十八。但样本把新客户占比从总体的百分之三十提高到了百分之六十。若数据库边界、状态时间和唯一客户口径都与问卷一致,总体续约意向应按目标份额计算:百分之三十乘百分之五十,加百分之七十乘百分之七十,结果为百分之六十四。
也可以给每条新客户记录相对权重零点五,给每条老客户记录相对权重一点七五。这样新客户权重总和为四百八十乘零点五,等于二百四十;老客户为三百二十乘一点七五,等于五百六十;两组合计仍归一到八百,但贡献恢复为百分之三十与百分之七十。原始百分之五十八回答“这八百名参与者怎样”,加权百分之六十四才是在设计假设成立时对全部在用付费客户的估计。
这里真正重要的不是六个百分点差异,而是目标基准是否正确。如果数据库的“老客户”按首次注册满一年定义,问卷却按首次付费满一年作答,两边即使标签同名也不能直接加权。若研究只面向本月有使用行为的客户,就不能拿全部历史付费客户结构做基准。权重不会检查定义,它只会精确执行研究者给出的目标。
权重修正偏差,也会损失精度
上例中八百条记录的权重总和是八百,权重平方和为一千一百。使用常见的 Kish 近似,有效样本量等于权重和的平方除以权重平方和,即六十四万除以一千一百,约为五百八十二。也就是说,仅考虑权重不均的影响,这八百份对总体估计提供的信息量近似于五百八十二份等权独立样本。
这个计算只反映权重变异,不包括整群抽样、重复测量或复杂无响应模型造成的全部设计效应,但它能快速揭示代价。权重越悬殊,少数记录对结果的影响越大,有效样本量通常越低。不能一边用八百作为宣传基数,一边用加权后的比例,却在置信区间和显著性检验中仍假设八百个等权独立观测。
极端单元尤其危险。假设某地区老客户在目标总体中占百分之九,而八百份样本里只占百分之二,单纯单元调整会给这十六条记录每条四点五倍的相对权重。在总权重归一到八百时,其中一个人的答案可让总体比例变化约零点五六个百分点,影响力是平均记录的四点五倍。此时最有效的修复通常是补招该单元、合并有实质依据的类别或减少加权维度,而不是让算法无限放大。
后分层、迭代比例调整和倾向权重怎样选
后分层需要知道完整交叉单元的目标数量或比例,例如新老客户乘四个区域的八格联合分布。它容易解释,也能精确还原每格,但样本中空格或极小格会产生无法计算或极端权重。只有边际分布时,不能把多个边际假装成已知联合分布。
迭代比例调整也叫 raking,会依次调整多个变量,让年龄、地区、客户阶段等边际分布逐步接近各自目标,直到变化足够小。它不要求知道所有交叉格的总体占比,但仍需要样本对目标类别有覆盖,并要设定收敛条件、迭代次数和权重范围。边际都匹配,不代表未指定的交叉关系也正确。
响应倾向或入样倾向权重通过模型估计一个人响应或进入非概率样本的概率,再按其倒数调整。模型可以使用更多变量和非线性关系,但前提更强:样本与参照数据必须有定义一致的辅助变量,模型还要捕捉与结果相关的选择机制。若真正影响参与和答案的变量没有测到,再复杂的模型也看不见它。
选择方法时,先选有用变量,再选算法。一个变量适合纳入,通常需要满足三项:有可信且同口径的总体基准;在样本中测量质量稳定;与响应或抽中机制、主要结果至少有清楚关系。Statistics Canada 发表的无响应加权研究指出,调整变量能否预测调查结果尤其重要,预测响应倾向也有帮助。只因字段存在就加入十几个变量,会制造稀疏单元、极端权重和难以解释的模型。
截尾不是无损修复,而是偏差与方差交换
将过大的权重截到上限,或把相邻小格合并,可以减少少数记录的影响并提高有效样本量,但加权后分布可能不再完全达到目标。以前述四点五权重为例,若上限设为三,这一格会被低估;重新校准又可能把缺失的权重推到其他记录。截尾规则必须在查看主要结论之前尽量预设,并保留未截尾与截尾版本做敏感性分析。
不能用“行业通常截到某个值”替代诊断。合理阈值与样本规模、基准稀疏度、主要指标和容许方差有关。团队可以比较权重最小值、最大值、百分位数、变异系数、有效样本量,以及加权前、未截尾和多个候选截尾规则下的点估计。若结论方向只在某个阈值下成立,报告应说结果对权重处理敏感,而不是挑最有利版本。
加权质量检查要覆盖数字和含义
- 总体边界:基准与研究是否使用相同对象、地域、状态和时间点。
- 变量映射:样本与基准的类别定义、缺失和“不知道”处理是否一致。
- 覆盖检查:目标占比大于零的类别在样本中是否有记录,是否存在极小格。
- 校准结果:加权后的指定分布是否达到目标,算法是否收敛。
- 权重分布:查看最小、最大、中位数、分位数、变异系数及高权重记录来源。
- 精度代价:计算权重设计效应和有效样本量;复杂抽样还要使用相应方差估计。
- 结论敏感性:比较未加权、完整权重和截尾版本,解释变化来自哪些组。
- 分组发布:始终展示真实未加权基数,不能把权重和当成访问人数。
加权变量自身出现缺失时,不能静默删除记录。可以使用有依据的缺失类别、插补或建模处理,但原始变量、派生加权变量和处理标记要分开保存。正式复杂调查还可能需要分层、聚类和重复权重;分析软件必须把这些设计信息纳入标准误,普通等权检验不再适用。
哪些研究不该用加权比例作结论
探索性深访和目的性招募关注经验覆盖,不需要把十几个人加权成总体。没有目标总体的产品概念测试,可以分别报告关键用户组反应,而不是自行规定市场结构。来自公开链接、社群转发或单一合作方的便利样本,即使在年龄和地区上与人口普查一致,也不等于获得了每个人的已知入样概率。
非概率样本并非不能做任何调整,但结论依赖模型与可观测变量,应写成模型辅助估计,并提供未加权结果、基准来源和敏感性分析。尤其不要为这类结果直接套用只考虑随机抽样的常规误差范围。加权解决的是“已观察到的差异如何调整”,不是“未知偏差已经消失”的证明。
可直接放进报告的方法说明
以上案例可以这样披露:“目标总体为统计日仍在用的唯一付费客户,客户阶段分布来自同日去重后的账户数据库。研究为分析新客体验进行了超额抽样,样本中新客占百分之六十,总体占百分之三十。总体指标使用客户阶段后分层权重,新客与老客相对权重分别为零点五和一点七五,并归一到样本总数。八百份名义样本的 Kish 权重有效样本量约为五百八十二。全国结果使用加权估计,分组表同时报告未加权基数;未进行未观测选择偏差校正。”
真正可复现的权重文件还应保存基准表及版本、每一步输入权重、变量重编码、缺失处理、算法和收敛阈值、截尾规则、最终权重、设计效应与生成代码。下一期更新基准时保留旧版本,避免历史看板因后台覆盖而改变。需要从源头改善精度时,可先用配额与超额抽样策略减少极端失衡;全国与地区目标并存时参考区域样本分配方法;对外发布前再按调查方法报告模板披露样本、权重和限制。
方法依据与延伸资料
- U.S. Census Bureau:SIPP Weighting:基础权重、无响应调整、多面板合并与后分层校准。
- Statistics Canada, Survey Methodology:The role of survey outcome variables in nonresponse adjustment:调整变量与结果及响应机制的关系。
- Pew Research Center:How different weighting methods work:raking、匹配、倾向权重及在线自愿样本实验。
- AAPOR Transparency Initiative:权重变量、计算方式、基准来源和非概率样本精度的披露。
