指南样本量统计功效抽样误差最小可检测差异

调研需要多少样本量?400份不是通用答案

从总体比例、有限总体、关键分组和版本比较四类任务出发,计算有效样本、设计效应与邀请量,并解释误差范围成立的前提。

最近更新 2026年9月2日 12 分钟 阅读

“做400份够不够”少了最关键的宾语。用简单随机抽样估计一个接近50%的总体比例,希望95%置信区间的误差约为正负5个百分点,计算结果是385份;但若要以80%功效识别50%与60%两个版本的差异,近似需要每组388份,共776份。若只想识别5个百分点差异,每组则约1565份。

样本量不是由一个行业惯例决定,而是由主要估计、允许不确定性、最小有意义差异、关键分组和抽样设计共同决定。总体人口从十万增加到一千万通常不会让所需样本同比增加,但从一个总体拆成四个必须单独报告的地区、使用聚类招募或需要发现更小差异,会显著增加有效样本需求。

先选任务:估计一个数,还是比较两个数

样本量计算前要锁定分析问题。四种常见任务不能混用同一个计算器:

任务计划输入样本量要控制什么
估计比例预期比例、置信水平、允许误差区间宽度
估计均值预期标准差、置信水平、允许误差均值区间宽度
比较组别或版本基线、最小有意义差异、显著性、功效、分配比发现目标差异的概率
模型或稀有事件预测变量、参数数、事件率、聚类与验证计划参数稳定和事件数

“总体满意度是多少”是估计任务;“新版是否比旧版提高至少10个百分点”是比较任务;“哪些因素预测流失”又是模型任务。先选一个主要结果和主要分析,其他指标作为次要结果报告,避免拿最容易显著的一项反过来解释样本量。

估计比例:385是怎么来的

在大总体、简单随机抽样、观测近似独立且使用正态近似的基础情形下,估计比例所需样本可写为:

n₀ = z² × p × (1-p) ÷ e²

z是置信水平对应的临界值,95%双侧近似取1.96;p是计划时预期比例;e是允许的半宽,也就是常说的正负多少个百分点。没有可靠先验时取p=0.5,因为此时p(1-p)最大,给出较保守的样本量。

代入p=0.5e=0.05

n₀ = 1.96² × 0.5 × 0.5 ÷ 0.05² = 384.16

样本必须向上取整,所以是385份有效回答。若有可信历史数据表明比例约20%,同样允许正负5个百分点,近似为1.96²×0.2×0.8÷0.05²=245.86,向上取246。预期比例若错了,实际区间可能比计划更宽,因此不能为了降低预算随意选一个远离50%的值。

NIST 的比例样本量说明同样要求先给出置信水平、允许抽样误差和总体比例,并把未知比例下的0.5作为最不利情形。这里的“正负5个百分点”只描述该抽样模型下的随机误差,不包括漏覆盖、无应答、题目误解、作弊、配额偏差或处理错误。

总体只有2000人时,有限总体修正才明显

当从一个固定且不放回的小名单抽取很大比例时,可以用有限总体修正:

n = n₀ ÷ [1 + (n₀-1) ÷ N]

若总体名单N=2000,把384.16代入得到约322.4,向上取323;若N=100000,结果约382.7,仍是383左右。由此可见,人口从十万扩大到千万不是样本量成倍增长的理由;真正重要的是计划精度、分组和设计。

修正的前提是这2000人确实构成完整目标总体,并能按已知概率抽样。客户名单漏掉线下用户、一个人出现多次或大量人无法联系时,数学上的有限总体修正不会修复覆盖偏差。若预期名单中相当一部分不响应,还要在323份有效样本之外单独增加抽取量。

总体够用,不代表每个关键分组够用

团队需要分别发布东、南、西、北四个地区的比例,每个地区都希望在接近50%时达到约正负5个百分点精度,那么目标不是总共385,而是每个地区约385,总计约1540份。若只均分总样本385,每区约96份,在同一简单近似下误差接近正负10个百分点。

不必为所有交叉表都保证相同精度。发布前列出“必须据此决定”的分组,例如地区和新老客户;年龄×地区×渠道等探索性切片可以合并、扩大区间或不单独发布。对稀有但决策关键的群体可超额抽样,分析总体时再按选择概率或已知结构加权。样本量按最大的核心需求规划,而不是回收结束后才发现某个单元只有十几人。

版本比较:差异越小,所需样本以平方速度增加

假设旧版完成信心为50%,团队认为提升到60%才值得全量上线,计划双侧显著性水平5%、统计功效80%、两组等量随机分配。使用两个独立比例的常见正态近似,约需每组388份。这个数与估计单个比例的385很接近只是巧合,计算目标完全不同。

若业务认为55%也值得上线,目标差异从10个百分点减半到5个百分点,近似样本不是翻倍,而是升到每组约1565份。标准误差随样本量平方根缩小,因此把可检测差异减半,常常需要接近四倍样本。反过来,预算只能支持每组200份时,应计算可检测差异或给出结果区间,不能把功效不足后的“不显著”写成“两个版本一样”。

DELTA² 指南强调,比较研究的目标差异应在研究前说明为何现实且重要,并与主要结果、显著性和功效一起报告。最终计算还取决于单侧或双侧检验、连续或二元结果、基线率、组间分配、重复测量、协变量和所用方法,应使用经过验证的软件复核,而不是仅依赖本文近似。

600份名义样本,可能只有480份有效信息量

简单随机公式把每份回答视为信息贡献相近。实际调查中的聚类、不同选择概率和大幅权重会改变方差。WHO 将有效样本量定义为:在简单随机抽样下能达到同等不确定性的样本数;复杂设计的有效样本量约等于实际样本量除以设计效应。

若600名回答者中一半权重为0.5、一半权重为1.5,权重和为600,权重平方和为750。按常用的权重有效样本近似:

n_eff = (Σw)² ÷ Σw² = 600² ÷ 750 = 480

这相当于权重设计效应1.25。600份完成在该近似下只提供约480份等权独立样本的信息量。权重能修正已知结构,却会增加方差;极端权重应在设计和回收阶段处理,而不是只靠事后计算。

聚类也会降低有效信息。若每个门店平均调查20人,同店回答的组内相关系数预估为0.05,简单近似设计效应为1+(20-1)×0.05=1.95。需要385份有效简单随机信息时,名义完成约要751份。增加更多门店通常比在同一个门店继续加人更有效,因为后者带来的信息更相似。分层在某些设计下可能提高精度,但必须按真实设计计算,不能默认抵消聚类。

从有效回答倒推邀请量,要连续乘三种损耗

上面的两版本比较需要776份有效回答。若从宽口径人群发出邀请,预计目标资格合格率40%,合格者完成率75%,完成后质量通过率90%,则每次邀请成为有效样本的概率为:

0.40 × 0.75 × 0.90 = 0.27

邀请量约为776÷0.27=2874.1,向上至少2875次。若还要满足分地区配额,应分单元计算;最难配额可能先耗尽可联系名单。合格率、完成率和通过率来自历史同类项目或软启动,不能用供应方的宽泛平均值代替。

质量损耗也不能通过“先多买20%”草率处理。清洗规则应在回收前定义,并监测误伤;若低质量集中在某设备、语言或无障碍路径,删除会改变样本结构。预计损耗只是预算缓冲,最终报告仍要给出被邀请、筛除、未完成、质量剔除和有效分析的实际数量。

小比例、模型和追踪研究要换一种计划单位

若某行为发生率只有2%,400份样本期望仅观察约8个事件,整体误差看似不大,也无法稳定比较事件人群或拟合包含多个变量的模型。此时应从“需要多少事件或每类多少案例”反推总样本,必要时定向超额抽样,再用合适权重恢复总体估计。

纵向追踪要以最后一波所需的完整配对数规划。若末期需要400人,预计每波保留80%,连续两次后起始样本至少约为400÷0.8²=625。不同流失群体体验不同,增加起始量只保数量,不自动消除流失偏差;还要设计追访、比较留存者与流失者,并说明结果适用于谁。

定性访谈、可用性测试和认知访谈的样本依据是覆盖关键经历、发现机制和信息饱和,不应把比例误差公式强行套上。它们可以解释“为什么”,但少量目的性样本不能估计人群占比。混合研究通常先用定性材料改善测量和机制假设,再按主要定量估计规划样本。

把样本量写成可审计计划,而不是一个采购数字

正式回收前留下一张计算记录:目标总体与抽样框、分析单位、主要结果、计划估计或检验、基线与方差来源、允许误差或最小有意义差异、置信水平、显著性、功效、关键分组、有限总体、设计效应、预计无应答与质量损耗、最终取整和软件版本。若输入来自小规模软启动,要说明不确定性并预设如何调整。

不要一边查看显著性一边随意续样到“有结果”为止,这会改变错误率。若需要中期查看、提前停止或分批决策,应在方案中采用相应序贯方法和阈值。回收后也不要做“观察功效”替代结果解释;STROBE 的说明建议交代研究规模如何确定,并用估计值和置信区间呈现实际精度。

问卷派可以按目标人群与配额监测邀请、合格、完成和质量通过数量,并在软启动后更新可行性假设。统计样本量应由研究设计确定,平台回收量只是执行结果。若样本来自非概率自愿渠道,即使达到2875或更多,也不能直接套用概率抽样的正负误差来覆盖选择偏差。

一份可批准的计划可以写成:“主要比较为旧版50%与新版60%的二元结果,双侧5%、功效80%、等量分配,近似每组388份有效回答;预计合格40%、完成75%、质量通过90%,初始邀请至少2875次。地区仅做探索性报告;若采用门店聚类,将根据软启动组内相关重新膨胀样本。”数字、假设和决策边界同时存在,样本量才真正可用。

继续规划时,可结合目标样本人群定义样本配额策略置信区间解释一起检查。

样本量、功效与复杂抽样依据