客户支持问卷里有一张九行、五列的矩阵。列标题从“非常不满意”到“非常满意”,行里却同时出现“等待时间”“问题是否解决”“客服专业”“愿意再次使用”“自助中心使用频率”。页面整齐,数据也都是1—5,但这些数字没有共同含义:结果事实被迫表达成满意度,频率被误当态度,未来意向又混入当次经历。
矩阵只是把多个题项放在同一页面的布局,不是测量质量证明。每行共用一组列,并不表示它们测量同一构念,更不表示可以直接求平均。设计顺序应是“研究构念→题干与回答尺度→适用对象→页面呈现”,而不是先选一个漂亮矩阵,再把能想到的内容塞进行标签。
先分清三个经常混用的对象
| 对象 | 它是什么 | 主要判断 |
|---|---|---|
| 矩阵/网格 | 多个行项目共享屏幕上的列选项 | 在目标设备上是否可读、可操作,项目是否同层级 |
| 等级回答题 | 一道题使用从低到高的有序类别 | 题干与锚点是否匹配,受访者能否稳定区分各级 |
| 多题构念量表 | 多个经过理论与实证支持的项目共同测一个潜在概念 | 项目内容、维度、计分、信度/效度和适用人群是否成立 |
五档单题不因为有“非常不同意—非常同意”就自动成为可复用的心理量表;九道题排进一张表,也不因为统计软件能计算平均值就构成综合指数。若目标只是分别看九个服务触点,就按单项分布报告;若要形成“服务信任”得分,则需在设计阶段证明哪些项目属于该构念、如何计分以及在哪类人群中适用。
九行旧矩阵怎样拆成四种可解释数据
先让受访者回想最近一次已经结束的客服事件,并确认使用过哪些渠道。然后把旧矩阵逐行归类:
| 旧矩阵内容 | 真正变量类型 | 改写方式 |
|---|---|---|
| 是否使用在线客服、电话、帮助中心 | 经历/暴露 | 多选事实题;只把实际使用渠道带入后续 |
| 问题是否解决 | 结果状态 | 是、部分解决、未解决、不确定 |
| 找到入口、说明理解、完成操作 | 任务难易 | 非常困难、较困难、不难也不容易、较容易、非常容易 |
| 等待和处理速度 | 时间体验 | 记录可回忆的时间区间,再单独问速度满意度(若决策需要) |
| 客服专业与沟通 | 人员体验 | 仅向接触人工客服者展示,同一满意度题干下可组成短电池 |
| 愿意再次使用 | 未来意向 | 在事件评价之后单独提问,不并入当次服务平均分 |
这一步会让页面数量增加,却减少无效数字。没用过电话的人不该被迫选择电话满意度;“问题未解决”也不是满意度1分的同义词。经历决定题目是否适用,结果、过程评价和未来意向则回答不同决策。
同一列标题必须对每一行完成同一句话
判断矩阵是否成立,可把题干和每个行标签连读。例如“就最近一次客服事件而言,完成以下任务有多容易或困难?——找到联系入口/说明遇到的问题/理解解决方案。”三行都能自然接在同一题干后,使用同一难易尺度。
若连读成“你对‘问题是否解决’有多满意”,就把客观结果改成了态度;连读成“你对‘客服使用频率’有多满意”,语义更不成立。合格矩阵至少满足:
- 行项目属于同一抽象层级,没有把品牌、触点、属性和结果混列;
- 每行使用同一主体、参考事件和时间范围;
- 所有人都有能力评价,或通过经历逻辑只展示适用行;
- 相同数字在每一行方向一致且含义相同;
- 每行都是分析或行动真正需要的变量。
五点还是七点,没有脱离任务的标准答案
量表点数应取决于受访者能否区分、构念需要的分辨率、施测模式、样本量和历史可比性。五点通常更短、更容易完整标注;七点提供更多等级,但多出的类别只有在目标人群能稳定使用时才是信息,而不是装饰。已有验证量表或趋势指标优先保持原设计,不能为页面美观随意改点数。
比点数更关键的是语义:
- 题干问满意度,就使用满意—不满意;问难易,就使用困难—容易,不能混用;
- 两端强度应对称,尽量给每个类别清楚文字,而不是只标1和5;
- 中点“既不满意也不不满意”是一种实质立场,不等于“不知道”;
- “没有经历/不适用”“不知道”“拒绝回答”应放在量表之外,保留独立代码;
- 同类量表方向在整份问卷中保持一致,不要一页高分代表好、下一页高分代表坏。
UK Government Analysis Function 的问卷设计指南强调回答类别要与题目匹配、避免重叠、控制数量并在同类量表间保持方向一致。它给出五点和七点示例,但“示例”不等于所有构念都必须选择同一点数。
不要用反向句给认真作答者设语言障碍
“客服没有不认真解决我的问题”这种双重否定可能看似能抓住直线作答,实际也会让认真者误读,跨语言和小屏环境风险更高。若理论量表包含正反向项目,应按其验证方案使用并在分析中正确反向计分;若只是为防作弊临时编造否定句,得到的差异可能是语言处理能力而非目标态度。
需要检查同意倾向时,可以用语义清晰、内容方向不同的项目,并结合认知测试和项目间关系判断。质量控制不应通过故意把题写难来实现。
手机端默认逐项呈现,矩阵需要额外证明
传统矩阵在手机上常出现行标签、列锚点和选中控件不能同时看见的问题;横向滚动后,受访者可能忘记当前列含义。美国人口普查局的移动问卷设计标准提案建议以逐项题替代传统网格,并汇总证据指出拆分可减少手机直线作答和题目无回答、改善跨设备可比性。
Pew Research Center 的移动网页问卷建议同样指出,网格可能促使同列作答,在手机上还会引入横纵滚动、错误记录和退出。逐项呈现不必等于每题单独加载一页:可以在同一页纵向堆叠少量项目,让每个项目旁都显示完整选项,同时避免频繁网络跳页。
2026 年更新的美国人口普查局网页问卷设计指南把网格等题型的建议放在随机实验、可用性测试、启发式和实践证据构成的证据谱系中。这意味着布局选择应在真实设备和目标人群中验证,不应把桌面端的一次预览当作结论。
用120人随机可用性试验比较布局
假设九行已经被缩成六个同构的“任务难易”项目,团队仍不确定传统矩阵还是逐项堆叠更合适。可在正式样本之外招募120名与目标人群相似的参与者,按手机/桌面分层后随机分到两种布局,每组60人。两版题干、项目、顺序和回答选项完全相同,只改变呈现。
在看结果前登记:
- 主要可用性结果:是否无帮助完成六项,以及需要返回修改的人数;
- 数据结果:项目无回答、选项误触、同列作答和答卷中断;
- 过程结果:该题组用时、横向滚动、放大、错误恢复和设备;
- 理解结果:完成后抽问“第3档代表什么”“刚才评价的是哪次经历”;
- 决策规则:若矩阵节省的时间伴随更多错误或跨设备差异,则采用逐项布局。
举例说,如果试验观察到传统矩阵中位用时52秒、9人返回修正、6人漏答至少一项;逐项版65秒、3人修正、2人漏答,那么不能只以快13秒宣布矩阵胜出。要结合错误、理解和移动端差异评估,这些数字是本项目的说明性试验结果,不是可套用的行业基准。
同一列全选不是自动无效
一名参与者六项都选“较容易”,用时55秒,评价对象均为其实际经历,开放回答还能具体说明流程,这可能是真实一致体验。另一人七秒内六项全选中点,其中两项按前题从未经历,随后开放回答与题意无关;这里是“极短时长+不适用矛盾+低相关文本”的联合证据,而不是直线本身。
延续上面的说明性试验:假设传统矩阵60人中有23人同列作答。复核后,14人的经历、用时和文本都合理,应保留;6人同时触发事先登记的多项低质量规则,可标记排除;其余3人只有弱信号,不应由人工主观猜测动机。报告质量处理时保留原始行、各信号和规则版本。
直线率还受内容影响:如果六项本来高度相似,答案一致并不奇怪;为了让人“不要直线”而塞入无关或反向项目,会损害构念。更好的预防是减少项目、确保每行有区分价值、只向有经历者展示,并让移动端易读。
分析时先看分布、基数和适用性
每个项目至少报告有效基数、完整类别分布、不适用和项目无回答。平均数可以作为摘要,但有序类别的距离是否近似相等是一项分析假设;不要只给“4.2分”而隐藏大量人集中在两端。比较群体时还要确认量表翻译、展示模式和项目含义一致。
只有当多个项目确实被设计为测量同一构念,并有适用的维度和计分证据时,才形成总分。内部一致性高也不能证明单维或有效:几道重复措辞的题可能高度相关,却只是在重复同一个狭窄表述。计分规则、最少已答项目、缺失处理和反向计分都应预先写进分析计划。
在问卷派中,题型选择服从测量规格
团队可以在问卷派中建立等级题或矩阵,并用逻辑只展示受访者经历过的项目。配置完成后应在目标手机上检查题干、完整标签、选中状态、返回修改和导出变量;若需要随机无自然顺序的行,还要保存实际顺序,方法可参考问卷随机化设计。
矩阵可发布的证据不是“九行刚好放得下”,而是每行连接同一题干、使用同一构念和回答尺度,所有评价者都具备相应经历,移动端试验证明布局不会增加重要错误,且分析者知道哪些项目可以分别报告、哪些经过验证后才能合成。页面整齐只是结果,数据同义才是前提。
