趣谈可用性测试(下)
如何通过SUS(系统可用性量表)获取定量的结论。
上期介绍了可用性测试以及它的评估维度,以及怎么获取定性的结论。那么本期我们来看看,如何通过SUS(系统可用性量表)获取定量的结论。
如何获取定量结论
在可用性测试中,我们主要通过SUS(系统可用性量表)与ASQ(归因问卷)来获取定量数据。ASQ非常常见,在此就不多做赘述了。
两者之中,SUS是量化问题的重点,SUS量表一般长这样:
有人会问:我可以改掉其中的部分问题吗?答案是不可以。SUS是一张问卷,每个问题都经过千锤百炼,无论是问题本身还是问题之间的组合都具有统计学和心理学上的科学性,它至少具有以下几点公认的特性:
(1) 正反提问
大家可以发现SUS问卷中,奇数问题是正面语气,偶数问题是负面语气,这样减少了被测试者的依从性,使结果更加客观。
(2) 奇数步距
从非常不同意到非常同意的等级划分,一般使用奇数,有很多量表也是这样规定的。因为用户可以选择一个中立的中间状态而不像偶数那样,不具有这个中间状态。
(3) 高度可信
基于统计学以及大量研究,是目前可信度最高的可用性标准化量表。
图来自论文:Determining What Individual SUSScores Mean: Adding an Adjective Rating Scale
从上图可知,在样本量为12+时,SUS量表能得到近乎100%正确的结论。总而言之,相信他是可靠的。
但是我们在使用时也需要注意一点,由于这套量表最初是由英文翻译过来,且语术比较专业化,部分问题对于一般用户而言是比较难理解的,比如她们很可能不明白“一致性”具体指的是什么。这个时候就需要测试的主持人向他们解释这个问题,使其理解。
那么当你的被测对象们完成了SUS问卷后,该如何去计算结果呢?参见下图:
把问题转换成数值是需要修正的:
- Q1、3、5、7、9的分值-1(基数行分值各-1)
- 5- Q2、4、6、8、10的分值(5-各偶数行分值)
- 单用户SUS分值=列相加*2.5(整列求和)
- SUS结论分=用户SUS平均值(各用户SUS总分求平均)
另外,除了上述SUS量表总分外,我们还可获得分量表:“易学性”、“易用性”。易学性对应SUS问卷中4、10两项,易用性对应其余8项。其计算方法与上述方法一致,但权重参数分别为*12.5与*3.125。
那么,SUS分值具体有什么用呢?
Bangor等三位PHD解释了这个问题。他们于2009年在Journal of Usability Studies发表了文章《Determining what individual SUS scores mean: Adding an adj》。
计算好SUS总分后,对照着查下评价吧。假如你的产品获得了70分,那恭喜,你的产品还不错(Good),再接再厉!
SUS量表还有一个很厉害的用法,就是能让你足不出户就能知道你的产品体验在市场上的排名情况。
通过建立同类产品的SUS排名数据库,可以得到一个上图这样的分级表。上表中,百分等级意味着产品的体验排名,例如,你的产品得分为67,那么它的体验优于市场上约50%以上的同类产品。
很多新手常常用上图对照表去判断自己的产品,这实际上是不科学的。上表是Jeff Sauro在2011年,通过446个研究,超过5000个用户的SUS反馈的数据库得到的。暂且不说这8年来用户体验设计、前端技术、硬件技术发展的如何迅速,C端B端等领域的标准也有所不同,产品类别层出不穷,所以实际上这样的分级表已经难以覆盖当前时代所有产品了。
所以需要注意的是,这样的分级表并不是各产品通用的,而是沉淀以往的研究获得的数据去建立这样一个数据库用来对照,成本不菲,一般的中小型公司很难做到这样,笔者在此仅为排除误区而做介绍。
结尾
在结尾我和大家分享下我低配快速版可用性测试的实操流程,仅供参考:
1.准备材料,检查待测任务的环境,是否需要重置、权限等前置条件。
2.与被测人员会面,介绍测试背景情况,包含测试用意以及该类产品的介绍。
3.让用户自由浏览系统但不进行配置类操作。(约2分钟)
4.开启录屏录音(MAC推荐quicktime)。
5.引导用户阅读需要测试的任务使其理解。
6.观察用户进行使用,观察内容主要为用户的发声思考、用户的操作行为,同时做好记录。
7.每个任务完成后让用户填写SUS表。
8.针对每个任务趁热打铁展开阶段访谈,主要了解用户操作的意图,用户的建议,或确认自己的猜想,以获取问题或需求。
9.所有任务完成后对整体感知进行SUS打分。
10.与用户围绕产品/功能闲聊(10分钟内),以获取一些意料外的建议。
11.重置待测任务的前置条件,继续下一个测试循环。
12.观看录屏复盘,及时整理资料。
有关文献
最后希望大家能够抽空阅读下以下文献,在理解的基础上再进行实践,依葫芦画瓢,生搬硬套是达不到目的的哟。
· Bangor, A., Kortum, P. T., & Miller, J. T. (2009). Determining what individual SUS scores mean:Adding an adjective rating scale. Journal of Usability Studies, 4(3), 114-123.
· Jeff Sauro.(2014). 用户体验度量. 机械工业出版社.
· l John Brooke. (2013). SUS: A Retrospective. Journal of Usability Studies, 8(2), 29-40.
· l Tullis, T. S., & Stetson, J. N. (2004). A comparison of questionnaires for assessing website usability. Proceedings of UPA 2004 Conference. Minneapolis, Minnesota.















































































