- 人机交互系统
- 🧪 实证研究实验实例:
- “手势交互 vs. 传统触控对移动设备上地图缩放任务绩效的影响”
- 1. 研究背景与动机
- 2. 研究问题与假设
- 3. 实验设计(实证研究方法核心)
- 4. 参与者(Participants)
- 5. 实验流程
- 6. 数据分析方法
- 7. 预期结果与意义
- 8. 伦理与局限性
- 🌟 实验目标
- 📌 DECIDE 框架详解与应用
- 1. D – Determine the goals of the evaluation(确定评估目标)
- 2. E – Explore the questions(探索评估问题)
- 3. C – Choose the evaluation paradigm and techniques(选择评估范式与技术)
- 4. I – Identify the practical issues(识别实际问题)
- 5. D – Decide how to deal with the ethical issues(处理伦理问题)
- 6. E – Evaluate, interpret and present data(评估、解释与呈现数据)
人机交互系统
PPT 1
HCI 是一门涉及人类使用的交互式计算系统的设计、评估和实施以及围绕它们的主要现象的研究的学科
以用户为中心的设计方法:User-Centered Design
Human-Computer Interaction (HCI)
HCI的重要性:
- 市场角度
- 用户期望简单易用的系统
- 对设计低劣系统的容忍度越来越差
- 企业角度
- 提高员工的生产效率
- 降低产品的开发成本
- 降低产品的后续支持成本
- 用户角度
- 获得较高的主观满意度
- 减少时间、金钱、生命损失
HCI是软件工程人员需要掌握的核心知识领域之一
典型的交叉学科
PPT 2
人机交互的发展历史
新的界面变革包含了上一代界面:作为一种特例
旧的交互方式仍有其存在的必要性:以前的用户从未消失
学习目的:利用原有技术实现新的交互手段
主要发展阶段:
- 批处理阶段:01串
- 联机终端时代:命令行界面
- 图形用户界面GUI时期:“直接操纵”是GUI的主要特征
PPT 3
交互框架
作用:
- 提供理解或定义某种事物的一种结构
- 能够帮助人们结构化设计过程
- 认识设计过程中的主要问题
- 有助于定义问题所涉及的领域
执行/评估活动周期EEC:最有影响力的框架
定义了活动的四个组成部分:
- 目标(Goal)$\neq$ 意图(Intention)
- 执行(Execution)
- 客观因素(World)
- 评估(Evaluation)
执行隔阂:用户为达目标而制定的动作与系统允许的动作之间的差别
评估隔阂:系统状态的实际表现与用户预期之间的差别
意义:如何才能使用户简单确定哪些活动是被允许的,确定系统是否处于期望的运行状态等问题
可用性目标:目的是为交互设计人员提供一个评估交互式产品和用户体验各方面的具体方法
易学性:使用系统的难易,在于确定用户准备花费多少时间学习一个产品
易记性:学会使用并记住该产品如何使用的难易程度
影响因素:意义、位置、分组、惯例、冗余
效用性:一定程度上该产品提供了正确的功能,可以让用户做他们需要做的或想做的事情
高效率:产品在对用户执行任务的支持程度
安全性:避免用户发生危险和陷入不好的情形
用户体验目标:一系列用户情绪和感受体验。在特定的时间和地点使用或与一个产品交互时,选择传达用户的感受、目前状态、情绪、感觉等最佳词汇的过程,可以帮助设计者了解用户体验的多面性变化性的本质
体验和可用性的关系:主观vs 客观
有些可用性和用户体验目标是不兼容的
认识和理解可用性和其他用户体验目标之间的关系是交互设计的核心
简易可用性工程
特点:
- 以提高产品可用性为目标的先进产品开发方法论
- 借鉴了许多不同领域的方法和技术
- 强调以人为中心来进行交互式产品的设计研发
四种主要技术:
- 用户和任务观察
- 了解产品的目标用户是可用性工程的第一个步骤
- 场景
- 简便易行的原型工具,通过省略整个系统的若干部分来减少实现的复杂性
- 简化的边做边说
- 让真实用户在使用系统执行一组特定任务的时候讲出所思所想
- 最有价值的单个可用性工程方法
- 可了解用户为什么这样做,并确定其可能对系统产生的误解
- 实验人员需要不断提示用户或请他们事先观摩
解释什么是边做边说(think aloud),并分析其在交互评估中的作用(3 分)
- 启发式评估
- 能够发现许多可用性问题
- 为避免个人偏见,应当让多个不同的人来进行经验性评估
基本规则:
- 可学习性
- 灵活性
- 健壮性
黄金规则
- 尽可能保证一致
- 最容易被违背的原则
- 符合普遍可用性
- 提供信息丰富的反馈
- 设计说明对话框以生成结束信息
- 预防并处理错误
- 让操作容易撤销
- 支持内部控制点
- 减轻短时记忆负担
启发式规则(要简要解释规则)
- 系统状态的可见度
- 对于用时长的操作需要给出显示反馈
- 系统和现实世界的吻合
- 使用用户熟悉的词汇,遵循现实世界的惯例
- 用户享有控制权和自主权
- 对错误提供一个返回方法
- 一致性和标准化
- 产品内部对同一功能的术语和形式一致,图片没有歧义
- 避免出错
- 避免用户出错的可能
- 依赖识别而非记忆
- 使用的灵活性和高效性
- 考虑不同类型用户的使用偏好
- 帮助用户识别、诊断和恢复错误
- 描述好错误信息,表明错误问题和建议
- 帮助和文档
- 提供帮助手册,用语简单
- 审美感和最小化设计
- 使用普遍接受的控制方式,不要放冗余的不相关信息
PPT 4
需求
需求获取是项目设计的第一个阶段
需求是关于目标产品的一种陈述,它指定了产品应该做什么,或者如何工作
产品特性:功能、物理条件、使用环境
用户特性:心理学原理、个性的差异、用户差异(体验水平、年龄、文化、健康)
体验水平差异:新手用户、专家用户、中间用户
年龄差异:老年人和儿童
文化差异:符号、姿势、颜色
健康差异:残疾、视觉损伤、听觉损伤等
:star:用户建模
人物角色:不是真实的人,是基于观察到的那些真实人的行为和动机,并且在整个设计过程中代表真实的人,是在人口统计学调查收集到的实际用户的行为数据的基础上形成的综合原型。
人物角色解决了产品开发过程中出现的三个设计问题:弹性用户、自参考设计和边缘情况设计
人物角色的构造要注意的问题:
- 谁将使用系统?
- 这些用户属于哪些类型的人群?
- 是什么因素决定他们将怎样使用系统?
- 他们与软件的关系有什么特征?
- 他们通常需要软件提供什么支持?
- 他们对软件会有怎样的行为和期望?
分析人物角色构建作业的问题(给图)?说明什么是人物角色?构建人物角色过程应该注意什么?(8分)
建模过程:拼凑(头脑风暴)、组织、细节、求精并循环
需求获取——观察:直接观察、间接观察
需求获取——场景:表示任务和工作结构的“非正式的叙述性描述”,讲故事
需求定义:创建问题和前景综述、头脑风暴、确定人物角色的期望、构建情境场景剧本、确立需求,然后迭代
模型
概念模型:对系统如何组织和操作的高级描述
心智模型:深植我们心中关于我们自己、别人、组织及周围世界每个层面的假设、形象和故事,并深受习惯思维、定势思维、已有知识的局限。
请说明什么是心智模型(Mental Model),并结合生活实际进行举例(2 分)。
基于对象的概念模型:隐喻的优势
需求验证:原型——在某一方面和真正产品比较接近、以便人们能对这一方面的各种技术方案进行不断评估和改进的一种接近于实际产品的模型
原型的重要性
原型的分类:低保真原型(多数项目的首选)和高保真原型
- 低保真原型简单、便宜、易于修改,但是和最终产品有一定差距。
- 高保真原型和最终产品较为接近,但是制作时间长,难以修改,并且容易让用户误以为已经有具体的实现。
原型是一种用户乐于接受的需求验证方式,请简要描述一下不同类型的原型在使用时的优缺点。
低保真原型:草图、故事板、绿野仙踪法
任务分析
记录人们如何完成任务的一种方式
任务分析的作用:
可以用来了解通过观察和访谈目前参与工作流程的人收集到的数据
主要用于调查现有情形,而不是展望新系统或设备
分析基本原理,了解人们想要达到什么目标,如何达到这些目标,并由此建立需求
:star:层次化任务分析(HTA)是应用最广的任务分析技术(图书馆目录服务):
把任务分解为若干子任务,再把子任务进一步分解为更细致的子任务。之后,把他们组织成⼀个”执行次序“,说明实际情形下如何执行各项任务。
PPT 5
设计框架
设计框架定义高层次上的屏幕布局,定义产品的工作流、行为和组织
定义外形因素和输入方法
外形因素
设计什么样的产品?
产品输入方法
产品与用户互动的形式
定义功能和数据元素
数据元素
交互产品中的基本主体,如相片、电子邮件、订单
功能元素
对数据元素操作的工具以及输入或者放置数据元素的位置
决定功能组合层次
元素分组
更好地在任务中和任务间来帮助促进任务角色的操作流程
勾画大致的设计框架
方块图阶段
构建关键情景场景剧本
描述了人物角色如何同产品交互
这些场景剧本描述了人物角色最频繁使用界面的主要路径
重点在任务层
举例:电子邮件应用中关键线路的活动主要包括读和写邮件,而不是配置邮件服务器
通过验证性的场景剧本来检查设计
验证性的场景剧本不用具备很多细节
但包含一系列“如果怎样,将怎样”的问题
情绪板
由能代表用户情绪的文本、元素、图片拼接而成的客观表达设计理念的方法
可以帮助定义视觉设计相关的5大内容
色彩、图形、质感、构图、字体
是设计领域中应用范围比较广泛的一种方法
情绪板的制作:寻找主题相关的关键词,关键词联想、搜索关键词图片、创建情绪板、视觉设计
设计中的妥协
个性化和配置
本地化和国际化
审美学与实用性
积极的文字表达
消除歧义
让软件友好和体贴
有趣的用语
“聪明”/“不聪明”的软件
邀功的对话框
加快系统的响应时间
减轻用户的记忆负担
为了能够使用软件来完成某些任务,必须记住两类信息或知识
和软件如何操作相关
应当选择哪个命令或操作、文件存在哪个目录中等
和该任务所需的领域知识相关
哪些系统函数可以使用,这些函数的参数及返回值是什么
减少用户的等待感
以某种形式的反馈让用户了解操作进行的进度和状态
以渐进方式向用户呈现处理结果
给用户分配任务,分散用户的注意力
减低用户的期望值
设计好的出错信息
四个简单原则
使用清晰的语言来表达,而不要使用难懂的代码
使用的语言应当精炼准确,而不是空泛而模糊的
对用户解决问题提供建设性的帮助
出错信息应当友好,不要威胁或责备用户
交互设计模式
模式:描述了问题和解决方案,并说明了它成功应用于何处
轮播:
优点
充分使用屏幕空间
当前信息清晰可见
缺点
用户几乎不使用轮播
用户通常只能看见图像中的一张,或仅关注第一幅画面
开源资源:组件在软件许可范围内允许重用,并允许任何人处于自己的需求使用和修改软件,而不用受到标准的版权制约
简化设计的策略
策略一:删除——最明显的简化设计方法
删除杂乱的特性
可以让设计师专注于把有限的重要问题解决好
有助于用户心无旁骛地完成自己的目标
如何删除:关注核心、砍掉残缺功能
删除错误
删除视觉混乱:减少用户必须处理的信息,集中注意力在真正重要的内容上
删减文字:
- 删除引见性文字
“欢迎光临我们的网站,我们希望您心情愉快……”
- 删除不必要的说明
“填写完这些字段后,请按提交按钮把申请提交给我们”
- 删除繁琐的解释
“产品搜索:回答几个简单的问题,即可帮您找到合适的产品”
- 使用描述性链接
“单击这里”或“更多内容”
精简句子:让文字变得更加简洁、清晰、有说服力
不要删减过多
策略二:组织——最快捷的简化设计方式
分块:
用户界面设计离不开分块
“7±2法则”
名词:可以按字母表、时间或空间顺序排列的清单
动词:围绕行为进行组织
确定清晰的分类标准
不清晰的分类标准
利用不可见的网格来对齐界面元素:布局对于设计能否让用户感觉简单十分重要
大小和位置:重要的元素要大一些,不太重要的界面元素应该小一些;把相似元素放在一起
感知分层
期望路径
策略三:隐藏——一种低成本的简化方案
隐藏什么:
主流用户很少使用,但自身需要更新的功能
事关细节(对服务器进行配置或设计邮件签名)
选项和偏好(修改绘图应用的单位)
特定于地区的信息(如时间和日期需频繁自动更新的信息)
自定义
渐进展示:隐藏精确的控制部件
适时出现:在合适的时机、合适的位置上显示相应功能
别让用户“找信息”
让功能易于发现:为隐藏功能打上标签:更多,高级;把标签放在哪里比把标签做多大重要得多
策略四:转移
被精简掉的按钮全部通过电视屏幕上的菜单来管理
在设备之间转移:有时候,把某项任务的某些内容(如输入信息)转移到不同的平台上可能是一种更好的选择
向用户转移:把复杂的工作留给用户
简单界面的最高境界,应该是专家和主流用户都会感觉非常好用
简化设计策略的组合:删除不必要的,组织要提供的,隐藏非核心的,转移……?
PPT 6
评估
评估是设计过程的组成部分,包括:
系统化的数据搜集过程
用户在与原型、应用程序、计算机系统、系统组件、应用程序或界面草图交互时收集关于用户体验方面的信息,从而改进其设计
评估侧重系统的可用性和用户体验
为什么要评估:
用户不仅期望一个可用的系统,还在追求愉悦感与参与感
对企业而言,好的设计有很大卖点;设计师可以专注于真实问题和不同用户群体的需求,而非与人们对喜爱与厌恶之处进行辩论
评估什么:原型、可运行系统、特定屏幕功能、完整工作流程、审美设计、安全性等等
在哪里评估:取决于正在评估的对象
实验室环境(提供了必要条件系统地检查产品,智能手机)和实地环境(小孩子玩新玩具)
何时开展评估:取决于产品的类型
新产品:市场调研和建立需求,调整和完善设计(“形成性评估”)
已完成产品:确定产品需要改进的方面(“总结性评估”)
评估原则:
评估应该依赖于产品和用户
评估与设计应结合进行
评估应在用户的实际工作任务和操作环境下进行
要选择有广泛代表性的用户
评估范型
快速评估
设计人员非正式地向用户或顾问了解反馈信息,以证实设计构思是否符合用户需要
可在任何阶段进行
基本特征:快速
可用性测试
评测典型用户执行典型任务时的情况
基本特征:是在评估人员的密切控制之下实行的
主要任务:量化表示用户的执行情况
缺点:
测试用户的数量通常较少
不适合进行细致的统计分析
实地研究
基本特征:在自然工作环境中进行
目的:理解用户的实际工作情形以及技术对他们的影响
作用:
- 探索新技术的应用契机
- 确定产品的需求
- 促进技术的引入
- 评估技术的应用
重难点:
- 如何不对受试者造成影响
- 控制权在用户,很难预测即将发生和出现的情况
预测性评估:
研究人员通过想象或对界面的使用过程进行建模
基本特征:
- 用户可以不在场
- 整个过程快速,成本较低
区分评估技术的因素:
评估在周期中的位置(早期评估更快更便宜)
评估的形式(环境)
技术的主客观程度(越主观,受评估人员知识的影响越大)
测量的类型(主观定性,客观定量)
提供的信息(底层信息、高层信息)
响应的及时性(边做边说、走查)
干扰程度(直接观察会影响用户)
所需资源(设备、时间、资金、参与者、评估人员的专业技术及环境等)
评估方法组合:
评估方法的组合取决于项目待评估的具体特性
常用组合:
- 启发式评估+边做边说等用户测试技术
- 访谈+问卷调查
启发式评估vs用户测试:前者不需要用户参与,二者发现的可用性问题不同,可以互补。
:star:评估方法一:人机交互的实证研究方法
研究假设:实验通常从研究假设开始
零假设和备择假设
实验的目的是找到统计学证据来反驳或否定零假设,以支持备择假设
一个成功的实验,从一个或多个好的假设开始是至关重要的
因变量和自变量:
自变量是指研究者感兴趣的因素或因变量变化的可能原因。
因变量是指研究者感兴趣的结果或效果,其中术语“因”用于说明该变量依赖于受试者的行为或自变量的变化。
实验构成:实验条件、实验单位、分配方式
实验条件:指的是我们需要比较的不同技术、设备或程序;即变量取值
实验单位:指的是我们应用实验条件的对象,在人机交互研究领域,实验单位通常是具有特定特征的人类受试者,特定特征例如性别、年龄、计算机使用经验等;
分配方式:指的是将实验单位分配到不同实验条件的方式。
实验性研究的强大在于它能够探索因果关系,能够实现这一目标的主要原因即在于它的完全随机化(如抛硬币、随机数字表)
实验(看PPT)
组间设计:每个参与者只暴露在一种实验条件下
优点:
• 设计更简洁
• 避免了学习效应
缺点:
• 结果受个体差异影响大
• 样本量大
适合的任务:简单、个体差异有限;受学习效果影响较大的任务
组内设计:
优点
样本量小
隔离了个体差异
缺点
学习效果的影响
疲劳问题
适合的任务:个体差异较大、学习效果不太容易影响的任务;目标参与者群体很小的任务
组间设计和组内设计的优缺点完全相反
选择合适的设计方法(看PPT)
很难找到和招募合格的参与者是许多HCI研究人员经常面临的问题
析因设计:
当一个实验调查一个以上的自变量或因素时,析因设计被广泛采用
可以同时调查所有自变量的影响以及多个变量之间的交互影响
析因设计中条件的数量由自变量的总数和每个自变量的取指决定
优点:允许在一个实验中研究两个或两个以上自变量之间的相互作用的影响
裂区设计
PPT 7
观察用户
观察用户怎样工作是极其重要的可用性方法
用户并不总能客观和完整地描述产品的使用情况,用户有可能忽略一些细节
观察法是所有可用性方法中最简单的方法
观察适用于产品开发的任何阶段
观察方式:真实环境的观察(重点是应用的上下文)、受控环境的观察(重点是研究用户执行任务的细节)
实验室观察
优点:提供了可控且一致的评估环境,易于比较分析
缺点:可控且一致的评估环境是人为环境,不自然;可能降低测试结论的普遍性和一般性;不利于观察多人之间的协作
实际问题:
- 测试地点选择,测试设备安装
- 测试设备检查
- 文档准备
观察框架:
Goetz and Lecomfte框架:人员、行为、时间、地点、原因、方式
- 关注事件的上下文、涉及的人员和技术
Robson框架:空间、行为者、活动、物体、举止、事件、目标、感觉
- 有助于组织观察和数据搜集活动
生理反应监控
不知道用户在想什么?让用户“边做边说”
优点:简单,只需要很少专业技术
缺点:不自然,可能改变人们执行任务的方式
合作评估:两位用户共同合作,以便他们互相讨论、互相帮助
- 限制少,评估者很容易学会应用
- 鼓励用户对系统提出批评
- 出现不清楚的情况时,评估者能够澄清容易混淆的地方
- 能提示许多信息
- 尤其适合评估面向儿童的系统
- 适用于多人共享系统的评估
实验室观察能够使得研究人员更好地分离多个可能的影响因素,从而能够得出更准确的研究结果
观察者对被观察者的影响取决于观察类型和观察技巧:
- 只对用户的某些行为感兴趣
选择作为旁观者观察
如了解不同性别学生使用计算机的时间差异
- 如想了解计算机及其他设备如何影响学生们的交流
则选择作为参与者进行观察
现场观察
指在用户的实际环境中观察用户在使用软件时的情况,是发现同使用环境有关的问题的最佳手段
现场观察的问题清单:
- 明确初步的研究目标和问题
- 选择一个框架指导观察
- 决定数据记录方式
- 评估后,尽快与观察者或被观察者共同检查所记录的笔记和其他数据
- 数据记录时,应区分个人意见和观察数据
- 培养良好的合作关系
- 处理敏感问题
- 注重团队协作
- 应从不同角度观察,避免只专注某些特定行为
注意事项:
- 观察人员自始至终应尽量保持安静
- 当用户的操作令观察人员无法理解时需要打断用户请他解释或者将行为记录下来
- 观察初期,应该拒绝用户的任何帮助请求
观察和访谈相结合
数据记录:纸笔记录、音视频记录、日志和交互记录
观察得到的数据:
- 笔记、草图、相片、访谈或事件的录音录像、日志和交互记录等
- 用户在做什么并统计用户花在任务各个部分上的时间
- 用户的情感反应
数据类型:
- 用于描述的定性数据
- 用于分类的定性数据
- 定量数据
定性分析
内容分析:用于详细分析录像数据,把数据内容划分为一些有意义、而且互斥的类别,费时费力不常使用
会话分析:用于仔细检查语义,重点是对话过程,可用于聊天室等互联网应用
话语分析:关注话语的使用而不是内容,把语言视为反映心理和社会因素的媒介
定量分析
视频数据的标注和分析,统计分析
PPT 8
询问用户和专家
了解用户的需要和对产品的意见和建议
不知道该怎么做或者对预期的结果没有把握,要请专家帮忙
询问用户之访谈
指导原则:
- 避免过长的问题
- 避免复合句
- 避免使用可能让用户尴尬或无法理解的术语
- 避免诱导性问题
- 尽可能保证问题是中性的
访谈步骤:开始(介绍自己、解释原因)、热身(简单问题)、主要访谈阶段(由易到难)、冷却阶段(简单问题,消除紧张)、结束访谈(感谢)
访谈类型:非结构化访谈(开放式问题)、结构化访谈(封闭式问题)、半结构化访谈(开放式+封闭式)、集体访谈(个别成员的看法是在应用的上下文中通过与其他用户交流形成的)
焦点小组
询问用户之问卷调查
问卷调查是用于搜集统计数据和用户意见的常用方法
问卷设计原则:
- 应确保问题明确具体
- 在可能时,采用封闭式问题并提供充分的答案选项
- 对于征求用户意见的问题,应提供一个“无看法”的答案选项
- 注意提问次序,先提出一般化问题,再提出具体问题
- 避免使用复杂多重问题
- 使用等级标度时设定适当等级范围
- 避免术语
- 明确说明如何完成问卷
- 设计问卷时紧凑也要适当留空
问题类型
有助于提高回复率的措施
在线问卷调查:有效而方便地搜集大量人员的意见
问卷调查或访谈都属于间接方法
访谈:
- 形式更自由
- 难以获得确切数据
- 花费更多时间
- 在访谈后立即得到结果
- 可能回避某些“敏感问题”的真实想法
询问专家之认知走查
评估应该贯穿于整个设计过程中,专家分析可应用于项目设计的任何阶段
认知走查:逐步检查使用系统执行任务的过程,从中找出可用性问题,不需要用户参与
主要目标是确定使一个系统如何易于学习
走查的步骤
- 标识典型用户特征
- 设计样本任务
- 制作原型,明确执行步骤
- 设计人员和专家共同分析
- 评估人员检查操作步骤
- 汇总信息
- 更正问题
检查步骤时了解以下问题:
- 正确的操作对于用户是否足够明显(可预见)
- 用户能否注意到正确的操作(可理解)
- 能否正确解释操作的响应(可解释)
优点:
- 不需要用户参与
- 不需要可运行的原型
- 能找出非常具体的用户问题
缺点:
- 工作量大,非常费时
- 关注面有限
协作走查:由用户、开发人员和可用性专家合作,逐步检查任务场景,讨论与对话元素相关的可用性问题
优点:
- 专注于用户任务,能够产生定量数据
- 符合参与式设计原则
缺点:
- 需要各方面专家,速度慢
- 由于时间限制,通常只能评估有限的场景
询问专家之启发式评估
一种灵活而又相当廉价的评估方式
十条启发式规则:
[!IMPORTANT]
- 系统状态的可视性
- 系统应与真实世界相符合
- 用户的控制权及自主权
- 一致性和标准化
- 帮助用户识别、诊断和修复错误
- 预防错误
- 依赖识别而非记忆
- 使用的灵活性及有效性
- 审美感和最小化设计
- 帮助及文档
启发式评估步骤:
- 彻底检查界面
- 将界面与启发式规则进行对比
- 列举可用性问题
- 应用启发式规则对每一个问题进行解释和确认
问题的严重性分类:频率、影响、持续时间
如何正确评估:
- 分析每个问题对应的启发式规则
- 列出所有问题
- 至少遍历两次界面
- 不要局限于10条启发式规则
启发式评估优点:
- 不涉及用户,所以面临的限制和道德问题较少
- 成本较低,不需要特殊设备,较为快捷
- 又被称为“经济评估法”
缺点:
- 评估人员需要经过长时间训练才能成为专家
- 可能出现虚假警报
PPT 9
:star:评估方法二:基于DECIDE框架的评估
评估框架六个步骤:
- 决定总体目标
Determine - 发掘具体问题
Explore - 选择评估范型和技术
Choose - 标识必须解决的实际问题
Identify - 决定如何处理道德问题
Decide - 评估解释并表示数据
Evaluate
确定目标:
评估目标决定了评估过程,影响评估范型的选择
为什么要评估:
- 产品设计是否理解了用户需要
- 为概念设计选择最佳隐喻
- 界面是否满足一致性需要
- 探讨新产品应做的改进
发掘问题:
根据目标确定问题
选择评估范型和技术:
范型决定了技术类型,必须权衡实际问题和道德问题
可结合使用多种技术:
- 不同技术有助于了解设计的不同方面
- 不同类型数据可从不同角度看待问题
- 组合有助于全面了解设计的情况
明确实际问题:
用户、设施及设备、期限及预算是否允许、是否需要专门技能
处理道德问题:
应保护个人隐私
指导原则:
- 说明研究目的及要求参与者做的工作
- 说明保密事项,对用户的和对项目的
- 测试对象是软件而非个人
- 对测试过程的特殊要求
- 用户可自由表达意见
- 说明是否录像
- 欢迎用户提问
- 用户随时可以终止测试
- 对用户话语的使用应取得同意并匿名
评估、解释并表示数据:
搜集什么类型的数据,如何分析,如何表示
可靠性、有效性、偏见、范围、环境影响
小规模试验:对评估计划进行小范围测试以确保评估计划的可行性,可进行多次,快速且成本低
可用性问题分级:评估结果总是可用性问题清单以及改进建议
一:基于量化数据的分级
二:问题严重性的主观打分并取平均值
三:可用性分级的两个因素(多少用户会遇到问题,用户受该问题影响的程度)
四:该问题只在第一次使用时出现,还是会永久出现
用户测试
在受控环境中测量典型用户执行典型人物的情况
目的是获得客观的性能数据,从而评价产品或系统的可用性,如易用性、易学性等
最适合对原型和能够运行的系统进行测试
可对设计提供重要的反馈
可用性测试中往往把用户测试和其他技术相结合
测试设计
用户测试需要考虑实际限制并做出适当折中:
- 确保不同参与者的测试条件相同
- 应确保评估目标特征具有代表性
- 实验可重复
- 以DECIDE框架为基础
定义目标和问题:
目标描述了开展一个测试的原因,定义了测试在整个项目中的价值
目标是对关注点的说明和解答
选择参与者:
参与者的选择对于任何实验的成功至关重要
了解用户特性有助于选择典型用户
通常平衡性别比例
越多越好,20-30个人
参与者不同:随机指派某个参与者组执行某个情形
缺点:要求有足够多的参与者,实验结果可能受到个别参与者影响(解决:随机分配or预测试)
优点:不存在“顺序效应”,即参与者在执行前一组任务时获得的经验将影响后面的任务
参与者相同:相同的参与者执行所有实验情形
与参与者不同相比只需要一半的参与者
优点:
- 能够消除个别差异的影响
- 便于比较参与者执行不同情形的差异
缺点:
- “顺序效应”
解决:均衡处理(一半人先A后B,另一半人先B后A)
参与者配对:根据用户特性,把两位参与者组成一组,再随机安排他们执行某一种情形
适用于参与者无法执行两个实验情形
缺点:
- 实验结果可能会受到一些未考虑的重要变量的影响
- 如在评估网站的导航性能时,参与者使用互联网的经验将影响实验结果
- 因此,“使用互联网的经验”即可作为一个配对标准
设计测试任务:应与定义的目标相关
通常是简单任务,有时较为复杂
不能仅限于所要测试的功能,应使用户全面使用设计的各个区域
每项任务应介于5-20分钟
应当以合乎逻辑的方法安排任务
明确测试步骤:
在测试之前准备好进度表和说明,设置好设备
正式测试前应该小规模测试
必要时应该询问参与者遇到了什么问题
若用户确实无法完成任务,应该继续下一项任务
过程控制在1小时以内
必须分析所有搜集到的数据
数据搜集:
确定如何度量观测的结果,使用的度量类型(定性、定量)依赖于所选择的任务
常用的定量度量:
- 完成任务的时间
- 停止使用产品一段时间后完成任务的时间
- 执行每项任务时的出错次数和错误类型
- 单位时间内的出错次数
- 求助在线帮助或手册的次数
- 用户犯某个特定错误的次数
- 成功完成任务的用户数
分析方法:定量数据:
最常用的描述性统计方法是次数统计
还有平均数统计
分析方法:定性数据
通常按主题分类
总结报告:
将测试结果以书面形式反馈给设计人员以便于进一步分析和改进
PPT 10
人的认知
信息处理模型
人类处理机模型
三个交互式组件:
- 感知处理器:信息被输出到声音存储和视觉存储区域
- 认知处理器:输入将被输出到工作记忆
- 动作处理器:执行动作
问题:
- 把认知过程描述为一系列处理步骤
- 仅关注单个人和单个任务的执行过程
- 忽视了复杂操作执行中人与人之间及任务与任务之间的互动
- 忽视了环境和其他人可能带来的影响
格式塔心理学
相近性原则:空间上比较靠近的物体容易被视为整体(设计界面时应按照相关性对组件进行分组)
相似性原则:人们习惯将看上去相似的物体看成一个整体(功能相近的组件应该使用相同或相近的表现形式)
连续性原则:共线或具有相同方向的物体会被组合在一起(将组件对齐,更有助于增强用户的主观感知效果)
对称性原则:相互对称且能够组合为有意义单元的物体会被组合在一起
完整和闭合性原则:人们倾向于忽视轮廓的间隙而将其视作一个完整的整体(界面上的空白可帮助实现分组)
人脑中的记忆结构:
感觉记忆:又称瞬时记忆,在人脑中持续约为1秒
帮助我们把相继出现的一组图片组合成一个连续的图像序列,产生动态的影像信息
短时记忆:感觉记忆经编码后形成,又称工作记忆,约保持30秒
储存的是当前正在使用的信息,是信息加工系统的核心,可理解为计算机的内存
短时记忆的存储能力约为7 ± 2个信息单元
7 ± 2理论 vs. 交互式系统设计:
- 浏览菜单和工具栏基于人的识别能力
- 界面设计时要尽可能减小对用户的记忆需求,同时可考虑通过将信息放置于一定的上下文中,来减少信息单元的数目
长时记忆:短时记忆中的信息经过进一步加工后会变为长时记忆,信息容量几乎无限
只有与长时记忆区的信息具有某种联系的新信息才能够进入长时记忆
长时记忆的遗忘,是指长时记忆中的信息有时是无法提取的,不代表信息的丢失
界面类型
基于命令的界面
- 命令的形式、语法和组织
- 选择易于标记/命名命令的方法应尽可能一致
优点:
- 专家用户能够快速而精确地完成任务
- 相较GUI节约系统资源
- 可动态配置可操作选项
WIMP和GUI
Window, Icon, Menu, Pointing
Graphical User Interface
- 如何进行窗口管理,找到内容并在不同窗口之间流畅切换
- 确定菜单选项的最佳术语
- 消除图标的歧义
多媒体界面
- 多媒体内容设计
- 何时使用音频与图形、声音与动画等
优点:
- 媒体和交互性的组合可以比其中任何一个提供更好的呈现信息的方式
- 增强了快速访问多种信息的能力
- 更易学习、更好理解、更多的参与度和乐趣
虚拟现实和增强现实
- 如何防止用户体验不好的事情
- 确保用户使用最有效的导航方式,如第一人称、第三人称
- 如何使用户与虚拟环境中的其他人协作和沟通
信息可视化和仪表盘Dashboard
- 设计一个易于理解和容易推理的可视化
- 是否使用动画或可交互
- 2D或3D
- 何种隐喻
笔式交互和触摸交互
手势界面
- 计算机如何识别和描绘用户的手势
- 如何确定手势运动的开始和结束
实物界面
- 物理活动和效果之间应该如何组合
- 使用何种实物来使用户能够以自然的方式执行活动
优点:
- 可以创造性地操纵,使得动态信息以不同方式呈现
- 支持多人一起探索
可穿戴计算:
- 舒适、卫生、续航、交互方式的选择
脑机界面
PPT 11
预测模型
能够预测用户的执行情况,但不需要对用户做实际测试,特别适合于无法进行用户测试的情形
GOMS模型
最著名的预测模型,基于人类处理机模型,是人类如何执行认知—动作型任务以及如何与系统交互的理论模型
- 采用分而治之的思想,将一个任务进行多层次的细化
- 把每个操作的时间相加就可以得到一项任务的时间
全称:
- Goal 目标
- Operator 操作
- Method 方法
- Selection 选择规则
优点:能够容易地对不同的界面或系统进行比较分析
局限性:
- 假设用户完全按一种正确的方式进行人机交互,没有清楚地描述错误处理的过程
- 只针对那些不犯任何错误的专家用户
- 任务之间的关系描述过于简单
- 忽略了用户间的个体差异
请分别使用一句话解释 GOMS 模型四个字母所代表的含义,以及为什么使用 GOMS 分析未必能预测出最好的设计(8 分)
:star:击键层次模型(计算)
对用户执行情况进行量化预测,仅涉及时间
用途:
- 预测无错误情况下专家用户在下列输入前提下完成任务的时间
- 便于比较不同系统
- 确定何种方案能最有效地支持特定任务
没有考虑:错误、学习性、功能性、回忆、专注程度、疲劳、可接受性
放置M的启发式规则:
1: 在每一步需要访问长时记忆区的操作前放置一个$M$
2: 在所有$K$和$P$之前放置$M$
$K -> MK; P -> MP$
3:删除键入单词或字符串之间的$M$
$MKMKMK -> MKKK$
4:删除复合操作之间的$M$ (如, 选中$P$和点击$P_1$)
$MPMP_1 -> MPP_1$
有一个摄氏/华氏温度转换工具,用户选择转换模式后,在第一个文本框内输入待转换的温度,按回车即在第二个文本框内显示转换后的温度。初始时,用户的手在键盘上。用 KLM 模型分析用户完成将 27.3 摄氏度转换成华氏度所需的操作时间。(10 分)(附完成各操作符操作所需的时间)
$M+H+P+P1+P+P1+H+M+5K=7.85$
MHPP1HMKKHMPP1PP1MPP1
Fitts定律
能够预测使用某种定位设备指向某个目标的时间
人机交互中,根据目标大小及至目标的距离,计算指向该目标的时间。可以指导设计人员设计按钮的位置、大小和密集程度
对图形用户界面设计有明显意义
困难指数:$ID = \log_2(\frac{A}{W}+1)$
平均时间:$MT=a+b\times \log_2(\frac{A}{W}+1)$
W 是物体宽度,A 是物体距离。ID 的单位是比特,MT 单位是秒。一般性计算下a=50,b=150(单位是毫秒,所以MT如果单位是秒,a单位要转换成秒,b单位转换成秒/比特)
建议:
- 大目标、小距离具有优势
- 屏幕元素应该尽可能多的占据屏幕空间
- 最好的像素是光标所处的像素
- 屏幕元素应该尽可能利用屏幕边缘的优势
- 大菜单比其他类型的菜单使用简单
请说明 Fitts 定律对交互设计有什么启发?
应用:
- 缩短当前位置到目标区域的距离(如右键菜单)
- 增大目标大小以缩短定位时间
Hick’s Law
一个人拥有的选择越多,他们做决定的时间就越长。
为用户提供更少、更集中的选项,帮助他们快速做出决定,而不要让他们陷入思维堵塞。
PPT 12
以用户为中心的设计思想
设计原则
- 及早以用户为中心
- 综合设计
- 及早并持续性地进行测试
- 迭代设计
UCD项目包含的方法
- 用户参与
- 焦点小组
- 问卷调查
- 民族志观察
- 走查
- 专家评估
- 可用性测试
用户参与
重要性:
- 期望管理
- 保证产品不会出乎用户意料,避免失望
- 对用户进行培训也有助于改进期望管理
- 拥有权
- 人们总渴望自己的意见得到重视
- 更容易接受有“拥有权”的最终产品
参与形式:
- 作为设计组成员
- 优点:用户能透彻理解系统及其原理
- 缺点:用户会逐渐变得不具有普通用户的代表性
- 以邮件、专题讨论或类似会议的形式参与
- 存在大量的用户时的折中方案
- 各个用户组派代表以全职的形式加入设计组
- 其他人员通过专题讨论等形式参与
**参与式设计:**让用户参与开发的一种方法
用户成为设计组成员,与设计人员合作设计产品
**PICTIVE:**协作式产品的界面造型技术
- 使用低保真的办公室用品模型来研究系统的特定屏幕和窗口布局
目的:
- 使得用户能够参与设计过程
- 改进设计过程的知识获取方法
阶段:
- 当事人自我介绍
- 简短讲解说明不同应用域
- 围绕设计的集策讨论
- 设计走查和决策讨论
**CARD:**需求和设计的协作分析
- 使用画有计算机和屏幕图像的卡片发掘各种工作流,是“情节串联图”的一种形式
PICTIVE关注系统细节,CARD注重宏观任务流,可互为补充
理解用户工作
如何了解:
- 他们是谁
- 可能不像你
- 找他们谈话
- 观察他们
- 应用想象力
上下文询问法
基于“学徒模型”,强调到用户工作的地方,在用户工作时观察,并和用户讨论他的工作(用户是师傅,研究人员是学徒)
原则:
- 上下文环境
- 伙伴关系
- 解释
- 焦点
与观察法的区别:
上下文询问法是边做边聊,观察法是只看不说
与民族志观察的区别:
- 过程更简短
- 重点更为明确集中
- 设计人员只询问不参与
- 目的明确—设计新系统
以活动为中心(ACD)
以用户为中心的缺陷:
- 影响产品的创新性
- 可操作性受到时间、预算和任务规模的限制
- 忽视了人的主观能动性和对技术的适应能力
设计思想:
- 把用户要做的事情(活动)作为重点关注对象
- 更适合于复杂的设计项目
ACD是对UCD的一种反思,把人与技术综合起来进行考虑,关注事情本身的活动目标,同样需要对用户进行研究或调研
设计题:试验评估
一、试验评估题(2013 原题)
在每一种情况中确定:
- 典型用户
- 应用的技术
- 代表性的测试任务
- 评价标准
- 实验过程(简要描述)
具体情况包括:
你有一个戏院订票系统的原型,潜在的戏迷应用它能减少在售票处前排队。
你已经设计和实现了一个新的游戏系统,在发布以前你想对齐进行评估。
已经要求你开发一个存储和管理学生考试结果的系统。在实现和给出原型之前,你希望对两个不同的设计进行测试。
情况 1
- 评估方法:用户测试
- 典型用户:戏迷
- 应用的技术:DECIDE 模式
- 代表性测试任务:比较新订票系统和原有订票方式的效率
- 评价标准:新系统订票所有时间比原有订票方式快 15%为好,10%-15%为普通,小于 10%为差
- 实验过程:让两组用户分别用新旧两种方式进行订票,记录时间,统计分析
情况 2
- 评估方法: 用户测试、用户观察
- 典型用户:游戏爱好者
- 应用的技术:边说边做、DECIDE 模式
- 代表性测试任务:新游戏系统的可用性和用户体验情况
- 评价标准:
- 对于界面,用户满意度>85%为优, 70-85 普通,70 以下为差
- 对于游戏情节设置:响应时间为优??
- 实验过程:安排用户学习体验游戏系统,可在过程中有道用户说出自己想法,并进行记录。之后发放问卷调查用户体验,统计数据,分析
情况 3
- 评估方法:专家访问
- 典型用户:教务人员老师
- 应用的技术:问卷调查、访谈
- 代表性测试任务:了解用户对于两个设计方案的看法,并进行比较
- 评价标准:在不同的方面分别进行比较,用户满意度高的优
- 实验过程:安排用户在一个安静的环境中,将两个设计方案向用户描述,听去用户建议,再发放问卷,对不同方面进行调查,统计数据、分析
二、可用性评估实验(本题共 14 分)
目前市场上大多数移动电话都不是为老年人设计的。现在假设你需要为 70 岁以上的老年人设计一款移动电话,你会如何着手设计活动?需求分析阶段你将使用哪些技术?为什么?(4 分)
- 我会考虑到用户的年龄差异,提供对残缺部分的支持,更加注重容错和冗余。
- 技术:
- 现场观察用户来获取同环境相关的问题。
- 构建场景和人物角色,解决产品开发过程中出现的三个设计问题
- 头脑风暴等
需求分析之后,你制作了一些纸质原型,计划对他们的可用性进行评估,你将使用哪些评估方法?为什么?(4 分)
- 快速评估、启发式评估
- 在项目早期可以使用启发式评估,同时还可以结合快速评估来获取到用户的相关反馈信息。
假设你的设计方案被企业采纳,他们做出了一个完整的原型,并希望在开始批量生产前对其可用性进行评估。你将如何开展可用性评估?请简述评估过程。(6分)
- 用户测试
- 选择被测试用户(三种)、开展预实验、使用 DECIDE 评估框架?
三、为下列每一中情况选择一个适当的评估方法
在每一种情况中确定:
- 典型用户
- 应用的技术
- 代表性的测试任务
- 评价标准
- 实验过程(简要描述)
具体情况包括:
- 在电子制表软件包的设计初期阶段,你要测试哪种类型的图标最容易学习。
- 你有一个戏院订票系统的原型,潜在的戏迷应用它能减少在售票处前排队。
- 你已经设计和实现了一个新的游戏系统,在发布以前你想对齐进行评估。
- 已经要求你开发一个存储和管理学生考试结果的系统。在实现和给出原型之前,你希望对两个不同的设计进行测试。
(24 分,其中实验过程描述每题 2 分,其余问题每题 1 分)
解答
- 情况一
- 评估方法: 用户观察、专家访问
- 典型用户:一些商务人士,需要经常使用到电子制表软件
- 应用的技术:访谈(对专家),用户观察、问卷调查
- 代表性测试任务
- 询问专家主流电子制表软件说使用的图标
- 将不同类型的图标发给不同的用户,相同时间后考察用户学习情况
- 评价标准:
- 就专家访问,统计不同专家的观点,推荐多的为优
- 就用户观察,比较用户学习情况,能记住 85%为好,70%为普通,地域 70%为差
- 实验过程
- 准备已有的若干套图标,询问专家,听取建议,并做记录
- 选择 N 组用户,分别用 N 套不同的图片让他们学习,学习时间为 10 分钟,然后进行测试,考察学习情况
- 情况二
- 评估方法:用户测试
- 典型用户:戏迷
- 应用的技术:DECIDE 模式
- 代表性测试任务:比较新订票系统和原有订票方式的效率
- 评价标准:新系统订票所有时间比原有订票方式快 15%为好,10%-15%为普通,小于 10%为差
- 实验过程:让两组用户分别用新旧两种方式进行订票,记录时间,统计分析
- 情况三
- 评估方法: 用户测试、用户观察
- 典型用户:游戏爱好者
- 应用的技术:边说边做、DECIDE 模式
- 代表性测试任务:新游戏系统的可用性和用户体验情况
- 评价标准:
- 对于界面,用户满意度>85%为优, 70-85 普通,70 以下为差
- 对于游戏情节设置:响应时间为优??
- 实验过程:安排用户学习体验游戏系统,可在过程中有道用户说出自己想法,并进行记录。之后发放问卷调查用户体验,统计数据,分析
- 情况四:
- 评估方法:专家访问
- 典型用户:教务人员老师
- 应用的技术:问卷调查、访谈
- 代表性测试任务:了解用户对于两个设计方案的看法,并进行比较
- 评价标准:在不同的方面分别进行比较,用户满意度高的优
- 实验过程:安排用户在一个安静的环境中,将两个设计方案向用户描述,听去用户建议,再发放问卷,对不同方面进行调查,统计数据、分析
当然可以!下面是一个基于人机交互(HCI)实证研究方法的完整实例实验设计。该实验采用控制变量法 + 用户实验(User Study),属于典型的定量实证研究,适用于评估交互技术对用户行为或体验的影响。
🧪 实证研究实验实例:
“手势交互 vs. 传统触控对移动设备上地图缩放任务绩效的影响”
1. 研究背景与动机
随着增强现实(AR)和多点触控技术的发展,手势交互(如双指捏合/展开)被广泛用于移动地图应用中。然而,与传统的按钮控件(如“+ / –”按钮)相比,不同交互方式对用户在地图缩放任务中的效率、准确性和主观体验是否存在显著差异,尚需实证验证。
2. 研究问题与假设
研究问题(RQ):
- RQ1:手势交互与按钮交互在地图缩放任务中的完成时间是否存在显著差异?
- RQ2:两种交互方式在缩放精度(如最终缩放级别与目标级别的一致性)上是否有差异?
- RQ3:用户对两种交互方式的主观偏好和感知易用性如何?
研究假设(Hypotheses):
- H1:手势交互比按钮交互完成缩放任务更快(H₁: μ_手势 < μ_按钮)。
- H2:按钮交互比手势交互缩放更精确(H₂: σ_按钮 < σ_手势)。
- H3:用户更偏好手势交互(主观评分更高)。
3. 实验设计(实证研究方法核心)
3.1 实验类型
- 实验室控制实验(Controlled Lab Experiment)
- 被试内设计(Within-subjects Design):每位参与者依次使用两种交互方式完成相同任务,以减少个体差异干扰。
3.2 自变量(Independent Variable)
- 交互方式(2 水平):
- A:手势交互(双指捏合/展开)
- B:按钮交互(屏幕右下角 + / – 按钮)
3.3 因变量(Dependent Variables)
- 客观指标:
- 任务完成时间(秒)
- 缩放误差(|目标缩放级别 – 实际缩放级别|,地图级别为 1–20)
- 主观指标:
- 系统可用性量表(SUS)得分(每种方式单独评分)
- NASA-TLX 工作负荷评分
- 偏好选择(二选一:“你更愿意日常使用哪种方式?”)
3.4 控制变量
- 设备:统一使用 iPhone 14(屏幕尺寸、触控灵敏度一致)
- 地图应用:自研轻量级地图原型(排除商业 App 功能干扰)
- 任务目标:每次缩放至指定级别(如“请将地图缩放到级别 12”)
- 环境:安静实验室,坐姿,固定光照
- 指导语标准化(实验脚本统一)
4. 参与者(Participants)
- 人数:N = 24(满足统计功效要求,α = 0.05, power = 0.8)
- 招募标准:
- 年龄 18–40 岁
- 日常使用智能手机
- 无手部运动障碍
- 随机分配交互顺序(AB 或 BA),以平衡顺序效应
5. 实验流程
- 知情同意:签署同意书,说明实验目的与权利。
- 练习阶段:每种交互方式练习 2 次(非正式任务)。
- 正式任务:
- 共 12 次缩放任务(6 次/方式 × 2 种交互)
- 每次任务目标级别随机(5–17 之间)
- 系统自动记录时间与最终缩放级别
- 主观问卷:
- 完成每种交互后填写 SUS 和 NASA-TLX
- 偏好访谈:最后询问“你更喜欢哪种方式?为什么?”(开放性问题)
- 致谢与报酬:赠送 30 元礼品卡。
6. 数据分析方法
- 定量分析:
- 使用 配对样本 t 检验(Paired t-test) 比较两种方式在时间、误差上的差异。
- 效应量(Cohen’s d) 评估实际差异大小。
- 描述性统计:均值、标准差、SUS 平均分(>68 为“可接受”)。
- 定性分析:
- 对偏好理由进行编码与主题归纳(如“更自然”“怕误触”等)。
7. 预期结果与意义
- 可能发现:
- 手势交互更快但误差略高(符合直觉:效率 vs. 精度权衡)
- 年轻用户更偏好手势,但部分用户抱怨“手指遮挡地图”
- HCI 贡献:
- 为移动地图交互设计提供实证依据
- 支持“情境适配”设计理念(如:快速浏览用手势,精细操作用按钮)
8. 伦理与局限性
- 伦理:匿名处理数据,可随时退出。
- 局限性:
- 实验室环境 vs. 真实使用场景(如行走中)
- 未考虑不同用户群体(如老年人)
- 单一任务类型(仅缩放),未涵盖平移、搜索等
🌟 实验目标
评估 HealthPal App 的新引入的“智能饮食建议”功能在真实用户中的可用性、易用性与用户满意度。
📌 DECIDE 框架详解与应用
1. D – Determine the goals of the evaluation(确定评估目标)
评估目标包括:
- 功能目标:评估“智能饮食建议”功能是否能帮助用户快速理解并采纳个性化建议。
- 用户目标:评估目标用户(18–45 岁关注健康的普通用户)是否觉得该功能有用、易用、值得信任。
- 系统目标:识别界面设计、交互流程或信息呈现中的可用性问题。
2. E – Explore the questions(探索评估问题)
基于目标,提出以下核心研究问题(Research Questions, RQs):
- RQ1:用户能否在 2 分钟内理解 App 生成的饮食建议?
- RQ2:用户是否信任该建议的内容?信任程度如何?
- RQ3:用户在使用该功能过程中是否遇到操作障碍(如点击错误、找不到入口等)?
- RQ4:用户对该功能的整体满意度如何(使用 SUS 或 Likert 量表)?
3. C – Choose the evaluation paradigm and techniques(选择评估范式与技术)
- 评估范式:形成性评估(Formative Evaluation),用于迭代改进设计。
- 评估技术:
- 实验室可用性测试(Lab-based Usability Testing)
- 任务分析(Task Analysis)
- 问卷调查(SUS + 自定义 Likert 量表)
- 出声思维法(Think-Aloud Protocol)
- 事后访谈(Semi-structured Interview)
4. I – Identify the practical issues(识别实际问题)
参与者招募:
- 目标人群:18–45 岁、有健康/饮食管理经验的智能手机用户。
- 样本量:n = 12(根据 Nielsen 的可用性测试准则,可发现约 85% 的主要问题)。
- 招募方式:校园/社区招募 + 筛查问卷。
设备与环境:
- 提供统一型号的智能手机(如 iPhone 14)。
- 录屏软件(如 OBS)+ 屏幕操作追踪。
- 安静实验室环境,避免干扰。
伦理考虑:
- 签署知情同意书。
- 允许随时退出。
- 数据匿名化处理。
5. D – Decide how to deal with the ethical issues(处理伦理问题)
- 所有数据仅用于研究目的。
- 不收集敏感健康数据(模拟用户数据)。
- 实验前明确告知实验流程与目的。
- 向参与者提供小额报酬(如 50 元礼品卡)以示感谢。
6. E – Evaluate, interpret and present data(评估、解释与呈现数据)
数据收集:
定量数据:
- 任务完成率(如:12 人中有 10 人成功查看并理解建议)
- 任务时间(平均用时 1.8 分钟)
- SUS 得分(平均 72/100,属于“可接受”范围)
- 信任度评分(5 点 Likert 量表,均值 3.6)
定性数据:
- Think-aloud 中常见问题:“我不确定这个建议是不是适合我”,“入口藏得太深了”
- 访谈反馈:希望增加“为什么这样建议”的解释(如链接营养学原理)
数据分析:
- 定量:使用 SPSS 或 Excel 进行描述性统计。
- 定性:采用**主题分析法(Thematic Analysis)**归纳可用性问题。
呈现方式:
- 报告中使用可用性问题清单(如 Nielsen 的 10 大可用性原则分类)
- 附上典型用户语录与改进建议
- 可视化:任务成功率柱状图、SUS 分布图、用户旅程痛点图
