返回技术与思考
行为、测量与解释观点与分析7 分钟阅读

把行为编码成标签时,我们究竟保留了什么

动作识别正确,解释仍可能错误。从一次伸手的不同含义出发,讨论编码体系、符号落地,以及行为分析应该保留的情境。

一个人把手伸向桌面。同一段动作,可以被标成“伸手”,也可以被解释为“取物”“求助”或“阻止”。如果桌上有一杯水,旁边站着一个人,前一秒又发生了一次误操作,这些解释的可能性还会改变。

这是一个假设场景,却指出了行为研究里很实际的困难:系统把动作看对了,并不意味着我们已经把问题问对了。

我关心行为自动识别,但更想往前追一步:当我们决定用哪些词来记录一个人时,哪些东西进入了数据,哪些东西从一开始就没有机会进入?

编码表先决定了什么能成为发现

假设研究者想知道用户是否能够独立使用一台设备。编码表里只有“点击”“停顿”“完成”,那么所有求助、反复确认和等待他人操作的片段,都要被塞进这三个框里。

最后可能得到一个漂亮结果:用户完成了任务。可是,他到底是自己理解后完成,还是在旁人逐步提示下完成?如果“谁提供了关键帮助”没有被记录,后续统计再精确,也很难从三个标签里恢复出来。

编码是一种有目的的压缩。压缩本身是必要的,否则我们无法比较几十段过程。问题在于,压缩规则应该由研究问题约束,而且能够被检查。

我会先用一组边界例子检查编码表:两段看起来相似的动作,是否因为任务意义不同而需要分开?两段外形不同的动作,是否其实完成了同一种功能?如果答案只能靠编码者心领神会,规则还没有写清。

这里需要区分三种错误。识别错误是把没有发生的动作记录进来;定义错误是类别没有区分研究真正关心的差异;解释错误则是记录没有问题,却在报告中赋予了超出证据的意义。提高识别准确率只能直接处理其中一层。

符号落地问题给我的提醒

Harnad 在《The Symbol Grounding Problem》中讨论:形式符号的意义,如何不只是依赖外部解释者,而与非符号的感知表征建立联系。这是认知建模中的问题,不等于一份行为编码表的效度问题。原文,1990

把两者联系起来,对我有用的地方是一种检查:一个标签在系统里被顺畅传递时,它与现场的联系还在不在?

“犹豫”可以从编码表进入数据库,再进入模型提示词,最后进入“用户缺乏信心”的总结。这一路每一步都符合格式,但最初的依据可能只有一次停顿。词语越传越像事实,观察却没有增加。

不过,我也不认为只要保留原始视频,意义问题就解决了。视频同样有机位、遮挡和时间范围;研究者的任务定义仍然影响解释。我们能做的是让这条联系可以回查、可以争论,减少一个未经检验的词在流程中获得过多权威。

一条记录至少要允许怎样的回查

如果我要设计这样的系统,会让一条行为记录保留几种不同内容。以下是方法提案,不是已经完成验证的产品规格。

首先是可定位的观察:动作发生的起止位置、涉及对象,以及摄像机实际拍到了什么。其次是任务位置:参与者正在完成哪一步,前后有哪些指令和响应。然后才是编码判断:选择了哪个类别,依据哪一版规则,有没有竞争解释。

例如,可以记录“在确认页停留,视线在金额和按钮间移动”,再提出“可能在确认后果”的解释。与之竞争的解释是“找不到下一步入口”。要区分两者,可能需要查看随后的动作、询问当事人,或调整反馈做对照。

这里的“不确定”需要有内容。是画面遮挡导致看不见?是动作看清了但意义不明确?还是规则本身不能处理这种情况?三者对应补拍、补情境和改规则,不能全部混成一个低置信度分数。

一致,不足以说明有用

两名编码者完全同意把所有停顿都叫作“犹豫”,可能说明他们很好地遵守了同一份规则。这仍然不能独立证明停顿反映犹豫,更不能证明降低停顿次数就是好的设计目标。

所以我希望把两个检查分开。一个检查编码能否稳定执行:同一材料交给不同人或模型,得到的记录差在哪里。另一个检查编码是否支持研究判断:这些区别能不能帮助我们分辨理解、等待、求助等不同过程。

这个区分也会改变错误分析。某些分歧值得消除,例如事件边界写得含糊。另一些分歧值得保留,因为它们暴露了一个类别同时容纳两种机制。过早把分歧统一掉,有时会把最有价值的研究线索一起清掉。

情境保留得越多越好吗

也不能无限增加字段。每新增一种记录,就增加采集、编码和复核成本;不相关的背景还可能诱导解释者编出更多故事。

我会用一个更苛刻的问题决定是否保留:这个信息能否区分两个会导致不同建议的解释?如果只是让报告更生动,却不改变判断,它的优先级就应当降低。

对简单计数任务,一个定义明确的动作类别可能已经够用。研究取放次数,没有必要为每次伸手推断复杂意图。等到研究问题变成“为什么用户反复取放”,原来足够的记录才可能不够。

因此,我不会把所有行为分析都推向最大复杂度。我更希望记录的详细程度与要作出的判断相称。

自动化还可以帮助我们质疑编码表

行为识别最直接的用途,是把人工规则执行得更快。另一个值得尝试的方向,是找出总是落入“其他”、反复被人工改标、或者在不同情境下含义不一致的片段,让研究者回来检查分类本身。

这还只是研究设想。新发现的模式也可能是镜头变化、光照或模型偏差,不能自动命名为新的心理机制。它的价值首先在于指出哪里值得看,而不是代替研究者决定那里是什么。

BehaviorLens 的三遍处理设计里,我关心中间结果怎样被复核。沿着这里的思考,复核对象还应该包括规则,而不只是模型有没有遵守规则。

我想推进的行为系统,应当既能压缩现实,也能提醒我们压缩丢掉了什么。下一步才是:这些标签如何接成有研究价值的行为结构

可以带走的材料

以下材料为本站整理的空白模板或指令示例,可下载后按任务改写。它们不包含客户数据,也不是上述项目的原始交付物或效果证明。