返回技术与思考
行为、测量与解释观点与分析8 分钟阅读

识别出行为之后:从标签到结构,还有多远

相同的动作次数,可以对应完全不同的过程。为什么切片方式、Markov chain、隐状态与长程序列,需要围绕不同研究问题选择。

两个人都查看说明两次、操作两次、求助一次,最后完成任务。一个人的顺序是“查看—操作—查看—操作—求助—完成”,另一个是“求助—查看—查看—操作—操作—完成”。

这是用于推演的例子,计数相同,过程却不一样。前者值得检查是否反复尝试后才求助,后者值得检查早期帮助是否改变了后续操作。只看频次,这个差别消失了;直接从顺序断定原因,也仍然太早。

所以我把行为标注看成中间层。让视觉语言模型写出“人在做什么”之后,还需要回答:这些动作怎样接起来,哪些结构反复出现,又有哪些解释必须回到现场检查?

五秒切片是一种观察选择

按固定时间切片,便于分配识别任务、对齐多种信号,也方便检查遗漏。但它会改变数据里什么算一次事件。

一个持续十秒的动作,可能被记成两条相同标签;一个只持续半秒的关键确认,可能淹没在五秒摘要里。两种情况都会影响后续的转移统计。前者制造了大量“原地不动”的转移,后者可能把原本并不相邻的事件错误接在一起。

因此,进入结构分析前,要先决定分析单位。是每五秒的状态,还是有起止点的行为事件?连续相同标签是否合并?同时说话和操作,保留两条轨道还是强制选择一个?记录缺失是否会被误当作“没有行为”?

我倾向于把原始切片保留为可回查的识别材料,再根据问题派生事件序列。这样“如何看视频”和“如何分析过程”可以采用不同单位,同时保留转换记录。

为什么我仍然关心纯 Markov chain

如果问题是“每次求助之后,下一类行为通常是什么”,直接统计观察到的类别转移就有价值。用一阶 Markov chain 表达,意味着在模型里用当前状态概括预测下一状态所需的过去信息;是否再假定转移概率随时间不变,需要另外说明。HMM 则增加了不可直接观察的状态,并用观测来推断它们。Jurafsky 与 Martin:Hidden Markov Models

两者对应不同问题。Markov chain 可以直接描述已经定义的行为之间怎样转换。HMM 适合考察某个假设的隐藏状态过程如何产生观测,但模型算出的状态不自动等于“困惑”“投入”这样的心理事实。

例如,假设有 10 次从“查看说明”出发的转移,其中 6 次接“操作”、3 次接“求助”、1 次接“离开”,就能形成一个直观的经验转移分布。这些数字完全是演示数据。它们说明怎样计算,不代表某个人群的实际行为。

这里还要追问分母。10 次来自 10 个人,还是主要来自一个人?反复卡住的参与者会贡献更多转移。把所有事件直接合并,回答的是这批记录中的转移分布,未必是“典型用户下一步会怎样”。

简单模型的价值,是让这些假设露出来。复杂模型并不能免除对观察单位和分母的解释。

三种结构,不必交给同一种方法

短程转移关注局部:求助后是否更容易继续操作,错误后会不会返回说明。它可以帮助定位流程中的连接点。

重复模式关注组合:一个“查看—尝试—返回”的片段是否经常出现,出现在哪里,持续多久。局部转移相似的两段序列,也可能有不同的重复组织方式。

长程结构关注阶段:进入任务、熟悉界面、执行主体操作和结束检查,是否具有不同的行为分布。某种顺序在初次探索时合理,在任务末尾反复出现却可能值得关注。

我不会预先规定哪种分析更高级。假如设计团队只需要知道哪一步最容易进入反复返回,先把事件时间线和局部转移看清,可能比引入隐藏状态更容易产生可检查的解释。等到问题真的涉及阶段转换,再讨论更合适的模型。

顺序能提示机制,不能独自证明机制

“查看说明后错误减少”可能与说明有关,也可能因为任务后半段本来更容易;“求助之后速度提高”还可能混入研究人员直接代做的影响。

因此,我会同时保留任务阶段、外部提示和系统反馈。发现一个顺序模式后,先提出竞争解释,再考虑要增加什么观察或比较。

样本切分也要服务这个目的。同一参与者的相邻片段分别进入训练集和测试集,可能让评估主要反映系统对这个人和这段环境的熟悉程度。要讨论新参与者或新任务,留出的材料就应该对应那个外推目标。

如果大量搜索片段后才挑出最漂亮的一条模式,也需要把它当作发现线索,在另外的材料中检查。被我们注意到的结构,不一定能在下一次出现。

一个值得实施的最小分析过程

我的起点会是一小批可以逐段回查的材料:先明确事件定义、开始和结束边界,保留缺失和并发;再把事件画到任务时间线上,检查是否混合了不同阶段或参与者。

随后只选一个问题,例如“返回说明之后,人是否能自行恢复”。先给出原始次数、参与者分布和典型片段,再决定要不要建立转移模型。只有当模型提出的区别超出肉眼已经看见的东西,并且能接受额外数据检查,复杂度才有理由增加。

输出也不应只有网络图。研究者需要知道一条连线对应哪些事件、数量有多少、在哪里失效,以及哪些设计变化可能让我们区分解释。

我希望行为结构分析最终改变的是下一次研究怎么做、设计哪里值得改。若结果只把一堆标签连成了更漂亮的图,识别之后最重要的那段工作仍然没有完成。

这又回到标签是否保留行为意义:结构分析能揭示记录之间的关系,前提是我们知道这些记录代表什么。