返回技术与思考
行为、测量与解释观点与分析7 分钟阅读

姿态、表情与语音:怎样区分观察和推断

多一种信号,不等于多一份独立证据。用一个假设场景拆开动作、解释和内部状态,讨论冲突、缺失与真正有用的多模态融合。

设想一次设备试用:参与者完成操作,笑了一下,说“可以”,随后把设备推远。模型分别输出正向表情、肯定语言和结束动作,报告很容易把它们合成一句“用户满意”。

但这也可能是礼貌回应、对操作完成的确认,或者表示不想继续。这个例子没有标准答案,恰好说明我关心的问题:多模态分析怎样让我们更接近实际过程,而不是更有把握地讲一个尚未核实的故事?

先给信息分配不同的工作

在行为自动识别的构想中,我倾向于先用姿态描述行动,再让表情和语音补充解释。但这不意味着姿态没有推断成分,也不意味着表情天然就是情绪读数。

更稳妥的分层是:首先记录可观察的表现,例如手离开设备、嘴角运动、某句话的文字和时间;其次结合任务判断行为功能,例如完成确认、请求帮助或结束互动;最后才讨论满意、紧张等内部状态。

这些层次之间需要理由。识别“微笑”与判断“满意”是两个不同的任务。Barrett 等人的综述集中讨论了从面部运动推断情绪的可靠性、特异性和情境问题,不能据此把某种面部动作直接当作某一种情绪的充分证据。Emotional Expressions Reconsidered,2019

同样,语言里出现“可以”,能直接支持的是参与者说过这句话;他在肯定什么,要放回前后对话。把识别模型的输出名称直接当成研究变量,容易跳过这一步。

三种信号,未必是三次独立确认

假设表情、语音和姿态都来自同一段礼貌告别,它们可能受到同一个互动情境影响。三个结果一致,首先说明这段告别在不同表现上相容,不必然说明它们分别验证了对产品的满意。

另一个情况是,多个结论实际上来自同一个多模态模型的一次回答。界面把回答分成三张卡片,并没有增加三个独立的测量过程。

因此,我会检查每条证据的来源、处理过程和可能共享的误差。若一个模态先为另一个模态提供标签,再用两者一致来证明可靠,推理就绕回了自己。

这并不否定融合。它只是要求说明融合到底增加了什么:补足遮挡、定位事件边界、区分两个解释,还是仅仅把同一信息重新表达了一遍。

模态冲突,有时比一致更值得看

参与者说“我懂了”,随后连续操作失败。语言和行为没有一致指向同一个判断。这时直接平均一个理解分数,会丢掉真正有用的问题。

他可能理解了目标,却不知道操作路径;可能记住了演示,却无法迁移;也可能系统没有按预期响应。下一步需要区分这些解释,而不是决定语言和行为谁永远更可信。

我会让分析保留三部分:已观察到什么,各种解释分别能说明什么,还有哪项证据能改变判断。例如,给出一次明确反馈后能否恢复,可以帮助检查反馈问题;要求参与者说明下一步意图,则可能帮助检查概念理解。

这些是待检验的调查方向,不能从一次冲突直接推断动机。冲突首先是一处需要补证据的位置。

缺失也需要自己的位置

没有拍到微笑,不等于观察到了没有微笑。语音识别为空,可能是参与者没说话,也可能是录音失败。两种情况如果在数据表里都写成零,后续模型很难知道差别。

时间同步也一样。一个人先听到错误提示,随后皱眉;若设备时钟错开,系统可能把皱眉对齐到此前的设计元素上。图表看起来严密,关联对象却已经变了。

所以我希望在解释之前先完成输入检查:模态是否存在,质量是否足够,时间能否对齐,当前片段有没有外部提示。某种证据不可用时,应缩小结论,而不是让其他模态自动补出一个肯定答案。

什么时候才值得加一种测量

我的选择标准是它能否改变下一步决定。若视频已经能看清参与者反复尝试同一个入口,加一种信号不一定比调整入口再测试更有价值。

如果两种竞争解释会导致不同设计,而新信号有机会区分它们,增加测量才开始有明确用途。即便如此,还要接下采集、同步、清洗、标注与复核的工作。

乳品包装研究中,EEG、眼动和观察分别帮助看不同环节,公开可说明的建议包括增加果杯使用指引。我不能因为采用了多种设备,就把建议写成已经证明有效。建议之后仍然有验证工作。

多模态的价值需要落到具体判断上,而不是落到设备清单的长度上。

让系统输出一个可以争论的解释

如果要把这套思路实现成工具,我希望结果页先呈现事件与可回查片段,再呈现支持和限制某种解释的材料。需要补查的位置应当足够具体,让研究者知道该去看哪段、问什么、重新比较什么。

一个百分比可以作为模型内部评分,但若要解释为“判断正确的概率”,还需要针对对应任务做校准检查。没有这样的依据,更多小数位不会带来更多确定性。

我愿意尝试的改进,是比较两种输出:只有综合结论,或同时展示依据、冲突与缺失。让研究者在同一批材料上判断,再检查错误发现、复核耗时和过度解释是否变化。这个比较尚待实施。

我期待多模态系统帮助人更准确地知道自己看见了什么,也更清楚哪些东西还没有看见。它与行为标签的意义问题是同一条研究线上的不同环节。