返回技术与思考
模拟、体验与验证待验证的方法8 分钟阅读

虚拟用户应该能够被现实推翻

从模拟回答走向可检验的行为预期:怎样定义验证范围、隔离校准数据、比较简单基线,并把模型失效转成下一次研究的问题。

一个虚拟住户说:“这个厨房动线不合理。”如果让它继续解释,它还能讲出早晨赶时间、两个人同时做饭、拿取餐具不方便的故事。

这些话可以启发讨论,但设计团队下一步究竟该改哪里?如果改完了,凭什么认为体验更好?

我早先在消费者研究的构想中考虑过用合成回答检查问卷措辞和任务情境。沿着这个问题继续想,我更感兴趣的是:虚拟用户能否提出有明确失败条件的预期,并接受真实行为的检查? 下文是方法提案,尚不是已经完成实测验证的系统成果。

先说明我们究竟在模拟什么

“虚拟用户”可以指很多不同东西。一个能回答访谈问题的角色,一个复现既有行为的数据模型,一个在空间里执行任务的行动者,以及一个帮助比较方案的预测工具,对应不同用途。

能让回答更丰富的个性设定,未必能改善动作时序。能复现旧空间中的轨迹,未必能预测新布局下的适应。把几种能力都称为“像真人”,容易隐藏它们需要分别验证的事实。

我会先写清一个窄问题。比如,在给定人数、任务、家具尺寸和行动约束下,方案 A 与 B 哪一个更容易出现通道相互阻挡。这个问题可以再分成几何碰撞检查、行为安排和人的实际应对。

若几何检查已经足够回答,就没有必要先建立一个会聊天的虚拟住户。只有新增的行为机制改变了有用的预测,复杂模拟才值得投入。

从意见变成可观察的预期

对厨房的假设场景,我会把“动线不好”展开成具体事件:谁在准备什么,两项任务在哪里争用空间,一方需要等待还是绕行,任务顺序会怎样改变。

随后说明比较条件。如果只改变储物位置,其他条件保持怎样;如果允许住户学习新布局,需要运行哪些任务才能观察这种变化;如果模型没有学习机制,就不能把重复运行称为适应。

预期可以是发生位置、事件顺序或两个方案的排序,不必一开始就承诺精确的体验总分。测量精度也应该与决策一致:判断有无严重阻挡,与预测平均省下几秒,需要的证据并不相同。

我还会在看实测结果前记录什么算失败。否则,模型说冲突在入口,真人在储物区停下来,我们可能事后把两者都解释成“空间不便”,让模拟永远显得正确。

验证包含几个不同问题

程序是否按设定运行,是实现检查。设定中的行为规则是否足以表达当前任务,是模型假设检查。输出与真实过程是否在所需精度内一致,是面向用途的验证。Sargent 对模拟模型验证的讨论区分了概念模型、实现、数据和运行有效性,并强调用途及可接受精度。Verification and Validation of Simulation Models,2003

对我而言,这个区分很实用。轨迹没有穿墙,只能说明一项约束工作了;生成的生活故事连贯,只能说明叙事没有明显断裂;都不能单独证明方案比较可靠。

模型也不需要在所有细节上像人。若用途是发现可能的空间争用,先检查它能否找到值得实测的问题,比要求它拥有完整人格更合理。但发布结果时,使用范围也必须保持这么窄。

校准材料与检验材料要分开

看到真人在哪里停顿,再修改规则让模型也在那里停顿,是一次校准。它帮助模型贴近这批材料,但不能用同一批材料宣称预测已经成功。

我会在资料允许时留出不同参与者、任务组合或布局,检验模型在没有按结果修改过的情境下表现怎样。留出哪一种,取决于希望推广到哪里。只留出同一视频的相邻片段,很难支撑跨家庭的判断。

比较对象也不能只有模型自己的旧版本。简单规则、已有研究流程和研究人员先验判断,都是值得考虑的基线。更复杂的模型若只比随机结果好,尚未证明它值得进入实际工作。

评价至少要同时看漏掉的问题、错误预警、方案排序,以及人工检查成本。一个把所有位置都标成风险的模型,也许很少漏报,却无法帮助团队安排下一步。

偏差需要成为可以定位的问题

模拟和实测不同,并不立即说明要换更大的模型。我会先检查差异在哪一层:空间数据是否准确,任务脚本是否缺步骤,参与者是否采用了模型没有允许的策略,还是输出被叙事加工成了另一个意思。

这会决定修正动作。尺寸错误要改输入;规则过窄要扩展行为可能;人的协商改变了任务顺序,则可能需要重新定义模拟单位。把所有偏差都交给提示词调优,容易失去问题位置。

有时正确的处理是缩小用途。例如,可以帮助提出访谈追问,暂时不能支持不同人群的偏好比例。明确这种退回,能让一个有限能力的工具仍然有用。

什么情况下我愿意让它影响设计决定

我希望看到一条完整记录:模型针对什么问题提出了什么预期,用什么独立材料检查,哪些部分对得上,哪些没有,以及决策者将承担怎样的误判后果。

对早期探索,可以容忍更多误报,只要团队知道需要实测。对投入较大的布局决策,就需要更强的对照和误差分析。不能因为界面相同,就沿用同一种信任程度。

我目前愿意推进的起点,是先用模拟暴露问题、比较假设和准备研究,再逐步检验它有没有资格承担更多工作。尚不能据此声称已经替代了真实用户。

接下来的问题是:如果我们要模拟一天、一周或更长时间,体验的研究对象会怎样变化?延长模拟时间,并不会自动获得长期经验。