如果 AI 写“任务 B 的负荷更高”,我需要查回它用了哪份文件、哪个时间段、什么指标,以及做过哪些处理。查不回去,这句话就很难进入研究讨论。
PsyPhiClaw 的设计里,我把需要检查的地方分成六类:输入是否完整、结论是否保留来源、统计解释是否过度、是否交代多重比较、有没有把相关写成因果,以及关键判断是否经过人工确认。
检查要影响下一步
缺输入时需要说明缺口;来源不清楚时需要回查;需要人工判断的结果应保留待审状态。这些要求要落实为流程行为,单在报告末尾写“仅供参考”没有完成检查。
还需要证明什么
公开实现包含 18 个行为分析模块,真实研究数据验证仍未完成。设计了检查规则,不等于已经证实它们能拦住错误。
我需要用正常输入和错误输入分别检查:系统在哪里停止,漏掉什么,人工是否能看懂原因,以及修正需要多少工作。尤其“证据不够时能否停下来”,目前还没有足够验证结果。