现在的全模态AI已经能够同时处理图像、视频、声音和文本,并完成越来越复杂的推理任务。在现有评测体系中,评测基准主要关注模型“最终做对了什么”,模型通常只需要给出最终答案即可被记为一次成功推理。但此类评价方式很难回答一个更关键的问题:模型究竟有没有准确感知到支撑推理的关键信息? 近日,飞捷科思(Fysic...