医疗AI正站在一个十字路口
一边是狂奔的市场——数百亿美元的资金涌入,数千家企业竞逐,数以万计的AI模型在实验室里诞生。另一边是冰冷的现实——一个连图都没看到的AI,可以在考试中击败人类放射科医生;一个在基准测试中名列前茅的模型,在真实临床场景中可能一败涂地。
古德哈特定律告诉我们:当考试分数成为目标,考试就失去了测量真实能力的意义。
医疗AI需要的不是更多的排行榜冠军,而是更严谨的评估框架、更透明的推理过程、更扎实的临床验证。李飞飞团队给出了三个清晰的启示:
第一,必须增加无图对照的消融测试,让每一次评估都看清楚“加了图到底能多加分,不加图差距又在哪里”。
第二,测评要避免只依靠公开基准或过于静态的标准题库,以免被训练数据或文本线索提前“作弊”。
第三,医疗等高风险场景必须严格校验有图与无图输出的差异,防止模型在没有视觉输入的情况下作出危险推理。
归根结底,如果我们想让AI真正进入临床,必须从将这些系统视为“神奇且无需负责的预言者”,转变为将其视为“严谨、透明的医疗合作伙伴” 。真正的信任不是在排行榜上赢得的,而是在解释中获得的。
医疗AI的终局,不是AI替代医生,而是AI成为医生值得信赖的“第二双眼睛”。但要走到那一天,我们首先需要承认:现在的考试,可能正在考错的东西。