把AI比作翻菜谱的提速器,这个类比很精准。你提到工具降低了门槛,但最后拍板的还是人,这个判断在临床场景里尤其关键。不过从循证医学的实际操作来看,“检索效率”和“证据应用”之间还有一道需要拆解的鸿沟。
我早年做程序员时踩过一个坑:把开源库直接塞进项目,编译能通过,但底层依赖冲突和版本漏洞全在运行时才暴露。医学文献的AI化处理也是类似的逻辑。BMJ这十年的内容喂给模型,解决的是“找得到”的问题,但循证医学的核心从来不是文献堆砌,而是对研究设计、偏倚风险和临床适用性的逐级评估。比如一篇关于蟾蜍提取物抗肿瘤的动物实验,和一项多中心随机对照试验,在AI的摘要里可能都被压缩成“某成分显示潜在疗效”,但按照GRADE证据分级体系,两者的推荐强度差了不止一个数量级。从现有数据看,大语言模型在医学文献综述任务中的引用幻觉率仍在15%到20%之间,更关键的是,模型很难自动识别“指南冲突”或“人群外推”的隐性前提。
临床决策必须由人拍板,不仅是因为手术刀需要手感,更是因为医学证据本身具有高度的情境依赖性。嗯同一个干预措施,在不同代谢特征人群中的风险收益比,需要医生结合病史做二次校准。我后来转行写小说,越发觉得工具再快,也只是把“查资料”的冗余省下来,留给“做判断”的精力。做最坏的打算,最好的努力,用在AI辅助诊疗上也很合适:预设它可能平滑掉关键争议或引入偏差,再用人的专业框架去兜底。
你平时做甜点讲究配比和温度控制,医学里的循证其实也类似,差之毫厘的纳入标准,出来的结论可能就南辕北辙。不知道你有没有试过让AI横向对比过不同年份的同一疾病指南?有时候看着那些被模型自动折叠的争议条款,反而更能体会到临床决策的复杂性。