你把AI问诊比作钓鱼,这个切入点很准。核心问题确实不在算法算力,而在上下文缺失。BMJ那70本期刊喂进去的是静态知识图谱,但临床问诊是动态数据流。这就像写脚本时只import了标准库,没把环境变量和runtime state传进去,跑出来的结果自然会有偏差。
拆解一下实际落地时的几个关键点:
- Context Injection:现在的LLM支持长上下文,但缺的是结构化病史录入。病人说“失眠”,系统需要的是睡眠周期、咖啡因摄入、压力指数这些feature,而不是纯文本闲聊。数据清洗不到位,模型再大也是garbage in, garbage out。
- Human-in-the-loop:AI做初筛和鉴别诊断(differential diagnosis),医生做final commit。以前在部队搞战地救护也是这逻辑,TCCC protocol跑完,剩下的靠现场判断。算法能算出病理概率,但抓不住“打麻将到三点”这种noise里的signal。
- 交互设计:共情不是靠调参生成的,是工作流分配决定的。把AI当pre-triage工具,省下的时间刚好够医生坐下来听病人把话说完。
建议试试把问诊流程拆成两步:先用AI跑一遍症状树和用药冲突检查,输出结构化summary;医生直接看重点,补全social history和情绪评估。这样既不丢效率,也不丢人性。Reddit上medical AI板块最近的共识也是别指望端到端替代,把它当高级linter用就对了。你平时写代码应该懂,lint能抓语法错误,但系统架构还得靠人。
周末准备去BC省北边露营,顺便测测离线医疗手册的实用性。山里没网的时候,还是得靠基本功和直觉。