谷歌评估AI“问诊”能力

Tue Jul 18 08:51:06 CST 2023

谷歌研究和深度思维公司的研究者报道了一个用于评估大型自然语言模型(LLM)能在多大程度上准确回答医学问题的基准,介绍了一个精于医学领域的大型自然语言模型Med-PaLM。研究表明,临床应用前,还有许多问题需要克服。相关研究近日发表于《自然》。

人工智能(AI)模型在医学领域有许多潜力,包括知识检索和支持临床决策等。但现有的模型尚不完善,例如可能会编造令人信服的医疗错误信息,或纳入偏见、加剧健康不平等。因此需要对其临床知识进行评估。然而这通常依赖有限基准的自动化评估,例如个别医疗测试得分,可能无法转化为可靠的应用。

为评估LLM编码临床知识的能力,谷歌研究公司的Shekoofeh Azizi和同事探讨了它回答医学问题的能力。他们提出了一个基准,称为MultiMedQA。它结合了6个涵盖专业医疗、研究和消费者查询的现有问题回答数据集以及HealthSearchQA,后者是一个新的数据集,包含3173个在线搜索的医学问题。

研究者随后评估了PaLM及其变体Flan-PaLM。他们发现,在一些数据集中,Flan-PaLM的表现达到了最先进水平。在整合美国医师执照考试类问题的MedQA数据集中,Flan-PaLM超过此前最先进的LLM达17%。不过,虽然Flan-PaLM的多选题成绩优良,但进一步评估显示,它在回答消费者的医疗问题方面仍存在差距。

为解决这一问题,研究者采用一种名为设计指令微调的方式使Flan-PaLM更适用于医学领域。设计指令微调是让通用LLM适用新的专业领域的一种有效方法。结果产生的模型Med-PaLM在试行评估中的表现令人欣慰。例如,Med-PaLM的回答评分为92.6%,相当于医师做出的回答(92.9%)。

这一结果表明AI“问诊”虽然很有前景,但有必要对它做进一步评估。

人民好医生权威健康科普 精彩呈现
打开