NurseLLM:海外首个专为护理领域定制的大型语言模型

摘要
大型语言模型(LLMs)的最新进展显著改变了医疗系统。然而,它们在护理等专业领域的潜力尚未得到充分探索。在这项工作中,我们推出了NurseLLM,这是首个专为护理领域设计的大型语言模型,用于处理多项选择题(MCQ)任务。我们开发了一个多阶段数据生成流程,构建了首个大规模护理MCQ数据集,用于在广泛的护理主题上训练LLMs。我们还引入了多个护理基准测试,以便进行严格评估。我们的广泛实验表明,NurseLLM在不同基准测试中的表现优于同等规模的最先进通用和专业医疗LLMs,这强调了专用LLMs在护理领域的重要性。最后,我们探讨了推理和多智能体协作系统在护理中的作用,突显了它们对未来研究和应用的潜力。

原文链接 https://t.zsxq.com/l9pOQ

核心速览

研究背景

  1. 研究问题:这篇文章要解决的问题是如何在护理领域利用大型语言模型(LLMs)进行有效的问答任务。尽管LLMs在通用医学AI系统中取得了显著进展,但在护理领域的潜力尚未得到充分探索。
  2. 研究难点:该问题的研究难点包括:护理和医学领域的知识体系不同,护理强调全面的、以患者为中心的护理,而医学则侧重于诊断和治疗;现有的护理问答数据集规模较小,且缺乏针对护理专业知识的评估标准,如美国的NCLEX考试。
  3. 相关工作:目前,尚未有专门针对护理领域的LLMs。大多数护理应用依赖于通用或医学领域的LLMs,但这些模型在临床评估中表现出不确定性,可能会导致不必要的诊断测试,误解护理概念,从而增加过度分诊的风险。

研究方法

这篇论文提出了NurseLLM,第一个专门为护理问答任务设计的LLMs。具体来说,
  1. 主题收集:首先,创建了一个全面的NCLEX主题分类体系,涵盖7个专科、60个领域、232个主题和1830个概念。
  2. 合成NCLEX问答生成:使用GPT-4o从这些概念中生成相应的NCLEX问答对,并为正确答案提供理由。这些理由随后用于训练NurseLLM,采用链式思维(CoT)推理方法。
  3. 基准测试创建:开发了多个基于NCLEX的基准测试,包括人类标注的黄金NCLEX基准(1726个问题)、GPT-4o生成的测试基准(1830个问题)、MultiMedQA(多个医学问答数据集的集合)及其护理子集MultiNurseQA。
  4. 去污染:为了确保训练样本的多样性和泛化能力,采用两步过滤法去除与测试集重叠的样本,并使用ROUGE-L评分进行样本比较。

实验设计

  1. 模型训练:使用Llama3-Med42-8B作为基础模型,最大长度设置为2048,批量大小为1,梯度累积步长为8,训练2个epoch,学习率为2e-5。模型在AWS SageMaker上使用NVIDIA 10G GPU训练4天。
  2. 模型合并:为了防止微调过程中出现的灾难性遗忘,使用MergeKit将微调后的LLM与基础模型Med42合并,合并比例为60%。
  3. 评估基准:使用四个基准进行评估:NCLEX-Test(1726个MCQ问题)、GPT4o-Test(1830个NCLEX MCQ问题)、MultiMedQA和MultiNurseQA。
  4. 基线模型:包括通用和医学领域的LLMs,如Med42、Gemma、Apollo、LLaMA、OpenBioLLM、Mistral、BioMistral、MedAlpaca和DeepSeek-LLaMA。

结果与分析

  1. NCLEX-Test上的表现:NurseLLM在NCLEX-Test基准上的准确率超过76%,优于所有开源LLMs,甚至优于一些医学领域的LLMs。
  2. GPT4o-Test上的表现:尽管GPT-4o生成的基准存在随机性,但NurseLLM在8B参数下达到了91%以上的准确率,接近GPT-4o-mini的94.97%。
  3. MultiMedQA上的表现:在通用医学基准上,医学领域的LLMs如Med42表现优于NurseLLM,但NurseLLM仍能保持与其他基线相当的表现。
  4. MultiNurseQA上的表现:在护理子集上,Med42继续优于NurseLLM,但NurseLLM紧随其后,仅落后0.19%。与其他基准相比,NurseLLM的性能下降最小。

总体结论

这篇论文介绍了NurseLLM,第一个专门为护理问答任务设计的LLMs。通过构建大规模、多样化的护理问答数据集,并开发了三个基于NCLEX的基准测试,证明了NurseLLM在护理领域的有效性。实验结果表明,NurseLLM在多个基准测试中均优于通用和医学领域的LLMs,突显了领域专业化在护理领域的重要性。此外,论文还探讨了推理和多代理协作系统在护理领域的潜力,展示了未来在该领域的研究和应用前景。
论文评价

优点与创新

  1. 首个专门针对护理领域的语言模型:NurseLLM是首个专门为护理问答任务设计的语言模型,不仅提供答案,还提供理由以确保模型的透明性和可信度。
  2. 多阶段数据生成管道:开发了第一个大规模且主题多样的护理问答数据集,涵盖广泛的护理主题。
  3. 多种护理基准测试:开发了三个不同的护理MCQ基准,用于系统地评估LLMs在护理问答任务上的表现。
  4. 显著优于通用和医疗专业LLMs:广泛的评估显示,NurseLLM在护理基准上的表现优于同等参数规模的最先进的通用和医疗专业LLMs。
  5. 推理和多代理协作系统的潜力:探讨了推理和多代理协作系统在护理领域中的潜力,展示了未来研究和应用的前景。

不足与反思

  1. 数据生成时间线:由于使用了2024年5月的GPT-4o版本,模型的响应可能会随时间变化,因此提示策略和数据生成管道应相应处理。
  2. 数据质量:尽管自动化数据生成管道使整体数据生成过程可扩展,但存在低质量数据进入语料库的风险,建议进行人工检查以维持语料库的标准质量。
  3. 模型响应:尽管NurseLLM在NCLEX问题上表现出色,但仍需提高准确性,表明LLM在回答护理问题时可能会产生不准确的响应。考虑到该领域的敏感性,建议在部署前谨慎使用NurseLLM。
  4. 模型评估:仅使用开源模型进行评估,未评估闭源LLMs,因为闭源模型的规模不具可比性且出于专有原因未将其纳入NCLEX基准测试。然而,计划在接受后发布合成测试基准和训练数据集。
关键问题及回答
问题1:NurseLLM在构建大规模护理问答数据集时,具体采用了哪些步骤来确保数据的多样性和质量?
  1. 主题收集:首先,创建了一个全面的NCLEX主题分类体系,涵盖7个专科、60个领域、232个主题和1830个概念。
  2. 合成NCLEX问答生成:使用GPT-4o从这些概念中生成相应的NCLEX问答对,并为正确答案提供理由。这些理由随后用于训练NurseLLM,采用链式思维(CoT)推理方法。
  3. 基准测试创建:开发了多个基于NCLEX的基准测试,包括人类标注的黄金NCLEX基准(1726个问题)、GPT-4o生成的测试基准(1830个问题)、MultiMedQA(多个医学问答数据集的集合)及其护理子集MultiNurseQA。
  4. 去污染:为了确保训练样本的多样性和泛化能力,采用两步过滤法去除与测试集重叠的样本,并使用ROUGE-L评分进行样本比较。
问题2:在实验设计中,NurseLLM是如何防止微调过程中出现的灾难性遗忘的?
为了防止微调过程中出现的灾难性遗忘,NurseLLM采用了MergeKit工具,将微调后的LLM与基础模型Med42合并。具体步骤如下:
  1. 模型微调:使用Llama3-Med42-8B作为基础模型,在护理数据上进行微调。
  2. 模型合并:使用MergeKit将微调后的LLM与基础模型Med42合并,合并比例为60%。这样可以在保留基础模型的通用医学能力的同时,适应新的护理知识。
问题3:NurseLLM在多个基准测试中的表现如何,与其他模型相比有哪些优势?
  1. NCLEX-Test:NurseLLM在NCLEX-Test基准上的准确率超过76%,优于所有开源LLMs,甚至优于一些医学领域的LLMs。
  2. GPT4o-Test:尽管GPT-4o生成的基准存在随机性,但NurseLLM在8B参数下达到了91%以上的准确率,接近GPT-4o-mini的94.97%。
  3. MultiMedQA:在通用医学基准上,医学领域的LLMs如Med42表现优于NurseLLM,但NurseLLM仍能保持与其他基线相当的表现。
  4. MultiNurseQA:在护理子集上,Med42继续优于NurseLLM,但NurseLLM紧随其后,仅落后0.19%。与其他基准相比,NurseLLM的性能下降最小。
总体而言,NurseLLM在护理领域的多个基准测试中均优于通用和医学领域的LLMs,突显了领域专业化在护理领域的重要性。

欢迎加入「知识图谱增强大模型产学研」知识星球,获取最新产学研相关"知识图谱+大模型"相关论文、政府企业落地案例、避坑指南、电子书、文章等,行业重点是医疗护理、医药大健康、工业能源制造领域,也会跟踪AI4S科学研究相关内容,以及Palantir、OpenAI、微软、Writer、Glean、OpenEvidence等相关公司进展。

电子书推荐


[300页电子书]Palantir 股票的大数据,大利润:为什么Palantir是未来企业级AI的潜力股

[555页电子书]从LLM Agent到RAG与知识图谱全攻略实战指南重磅发布——构建具备推理、检索与行动能力的智能体

250页电子书-医学领域的人工智能革命:GPT-4及医学大模型未来展望。OpenAI CEO作序

[100页电子书]知识图谱&大模型双轮驱动的工业 AI 数智化转型权威指南 - Cognite

[73页]OpenAI联合哈佛等重磅发布全球首份ChatGPT使用报告,分析用户增长、使用模式及其经济价值

[140页]Neo4j GraphRAG白皮书

[72页]谷歌推出个性化实时监测主动健康管理大模型PH-LLM

[180页电子书]GraphRAG全面解析及实践-Neo4j:构建准确、可解释、具有上下文意识的生成式人工智能应用

[30页电子书]GraphRAG开发者指南


往期推荐


N.U.R.S.E.S. 拥抱人工智能:护理专业人工智能素养指南重磅发布

智能守护银发族:Palantir×SOMPO共塑日本医疗与护理新时代

药械营养保健企业的Agentic AI应用(罕见病诊断、患者护理、生产检测等)全解析

生成式人工智能在护理中被忽视的阴暗面:国际智库的视角

Precina Health 如何使用GraphRAG 通过实时洞察彻底改变 2 型糖尿病护理

利用生成式人工智能增强重症监护室护理实践:一项基于模拟临床案例的诊断协同效应形成性研究

多模态生成式人工智能辅助医疗护理培训 - DFKI、南安普顿大学等

大模型在失智患者护理的研究 - Cardiff&剑桥大学

CancerKG.ORG - “知识图谱 +大模型”双轮驱动的人机协同癌症诊疗与护理智能体

利用大模型提升护理与老年照护:一个AI驱动的框架 - 复旦、上交等

[最新论文]探索大模型在乳腺癌肿瘤学护理领域中的应用潜力 - 谷歌DeepMind等

厦门·护理信息大会|首都医科大学与柯基数据合作的NursGPT项目顺利启动!

从“小白”到“专家”:大模型在肿瘤护理中的潜力探索

使用大模型指导患者创建高效全面的临床护理信息

Nature - 基于护理大模型的医院门诊接待机器人和护士的人机协同新范式

护理临床智能决策的新颖方法:大语言模型与本地知识库的整合

护理国自然近一半竟然是这个?

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询