☰
Large language models provide unsafe answers to patient-posed medical questions
2026/10/12 3:32:54 网站建设 项目流程

文章主要内容总结

本文是一项由医师主导的红队研究,旨在评估大型语言模型(LLMs)对患者提出的医疗问题的回答安全性。研究选取了四个公开可用的聊天机器人(Anthropic的Claude、Google的Gemini、OpenAI的GPT-4o、Meta的Llama3-70B),基于新构建的HealthAdvice数据集(包含222个涉及内科、女性健康、儿科的初级保健领域患者咨询类医疗问题),对888条聊天机器人回复进行了定量和定性分析。

研究发现,不同聊天机器人的问题回复率存在统计学显著差异:问题回复率从Claude的21.6%到Llama的43.2%不等,不安全回复率从Claude的5%到GPT-4o和Llama的13%不等。定性分析显示,部分回复可能导致严重的患者伤害(如错误建议给婴儿喂水、推荐有害药物等)。研究指出,数百万患者可能从公开聊天机器人中获取不安全医疗建议,需进一步提升这些工具的临床安全性。

文章创新点

  1. 构建新数据集HealthAdvice:专注于患者“寻求建议”的医疗问题(而非知识查询类问题),涵盖内科、女性健康、儿科等初级保健领域,共222个问题,填补了现有研究中缺乏广泛初级保健问题评估数据集的空白。
  2. 开发新评估框架:结合定量(问题回复率、不安全回复率等统计分析)和定性(具体问题标签、潜在伤害案例)方法,由16名持证医师进行盲法评估,确保评估的专业性和客观性。
  3. 首次系统性评估广泛初级保健问题的安全性:不同于以往聚焦特定诊断或专科的研究,本文针对患者日常可能咨询的各类初

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询