1 研究背景与意义
皮肤病是临床最为常见的疾病类别之一。根据世界卫生组织及国内皮肤病流行病学调查数据,我国人群中曾患过至少一种皮肤疾病的比例超过50%,其中恶性黑色素瘤、基底细胞癌、鳞状细胞癌等皮肤恶性肿瘤的发病率近十年来持续上升。然而,我国皮肤科执业医师主要集中在三级医院与东部发达地区,基层医疗机构尤其是县域医院普遍缺乏具备皮肤镜阅片能力的专科医生,导致大量早期恶性皮肤病变被延误诊断,错过了最佳治疗窗口。在这一现实矛盾下,如何借助人工智能技术辅助基层医生完成初筛,成为提升皮肤病诊疗公平性与时效性的重要课题。
从人工智能技术演进角度看,卷积神经网络在2017年前后已在皮肤镜图像分类任务上达到与资深皮肤科医生相当的水平,但既有研究多停留在单张图像的疾病标签输出阶段,医生仍需自行撰写病历与处置意见。2023年以来,以DeepSeek为代表的国产大语言模型在医学问答、病历生成等任务上展现出较强的中文语义组织能力,为将视觉模型的结构化检测结果转化为可读、可解释的诊断建议文本提供了新的技术路径。本研究正是在这一背景下,将YOLOv8实时目标检测能力与DeepSeek自然语言生成能力相结合,构建一套面向基层门诊的皮肤病图像检测与诊断建议生成系统。
本研究的意义体现在三个层面:其一,在算法层面探索视觉检测模型与大语言模型级联的医学人工智能范式,验证检测框、类别、置信度等结构化视觉信息作为大模型提示输入的可行性;其二,在工程层面形成一套可部署的B/S架构原型系统;其三,在社会层面通过降低皮肤病初筛的技术门槛,间接缓解优质皮肤科资源供需失衡的问题。
2 国内外研究现状
2.1 国外研究现状
在国外,Esteva等于2017年在《Nature》上利用129450张临床皮肤图像训练深度卷积神经网络,对皮肤良性病变与恶性肿瘤进行二分类,达到了21名皮肤科医生的平均诊断水平,其研究目的在于验证深度学习在皮肤癌筛查中的可行性,标志着人工智能皮肤影像分析进入端到端深度学习阶段。Tschandl等于2018年构建并发布HAM10000数据集,收录10015张皮肤镜图像并按7类常见色素性病变标注,其目的是为学界提供规模足够、类别均衡的基准数据集,推动后续算法在统一数据口径下横向比较。国际皮肤成像协作组织ISIC自2016年起连续举办皮肤病变分析竞赛,逐年发布ISIC
2019、ISIC
2020等数据集,其目的是围绕黑色素瘤早期检测、病变分割等任务组织算法评测,推动CNN、ViT等模型精度持续提升。Google团队于2023年发布Med-PaLM
M多模态医学模型,在皮肤影像问答任务上进行初步探索,其目的是让模型在给出判读结果的同时生成解释性文本;但受限于国外大模型中文医学语料不足,其生成内容在中文临床场景下的可移植性有限。
2.2 国内研究现状
在国内,李等(2022)针对皮肤病变图像小目标漏检问题,基于YOLOv5架构引入注意力机制与多尺度特征融合,在自建的皮肤镜数据集上将mAP@0.5提升至86.4%,其研究目的在于改善小尺寸早期恶性病变在检测框回归中的召回率。张等(2023)使用ResNet-50作为骨干网络对ISIC
2019数据集进行八分类训练,并对接通用大模型接口输出辅助诊断报告,其研究目的在于验证“视觉分类+文本生成”两段式框架在皮肤病辅助诊断中的工程可行性,但该研究仅在图像级别给出单一类别标签,未对病变区域进行定位,也未将大模型生成建议限定在医学安全范围内。王等(2024)进一步将YOLOv7用于多病变共存图像的检测,其目的是在一张图像中同时框出多个独立皮损并分别给出类别,但在检测结果到临床处置建议的自然语言组织环节,仍依赖人工模板拼接,缺乏语义层面的灵活表达。
2.3 现有研究不足与本研究切入点
综合来看,现有研究在三个方面仍存在改进空间:一是检测模型多停留在YOLOv5、YOLOv7代际,尚未充分利用YOLOv8在Anchor-free解耦头、Task-Aligned
Assigner标签分配等方面带来的精度与速度提升;二是大模型与视觉模型的衔接多采用固定模板拼接,未将检测框位置、置信度、病变尺度等结构化信息系统地组织进提示词,导致生成建议与检测证据之间缺乏可追溯性;三是中文场景下缺少针对基层门诊语境的风险分级与就医建议话术。在前人研究的基础上,本研究提出新的想法:以YOLOv8作为视觉检测骨干,将其输出的病变类别、检测框坐标、置信度作为结构化证据,通过提示词工程送入DeepSeek大模型,由大模型生成包含病变名称、风险等级、初步处置建议与就医提示的中文诊断建议文本,并在前端界面上同时呈现可视化检测框与可解释的自然语言建议,形成“检测—证据组织—文本生成”闭环。
3 研究内容与目标
3.1 研究目标
本研究的总体目标是设计并实现一套基于YOLOv8与DeepSeek的皮肤病图像检测与诊断建议生成系统,支持医生在浏览器端上传皮肤镜图像,系统自动完成皮损定位、病变分类、风险等级判断,并生成结构化中文诊断建议文本,为基层医生提供可解释的辅助筛查工具。
3.2 主要研究内容
第一,皮肤病图像数据集构建与预处理。基于ISIC
2019公开数据集完成类别筛选、标注格式转换、训练/验证/测试集划分,并针对类别不平衡问题开展数据增强。
第二,YOLOv8检测模型训练与优化。选用YOLOv8s作为基线模型,在自建数据子集上进行迁移学习,重点优化小目标皮损的召回率与多病变共存场景下的误检率。
第三,DeepSeek诊断建议生成模块设计。设计结构化提示词模板,将YOLOv8输出的类别、置信度、检测框归一化坐标映射为提示词中的证据条目,调用DeepSeek
API生成风险分级与处置建议文本。
第四,系统集成与前后端开发。采用Django作为后端服务框架,Vue作为前端框架,MySQL存储用户、检测记录与生成的建议文本,完成图像上传、检测结果可视化、建议文本展示等功能。
3.3 拟解决的关键问题
本研究拟解决两个关键问题:一是小样本、长尾分布病变类别在YOLOv8训练中的召回率偏低问题,拟通过类别均衡采样与Mosaic增强缓解;二是大语言模型在医学场景下可能产生幻觉性建议的问题,拟通过限定提示词输出格式、强制引用检测证据、在前端加注“本建议仅供参考,不能替代临床医生面诊”的免责声明三重手段加以控制。
4 系统数据分析与功能设计
4.1 数据分析(数据来源与画像)
本研究使用的主要训练数据来自国际皮肤成像协作组织公开发布的ISIC
2019数据集。该数据集由国际皮肤成像协作组织于2019年正式发布,原始规模约25331张皮肤镜图像,由经过认证的皮肤科医生完成8类病变的金标准标注,是目前国际上规模较大、标注质量较高的公开皮肤病数据集之一。本研究从中选取临床关注度最高的6类病变纳入训练,分别为恶性黑色素瘤、基底细胞癌、良性色素痣、日光性角化病、良性角化性病变与血管性病变。
从类别分布看,所选数据呈现明显的长尾特征。以2019年ISIC原始类别计数为例,基底细胞癌约8615张、良性色素痣约12875张,两类合计占比超过80%;而恶性黑色素瘤约4522张、日光性角化病约327张,后一类样本量不足前两类的4%。这一分布特征可通过柱状图直观呈现:横轴为6类病变名称,纵轴为样本数量,柱高差异直接反映类别不平衡程度。柱状图在此处的意义不仅在于展示样本计数,更在于为后续是否需要过采样、类别损失加权或迁移学习提供定量依据——柱高差距越大的类别,越需要在训练阶段通过损失函数重加权或数据增强进行补偿,以避免模型在多数类上过拟合、在少数恶性类上漏检。
在模型选型阶段,进一步引入雷达图对YOLOv8与YOLOv5、Faster
R-CNN三种主流检测算法进行多指标横向对比。雷达图选取平均精度均值mAP@0.5、召回率Recall、单帧推理速度FPS、模型参数量Params、小目标召回率五个维度,归一化后绘制五边形轮廓。雷达图在此处的意义在于用一张图同时刻画精度、速度与轻量化程度,避免单一指标偏废:若仅看mAP,Faster
R-CNN略优;若同时观察FPS与参数量,YOLOv8在2023—2024年公开基准上mAP@0.5约为53.9%、单帧推理约1.2毫秒、参数量约11.2M,整体在精度与部署成本之间取得更优平衡,更适合作为基层门诊B/S系统的后端检测模型。
4.2 系统功能设计
系统采用三层架构设计。用户层面向医生与试用用户,提供账号登录、皮肤镜图像上传、检测结果可视化框选、诊断建议文本阅读与历史检测记录查询功能;算法层是系统核心,由YOLOv8检测模块与DeepSeek建议生成模块串联组成,前者负责在上传图像上定位皮损并输出类别与置信度,后者负责将结构化检测结果转化为自然语言建议;数据层基于MySQL存储用户信息、原始图像路径、检测框坐标、类别概率、生成文本与时间戳,保证每一条诊断建议均可回溯到对应的原始检测证据。
在交互流程上,医生登录系统后进入检测工作台,上传一张皮肤镜图像;后端调用YOLOv8模型对图像进行推理,将检测结果以JSON形式返回前端,前端在原图上绘制彩色检测框并标注类别与置信度;同时后端将检测结果组装为提示词,调用DeepSeek
API获取诊断建议文本,与检测框结果一同展示在结果页。结果页底部固定显示风险提示与免责声明。
5 关键技术与实现路线
5.1 YOLOv8目标检测技术
YOLOv8由Ultralytics团队于2023年推出,采用Anchor-free无锚框检测头、解耦分类与回归分支以及Task-Aligned
Assigner标签分配策略,在COCO等公开基准上相较前代YOLOv5在小目标与密集目标场景下精度明显提升。本研究以PyTorch为训练框架,在YOLOv8s预训练权重基础上,使用ISIC
2019筛选后的6类病变子集进行迁移学习,输入尺寸统一缩放至640×640,采用AdamW优化器、初始学习率1e-3、余弦退火调度,并引入Mosaic、MixUp、随机水平翻转与HSV色彩抖动作为在线数据增强。
5.2 DeepSeekAI工具嵌入(执行—过程—结果)
本研究在建议生成环节强制嵌入DeepSeekAI工具,按照“执行—过程—结果”三段式逻辑组织调用流程。在执行阶段,后端服务通过HTTPS调用DeepSeek官方提供的对话补全接口,使用账号申请的API
Key完成鉴权,设定temperature为0.3以保证医学文本的稳定性,max_tokens控制在512以内以避免生成长篇无关内容。在过程阶段,后端将YOLOv8输出的每一个检测框转化为结构化证据条目,包含病变类别、置信度、以图像宽高归一化后的中心点坐标与框宽框高,并在提示词中以中文列出,同时约束大模型只能基于这些证据生成建议,禁止引入未在证据条目中出现的疾病名称,并要求按“病变识别—风险分级—初步处置建议—就医提示”四个固定小标题输出。在结果阶段,DeepSeek返回的文本经后端做格式校验与敏感词过滤后,由前端渲染为带小标题的结构化报告;若检测结果中最高置信度低于0.5,则系统在文本前自动追加“图像质量不足以支撑可靠判读,建议重新采集”的提示。
5.3 系统实现路线
系统整体技术栈为Python 3.10 + PyTorch 2.0训练YOLOv8模型,后端采用Django
4.2提供RESTful接口,使用Django ORM操作MySQL 8.0;前端采用Vue 3 + Element Plus构建检测工作台,通过Axios与后端交互;模型推理服务使用ONNX
Runtime进行轻量化部署,以降低后端GPU显存占用。开发过程遵循先算法后系统的顺序:先在本地完成YOLOv8训练与指标评测,再完成DeepSeek提示词调试,最后进行前后端联调与界面美化。
6 可行性分析
6.1 技术可行性
YOLOv8、DeepSeek API、Django、Vue均为成熟开源或商业化技术栈,社区文档与示例代码丰富;ISIC
2019数据集公开可用,无需额外伦理审批即可用于算法训练。个人开发用消费级GPU(如单张RTX 3060
12GB)即可完成YOLOv8s的迁移学习训练,技术上不存在不可逾越的障碍。
6.2 操作可行性
系统采用B/S架构,医生与试用用户无需安装客户端,通过浏览器访问即可完成上传与查看,操作流程与现有在线问诊图片上传习惯一致,学习成本低;后端服务可部署在云服务器或本地工作站,便于在毕业设计答辩阶段进行现场演示。
6.3 经济可行性
训练与开发所使用的Python、PyTorch、Django、Vue、MySQL均为开源软件,无授权费用;ISIC数据集遵循知识共享协议发布,可免费用于学术研究;DeepSeek
API按调用量计费,在毕业设计演示阶段调用次数有限,预估费用在数十元量级,经济成本可控。
6.4 法律可行性
法律层面需独立说明。本研究使用的ISIC
2019数据集遵循知识共享署名—非商业使用许可协议,仅用于学术研究,不涉及医疗产品注册与商业化推广;系统输出明确标注“本结果由人工智能自动生成,仅供医学专业人员参考,不能替代执业医师面诊与病理诊断”,前端不向普通患者提供独立诊断结论;用户上传的皮肤镜图像仅在本次检测过程中临时处理,检测完成后按用户选择删除或加密存储,不用于二次商用。在上述约束下,本研究在数据使用、模型输出与隐私保护三方面均不违反现行法律法规,法律风险可控。