在智慧中医数字服务平台中,外部健康资讯如果靠手工整理,标题、日期、链接和正文很难保持一致。旧稿展示的是用 Scrapy 做标准化采集模板,将单站样例沉淀为可复用的采集流程。
读完本文后,可以独立检查一个 Scrapy 采集样例是否具备目标站点确认、字段定义、列表页解析、详情页解析、请求头配置、MongoDB 存储配置,以及启动后的待验收检查口径。
文章目录
- 设计与需求
- 后端设计
- 前端设计
- 扩展功能
- 采集工程快速创建
- 采集字段、请求头与 MongoDB 配置
- 列表页与详情页解析
- Codex开发标准
- SOP 标准
- PDD 标准
- 总结
设计与需求
旧稿围绕“基于 Django 的全民健康智慧中医数字服务平台”相关内容,实际展开的是一个 Scrapy 标准化数据采集样例。采集目标以“大众健康之窗”为例,抽取新闻标题、日期、链接和正文内容,其中正文需要通过列表页中的 URL 跳转到详情页继续采集。