Data-Science-For-Beginners 云上数据科学入门:云计算基础模型与云端数据科学实战
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
本指南对应 Data-Science-For-Beginners 课程「5-Data-Science-In-Cloud」单元的第 17 课(英文原版,法语译本),系统讲解云计算的本质、公有/私有/混合云的部署形态、IaaS/PaaS/SaaS 三大服务模型,以及数据科学家选择云端的原因。读完本文,你将掌握云计算的完整概念框架,理解云服务如何解决存储、集成、算力、分析与机器学习等数据科学核心挑战,并透过两个真实项目示例(实时社交媒体情感分析、COVID 科学论文分析)看清云端数据科学的落地路径。
数据科学与云:第 17 课课程速写(Sketchnote)
一、什么是云(Cloud)?
云(Cloud),又称云计算(Cloud Computing),是指通过互联网按需交付一系列计算服务的模式,这些服务托管在远端基础设施之上,以「按使用量付费」为主要计费方式。服务范围涵盖存储、数据库、网络、软件、数据分析以及各类智能服务。
从课程的定义可以提炼出云计算的三个关键特征:
- 按需交付(on-demand):用户可以随时申请、释放计算资源,无需等待漫长的采购与部署周期;
- 通过互联网访问(over the internet):一切能力经由网络对外提供,用户无需关心资源物理位置;
- 按用量计费(pay-as-you-go):只为自己实际消耗的资源付费。
二、云的部署形态:公有云、私有云与混合云
课程将云的部署形态划分为三类,理解其区别是选择云架构的第一步:
| 部署形态 | 定义 | 关键特征 |
|---|---|---|
| 公有云(Public cloud) | 由第三方云服务提供商拥有并运营,通过互联网向公众交付其计算资源 | 资源多租户共享、弹性伸缩、按量付费,无需自建基础设施 |
| 私有云(Private cloud) | 仅供单一企业或组织独占使用的云计算资源,服务与基础设施维护在私有网络上 | 数据主权与合规性更强,适合对安全、监管有严格要求的组织 |
| 混合云(Hybrid cloud) | 公有云与私有云的结合体:用户保留本地(on-premises)数据中心,同时允许数据与应用运行在一个或多个公有云上 | 兼顾本地敏感数据与云端弹性算力,是最常见的企业级架构 |
三、云服务的三大服务模型:IaaS、PaaS 与 SaaS
绝大多数云计算服务可归入以下三类服务模型,它们代表了对底层基础设施不同层级的托管与抽象:
基础设施即服务(IaaS)
用户以租赁方式获得 IT 基础设施,包括服务器、虚拟机(VM)、存储、网络与操作系统。IaaS 提供最底层的控制力,用户需要自行管理与配置系统环境,适合需要高度定制化基础设施的场景。
平台即服务(PaaS)
用户租用一个用于开发、测试、交付和管理软件应用的完整运行环境。PaaS 的最大价值在于:用户无需关心底层服务器、存储、网络与数据库的配置与管理,可将全部精力投入应用逻辑本身。本课程的云数据科学实践(AutoML 训练、模型部署)即属于典型的 PaaS 应用场景。
软件即服务(SaaS)
用户通过互联网按需访问软件应用,通常采用订阅制。用户无需关心软件的托管、底层基础设施以及升级和安全补丁等维护工作,开箱即用,例如各类在线办公套件与数据分析 SaaS 产品。
三大模型的核心差异可概括为「谁负责什么」:IaaS 用户负责操作系统之上的一切,PaaS 平台负责运行时环境,SaaS 则连应用本身也由厂商托管。
四、主要云服务提供商
课程指出,全球规模最大的云服务提供商包括Amazon Web Services(AWS)、Google Cloud Platform(GCP)与 Microsoft Azure。后续课程(18-Low-Code 与 19-Azure)将以 Azure 为平台,演示如何利用云的能力完成心力衰竭预测项目的完整生命周期——从数据准备、模型训练到部署与调用。
五、为什么数据科学家要选择云?
开发者与 IT 专业人士选择云计算的动机通常包含以下七点,课程逐一进行了阐述:
- 创新(Innovation):可将云服务提供商打造的创新服务直接集成进应用,为产品注入前沿能力;
- 灵活性(Flexibility):只为自己需要的服务付费,可从海量服务中按需选择,随业务演进动态调整;
- 预算友好(Budget):无需前期一次性投入购买软硬件、自建并运维本地数据中心,按实际使用付费即可;
- 可扩展性(Scalability):资源随项目需求伸缩,应用可根据外部因素随时增减计算能力、存储与带宽;
- 生产力(Productivity):把精力聚焦在核心业务上,将数据中心管理等事务性工作交由云平台承担;
- 可靠性(Reliability):云计算提供多种持续备份机制,可建立灾难恢复(disaster recovery)计划,在危机时刻保障业务连续性;
- 安全性(Security):获得云平台提供的强化项目安全性的策略、技术与控制措施。
六、云如何解决数据科学家的五大核心挑战
在理解云的概念与优势后,课程进一步聚焦数据科学家与数据开发者的日常工作,指出云可以针对性地解决以下五大挑战:
1. 海量数据存储
无需购买、管理与防护大型服务器,可直接将数据存放于云端,典型方案包括Azure Cosmos DB、Azure SQL Database 与 Azure Data Lake Storage,分别覆盖 NoSQL 文档存储、关系型数据库与大规模数据湖场景。
2. 数据集成
数据集成是数据科学从「数据采集」走向「采取行动」的关键环节。借助云中的数据集成服务(如Azure Data Factory),可以从多源采集、转换并集成数据至统一的数据仓库中。
3. 数据处理
海量数据处理需要强大的计算能力,并非所有人都拥有足够强劲的本地机器。因此许多团队选择直接调用云的规模化算力来运行和部署解决方案。
4. 数据分析服务
Azure Synapse Analytics、Azure Stream Analytics 与 Azure Databricks等云服务可帮助你将数据转化为可执行的洞察。
5. 机器学习与人工智能服务
不必从零开始搭建,可直接使用云提供商提供的机器学习算法(如Azure ML),以及语音转文本、文本转语音、计算机视觉等认知服务(Cognitive Services),显著降低 AI 应用的开发门槛。
七、云中数据科学实战示例
为了让抽象概念落地,课程给出了两个端到端的项目示例。
示例一:实时社交媒体情感分析
这是机器学习初学者最常研究的场景之一。假设你运营一个新闻媒体网站,希望利用实时数据了解读者可能感兴趣的内容,可以构建一个对 Twitter 上相关主题推文执行实时情感分析的程序。
关键指标包括:特定主题(hashtag)的推文数量(volume),以及借助分析工具对指定主题进行情感分析得到的情感倾向(sentiment)。
项目实现步骤如下:
- 创建用于流式输入的事件中心(Event Hub),负责收集 Twitter 数据;
- 配置并启动 Twitter 客户端应用,调用 Twitter 流式 API(Streaming APIs);
- 创建流分析作业(Stream Analytics job);
- 指定作业的输入与查询逻辑;
- 创建输出接收器(output sink)并指定作业输出;
- 启动作业,持续消费实时情感分析结果。
说明:该场景对应的完整微软官方教程(Stream Analytics 结合 Twitter 情感分析)链接位于原文档中,因外部链接不在本文范围内,此处仅保留方法论层面的步骤梳理。
示例二:科学论文智能分析
第二个示例来自本课程作者之一 Dmitry Soshnikov 的真实项目:构建一个分析COVID 论文的工具。该工具能够从海量科学论文中抽取知识、获取洞察,帮助研究人员高效浏览大型论文集合。
项目采用的技术路线如下:
- 使用Text Analytics for Health(医疗文本分析服务)对论文信息进行抽取与预处理;
- 使用Azure ML对处理过程进行并行化加速;
- 使用Cosmos DB存储并查询抽取出的结构化信息;
- 使用Power BI创建交互式仪表盘,支持数据探索与可视化。
两个示例共同说明:云服务可以被灵活组合,用于支撑数据科学项目的采集、存储、计算、分析与可视化全链路。正如课程总结所言——「如你所见,我们可以在许多方面利用云服务来开展数据科学」。
八、课程延伸:从「为什么上云」到「如何在云端做数据科学」
第 17 课回答了「为什么要用云」,而同一单元的后续课程则完整回答了「如何在云上落地一个数据科学项目」。三者构成一条从理念到实战的完整链路:
| 课程 | 主题 | 核心内容 |
|---|---|---|
| 17-Introduction | 云上数据科学导论 | 云计算基础概念、部署形态、服务模型与选择理由 |
| 18-Low-Code | 低代码/无代码方式 | 在 Azure ML Studio 中以 GUI 方式完成训练、部署与端点调用,适合快速验证(POC) |
| 19-Azure | Azure ML SDK 方式 | 以 Python SDK 编程化完成同一流程,适合生产级、可自动化复用的场景 |
两种实现方式各有取舍:低代码/无代码方式无需编程经验、开发快速,适合验证项目可行性、构建概念验证(POC);但项目成长并走向生产环境时,通过 GUI 创建资源不可持续,必须用代码程序化地自动化一切——从资源创建到模型部署——这正是掌握 Azure ML SDK 的价值所在。这两条路线在仓库中均有完整的操作文档(18-Low-Code/README.md、19-Azure/README.md)与可运行的示例 Notebook(5-Data-Science-In-Cloud/19-Azure/notebook.ipynb)可供对照学习。
九、课后实践:云提供商数据科学能力市场调研
本课的课后作业(Assignment)要求进行一项市场调研(Market Research):
本课介绍了多家重要的云服务提供商。请开展市场调研,了解各家能为数据科学家提供哪些能力:它们的服务是否具有可比性?撰写一篇短文,描述至少三家云提供商的数据科学服务。
作业评分标准(Rubric)如下:
| 优秀(Exemplary) | 合格(Adequate) | 待改进(Needs Improvement) |
|---|---|---|
| 一页篇幅的论文描述三家云提供商的数据科学服务并比较其差异 | 提交了较短的论文 | 提交了论文但未完成分析 |
建议按以下维度开展调研对比:机器学习平台(如 AutoML 能力)、数据存储与集成服务、数据分析与可视化工具、AI 认知服务、计费模式与生态集成度,并结合本课学习的 IaaS/PaaS/SaaS 框架归类各家的服务层次。
小结
云计算为数据科学提供了一站式的基础设施与平台能力:以 IaaS 获得弹性算力、以 PaaS 摆脱环境运维负担、以 SaaS 直接消费智能服务。结合本单元后续课程,你将能真正在云端完成一个数据科学项目的完整生命周期。想进一步了解课程目录结构,可查阅 docs/_sidebar.md 中的单元导航,或直接在仓库中浏览 5-Data-Science-In-Cloud 单元下的全部资源。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考