news 2026/9/13 17:09:17

云计算中的数据科学入门:Data-Science-For-Beginners 第 17 课「云计算入门」全解

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
云计算中的数据科学入门:Data-Science-For-Beginners 第 17 课「云计算入门」全解

云计算中的数据科学入门:Data-Science-For-Beginners 第 17 课「云计算入门」全解

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

本篇指南以 Data-Science-For-Beginners 课程第 5 单元第 17 课《云计算中的数据科学入门》为骨架,系统讲解云计算的核心概念(公有云 / 私有云 / 混合云、IaaS / PaaS / SaaS)、数据科学团队选择云平台的七大理由,以及两个真实落地的云上数据科学案例(Twitter 实时情感分析与 COVID 科学论文分析)。学完本文,你将能够准确判断"数据科学为什么要上云",并理解云服务在数据存储、集成、分析、机器学习的完整价值链中扮演的角色。

《云计算中的数据科学:入门》速记图 —— 课程配套 sketchnote

什么是云(What is the Cloud)

云(Cloud),又称云计算(Cloud Computing),是指通过互联网,在托管基础设施上按需交付范围广泛的"按使用付费"(pay-as-you-go)计算服务。这些服务涵盖存储、数据库、网络、软件、分析以及各类智能服务。

课程将云分为三种部署形态,这是理解一切云上数据科学方案的基础:

  • 公有云(Public cloud):由第三方云服务提供商所有并运营,将其计算资源通过互联网交付给公众使用。例如你无需自建机房,即可直接申请一台虚拟机或一个对象存储桶。
  • 私有云(Private cloud):指仅供单一企业或组织独占使用的云计算资源,服务与基础设施维护在私有网络中,适合对数据主权、合规性要求极高的场景。
  • 混合云(Hybrid cloud):结合公有云与私有云的系统。用户保留本地(on-premises)数据中心的同时,允许数据与应用运行在云端,实现"核心数据留本地、弹性负载上云端"的灵活架构。

云服务的三种模型:IaaS、PaaS、SaaS

大多数云计算服务可归为以下三类,其核心差异在于"用户管理边界"不同——云提供商替你承担的基础设施层越多,你需投入的运维就越少:

  • 基础设施即服务(Infrastructure as a Service,IaaS):用户租用 IT 基础设施,包括服务器、虚拟机(VMs)、存储、网络、操作系统。用户仍需自行管理操作系统之上的一切,适合需要完全掌控运行环境的场景。
  • 平台即服务(Platform as a Service,PaaS):用户租用用于开发、测试、交付和管理软件应用的完整环境。用户无需关心底层服务器、存储、网络和数据库的搭建与维护,可专注于业务代码本身。对数据科学家而言,托管的数据仓库、分析平台多属此类。
  • 软件即服务(Software as a Service,SaaS):用户按需、通常以订阅方式通过互联网获得软件应用的使用权。用户无需操心软件的托管、底层基础设施以及升级和补丁维护,开箱即用。

目前全球规模最大的云服务提供商包括Amazon Web Services(AWS)Google Cloud Platform(GCP)Microsoft Azure

为什么选择云来做数据科学?

开发者与 IT 专业人员选择云,通常出于以下七大理由(原文逐一列举,这里完整保留并补充解读):

  1. 创新(Innovation):把云提供商自研的创新服务直接集成进应用,例如认知服务、流分析、AutoML,快速为产品"加能力"。
  2. 灵活性(Flexibility):按需选择服务、按使用量付费(pay-as-you-go),随业务需求变化随时调整服务组合。
  3. 预算(Budget):无需前期重资产投入购买硬件软件、建设并运营本地数据中心,只为自己实际使用的资源买单,把资本支出转化为运营支出。
  4. 可扩展性(Scalability):资源可随项目需求自动伸缩——计算、存储、带宽随外部因素动态增减,避免"峰值算力不够、闲时算力浪费"。
  5. 生产力(Productivity):把数据中心管理这类可外包的琐事交给云厂商,团队专注核心业务。
  6. 可靠性(Reliability):云提供多种持续备份机制,可配置灾难恢复(disaster recovery)计划,让业务在危机时刻依然在线。
  7. 安全性(Security):受益于云厂商的策略、技术与管控,从物理安全到数据加密全面加固项目安全。

数据科学家面临的挑战与云上解法

课程进一步把"云的价值"映射到数据科学家日常的五大工作负载:

  • 存储海量数据:不必采购、管理并防护大型服务器,可直接把数据存入云端,例如 Azure Cosmos DB、Azure SQL Database 与 Azure Data Lake Storage 等托管存储方案。
  • 执行数据集成:数据集成是数据科学的关键环节,帮助团队从"采集数据"走向"采取行动"。借助 Data Factory 等云上数据集成服务,可从多种来源收集、转换并整合数据,汇入统一的数据仓库。
  • 处理数据:处理海量数据需要巨大算力,并非人人都拥有足够强大的机器;云上超大规模算力让运行与部署解决方案成为可能。
  • 使用数据分析服务:如 Azure Synapse Analytics、Azure Stream Analytics、Azure Databricks,帮助把数据转化为可执行的洞察(actionable insights)。
  • 使用机器学习与数据智能服务:不必从零造轮子,可直接使用云厂商提供的机器学习算法(如 AzureML),以及语音转文字、文字转语音、计算机视觉等认知服务。

实战案例一:实时社交媒体情感分析

课程给出的第一个案例是机器学习入门者最常研究的场景之一:Twitter 实时情感分析

业务背景:假设你运营一个新闻媒体网站,希望借助实时数据了解读者可能感兴趣的内容。你可以构建一个程序,对 Twitter 上与读者主题相关的推文进行实时情感分析。

关键观测指标:特定话题(hashtag)的推文数量(volume),以及通过分析工具对指定话题进行情感判定(sentiment)

搭建该项目的完整步骤(原文步骤,逐一保留):

  1. 创建事件中心(Event Hub)作为流式输入,用于收集 Twitter 数据;
  2. 配置并启动 Twitter 客户端应用,调用 Twitter Streaming API;
  3. 创建一个 Stream Analytics 作业;
  4. 指定作业的输入与查询(query);
  5. 创建输出接收器(output sink),并指定作业输出;
  6. 启动作业。

这是一条典型的"流式数据管道"链路:数据源(Twitter)→ 事件中心 → 流分析作业 → 输出,完整过程可参考微软 Stream Analytics 官方文档。

实战案例二:科学论文分析

第二个案例来自本课程作者之一Dmitry Soshnikov的真实项目:分析 COVID 相关科学论文,从海量论文中提取知识、获得洞察,帮助研究者高效地在大型论文集合中导航。

该项目的技术拆解如下(原文步骤,逐一保留):

  1. 抽取与预处理信息:使用 Text Analytics for Health(医疗文本分析)服务,从论文中抽取并预处理结构化信息;
  2. 并行化处理:使用 Azure ML 将处理过程并行化,应对大规模论文语料的算力需求;
  3. 存储与查询:使用 Cosmos DB 存储并查询抽取出的信息,提供低延迟的检索能力;
  4. 可视化:使用 Power BI 构建交互式仪表盘,用于数据探索与可视化。

从"文本抽取 → 并行计算 → 存储查询 → 交互可视化"的完整链路可以看出,云服务可以以多种方式支撑端到端的数据科学项目。

课程脉络:从"云入门"到 Azure ML 实战

本课是 5-Data-Science-In-Cloud 单元的第一课。该单元在云概念基础上,继续围绕心力衰竭预测项目(Heart Failure Prediction)展开,以两种方式完整演示"训练—部署—消费"模型的全流程(数据来自公开的 Heart Failure Clinical Records 数据集):

  1. 第 18 课——低代码 / 无代码方式:在 Azure Machine Learning Studio 中通过图形界面完成 AutoML 训练、部署与端点消费,适合快速验证项目可行性、搭建概念验证(POC)。详见 18-Low-Code 课程。
  2. 第 19 课——Azure ML SDK 方式:用代码以编程方式自动化一切,满足生产级需求。例如用Workspace.from_config()加载工作区、创建实验(实验名须为 3–36 个字符,仅含字母、数字、下划线与短横线),并通过AmlCompute.provisioning_configuration(vm_size="Standard_D2_v2", min_nodes=1, max_nodes=3)创建计算集群。AutoML 训练则通过 AutoMLConfig 配置关键参数:experiment_timeout_minutes(实验超时时间)、max_concurrent_iterations(最大并发迭代数)、primary_metric(主指标,如AUC_weighted)、task(任务类型,可取 classification / regression / forecasting)、training_data(含特征与标签列的训练数据)、label_column_name(标签列名)、enable_early_stopping(提前停止)与featurization(特征化策略),再通过experiment.submit(automl_config)提交训练,以remote_run.get_output()获取最优模型并注册。

这两课之间的取舍逻辑值得留意:低代码路线上手快、适合验证可行性,但当项目走向生产时,资源创建、模型部署都必须以代码自动化的方式落地,这正是 Azure ML SDK 的用武之地。

课后作业:云服务商数据科学能力市场调研

本课的配套作业是市场调研(Market Research):课程已指出 AWS、GCP、Azure 等多家重要云服务商,作业要求进行市场调研,分析各家能为数据科学家提供什么服务、这些服务是否具有可比性,并撰写一篇报告,描述至少三家云服务商的数据科学产品并加以区分。

评分标准(Rubric)明确给出了质量梯度:

优秀(Exemplary)合格(Adequate)待改进(Needs Improvement)
一篇一页纸的报告,描述了三个云服务商的数据科学产品并做出区分提交了篇幅较短的报告提交了报告但未完成分析

这一作业的落点正是本课正文的价值延伸:只有理解了 IaaS / PaaS / SaaS 的层次划分与各类云上数据服务,才能对不同厂商的"数据科学全家桶"做出有依据的比较。

小结

本课回答了三个递进的问题:云是什么(按需交付的计算服务,分公有 / 私有 / 混合三种形态,按 IaaS / PaaS / SaaS 三个层次提供)、为什么用云做数据科学(创新、灵活、预算、可扩展、生产力、可靠、安全七大理由,以及对存储、集成、处理、分析、机器学习五类负载的具体帮助)、云上数据科学长什么样(Twitter 情感分析、科学论文分析两个真实案例)。它也为后续第 18、19 课的 Azure ML 实操铺平了概念基础。

学习建议:在学习第 17 课后,建议依次完成课后测验与市场调研作业,再进入低代码 / 无代码与 Azure ML SDK 两课,亲手将本文提到的概念落地为真实可运行的云上模型。

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/13 17:07:00

订单可视化提升效率:如何构建一套全面监控体系

1. 为什么订单可视化能直接提升效率订单业务链路通常横跨下单、支付、库存、仓储、物流、售后等多个环节,任何一个节点延迟或异常,都会影响履约时效和用户体验。传统模式下,运营、客服和技术人员往往需要从多套系统中手工查询订单状态&#x…

作者头像 李华
网站建设 2026/9/13 17:05:26

低空经济网络关注度分析与技术实现

1. 项目背景与意义 "低空经济"作为近年来兴起的新经济形态,正在全球范围内引发广泛关注。这个涵盖无人机物流、城市空中交通、低空旅游等领域的综合性产业,正在重塑传统经济格局。2022年6月至2025年6月这三年时间窗口,恰好是低空经…

作者头像 李华
网站建设 2026/9/13 17:01:46

如何用 SpacetimeDB 计划表让 Reducer 在指定时间或按间隔定时执行

如何用 SpacetimeDB 计划表让 Reducer 在指定时间或按间隔定时执行 【免费下载链接】SpacetimeDB Development at the speed of light 项目地址: https://gitcode.com/GitHub_Trending/sp/SpacetimeDB SpacetimeDB 的模块中,Reducer 是修改数据库状态的唯一途…

作者头像 李华