
数据科学场景化思考实战Data-Science-For-Beginners 第一课作业完整解析与拓展【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners导读本文以开源课程 Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!第一课《Defining Data Science》配套作业为核心完整解析这份题为《Devoir : Scénarios en Science des Données》数据科学场景的法语版作业它要求学习者围绕教育、疫苗接种、工作生产力三大领域从收集哪些数据、如何收集、如何存储、能得出什么洞察与决策四个维度展开场景化思考。读完本文你将掌握数据科学项目立项阶段的四问框架、数据采集与存储选型的方法论、以及对照仓库真实数据集进行方案验证的完整思路并能据此独立完成这份作业及其评分要求。一、作业定位第一课的数据科学场景思考题本作业是课程第一课 Defining Data Science 的收尾任务位于 translations/fr/1-Introduction/01-defining-data-science/assignment.md法语版内容与 英文原版 一致。它紧承第一课的核心主张数据科学的价值不在于处理数据本身而在于用数据改进真实世界的流程与决策。因此作业要求学习者面向现实中的业务流程或问题模拟数据科学家的第一步——不写代码、不做模型而是先把问题拆解为可被数据回答的问题。作业要求针对每一个问题领域逐一回答以下四个问题你能收集哪些数据Quelles données pouvez-vous collecter你打算如何收集这些数据Comment les collecteriez-vous你会如何存储这些数据数据的规模大概有多大Comment stockeriez-vous les données ? Quelle serait probablement la taille des données你能从这些数据中得出什么洞察aperçus基于这些数据我们能做出什么决策Quelles décisions pourrions-nous prendre这四个问题并非随意罗列而是对应了第一课 README 中归纳的数据旅程五步数据获取Data Acquisition→ 数据存储Data Storage→ 数据处理Data Processing→ 可视化/人工洞察Visualization / Human Insights→ 预测模型训练Training a predictive model。换言之这份作业就是让你在动手编码之前先把这五个环节在脑子里各走一遍——这正是数据科学项目立项阶段最关键的需求分析。二、四问框架逐条拆解怎么把想法变成数据方案2.1 问题一收集哪些数据判断该收集什么数据的核心原则是数据必须能反向回答你要解决的业务问题。第一课将数据划分为结构化structured、半结构化semi-structured与非结构化unstructured三类并给出了常见数据来源清单结构化数据IoT 传感器读数温度、压力、购买/访问后的用户问卷、用户行为分析如用户在站点内的浏览深度与离开原因非结构化数据文本可用于情感分析、关键词提取、图片/视频如监控视频用于估算道路交通流量、Web 服务器日志哪些页面被访问最多、停留多久半结构化数据社交网络关系图可刻画用户性格与信息传播潜力、聚会合影中的人际关系图Group Dynamics。仓库的 data 目录 恰好提供了一批真实可查的结构化数据集可作为该收集什么数据的参照物例如 honey.csv 记录各州、各年份的蜂群数、单群产量、总产量、库存与单价birds.csv 记录鸟类物种的目、科、属与体型/翼展/体重区间diabetes.tsv 为糖尿病患者的年龄、性别、BMI、血压及多项生理指标emails.csv 则是典型的词频矩阵每封邮件中各单词的出现次数。这些文件说明好的数据集 明确的行对象 明确的列指标 可追溯的时间/空间维度。你在作业中设计收集什么数据时应当能想象出最终落成的表头长什么样。2.2 问题二如何收集收集方式取决于数据源类型。第一课给出的典型路径包括IoT / 传感采集若场景依赖传感器如教室温湿度、车间设备状态通常需要缓冲端点如 IoT Hub先汇聚海量原始信号再做后续处理问卷/表单面向用户的主观反馈成本低、可批量仓库 data/form.csv 即是一份问卷回收数据的样例日志与行为埋点被动采集用户在系统内的操作轨迹公开数据集与爬取利用现成的开放数据课程中挑战环节就通过抓取维基百科文本生成词云代码见 notebook.ipynb。作业中你不需要真正实施采集但必须明确数据从哪里来、以什么频率/渠道进入系统这决定了后续存储与处理的成本。2.3 问题三如何存储数据规模多大第一课 README 给出三种典型存储方案这也是作业评分中明确会考察的一环评分标准要求讨论了数据存储方式存储方案适用场景关键特征关系型数据库Relational结构化、表间有关联的数据以 SQL 查询表按 schema 组织通常需将原始数据转换为符合表结构的形式NoSQL 数据库如 CosmosDB层次化 JSON 文档、图结构等复杂数据不强制 schema可存更复杂数据但查询能力弱于 SQL且无法强制参照完整性数据湖Data Lake海量原始、非结构化数据常与大数据结合数据无法单机容纳时由集群存储处理常配合 Parquet 格式规模估算要与存储选型联动若每天仅产生几百条问卷记录一张关系表即可承载若场景是全校每间教室每分钟一次的传感器读数数年累计将达千万级行——此时就需要考虑数据湖或分布式方案。仓库 2-Working-With-Data 部分专门用两课讲解关系型与非关系型数据对应目录 05-relational-databases 与 06-non-relational后者还提供了 JSON 样例PersonsData.json、TwitterData.json可供参考。2.4 问题四能得出什么洞察与决策这是四问的落点数据必须转化为可行动的洞察actionable insights。第一课强调数据科学的最终目标是基于数据做决策而洞察通常需要经过可视化或统计检验才能被看见——这正是课程 3-Data-Visualization 部分共 5 课数量、分布、比例、关系与有意义可视化要训练的能力。在作业阶段你只需要合情合理地推演假如我拿到这些数据我能发现什么规律并据此做什么改变。注意洞察应当可验证、可执行而不是空泛的了解情况。三、三大示例场景从提示到可落地的数据方案作业给出了三个起始领域也允许你替换为自己的想法下面给出每个领域的完整推演示范。完成作业时可对照此思路填充官方表格。3.1 场景一用数据改进儿童的在校教育过程收集哪些数据学生学习行为数据各模块/章节的完成时长、作业提交时间与成绩、测验得分、课堂出勤、教师的评价记录、学生的年龄/年级等属性数据非结构化数据可包括作业文本与课堂讨论记录用于理解难点。如何收集学习管理系统LMS自动埋点记录学习行为课后测验与作业通过系统提交学生属性通过注册表单维护。注意保护未成年人数据的合规性。如何存储学习行为与成绩属于高度结构化的关系数据宜用关系型数据库按学生表—课程表—成绩表建模主键/外键关联讨论文本等非结构化内容可放入 NoSQL 或文件存储。规模上一所学校数千学生、每年数千条行为记录单机关系库即可承载。洞察与决策第一课 README 中的课程优化例子正属于此类——统计每名学生完成每个模块的平均时长考虑按模块字符数归一化找出学生普遍卡壳的模块并简化内容分析测验中每道题的错误率定位学生理解薄弱的概念点并改进讲义进一步将完成时长与学生年龄分段交叉分析可给出分年龄段的课程推荐减少因预期不符导致的退课。3.2 场景二用数据控制疫情期间的疫苗接种收集哪些数据接种记录疫苗批号、接种时间、接种点、人口信息年龄、地区、慢性病史、职业、疫情传播数据每日新增病例、住院率、死亡率、疫苗库存与有效期数据。如何收集接种点在接种时通过信息系统实时登记医疗机构按日上报病例人口信息来自既有卫生档案疫苗库存由供应链系统维护。仓库 data/COVID 下的time_series_covid19_confirmed_global.csv、time_series_covid19_deaths_global.csv、time_series_covid19_recovered_global.csv正是这类按国家/地区日期累积的典型时序公开数据可直接作为如何组织疫情数据的参照。如何存储接种与病例数据为典型的表格时序数据关系型数据库 分区表足以支撑按日期、地区的聚合查询若涉及全人口级的细粒度轨迹与图谱分析可引入 NoSQL 或数据湖。规模取决于人口量级国家级每日千万级记录的聚合运算需考虑集群或列式存储如 Parquet。洞察与决策识别接种率低的人群与地区定向投放接种宣传与增设临时接种点监测不同疫苗批次的副作用报告率辅助安全性决策结合病例曲线评估某地区疫苗覆盖率与住院率的关系动态调整分配优先级与解封策略。3.3 场景三用数据保证工作生产力收集哪些数据任务管理系统中的任务完成时间、工作时长记录、会议时长与数量、干扰事件日志消息/邮件打断频次、个人健康数据睡眠时长若有穿戴设备。如何收集项目管理/待办工具自动记录任务耗时日历与通讯工具导出会议与消息元数据穿戴设备或手记补充健康维度。注意这类数据高度个人化需在隐私允许的范围内使用。如何存储个人量级数据量很小每天几十到几百条记录关系型数据库或本地 CSV/电子表格即可若要跨团队分析可统一入库并按人员、周聚合。洞察与决策发现深度工作时段与任务产出效率的相关性据此调整日程安排把高难度任务排进高效时段、减少中断识别会议占比过高的团队并推动会议瘦身结合任务预估与实际耗时偏差改进工作估时模型。3.4 官方作业表格可直接复制使用作业要求填写下表可用自己的领域替换建议领域原表共 3 行务必全部填写领域问题收集哪些数据如何存储数据能得出哪些洞察/决策教育疫苗接种生产力四、评分标准解读三个等级差在哪里作业末尾附带的评分表Rubric是自我校验的标尺共分三档优秀Exemplary合格Adéquat待改进À améliorer能为所有问题领域识别出合理的数据来源、存储方式以及可行的决策/洞察方案的某些方面不够详细未讨论数据存储至少描述了 2 个领域只描述了方案的部分内容仅考虑了 1 个领域从评分表可以提炼出三条硬性要求① 领域数量要足够至少 2 个理想是 3 个全部覆盖② 存储环节不可缺这是最容易被忽略、也最容易被扣分的一项务必回到本文 2.3 节的三种存储方案去说明③ 洞察与决策必须落到可采取的行动而非泛泛而谈。建议在提交前逐行检查每一行是否都填满了四列存储方式是否结合了数据规模说明洞察/决策是否具体到据此可以做什么改变五、拓展把作业升维成数据旅程的完整推演如果你想让作业质量超出评分表要求可以在四个问题之外主动补充以下两层思考——它们全部源于第一课正文属于课程明确传授的方法论数据旅程的完整性第一课将数据生命周期归纳为获取→存储→处理→可视化→建模五步作业四问其实覆盖了前两步和第四步决策即洞察。你可以在方案中额外说明原始数据如何清洗转换对应课程第 8 课 数据准备以及最终是否需要训练预测模型课程第 10 周内容的前置铺垫。例如疫苗接种场景中预测未来两周某地区的确诊趋势就需要在历史时序数据之上构建预测模型——仓库中的 COVID 时序文件正是这类建模任务的输入素材。数字化与数字化转型第一课指出先要把业务流程转化为数字形式数字化digitalization再对其应用数据科学技术驱动决策、甚至改变业务方向数字化转型digital transformation。在作业的场景描述里点明该流程中哪些环节目前还是纸面/人工的需要先数字化会让你的方案更贴合数据科学的真实落地逻辑。此外仓库为每个主要板块都提供了配套的练习数据集与 Notebook完成作业后可以挑选一个场景实际动手例如用 04-stats-and-probability 的统计方法检验你设想中的相关性或用 3-Data-Visualization 的图表验证你的洞察假设。这样就从纸上推演跨入了真实数据科学流程与第一课的挑战环节用 notebook.ipynb 处理维基百科文本生成词云形成闭环。六、总结完成本作业的行动清单为每个领域写清楚四问答案至少覆盖教育、疫苗接种、生产力 3 个领域或用自选领域替换每一问都落到具体数据要能说出哪张表、哪些列存储要指定关系型 / NoSQL / 数据湖并估算规模决策要具体到据此做什么行动用本文 3.4 节的表格组织答案逐格检查是否填满对照评分表自我评分存储是否讨论、领域是否 ≥2、洞察是否可行动有余力时把方案中的关键假设与仓库 data 目录 的真实数据集如 COVID 时序数据、honey.csv、birds.csv对照验证你的数据模型设想是否成立。完成这份作业你就完成了数据科学学习的第一步在写第一行代码之前学会用数据的眼光重新审视世界上的问题。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考