
Data-Science-For-Beginners 数据集分类实战结构化、数值类型与数据源识别全解析【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners导读本篇文章以 Data-Science-For-Beginners 课程第 3 课Defining Data的课后作业 Classifying Datasets 为核心系统讲解数据科学家最基础也最关键的技能——对数据进行分类。文中将围绕结构类型Structured / Semi-Structured / Unstructured、数值类型Qualitative / Quantitative、来源类型Primary / Secondary三条分类轴展开逐题拆解 5 个真实场景作业并结合本仓库中的实际数据文件与课程原文帮助你掌握一套可复用的数据分类判断框架完成作业的同时建立对数据本质的认知。一、作业背景为什么数据科学家要先学会分类数据在数据科学工作流中拿到数据的第一步往往不是建模而是搞清楚你手里到底是什么样的数据。正如课程 Defining Data 所定义的数据是用于发现规律、支撑决策的事实、信息、观测与测量结果单个数据单元称为数据点data point数据点的集合构成数据集dataset。数据集可能以不同格式和结构存在且通常取决于其来源。本作业正是对这一知识点的巩固通过 5 个贴近现实的场景练习从三个维度对数据分类分类轴类别判断核心问题结构类型结构化 / 半结构化 / 非结构化数据是否以行与列组织是否遵循固定格式与规则数值类型定性 / 定量数据能否被客观测量并用于数学运算来源类型主要 / 次要数据是使用者自己生成的还是来自他人为通用目的收集的数据作业的评分标准assignment.md 中的 Rubric非常清晰正确识别全部 5 个场景的结构、数值、来源类型即为Exemplary典范识别正确 3 个为Adequate合格2 个及以下为Needs Improvement需改进。下面我们先用课程原文把三个分类轴讲透再逐题给出判断思路与参考答案。二、分类轴一结构类型结构化 / 半结构化 / 非结构化课程的 Defining Data 一课把数据的组织形式归纳为三种结构这是本作业中每题第一个要回答的问题。2.1 结构化数据Structured Data结构化数据被组织为行与列的格式每一行拥有相同的一组列列代表某一特定类型的取值并以描述该值的名称标识行则存放实际数值。列通常带有一组特定的规则或限制以保证取值准确——例如客户表格中的电话号码列可以设置规则确保它永不为空、只含数字、不含字母。结构化数据的优点是可以按特定方式组织从而与其他结构化数据建立关联这正是关系型数据库的基础缺点是因为设计上要求高度规整改动整体结构成本很高——例如给客户表新增一个不能为空的邮箱列就必须为数据集中的每一行现有客户补上邮箱值。课程给出的典型示例包括电子表格spreadsheets、关系型数据库relational databases、电话号码、银行对账单。仓库中 data/form.csv 这类 CSV 表格文件即典型代表——表头birth_month,state,pet定义了列名每一行数据遵循相同的列结构。2.2 非结构化数据Unstructured Data非结构化数据通常无法归入行或列也不包含固定格式或规则。由于结构限制更少新增信息比结构化数据更容易——课程举例一个每 2 分钟采集一次气压的传感器如果升级为可同时记录温度在非结构化数据中无需改动既有数据即可追加。但相应地分析与排查这类数据会更耗时——例如科学家想从传感器数据中求上个月平均温度却发现部分记录中传感器用字母 e 标记故障而非常规数字导致数据不完整。典型示例文本文件text files、短信text messages、视频文件video files。此外图片、音频文件也属于此类。2.3 半结构化数据Semi-Structured Data半结构化数据兼具结构化与非结构化的特征它通常不遵循行与列的格式但以被视为有组织的方式存储可能遵循固定格式或规则。结构因来源而异——可能是清晰的层级结构也可能更灵活、便于融入新信息。描述这类数据组织方式的是元数据Metadata它根据数据类型有不同的名称常见的有标签tags、元素elements、实体entities、属性attributes。课程的经典例子是电子邮件一封邮件有主题subject、正文body和一组收件人recipients可以按谁发的、何时发的进行组织。典型示例还包括 HTML、CSV 文件、JSON。仓库中 2-Working-With-Data/06-non-relational/PersonsData.json 就是半结构化数据的直观样本它以firstname、age等键值对即元数据中的属性组织每条记录层次清晰但并非严格的二维行列表格。三、分类轴二数值类型定量 / 定性3.1 定量数据Quantitative Data定量数据是数据集中的数值观测通常可被分析、测量并用于数学运算。课程示例包括国家人口、人的身高、公司季度收益。经过进一步分析定量数据可以用于发现空气质量指数AQI的季节趋势或估算工作日高峰时段交通拥堵的概率。3.2 定性数据Qualitative Data定性数据又称类别数据 categorical data无法像定量观测那样被客观测量通常是捕捉某事物质量的各种主观数据格式例如产品或过程。课程特别强调一个易错点有时定性数据也表现为数值但通常不用于数学运算——比如电话号码、时间戳。定性数据的典型示例视频评论、汽车的品牌型号、你最好的朋友最喜欢的颜色。它可用于理解消费者更青睐哪些产品或识别求职简历中的热门关键词。关键判断技巧判断一个数值型字段是定量还是定性不取决于它是不是数字而取决于这个数字是否承载了可运算的量值意义——电话号码可以排序、但做加减法没有意义因此属于定性类别数据。四、分类轴三来源类型主要 / 次要数据源data source是数据最初生成或栖身的位置随数据的收集方式与时间而变化。主要数据Primary Data由数据使用者用户自己生成的数据。课程举例一群科学家在雨林中自行采集观测记录即为主要数据。次要数据Secondary Data来自某个为通用目的收集数据的来源。上述科学家若决定把数据分享给其他科学家那么对使用这批数据的后来者而言它就是次要数据。此外课程还梳理了常见数据源形态数据库是常见来源依赖数据库管理系统DBMS托管维护数据用户通过查询queries命令探索数据文件类数据源包括音频、图片、视频文件以及 Excel 等电子表格互联网是托管数据的常见位置API应用程序接口允许程序员创建通过互联网与外部用户共享数据的方式网页抓取web scraping则从网页中提取数据。这些数据源在课程 2-Working-With-Data 的后续章节关系型数据库、非关系型数据库、用 Python 处理数据、数据准备中有深入实战讲解。五、作业逐题解析与参考答案下面结合上述框架对作业的 5 个场景逐一分析。每个场景先给出判断理由再给出答案。场景 1被收购公司的客户电话号码电子表格一家公司被收购后有了母公司。数据科学家收到母公司提供的一份客户电话号码电子表格spreadsheet。结构类型结构化Structured。电子表格是课程明确列出的结构化数据示例行与列组织、每行拥有相同的列集合且电话号码列通常会施加仅含数字、不得为空等规则限制。数值类型定性Qualitative。电话号码虽然由数字构成但正如课程所强调的这类数值不会被用于数学运算——对电话号码求和或求平均毫无意义它是对客户身份的一种类别化描述。来源类型次要Secondary。这批数据并非数据科学家自己采集而是由母公司为自身业务目的收集后转交的属于他人为通用目的收集的数据因此对使用者而言是次要数据。场景 2智能手表的心率原始数据JSON一块智能手表持续采集佩戴者的心率数据原始数据以 JSON 格式存储。结构类型半结构化Semi-Structured。JSON 是课程列出的半结构化典型示例它不遵循二维行列表格式但通过键值对属性/实体这类元数据形成清晰、可解析的层次结构。仓库中的 PersonsData.json 正是这种以属性组织记录的形态。数值类型定量Quantitative。心率是典型的可测量、可数学处理的数值观测——可以计算均值、最高/最低心率识别异常波动这正是健康分析的核心输入。来源类型主要Primary。数据由智能手表的佩戴者使用者本人佩戴设备生成属于使用者自己产生的数据为原始raw状态、未经加工组织符合主要数据的定义。场景 3员工士气工作场所调查CSV一份存储在 CSV 文件中的员工士气工作场所调查。结构类型半结构化Semi-Structured。这是本作业最有迷惑性的一题。课程明确将CSV 文件列入半结构化数据示例——它虽有表格轮廓但对字段类型、取值规则、层级关系等约束远不如严格的关系型/电子表格结构化数据完整因此归为半结构化这一分类遵循课程 Defining Data 的原文界定。仓库中的 data/form.csv 可作为观察样本如birth_month,state,pet这样的列其取值自由度高、规则松散。数值类型定性Qualitative。员工士气调查本质上捕捉的是主观感受与态度如满意度评分、开放性问题回答无法被客观测量属于捕捉质量的主观数据。来源类型主要Primary。调查数据由雇主数据使用者面向本组织员工直接采集生成属于使用者自己生成的数据。场景 4太空探测器收集的星系数据库天体物理学家正在访问一个由太空探测器收集的星系数据库数据包含每个星系内的行星数量。结构类型结构化Structured。数据库是课程明确列出的结构化数据典型载体依赖数据库管理系统托管维护数据以严格的表结构行与列组织并施加字段约束。数值类型定量Quantitative。每个星系内的行星数量是标准的可计数、可数学运算的数值观测可用于统计分布、相关性分析等。来源类型次要Secondary。数据由太空探测器而非使用它的天体物理学家收集天体物理学家是访问者、使用者因此对他们而言这是次要数据。场景 5个人理财 App 的 API 交易数据一款个人理财应用使用 API 连接用户的金融账户以计算净资产用户可以以类似电子表格的行列格式查看全部交易。结构类型结构化Structured。虽然数据来自 API互联网数据源的一种但呈现给用户的形态是类似电子表格的行列格式符合结构化的判定标准。这也说明分类应基于数据最终的组织形态而非传输途径。数值类型定量Quantitative。交易金额、账户余额等是典型的可测量、可数学运算的数值计算净资产本身就是数学运算。来源类型主要Primary。数据源自用户本人的金融账户由用户的使用行为产生对用户而言属于自己生成的数据App 只是通过 API 将账户数据拉取并可视化。六、参考答案汇总表与自测场景结构类型数值类型来源类型1. 母公司客户电话号码电子表格结构化定性次要2. 智能手表心率 JSON 原始数据半结构化定量主要3. 员工士气调查 CSV半结构化定性主要4. 探测器收集的星系数据库结构化定量次要5. 理财 App 的 API 交易数据结构化定量主要对照评分标准assignment.md 的 Rubric若能独立完整地给出上述 5 组判断即达到Exemplary典范水平。建议先不看答案自行完成作业再用上表核对——重点复盘场景 3CSV 为何是半结构化与场景 1电话号码为何是定性这两个最易出错的判断点。七、拓展挑战用 Kaggle 数据集巩固分类技能完成本作业后课程还提供了一个延伸挑战Defining Data 的 Challenge 小节使用 Kaggle 的开放数据集搜索工具挑选 35 个感兴趣的数据集并回答两个问题数据是定量的还是定性的数据是结构化、非结构化还是半结构化的判断时可以运用本文的快速决策链先看组织形态定结构行列表 → 结构化JSON/HTML/CSV → 半结构化纯文本/音视频 → 非结构化再看数值是否承载量值意义定类型可测量可运算 → 定量类别/编号性数值 → 定性最后看生成主体定来源使用者自产 → 主要他人为通用目的收集 → 次要。把这套决策链内化后无论是后续课程中的关系型数据库05-relational-databases、非关系型数据库06-non-relational还是用 Python 处理数据07-python你都能在拿到数据的第一时间做出正确判断。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考