ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Python 宏观经济实证 · 数据清洗 (2)

Python 宏观经济实证 · 数据清洗 (2) 接上一篇《Python 宏观经济实证 · 数据清洗 (1)》本篇承接上一篇数据清洗内容:(1) 通过 Excel 操作与 Python 代码两种方式,对补全后的完整数据进行四则运算,生成匹配研究维度的初始指标;(2) 对规整的初始指标数据集进行标准化/归一化处理,最终得到可用于后续研究的“标准数据”。“数据清洗”部分完整源码 .ipynb 文件(包括:缺失值处理、特征工程、标准化 / 归一化)已在资源处挂载,需要的朋友可自行下载。四、四则运算补全得到完整数据后,我们需要按照公式生成能够衡量 Economy_1 的初始指标。原始数据有些可以直接使用,有些需要经过四则运算才能匹配衡量维度。比如:RD经费投入(可以直接使用),移动基站覆盖率 = 移动基站个数 ➗ 行政区域土地面积(需要进行四则运算)。那么,就介绍两种比较常用的方法:1. Excel 表格计算 步骤一:打开需要处理的表格; 步骤二:点击结果存储所在列的单元格(紧接着用于记录指标名称的第一行); 步骤三:点击函数框,通过鼠标点击单元格、键盘输入运算符号的方式计算出一个数据;步骤四:鼠标移到刚刚计算出数据的单元格右下角,标识变 “十” 字的时候下拉,直到本列数据末尾,这样就能够将公式应用到下拉范围内的所有单元格中,得出相应的计算结果; 步骤五:对计算好的列复制(Ctrl + C)→ 点击需要粘贴到的列 → 右键 → 点击 “粘贴为数值”,这样就不会受公式中对应单元格数据变动影响(因为源数据处理完,在 “初始指标” 表格中要删除); 步骤六:
返回列表