阿里云工程师用机器学习破解雾霾成因

2016-12-30 19:12:00 作者:王婷婷 分类 : 比特网

  日前,一位署名为“傲海”的阿里云工程师在云栖社区发布了一篇分析北京雾霾成因的文章。作者通过机器学习算法分析发现,北京重度雾霾天的出现同大气中二氧化氮的含量存在强相关性。

  人们很早就知道硫酸盐是雾霾形成的重要原因。住宅及发电厂的燃煤释放大量二氧化硫,随后转化为硫酸颗粒造成污染。但困扰科学家的是,二氧化硫究竟是如何转化成硫酸的?

  阿里云工程师的发现回答了这个问题,同是也从另一个角度佐证了最近中德两国研究人员一份研究成果:大气细颗粒物吸附的水分中二氧化氮与二氧化硫的化学反应是当前雾霾中硫酸盐的主要生成路径。该成果通过分析清华大学楼顶气溶胶成分得出。

  文章中,工程师采集了公开的2016年全年北京天气数据,包含天、小时、PM2.5、PM10、二氧化硫、一氧化碳、二氧化氮等数字。利用阿里云机器学习平台,通过随机森林、逻辑回归等算法寻找雾霾同某一项指标的相关性。

  记者通过邮件联系到了文章作者傲海。傲海介绍,他本人就在北京工作,同样深受雾霾困扰。因为自己是从事机器学习相关的工作,所以就想能否通过政府的公开数据做一些分析。“对抗雾霾,我们每个人都可以做出贡献”。

  据了解,二氧化氮主要来自发电厂及汽车尾气。由此来看,限行政策将可缓解空气雾霾。

  附工程师分析全文:

  本次实验在阿里云机器学习平台上完成

  https://data.aliyun.com/product/learn

  数据源:采集了2016全年的北京天气指标。

  采集的是从2016年1月1号以来每个小时的空气指标。

  具体字段如下表:

  字段名含义类型

  time日期,精确到天string

  hour表示的是时间,第几小时的数据string

  pm2pm2.5的指标string

  pm10pm10的指标string

  so2二氧化硫的指标string

  co一氧化碳的指标string

  no2二氧化氮的指标string

  一、数据探索流程

  阿里云机器学习平台采用拖拉算法组件拼接实验的操作方式,先来看下整个实验流程:

说明: https://zos.alipayobjects.com/rmsportal/VnKWgyKMbHpLGKBIdMmp.png

  我们把整个实验拆解成四个部分,分别是数据导入及预处理、统计分析、随机森林预测及分析、逻辑回归预测及分析。下面我们分别介绍一下这四个模块的逻辑。

  1.数据导入及预处理

  (1)数据导入

  在“数据源”中选择“新建表”,可以把本地txt文件上传。

说明: https://zos.alipayobjects.com/rmsportal/vPSKQgoyndSAiWFZilDn.png

  数据导入后查看:

说明: https://zos.alipayobjects.com/rmsportal/EtcwnOkkjqHNQKBOXFDM.png

  (2)数据预处理

  通过类型转换把string型的数据转double。把pm2这一列作为目标列,数值超过200的情况作为重度雾霾天气打标为1,低于200标为0,实现的SQL语句如下。

  select time,hour,(case when pm2>200 then 1 else 0 end),pm10,so2,co,no2 from ${t1};

  (3)归一化

  归一化主要是去除量纲的作用,把不同指标的污染物单位统一。

说明: https://zos.alipayobjects.com/rmsportal/gqHInWZldQUpdqXtQPjS.png

  二、统计分析

  我们在统计分析的模块用了两个组件:

  (1)直方图

  通过直方图可以可视化的查看不同数据在不同区间下的分布。通过这组数据的可视化展现,我们可以了解到每一个字段数据的分布情况,以PM2.5为例,数值区间出现最多的是11.74~15.61,一共出现了430次。

说明: https://zos.alipayobjects.com/rmsportal/PhTTPoOlOHBrVbLyLziX.png

  (2)数据视图

  通过数据视图可以查看不同指标的不同区间对于结果的影响。

说明: https://zos.alipayobjects.com/rmsportal/jNkIhAkjIrGDsJZnXrXY.png

  以no2为例,在112.33~113.9这个区间产生了7个目标列为0的目标,产生了9个目标列为1的目标。也就是说当no2为112.33~113.9区间的情况下,出现重度雾霾的天气的概率是非常大的。熵和基尼系数是表示这个特征区间对于目标值的影响,数值越大影响越大,这个是从信息量层面的影响。

  3.随机森林预测及分析

  本案其实是采用了两种不同的算法对于结果进行预测,我们先来看看随机森林这一分支。我们通过将数据集拆分,百分之八十的数据训练模型,百分之二十的数据预测。最终模型的呈现可以可视化的显示出来,在左边模型菜单下查看,随机森林是树状模型。

说明: https://zos.alipayobjects.com/rmsportal/niUhqLDkXzrdXBmGogUs.png

  通过这个模型预测结果的准确率:

说明: https://zos.alipayobjects.com/rmsportal/nDNoGHbcYIgvxUVmlIUy.png

  我们看到AUC是0.99,也就是说如果我们有了本文用到的天气指标数据,就可以预测天气是否雾霾,而且准确率可以达到百分之九十以上。

  4.逻辑回归预测及分析

  再来看下逻辑回归这一分支的预测模型,逻辑回归是线性模型:

说明: https://zos.alipayobjects.com/rmsportal/MIuCGzySztAozABIuyOq.png

  模型预测准确率:

说明: https://zos.alipayobjects.com/rmsportal/hnEjbvyjjhgqubVawkZr.png

  逻辑回归的AUC为0.98,比用随机森林计算得到的结果略低一点。如果排除调参对于结果的影响因素,可以说明针对这个数据集,随机森林的训练效果会更好一点。

  三、结果评估

  上面介绍了如何通过搭建实验来搭建针对PM2.5的预测流程,准确率达到百分之九十以上。下面我们来分析一下哪种空气指标对于PM2.5影响最大,首先来看下逻辑回归的生成模型:

说明: https://zos.alipayobjects.com/rmsportal/MIuCGzySztAozABIuyOq.png

  因为经过归一化计算的逻辑回归算法有这样的特点,模型系数越大表示对于结果的影响越大,系数符号为正号表示正相关,负号表示负相关。我们看一下正号系数里pm10和no2最大。pm10和pm2只是颗粒尺寸大小不同,是一个包含关系,这里不考虑。剩下的no2(二氧化氮)对于pm2.5的影响最大。我们只要查阅一下相关文档,了解下哪些因素会造成no2的大量排放即可找出影响pm2.5的主要因素。

  下面网上是找到的关于no2排放的论述,文中说明了no2主要来自电厂和汽车尾气。《减少二氧化氮与氨或是抑制中国雾霾形成的关键》

* 本文为ChinaByte比特网原创内容,版权所有,转载请注明出处和原文链接,未经授权请勿用于商业用途。

最近更新
科普

科普图集
带着朋友和机器人上月亮散步

带着朋友和机器人上月亮散步>>详情

邮件订阅

软件信息化周刊
比特软件信息化周刊提供以数据库、操作系统和管理软件为重点的全面软件信息化产业热点、应用方案推荐、实用技巧分享等。以最新的软件资讯,最新的软件技巧,最新的软件与服务业内动态来为IT用户找到软捷径。
商务办公周刊
比特商务周刊是一个及行业资讯、深度分析、企业导购等为一体的综合性周刊。其中,与中国计量科学研究院合力打造的比特实验室可以为商业用户提供最权威的采购指南。是企业用户不可缺少的智选周刊!
网络周刊
比特网络周刊向企业网管员以及网络技术和产品使用者提供关于网络产业动态、技术热点、组网、建网、网络管理、网络运维等最新技术和实用技巧,帮助网管答疑解惑,成为网管好帮手。
服务器周刊
比特服务器周刊作为比特网的重点频道之一,主要关注x86服务器,RISC架构服务器以及高性能计算机行业的产品及发展动态。通过最独到的编辑观点和业界动态分析,让您第一时间了解服务器行业的趋势。
存储周刊
比特存储周刊长期以来,为读者提供企业存储领域高质量的原创内容,及时、全面的资讯、技术、方案以及案例文章,力求成为业界领先的存储媒体。比特存储周刊始终致力于用户的企业信息化建设、存储业务、数据保护与容灾构建以及数据管理部署等方面服务。
安全周刊
比特安全周刊通过专业的信息安全内容建设,为企业级用户打造最具商业价值的信息沟通平台,并为安全厂商提供多层面、多维度的媒体宣传手段。与其他同类网站信息安全内容相比,比特安全周刊运作模式更加独立,对信息安全界的动态新闻更新更快。
新闻中心热点推荐
新闻中心以独特视角精选一周内最具影响力的行业重大事件或圈内精彩故事,为企业级用户打造重点突出,可读性强,商业价值高的信息共享平台;同时为互联网、IT业界及通信厂商提供一条精准快捷,渗透力强,覆盖面广的媒体传播途径。
云计算周刊
比特云计算周刊关注云计算产业热点技术应用与趋势发展,全方位报道云计算领域最新动态。为用户与企业架设起沟通交流平台。包括IaaS、PaaS、SaaS各种不同的服务类型以及相关的安全与管理内容介绍。
CIO俱乐部周刊
比特CIO俱乐部周刊以大量高端CIO沙龙或专题研讨会以及对明星CIO的深入采访为依托,汇聚中国500强CIO的集体智慧。旨为中国杰出的CIO提供一个良好的互融互通 、促进交流的平台,并持续提供丰富的资讯和服务,探讨信息化建设,推动中国信息化发展引领CIO未来职业发展。
IT专家网
IT专家新闻邮件长期以来,以定向、分众、整合的商业模式,为企业IT专业人士以及IT系统采购决策者提供高质量的原创内容,包括IT新闻、评论、专家答疑、技巧和白皮书。此外,IT专家网还为读者提供包括咨询、社区、论坛、线下会议、读者沙龙等多种服务。
X周刊
X周刊是一份IT人的技术娱乐周刊,给用户实时传递I最新T资讯、IT段子、技术技巧、畅销书籍,同时用户还能参与我们推荐的互动游戏,给广大的IT技术人士忙碌工作之余带来轻松休闲一刻。