原标题:产品经理AI指北(一):企业AI产品经理采购指南

   
前段时间学习完了python,再加上最近需要找工作,决定爬取招聘网站(本文以拉勾网为抓取对象),通过建立相关数据模型,分析产品经理相关要求和职责,指导简历制作及今后产品努力的方向。

文章通过教学爬取招聘数据的方式,详细剖析了当今AI产品经理的岗位需求和企业招聘情况。

(1)确定目标

澳门新葡亰平台游戏 1

   
 本文以拉勾网作为抓取对象,主要在于拉勾网是互联网求职者的一个重要渠道,分析拉勾网具有一定参考意义。

商业情报领域,有一个被称为奥地利学派的理论,他们主要关注不能量化的信息,而非公式化的信息,认为这类信息才是高利润的来源,并且指出商业情报工作的重点,应该是不能用数据或统计分析方法解决的问题。

(2)获取数据

我个人其实很欣赏这个理论,如果能够通过数据的统计分析能够发现需求的话,那么产品经理的价值和意义怎么去体现,产品经理真正的价值应该是体现在:用数据和统计分析方法无法直观体现和挖掘需求的数据上。

澳门新葡亰平台游戏,   
 确定好目标好,下一步就到了获取数据源步骤。获取数据源是数据分析的前提和基础。获取数据源主要有五种常见的方式:

John:

好久不见,我是Kevin。近期也想从产品经理转行成为一名AI产品经理,我需要做什么样的准备呢?

Kevin

2018年9月8日

1.互联网公开数据

Kevin:

   
 互联网公开数据主要通过搜索获取,例如,想要获取2016收集销量排行数据,可通过输入相关关键词获取相应结果,图1
2016年收集销量排行榜,输入“手机销量排行榜2016”,得出有关销售量结果。

已经收到你的来信,的确好久不见!既然你想成为一名AI产品经理,那我今天先给你说一下企业对于AI产品经理有怎样的要求吧?

澳门新葡亰平台游戏 2

一、爬取招聘数据

图1 2016年收集销量排行榜

我们从拉勾上爬取有关AI产品经理的招聘数据:

     
当然,直接通过搜索引擎获取结果是一件比较幸运的事,不过,在获取数据时,一般不会直接获取到想要的数据。除了互联网公开数据外,本地数据也是一个重要数据来源渠道。

澳门新葡亰平台游戏 3

2.本地数据

完整的代码下载地址:

   
 本地数据主要指存储在本地电脑、网盘等载体内的数据,以PDF、Word、Excel及CSV为主。例如,图2
快消品行业分析报告,收集了快消品在营销、趋势等方面的数据。

链接: 密码:b5dz

澳门新葡亰平台游戏 4

在范冰的《增长黑客》一书中,提到增长黑客使用的各种方法,包括:A/B
测试、数据抓取、排队机制、提供有损服务等。由于今天我们的任务主要是基于数据分析的,我们就来简单的了解一下数据抓取。

 图2  快消品行业分析报告

作为产品经理、增长黑客、亦或AI产品经理,难免会在日常工作中需要使用和分析第三方的数据,比如百度API
Store,聚合数据等公开的第三方数据服务提供商,从事淘宝客产品的伙伴,可能需要分析淘宝的商品数据。

3.API数据

不管是哪一种类型的产品经理,遇到问题的第一时间,想到的并不是需要用写代码去解决问题(请记住我们是产品经理,我们不是负责开发的伙伴),而是利用现有的工具,数据的抓取工作也是同样的道理。现有的第三方工具,比如八爪鱼(

   
 API数据是一个重要的数据渠道,尤其随着互联网数据存储量越来越大以及众多网站开放了API接口,使得API接口数据成为重要形式。目前,有很多API数据应用市场,例如,百度API
store
,聚合数据等,整合各种类型API,用户可通过申请apikey,获取相关数据。例如,想要获取全国天气实时数据,可通过调用天气API,获取实时数据。图
3 全国天气数据接口,申请APIkey,导入相应库,获取数据。

如果现有第三方工具不能满足需要的情况,例如John的尴尬情况,因为八爪鱼只提供Windows的版本,我的Mac无法运行,所以我选了用Python编写爬虫。而产品经理涉及相关的爬虫工作,我们只需要了解基础的爬虫程序就可以了,如果要从事比较深入的工作,好吧你可以转行从事开发的工作了,少年!

澳门新葡亰平台游戏 5

我们先写一个最基本的爬虫小程序。

图 3 全国天气数据接口

工作:Python2.7

4.数据库数据

目的:第一个爬虫程序

   
数据库是存储数据的重要载体,目前,常用的数据库有mysql、sqlserver及oracle等,读取数据库数据需要sql语句。

澳门新葡亰平台游戏 6

5.爬虫数据

第一行代码是:

   
数据爬取是当前获取数据的一种重要方式,通过比如用爬虫工具爬取点评网站的商家评分、评价内容等,或是直接自己人肉收集(手工复制下来),亦或是找一个免费问卷网站做一份问卷然后散发给你身边的人,都是可以的。这种方式受限制较少,但工作量/实现难度相对较大。不过,爬虫数据需要具有一定的编程基础,当前在爬取数据方面常用的是python。本文爬取拉勾网也是采取python作为爬虫语言,下面,本文在获取数据时,采取数据抓取的方式,着重阐述如何爬取拉勾网相关数据的。

# -*- coding:UTF-8 -*-

爬取拉勾网:

如果我们是使用的Python工具,第一行代码一定先写下这句,这是为了使我们在编写代码时,能够使用中文的注释或者一些中文字符。

   
数据爬取,简单的说,就是利用python写一个定向爬虫脚本,抓取北京产品经理在工作年限、学历要求及行业领域等方面的数据,通过数据数据挖掘模型,分析各个维度下产品经理相关要求。如图4产品经理抓取界面

OK我们导入requests库,requests库的开发者为我们提供了详细的中文教程,查询起来很方便,万事请问度娘。如果我们需要使用Python进行网络请求,requests将是我们十分常用的库。

澳门新葡亰平台游戏 7

import requests

           图4 产品经理抓取界面

让我们看下requests.get()方法,它用于向服务器发起GET请求,不了解GET请求没有关系。我们可以这样理解:get的中文意思是得到、抓住,那这个requests.get()方法就是从服务器得到、抓住数据,也就是获取数据。我们就以百度为例:

   
 通过分析检查元素-network-doc-分析http请求方式(get\post)-分析网页div、css选择类之后,选择requests、BeautifulSoup、正在表达式等工具后,开始爬虫(此处省去爬虫具体分析及爬虫过程),爬虫结束后,将爬虫结果存入本地Excel(由于数据量较少,没有使用mysql)。如图
5  部分代码界面

if __name__ == ‘__main__’:

澳门新葡亰平台游戏 8

target = ‘

                                图5 爬虫结果界面

req = requests.get(url=target)

   
 获取数据后,将数据存储在EXcel中,此时数据较乱,会出现空值等情况,针对此情况,需要进行数据清洗的过程。

print(req.text)

(3)清洗数据

运行程序,我们看到以下结果:

     
爬虫获得的数据,90%以上的情况,你拿到的数据都需要先做清洗工作,排除异常值、空白值、无效值、重复值等等。这项工作经常会占到整个数据分析过程将近一半的时间。如果在上一步中,你的数据是通过手工复制/下载获取的,那么通常会比较干净,不需要做太多清洗工作。但如果数据是通过爬虫等方式得来,那么你需要进行清洗,提取核心内容,去掉网页代码、标点符号等无用内容。无论你采用哪一种方式获取数据,请记住,数据清洗永远是你必须要做的一项工作。通过对数据清洗后,下图6
数据清洗后的数据

澳门新葡亰平台游戏 9

澳门新葡亰平台游戏 10

我们已经完成了我们的第一个小程序。大家可以把链接换成其他的链接,尝试一下爬取我们感兴趣的内容。

图 6 清洗后数据

再者,我们来说一下比较深入一点的爬虫抓取工程,通常思路:

(4)整理数据及分析

  1. 找到我们目标数据的API;
  2. Python模拟GET请求获取数据;
  3. 保存数据,等待我们去揭开他的神秘面纱。

   
 清洗过后,需要进行数据整理,即将数据整理为能够进行下一步分析的格式,由于数据量较少,并没有采用Spss,而是Excel。整理完相关数据后,确定分析的维度及指标,一般计算一些二级指标就可以,例如,通过计算手机销售量同比、环比等增长率。如果你收集的是一些非数字的数据,比如对商家的点评,那么你进行下一步统计之前,需要通过“关键词-标签”方式,将句子转化为标签,再对标签进行统计。当然,非数字的数据,还通常用分词统计,例如,岗位要求可以采用sae分词统计及关键词抽离等方式,抽离出关键标签及统计。

我们以本次爬取拉勾的招聘数据为例,笔者首先找到招聘数据的API:

(5)结      论

澳门新葡亰平台游戏 11

   
做完以上工作后,下一步对数据分析并制作数据报表。主要涉及到工资分配表,图7
工资分配表、图8工作经验表、图9公司简介表、图10岗位要求表

具体的实现过程,可以从百度网盘中下载源码。

澳门新葡亰平台游戏 12

程序运行完之后,数据如下图所示:

图7 工资分配表

二、数据分析及理解

澳门新葡亰平台游戏 13

我们开始对获取到的数据进行分析和理解:

图 8-1工作经验表

链接: 密码:b5dz

澳门新葡亰平台游戏 14

给大家分享一个模板,我们基础的数据分析和理解工作,也可以参考该模板:

图 8-2工作经验表(年限)

# 1. 准备

澳门新葡亰平台游戏 15

  1. # a) 导入类库
  2. # b) 导入数据集
  3. # c) 初步描述性统计

图8-3工作经验表(学历)

# 2. 预处理数据

澳门新葡亰平台游戏 16

  1. # a) 数据清洗
  2. # b) 特征选择
  3. # c) 数据转换

图9公司简介表

# 3. 概述数据

澳门新葡亰平台游戏 17

  1. # a) 描述性统计
  2. # b) 数据可视化

图10岗位要求表

2.1 导入数据

     通过图7
工资分配表可知,北京地区产品经理主要集中在10K-20K之间(此次没有对各个区间合并),工作经验主要要求在1-3年及3-5年两个区间,学历以最低本科学历为主,公司方面,以不需要融资、A轮及上市公司为主,通过岗位要求关键词提炼,工具技能(axure、visio等)为基本要求,除了基本的需求分析、产品流程外,数据分析技术能力、市场能力也是一些比较看重的。(注:时间较仓促,分析的维度及采集数据较少)

通过Pandas导入CSV文件,CSV 文件是用逗号(,)分隔的文本文件。

   
作者简介:励秣,某公司产品经理,目前正在寻找后台或数据产品,希望有坑者“收留”,微信:15005417866。13年,985本科毕业,毕业前有近两年开发实践工作,擅长java、python,毕业后,在某知名在线租房公司一年产品运营工作,转产品近3年,且以后台为主,涉及到一些数据相关设计,希望大家帮忙推荐。

相关文章