[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事


[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事
文章图片
[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事
文章图片
[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事
文章图片
[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事
文章图片
[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事
文章图片
[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事
文章图片
[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事
一次完整的python分析+可视化展示 , 是什么样的?

比如我想知道知乎用户的学历 , 是否都是985呢?我还想知道知乎最受关注的话题都是些什么?高端人士都喜欢看什么书呢?“人在XX , 刚下飞机?”这句话出现的频率有多高呢?
最快的方法是用python爬虫然后加BI可视化分析!python爬虫仅需几步就可以完成:
  • 找到网页URL , 查看HTML代码
  • 在HTML代码中找到你要提取的数据
  • 写python进行网页请求和解析
  • 存储数据 , Excel导出

于是我使用10000秒的时间写了5000行代码 , 爬取了知乎下5646个话题与回答 , 10W+用户 , 和我预想的结果完全不一样 。
我们先放一部分代码 , 完整的可以到文末看评论~
最后爬取了大概快60W的数据 , 我们接下来要对它进行数字可视化的分析 。
我们想通过数据知道什么?
  • 知乎人均985吗?
  • 知乎最受关注的话题是哪些?这些话题的关系图谱是怎么样的?
  • 知乎大佬最推荐的书是哪些?
  • 知乎的娱乐栏目最受关注的都是哪些?
在分析之前 , 我们得挑选一个数据可视化工具 , 有人会问:为什么不用python呢?因为python处理数据或许很不错 , 但其实它并不简单 , 分析起来是很困难的 , SQL语句、Pandas和Matplotlib这些十分繁琐 , 一般人也不会 。
所以我想到既然有现成数据的话 , 那选择一个可以直接连接数据源的工具就更好了 , 我想到了BI里的佼佼者FineBI , 轻便敏捷的数据分析能力 , 浏览器里就可以直接操作 , 而且对于大数据量可以及时响应 , 直接拖拽即可生成可视化 。
虽然主打的是企业级的数据分析工具 , 但是个人也是可以用的 , 而且是free的 , 功能并不会减少 , 可谓良心 。 很多企业依然有各种各样的数据问题:IT-业务沟通困难 , 领导决策缺乏数据支撑....
FineBI从IT、业务、管理层三个方面去解决问题:
【[知乎]5000行python代码+可视化60W数据,告诉你知乎用户不为人知的事】
通过自助数据集功能 , 普通业务人员就能对数据做筛选、切割、排序、汇总等 , 自助灵活地达成期望的数据结果 。
BI工具就介绍到这里 , 接下来我们看知乎的可视化分析 , 以下都是由FineBI所作 。