怎么用Python电商车厘子销售数据
发表于:2025-12-02 作者:千家信息网编辑
千家信息网最后更新 2025年12月02日,这篇文章主要讲解了"怎么用Python电商车厘子销售数据",文中的讲解内容简单清晰,易于学习与理解,下面请大家跟着小编的思路慢慢深入,一起来研究和学习"怎么用Python电商车厘子销售数据"吧!01
千家信息网最后更新 2025年12月02日怎么用Python电商车厘子销售数据
这篇文章主要讲解了"怎么用Python电商车厘子销售数据",文中的讲解内容简单清晰,易于学习与理解,下面请大家跟着小编的思路慢慢深入,一起来研究和学习"怎么用Python电商车厘子销售数据"吧!
01 数据获取
本文利用Python采集了淘宝网1585个商家车厘子销售数据,获取到车厘子的商品名称、商品价格、付款人数、店铺名称、发货地址等字段。限于篇幅,爬虫代码仅给出主函数:
def main:browser.get('https://www.taobao.com/')page = search_product(key_word)print(page)get_datapage_num = 70while int(page) != page_num:print("-" * 100)print("正在爬取第{}页数据".format(page_num + 1))browser.get('https://s.taobao.com/search?q={}&s={}'.format(key_word, page_num*44))browser.implicitly_wait(10)get_datapage_num += 1print("数据抓取完成")if __name__ == '__main__':key_word = "车厘子"browser = webdriver.Chrome("./chromedriver")main02 数据处理
1.数据读取并预览
import pandas as pdimport numpy as npdf = pd.read_csv('/菜J学Python/淘宝/车厘子.csv',header=None,names=['商品名称','商品价格','付款人数','店铺名称','发货地址']) #添加字段名称df.sample(5)
2.查看数据信息
df.info
Int64Index: 1595 entries, 0 to 1674Data columns (total 5 columns):# Column Non- Count Dtype--- ------ -------------- -----0 商品名称 1595 non- object1 商品价格 1595 non- float642 付款人数 1595 non- object3 店铺名称 1595 non- object4 发货地址 1585 non- objectdtypes: float64(1), object(4)memory usage: 74.8+ KB
发现数据存在以下几个问题:
(1)发货地址有缺失值
(2)付款人数需做提取
(3)发货地址需做分割
(4)自定义索引并降序
3.数据清洗
#剔除缺失记录df.dropna(axis=0, how='any', inplace=True)#从发货地址字段中切分出省份和城市df["省份"] = df["发货地址"].str.split(' ',expand=True)[0] #expand=True可以把用分割的内容直接分列df["城市"] = df["发货地址"].str.split(' ',expand=True)[1] #提取城市df["城市"].fillna(df["省份"], inplace=True) #城市字段空值用省份非空值填充#用正则表达式从付款人数中提取数字import redf['数字'] = [re.findall(r'(\d+\.{0,1}\d*)', i)[0] for i in df['付款人数']] # 提取数值df['数字'] = df['数字'].astype('float') # 转化数值型df['单位'] = [''.join(re.findall(r'(万)', i)) for i in df['付款人数']] # 提取单位(万)df['单位'] = df['单位'].apply(lambda x:10000 if x=='万' else 1)df['付款人数'] = df['数字'] * df['单位'] # 计算付款人数df.drop(['发货地址', '数字', '单位'], axis=1, inplace=True) # 删除多余的列#按商品价格降序并重置索引df = df.sort_values(by="商品价格", axis=0, ascending=False) #降序df = df.reset_index(drop=True) #重置索引清洗后,数据预览如下:
感谢各位的阅读,以上就是"怎么用Python电商车厘子销售数据"的内容了,经过本文的学习后,相信大家对怎么用Python电商车厘子销售数据这一问题有了更深刻的体会,具体使用情况还需要大家实践验证。这里是,小编将为大家推送更多相关知识点的文章,欢迎关注!
数据
人数
地址
商品
名称
单位
数字
销售
价格
商品价格
城市
电商
字段
省份
内容
店铺
索引
学习
数值
缺失
数据库的安全要保护哪些东西
数据库安全各自的含义是什么
生产安全数据库录入
数据库的安全性及管理
数据库安全策略包含哪些
海淀数据库安全审计系统
建立农村房屋安全信息数据库
易用的数据库客户端支持安全管理
连接数据库失败ssl安全错误
数据库的锁怎样保障安全
天际通数据库
捕鱼游戏软件开发
服务器源库
更改数据库时间为当前时间
畅春园租房软件开发
linux自动备份数据库
在数据库的设计视图
高淳软件开发商
华为泰山服务器bmc管理口
网络安全建设 意义
配置web服务器dns主机
陕西有网络安全专业的学校
服务器硬盘要求
餐饮软件数据库怎么发
网络安全的简单论文
asp修改数据库名称和列名
蜜罐网络安全
深圳市互联网教育科技
学堂在线网络技术与应用
Mysql数据库教科书
软件开发单一来源采购条件
南安普顿网络安全专业
计算机软件开发 技术转让
天涯明月刀美脸男数据库
美国网络安全厂商
天津pdu服务器电源都有哪些
任务发布 数据库设计实例
自制电磨hp服务器风扇电机
哪个数据库没有关键词
江西企业软件开发销售价格