Python怎么采集淘宝车厘子数据
发表于:2025-12-01 作者:千家信息网编辑
千家信息网最后更新 2025年12月01日,这篇文章主要介绍"Python怎么采集淘宝车厘子数据",在日常操作中,相信很多人在Python怎么采集淘宝车厘子数据问题上存在疑惑,小编查阅了各式资料,整理出简单好用的操作方法,希望对大家解答"Pyt
千家信息网最后更新 2025年12月01日Python怎么采集淘宝车厘子数据
这篇文章主要介绍"Python怎么采集淘宝车厘子数据",在日常操作中,相信很多人在Python怎么采集淘宝车厘子数据问题上存在疑惑,小编查阅了各式资料,整理出简单好用的操作方法,希望对大家解答"Python怎么采集淘宝车厘子数据"的疑惑有所帮助!接下来,请跟着小编一起来学习吧!
数据获取
本文利用Python采集了淘宝网1585个商家车厘子销售数据,获取到车厘子的商品名称、商品价格、付款人数、店铺名称、发货地址等字段。限于篇幅,爬虫代码仅给出主函数:
def main(): browser.get('https://www.taobao.com/') page = search_product(key_word) print(page) get_data() page_num = 70 while int(page) != page_num: print("-" * 100) print("正在爬取第{}页数据".format(page_num + 1)) browser.get('https://s.taobao.com/search?q={}&s={}'.format(key_word, page_num*44)) browser.implicitly_wait(10) get_data() page_num += 1 print("数据抓取完成")if __name__ == '__main__': key_word = "车厘子" browser = webdriver.Chrome("./chromedriver") main()数据处理
数据读取并预览
df.info()Int64Index: 1595 entries, 0 to 1674Data columns (total 5 columns): # Column Non-Null Count Dtype--- ------ -------------- ----- 0 商品名称 1595 non-null object 1 商品价格 1595 non-null float64 2 付款人数 1595 non-null object 3 店铺名称 1595 non-null object 4 发货地址 1585 non-null objectdtypes: float64(1), object(4)memory usage: 74.8+ KB
查看数据信息
df.info()Int64Index: 1595 entries, 0 to 1674Data columns (total 5 columns): # Column Non-Null Count Dtype--- ------ -------------- ----- 0 商品名称 1595 non-null object 1 商品价格 1595 non-null float64 2 付款人数 1595 non-null object 3 店铺名称 1595 non-null object 4 发货地址 1585 non-null objectdtypes: float64(1), object(4)memory usage: 74.8+ KB
发现数据存在以下几个问题:
(1)发货地址有缺失值
(2)付款人数需做提取
(3)发货地址需做分割
(4)自定义索引并降序
数据清洗
#剔除缺失记录df.dropna(axis=0, how='any', inplace=True)#从发货地址字段中切分出省份和城市df["省份"] = df["发货地址"].str.split(' ',expand=True)[0] #expand=True可以把用分割的内容直接分列df["城市"] = df["发货地址"].str.split(' ',expand=True)[1] #提取城市df["城市"].fillna(df["省份"], inplace=True) #城市字段空值用省份非空值填充#用正则表达式从付款人数中提取数字import redf['数字'] = [re.findall(r'(\d+\.{0,1}\d*)', i)[0] for i in df['付款人数']] # 提取数值df['数字'] = df['数字'].astype('float') # 转化数值型df['单位'] = [''.join(re.findall(r'(万)', i)) for i in df['付款人数']] # 提取单位(万)df['单位'] = df['单位'].apply(lambda x:10000 if x=='万' else 1)df['付款人数'] = df['数字'] * df['单位'] # 计算付款人数df.drop(['发货地址', '数字', '单位'], axis=1, inplace=True) # 删除多余的列#按商品价格降序并重置索引df = df.sort_values(by="商品价格", axis=0, ascending=False) #降序df = df.reset_index(drop=True) #重置索引清洗后,数据预览如下:
到此,关于"Python怎么采集淘宝车厘子数据"的学习就结束了,希望能够解决大家的疑惑。理论与实践的搭配能更好的帮助大家学习,快去试试吧!若想继续学习更多相关知识,请继续关注网站,小编会继续努力为大家带来更多实用的文章!
数据
人数
地址
商品
单位
名称
数字
价格
商品价格
城市
宝车
省份
学习
字段
店铺
索引
数值
更多
缺失
帮助
数据库的安全要保护哪些东西
数据库安全各自的含义是什么
生产安全数据库录入
数据库的安全性及管理
数据库安全策略包含哪些
海淀数据库安全审计系统
建立农村房屋安全信息数据库
易用的数据库客户端支持安全管理
连接数据库失败ssl安全错误
数据库的锁怎样保障安全
怎么向服务器发送数
服务器200m多少钱
网络安全宣传周手抄报时代少年团
csgo查服务器地区
网络安全协会张健
中小学生网络安全签名
莱芜供暖站自动化控制软件开发
数据库的主要作用
湖州java软件开发设计
未来教育数据库下载地址
软件开发甲方不满意
成年人网络安全问题
聊城软件开发平台
服务器搭建云点播
互联网科技和文创
c#注册的代码不连接数据库
数据库应用技术网课答案
软件开发有什么进项
加强网络安全应急队伍建设
共享影视库服务器
聊天数据库好友关系
网络安全绘画的说明
普陀区口碑好的软件开发平均价格
请求服务器接口报错
超算中心什么数据库
免费 日志服务器
H3C网络安全工程商
手机服务器管理软件
lol各个服务器版本更新速度
江苏智能化软件开发方法