您好,登錄后才能下訂單哦!
這篇文章將為大家詳細(xì)講解有關(guān)怎樣用Python爬取京東的價(jià)格和標(biāo)題及評(píng)價(jià)等商品情況,文章內(nèi)容質(zhì)量較高,因此小編分享給大家做個(gè)參考,希望大家閱讀完這篇文章后對(duì)相關(guān)知識(shí)有一定的了解。
前言
代碼實(shí)現(xiàn)
import requests from lxml import etree import time import random import pandas as pd import json from sqlalchemy import create_engine from sqlalchemy.dialects.oracle import DATE,FLOAT,NUMBER,VARCHAR2 import cx_Oracle
先導(dǎo)入需要用的包
def create_table(table_name): conn = cx_Oracle.connect('user/password@IP:port/database') cursor = conn.cursor () create_shouji = ''' CREATE TABLE {}( 商品ID VARCHAR2(256), 價(jià)格 number(19,8), 店名 VARCHAR2(256) , 店屬性 VARCHAR2(256) , 標(biāo)題 VARCHAR2(256) , 評(píng)論 NUMBER(19), 優(yōu)評(píng)論 NUMBER(19) ) '''.format(table_name) cursor.execute(create_shouji) cursor.close() conn.close()
建表
def mapping_df_types(df_pro): dtypedict = {} for i, j in zip(df_pro.columns, df_pro.dtypes): if "object">
定義類(lèi)型的映射
def sava_oracle(df_pro): engine = create_engine('oracle://user:password@ip:port/database') dtypedict = mapping_df_types(df_pro) df_pro.to_sql("shouji",con=engine,index=False,if_exists='append',dtype=dtypedict)
定義請(qǐng)求頭和請(qǐng)求方法
headers={ 'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/83.0.4103.61 Safari/537.36 Edg/83.0.478.37' } def requesturl(url): session = requests.Session() rep = session.get(url,headers=headers) return rep
解析評(píng)論的url
def commreq(url_comm): dd_commt = pd.DataFrame(columns=['商品ID','評(píng)論','優(yōu)評(píng)論']) session = requests.Session() rep_comm = session.get(url_comm,headers=headers) comment = json.loads(rep_comm.text)['CommentsCount'] comment_list = [] for i in comment: comment_list.append({'商品ID':str(i['ProductId']),'評(píng)論':i['CommentCount'],'優(yōu)評(píng)論':i['GoodCount']}) dd_commt = dd_commt.append(comment_list) return dd_commt
主體解析
def parse(rep): df = pd.DataFrame(columns=['商品ID','價(jià)格','店名','店屬性','標(biāo)題']) html = etree.HTML(rep.text) all_pro = html.xpath("//ul[@class='gl-warp clearfix']/li") proid = ','.join(html.xpath("//li/@data-sku")) # 商品評(píng)價(jià)url # referenceIds=之后到&callback之前,都是商品的id,只需要在商品列表獲取商品id拼接即可 # 1. 評(píng)論解析 url_comm = r'https://club.jd.com/comment/productCommentSummaries.action?referenceIds={}'.format(proid) dd_commt = commreq(url_comm) # 2. 商品列表信息解析 pro_list = [] for product in all_pro: proid = ''.join(product.xpath("@data-sku")) price = ''.join(product.xpath("div[@class='gl-i-wrap']//strong/i/text()")) target = ''.join(product.xpath("div[@class='gl-i-wrap']//a/em//text()")).replace('\t\n','').replace('\\u2122','') shopname = ''.join(product.xpath("div[@class='gl-i-wrap']//span/a/@title")) shoptips = product.xpath("div[@class='gl-i-wrap']//i[contains(@class,'goods-icon')]/text()") if '自營(yíng)' in shoptips: shoptips='自營(yíng)' else: shoptips='非自營(yíng)' pro_list.append(dict(商品ID=proid,價(jià)格=price,店名=shopname,店屬性=shoptips,標(biāo)題=target)) df = df.append(pro_list) # 3. 合并商品評(píng)論和列表 df_pro = pd.merge(df,dd_commt,on='商品ID') return df_pro
加入主程序
if __name__ == "__main__": create_table('shouji') for i in range(1,81): url = 'https://search.jd.com/s_new.php?keyword=手機(jī)&wq手機(jī)&ev=3613_104528%5E&page={0}&s=30'.format(i) rep = requesturl(url) df_pro = parse(rep) sava_oracle(df_pro) time.sleep(random.randrange(1,4)) print('完成:',i)
關(guān)于怎樣用Python爬取京東的價(jià)格和標(biāo)題及評(píng)價(jià)等商品情況就分享到這里了,希望以上內(nèi)容可以對(duì)大家有一定的幫助,可以學(xué)到更多知識(shí)。如果覺(jué)得文章不錯(cuò),可以把它分享出去讓更多的人看到。
免責(zé)聲明:本站發(fā)布的內(nèi)容(圖片、視頻和文字)以原創(chuàng)、轉(zhuǎn)載和分享為主,文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng),如果涉及侵權(quán)請(qǐng)聯(lián)系站長(zhǎng)郵箱:is@yisu.com進(jìn)行舉報(bào),并提供相關(guān)證據(jù),一經(jīng)查實(shí),將立刻刪除涉嫌侵權(quán)內(nèi)容。