<s id="toljj"><delect id="toljj"></delect></s>

溫馨提示×

溫馨提示×

您好，登錄后才能下訂單哦！

密碼登錄×

忘記密碼？

登錄注冊×

獲取短信驗證碼

其他方式登錄

點擊登錄注冊即表示同意《億速云用戶服務(wù)條款》

用戶登錄×

賬戶密碼登錄

請使用微信掃描上方二維碼

使用幫助

請求超時！

請點擊重新獲取二維碼

Python爬蟲之批量下載喜馬拉雅音頻的方法

發(fā)布時間：2021-05-18 14:59:31 來源：億速云閱讀：983 作者：小新欄目：開發(fā)技術(shù)

這篇文章給大家分享的是有關(guān)Python爬蟲之批量下載喜馬拉雅音頻的方法的內(nèi)容。小編覺得挺實用的，因此分享給大家做個參考，一起跟隨小編過來看看吧。

一、解析網(wǎng)站

1.1 獲取音頻地址

在喜馬拉雅網(wǎng)站上，隨便點開一個音頻，打開“開發(fā)者工具”，再點擊播放按鈕，可以看到出現(xiàn)了多個請求：

Python爬蟲之批量下載喜馬拉雅音頻的方法

經(jīng)過排查，發(fā)現(xiàn)可疑url:

Python爬蟲之批量下載喜馬拉雅音頻的方法

查看它的響應(yīng)信息，發(fā)現(xiàn)音頻地址就在里面：

Python爬蟲之批量下載喜馬拉雅音頻的方法

接下來，解析這個返回音頻地址的url：

https://www.ximalaya.com/revision/play/v1/audio?id=348451879&ptype=1

發(fā)現(xiàn)url中的id參數(shù)就決定了返回的音頻地址，而id參數(shù)是音頻的id號。

1.2 解析專欄網(wǎng)頁

我們已經(jīng)知道了獲取音頻url的網(wǎng)址，接下來要獲取一個專欄內(nèi)的音頻id和名稱，打開一個專欄，發(fā)現(xiàn)：

Python爬蟲之批量下載喜馬拉雅音頻的方法

所有的音頻存放在class為1F_的li標(biāo)簽中，再來解析li標(biāo)簽：

Python爬蟲之批量下載喜馬拉雅音頻的方法

在li標(biāo)簽中的第一個a標(biāo)簽存儲著我們所有需要的數(shù)據(jù)，妙~??！

1.3 整理億下思路

思路：

1.獲取專欄內(nèi)的li標(biāo)簽

2.獲取li標(biāo)簽里的第一個a標(biāo)簽

3.讀取a標(biāo)簽的title和href屬性

4.將href解析成音頻id

5.將id帶入url請求音頻源地址

6.提取音頻源地址

7.請求音頻源地址

8.保存音頻（文件名為a的title屬性）

思路整理完了，開始編寫代碼。

二、編寫爬取代碼

代碼奉上——

import requests
from fake_useragent import UserAgent as ua
from bs4 import BeautifulSoup as bs

# 專欄地址
music_list_url = 'https://www.ximalaya.com/ertongjiaoyu/19702607/'
# 獲取音頻地址的url
get_link_url = "https://www.ximalaya.com/revision/play/v1/audio"

# UA偽裝
headers = {
    "User-Agent": ua().random
}

# 參數(shù)
params = {
    "id": None,    # id先設(shè)為None
    "ptype": "1",
}

# 獲取專欄HTML源碼
music_list_r = requests.get(music_list_url, headers=headers)
# 解析 獲取所有l(wèi)i標(biāo)簽
soup = bs(music_list_r.text, "lxml")
li = soup.find_all("li", {"class": "lF_"})

# for循序遍歷處理
for i in li:
    a = i.find("a")   # 找到a標(biāo)簽
    # 獲取href屬性
    # split("/")將字符串以"/"作為分隔符 從右往左數(shù)第一項是id號
    music_id = a.get("href").split("/")[-1]
    # 獲取title屬性 和“.m4a”拼接成文件名
    music_name = a.get("title") + ".m4a"

	# 修改請求參數(shù)id
    params['id'] = music_id

	# 獲得音頻源地址
    r = requests.get(get_link_url, headers=headers, params=params)
    link = r.json()['data']['src']

	# 獲取音頻文件并保存
    music_file = requests.get(link).content
    with open(music_name, "wb") as f:
        f.write(music_file)

print("下載完畢！")

運行代碼，等待億會（真的要等億會），可以看到當(dāng)前目錄下已經(jīng)出現(xiàn)了音頻文件，如圖：

Python爬蟲之批量下載喜馬拉雅音頻的方法

感謝各位的閱讀！關(guān)于“Python爬蟲之批量下載喜馬拉雅音頻的方法”這篇文章就分享到這里了，希望以上內(nèi)容可以對大家有一定的幫助，讓大家可以學(xué)到更多知識，如果覺得文章不錯，可以把它分享出去讓更多的人看到吧！

python的五大特點是什么

python的五大特點：1.簡單易學(xué)，開發(fā)程序時，專注的是解決問題,而不是搞明白語言本身。2.面向?qū)ο?，與其他主要的語言如C++和Java相比, Python以一種非常強大又簡單的方式實現(xiàn)面向?qū)ο缶幊獭?.可移植性，Python程序無需修改就可以在各種平臺上運行。4.解釋性，Python語言寫的程序不需要編譯成二進制代碼,可以直接從源代碼運行程序。5.開源，Python是 FLOSS(自由/開放源碼軟件)之一。

向AI問一下細(xì)節(jié)

推薦閱讀：

免責(zé)聲明：本站發(fā)布的內(nèi)容（圖片、視頻和文字）以原創(chuàng)、轉(zhuǎn)載和分享為主，文章觀點不代表本網(wǎng)站立場，如果涉及侵權(quán)請聯(lián)系站長郵箱：is@yisu.com進行舉報，并提供相關(guān)證據(jù)，一經(jīng)查實，將立刻刪除涉嫌侵權(quán)內(nèi)容。

上一篇新聞：
Mysql和Oracle之間的誤區(qū)是什么
下一篇新聞：
TensorFlow和keras中GPU的使用示例

猜你喜歡

AI
助
手

產(chǎn)品服務(wù)

地區(qū)劃分

專題活動

幫助支持

關(guān)于我們

售后咨詢

7*24小時在線電話：400-100-2938

7*24小時在線 QQ：800811969

關(guān)注億速云

億速云公眾號

手機網(wǎng)站二維碼