溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點(diǎn)擊 登錄注冊 即表示同意《億速云用戶服務(wù)條款》

SogouQ中如何計算查詢詞URL最優(yōu) Rank

發(fā)布時間:2022-01-05 14:47:09 來源:億速云 閱讀:125 作者:柒染 欄目:云計算

這期內(nèi)容當(dāng)中小編將會給大家?guī)碛嘘P(guān)SogouQ中如何計算查詢詞URL最優(yōu) Rank,文章內(nèi)容豐富且以專業(yè)的角度為大家分析和敘述,閱讀完這篇文章希望大家可以有所收獲。

PS1: 日志原格式是GB2312編碼, 一定要記得轉(zhuǎn)成UTF-8

PS2: 日志格式和格式說明:  

訪問時間\t用戶ID\t[查詢詞]\t該URL在返回結(jié)果中的排名\t用戶點(diǎn)擊的順序號\t用戶點(diǎn)擊的URL, 

這個格式有坑, 深坑:

"該URL在返回結(jié)果中的排名\t用戶點(diǎn)擊的順序號"這兩個字段之間的分割符并不是制表符\t而是空格

val sogouQRdd = sc.textFile("hdfs://node1:9000/sogouQ/input")
sogouQRdd.cache    # 在下一次Action操作時, 將日志文件緩存到內(nèi)存中

求出日志文件條目總數(shù)

val itemCountRdd = sogouQRdd.count
itemCountRdd: Long = 1724264

對于每一個查詢詞, 求出該 URL 在返回結(jié)果中的排名為1, 且用戶點(diǎn)擊的順序號為1的條目總數(shù)

這說明此次搜索結(jié)果的 URL 的 Rank 最優(yōu)

val suitableRankRdd = sogouQRdd.filter(_.split('\t').length == 5).map(_.split('\t'))
.filter(_(3).split(' ')(0).toInt == 1).filter(_(3).split(' ')(1).toInt == 1).count

suitableRankRdd: Long = 279859

計算查詢詞 URL 最優(yōu) Rank 的頻率:

最優(yōu)Rank頻率 URL最優(yōu)Rank次數(shù) / 條目總數(shù)

suitableRankRdd / itemCountRdd = 0.1623

所以查詢詞 URL最優(yōu)Rank 的頻率為 16.23%

上述就是小編為大家分享的SogouQ中如何計算查詢詞URL最優(yōu) Rank了,如果剛好有類似的疑惑,不妨參照上述分析進(jìn)行理解。如果想知道更多相關(guān)知識,歡迎關(guān)注億速云行業(yè)資訊頻道。

向AI問一下細(xì)節(jié)

免責(zé)聲明:本站發(fā)布的內(nèi)容(圖片、視頻和文字)以原創(chuàng)、轉(zhuǎn)載和分享為主,文章觀點(diǎn)不代表本網(wǎng)站立場,如果涉及侵權(quán)請聯(lián)系站長郵箱:is@yisu.com進(jìn)行舉報,并提供相關(guān)證據(jù),一經(jīng)查實(shí),將立刻刪除涉嫌侵權(quán)內(nèi)容。

AI