您好,登錄后才能下訂單哦!
這期內(nèi)容當(dāng)中小編將會給大家?guī)碛嘘P(guān)SogouQ中如何計算查詢詞URL最優(yōu) Rank,文章內(nèi)容豐富且以專業(yè)的角度為大家分析和敘述,閱讀完這篇文章希望大家可以有所收獲。
PS1: 日志原格式是GB2312編碼, 一定要記得轉(zhuǎn)成UTF-8
PS2: 日志格式和格式說明:
訪問時間\t用戶ID\t[查詢詞]\t該URL在返回結(jié)果中的排名\t用戶點(diǎn)擊的順序號\t用戶點(diǎn)擊的URL,
這個格式有坑, 深坑:
"該URL在返回結(jié)果中的排名\t用戶點(diǎn)擊的順序號"這兩個字段之間的分割符并不是制表符\t, 而是空格
val sogouQRdd = sc.textFile("hdfs://node1:9000/sogouQ/input") sogouQRdd.cache # 在下一次Action操作時, 將日志文件緩存到內(nèi)存中
求出日志文件條目總數(shù)
val itemCountRdd = sogouQRdd.count itemCountRdd: Long = 1724264
對于每一個查詢詞, 求出該 URL 在返回結(jié)果中的排名為1, 且用戶點(diǎn)擊的順序號為1的條目總數(shù)
這說明此次搜索結(jié)果的 URL 的 Rank 最優(yōu)
val suitableRankRdd = sogouQRdd.filter(_.split('\t').length == 5).map(_.split('\t')) .filter(_(3).split(' ')(0).toInt == 1).filter(_(3).split(' ')(1).toInt == 1).count suitableRankRdd: Long = 279859
計算查詢詞 URL 最優(yōu) Rank 的頻率:
最優(yōu)Rank頻率 = URL最優(yōu)Rank次數(shù) / 條目總數(shù)
suitableRankRdd / itemCountRdd = 0.1623
所以查詢詞 URL最優(yōu)Rank 的頻率為 16.23%
上述就是小編為大家分享的SogouQ中如何計算查詢詞URL最優(yōu) Rank了,如果剛好有類似的疑惑,不妨參照上述分析進(jìn)行理解。如果想知道更多相關(guān)知識,歡迎關(guān)注億速云行業(yè)資訊頻道。
免責(zé)聲明:本站發(fā)布的內(nèi)容(圖片、視頻和文字)以原創(chuàng)、轉(zhuǎn)載和分享為主,文章觀點(diǎn)不代表本網(wǎng)站立場,如果涉及侵權(quán)請聯(lián)系站長郵箱:is@yisu.com進(jìn)行舉報,并提供相關(guān)證據(jù),一經(jīng)查實(shí),將立刻刪除涉嫌侵權(quán)內(nèi)容。