溫馨提示×

溫馨提示×

您好，登錄后才能下訂單哦！

密碼登錄×

忘記密碼？

登錄注冊(cè)×

獲取短信驗(yàn)證碼

其他方式登錄

點(diǎn)擊登錄注冊(cè) 即表示同意《億速云用戶服務(wù)條款》

用戶登錄×

賬戶密碼登錄

請(qǐng)使用微信掃描上方二維碼

使用幫助

請(qǐng)求超時(shí)！

請(qǐng)點(diǎn)擊重新獲取二維碼

使用tf*idf實(shí)現(xiàn)對(duì)文檔集合的檢索

發(fā)布時(shí)間：2020-07-09 13:59:44 來(lái)源：網(wǎng)絡(luò) 閱讀：395 作者：jokance 欄目：web開(kāi)發(fā)

步驟：

讀取三篇文檔1.txt,2.txt,3.txt，里邊的內(nèi)容分別為“this is php”,“this is html html”，“this is java”
分詞，并統(tǒng)計(jì)詞頻tf
計(jì)算文檔頻率df
計(jì)算每篇文檔的特征向量
計(jì)算搜索詞與文檔的夾角余弦值

<?php
    $_txts = array('1.txt','2.txt','3.txt');
    $_len = count($_txts);
    for ($i = 0;$i < $_len;$i++){
        $_contents[] = file_get_contents($_txts[$i]);   //讀取內(nèi)容
    }
            
    for ($i = 0;$i < $_len;$i++){
        //分詞
        $_words[] = explode(' ',trim($_contents[$i])); 
        foreach ($_words[$i] as $_key=>$_value){
            $_value = trim($_value);
            $_value = preg_replace('/[.|,|(|)|-|;]/','',$_value);
            $_words[$i][$_key]=strtolower($_value);
                    
        }
        //統(tǒng)計(jì)文檔所有詞的長(zhǎng)度,一般計(jì)算tf需要除以這個(gè)值，為了簡(jiǎn)便，本次試驗(yàn)省去這步
        //$_words_count[]=count($_words[$i]);
        //詞頻tf
        $_tf[] = array_count_values($_words[$i]);
        //去重
        $_words[$i]= array_unique($_words[$i]);
    }  
            
    //合并
    $_words_com = array_merge($_words[0],$_words[1],$_words[2]);
    //文檔頻率
    $_df = array_count_values($_words_com);
    //特征向量
    for ($i = 0;$i < $_len;$i++){
        //初始化，與文檔頻率的維度相同
        $_vsm[$i] = $_df;
        //把每個(gè)維度的值設(shè)置為0
        foreach($_vsm[$i] as $_key=>$_value){
            $_vsm[$i][$_key] = 0;
        }
        for ($j=0;$j<count($_words[$i]);$j++){
            if (in_array($_words[$i][$j],$_words_com)){
                $_vsm[$i][($_words[$i][$j])] = ($_tf[$i][($_words[$i][$j])])*(log($_len/$_df[($_words[$i][$j])]));
                        
            }  
        }
    }  
            
    for($i = 0;$i < count($_vsm); $i++){
        echo '第'.($i+1).'篇文檔的特征向量: ('. implode(",",$_vsm[$i]).')<br/>';
    }
            
    //測(cè)試
    $_query = 'java';
    $_vsm_que = $_df;
    foreach($_vsm_que as $_key=>$_value){
        $_vsm_que[$_key] = 0;
    }
    if (in_array($_query,$_vsm_que)){
        $_vsm_que[$_query] = 1;
    }
            
    for ($i = 0; $i < count($_vsm); $i++){
        foreach($_vsm_que as $_key=>$_value){
            $_sim[$i] += ($_vsm[$i][$_key]) * ($_vsm_que[$_key]);
            $_w1 += pow($_vsm_que[$_key],2);
            $_w2 += pow($_vsm[$i][$_key],2);
        }
        //求夾角余弦值，相似度計(jì)算
        $_cos[$i] = $_sim[$i]/(sqrt($_w1)*sqrt($_w2));
        echo '<br/>';
        echo '第'.($i+1).'篇文檔的相似度：'.$_cos[$i];
    }
            
    arsort($_cos);
    foreach($_cos as $_key=>$_value){
        echo '<br/><br/>';
        echo '最符合的結(jié)果為第'.($_key+1).'篇文檔';
                
        break;
    }
?>

在瀏覽器運(yùn)行的結(jié)果：

第1篇文檔的特征向量: (0,0,1.09861228867,0,0)
第2篇文檔的特征向量: (0,0,0,2.19722457734,0)
第3篇文檔的特征向量: (0,0,0,0,1.09861228867)

第1篇文檔的相似度：0
第2篇文檔的相似度：0
第3篇文檔的相似度：0.235702260396

最符合的結(jié)果為第3篇文檔

向AI問(wèn)一下細(xì)節(jié)

推薦閱讀：

免責(zé)聲明：本站發(fā)布的內(nèi)容（圖片、視頻和文字）以原創(chuàng)、轉(zhuǎn)載和分享為主，文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng)，如果涉及侵權(quán)請(qǐng)聯(lián)系站長(zhǎng)郵箱：is@yisu.com進(jìn)行舉報(bào)，并提供相關(guān)證據(jù)，一經(jīng)查實(shí)，將立刻刪除涉嫌侵權(quán)內(nèi)容。

上一篇新聞：
python下載安裝庫(kù)的方法
下一篇新聞：
XML屬性的代碼詳解

猜你喜歡

AI
助
手

產(chǎn)品服務(wù)

地區(qū)劃分

專題活動(dòng)

幫助支持

關(guān)于我們

售后咨詢

7*24小時(shí)在線電話：400-100-2938

7*24小時(shí)在線 QQ：800811969

關(guān)注億速云

億速云公眾號(hào)

手機(jī)網(wǎng)站二維碼