<tr id="uswcw"><button id="uswcw"></button></tr><tr id="uswcw"></tr>

^{<delect id="uswcw"></delect>}

溫馨提示×

溫馨提示×

您好，登錄后才能下訂單哦！

密碼登錄×

忘記密碼？

登錄注冊×

獲取短信驗證碼

其他方式登錄

點擊登錄注冊即表示同意《億速云用戶服務條款》

用戶登錄×

賬戶密碼登錄

請使用微信掃描上方二維碼

使用幫助

請求超時！

請點擊重新獲取二維碼

怎么在Python中利用Spacy進行分詞

發(fā)布時間：2021-04-22 15:23:15 來源：億速云閱讀：472 作者：Leah 欄目：編程語言

本篇文章給大家分享的是有關怎么在Python中利用Spacy進行分詞，小編覺得挺實用的，因此分享給大家學習，希望大家閱讀完這篇文章后可以有所收獲，話不多說，跟著小編一起來看看吧。

python是什么意思

Python是一種跨平臺的、具有解釋性、編譯性、互動性和面向?qū)ο蟮哪_本語言，其最初的設計是用于編寫自動化腳本，隨著版本的不斷更新和新功能的添加，常用于用于開發(fā)獨立的項目和大型項目。

1、說明

Spacy語言模型包含一些強大的文本分析功能，如詞性標記和命名實體識別。

導入spacy相關模塊后，需要加載中文處理包。然后讀小說數(shù)據(jù)，nlp處理天龍八部小說，包括分詞、定量、詞性標注、語法分析、命名實體識別，用符號/分隔小說。最后，通過is_stop函數(shù)判斷單詞中的單詞是否為無效單詞，刪除無效單詞后，將結(jié)果寫入txt文件。

2、實例

import spacy
import pandas as pd
import time
from spacy.lang.zh.stop_words import STOP_WORDS
 
nlp = spacy.load('zh_core_web_sm')
 
def fenci_stopwords(data,newdata1):
    fenci = []
    qc_stopwords =[]
 
    article = pd.read_table(data,encoding="utf-8")
    start1 = time.time()
    with open(newdata1,'w',encoding='utf-8') as f1:
        for i in article["天龍八部"]:#分詞
            doc = nlp(i)
            result1 = '/'.join([t.text for t in doc])
            fenci.append(result1)
 
  for j in fenci:#去除停用詞   
            words = nlp.vocab[j]    
            if words.is_stop == False:        
                qc_stopwords.append(j)
                result2 = '/'.join(qc_stopwords)
                f1.write(result2)
    end1 = time.time()
    return end1-start1

以上就是怎么在Python中利用Spacy進行分詞，小編相信有部分知識點可能是我們?nèi)粘９ぷ鲿姷交蛴玫降?。希望你能通過這篇文章學到更多知識。更多詳情敬請關注億速云行業(yè)資訊頻道。

向AI問一下細節(jié)

推薦閱讀：

免責聲明：本站發(fā)布的內(nèi)容（圖片、視頻和文字）以原創(chuàng)、轉(zhuǎn)載和分享為主，文章觀點不代表本網(wǎng)站立場，如果涉及侵權請聯(lián)系站長郵箱：is@yisu.com進行舉報，并提供相關證據(jù)，一經(jīng)查實，將立刻刪除涉嫌侵權內(nèi)容。

上一篇新聞：
mysql左連接和右連接有什么區(qū)別
下一篇新聞：
基于BootStrap multiselect.js實現(xiàn)的下拉框聯(lián)動效果

猜你喜歡

AI
助
手

產(chǎn)品服務

地區(qū)劃分

專題活動

幫助支持

關于我們

售后咨詢

7*24小時在線電話：400-100-2938

7*24小時在線 QQ：800811969

關注億速云

億速云公眾號

手機網(wǎng)站二維碼

<optgroup id="aqamq"><noscript id="aqamq"></noscript></optgroup>

<rt id="aqamq"><cite id="aqamq"></cite></rt>

<tbody id="aqamq"><source id="aqamq"></source></tbody>