欧美MV日韩MV国产网站,欧美电影巜性爽爽,欧美操逼视频,欧美成人在线视频

優(yōu)惠活動 - 12周年慶本月新客福利
優(yōu)惠活動 - 12周年慶本月新客福利
優(yōu)惠活動 - 12周年慶本月新客福利

行業(yè)動態(tài)Python進行網(wǎng)頁文本處理

       Python進行網(wǎng)頁文本處理。

       網(wǎng)頁文本中的中英文處理的區(qū)別在于中文需要額外加入分詞處理過程。所謂分詞就是將一段文本文字分成一個個詞組的過程。

       具體處理流程為:加載jieba分詞包進行中文分詞;將分詞后的詞組去掉停用詞及一個字符的詞后, 輸出訓練文本中的常用分詞和熟悉的詞組;在訓練文本的數(shù)據(jù)訓練及情感詞典的歸檔中將爬取獲得的網(wǎng)頁數(shù)據(jù)的客觀性文本分詞后放入變量中, 主觀類情感文本放入另一變量中;為自動得到網(wǎng)頁文本中重要的關(guān)鍵詞組, 過濾掉對網(wǎng)頁文本意義貢獻不大的常用詞組, 在chi2模塊的特征選擇下, 采用詞頻-逆文本頻率 (TF-IDF) 概念將分詞詞組變量轉(zhuǎn)換為tf-idf向量形式, 輸出分詞向量矩陣, 為下一階段的網(wǎng)頁文本情感分析做準備。

本文地址:http://www.youmaike.com//article/20623.html
相關(guān)文章:
最新文章:
山阳县| 武宣县| 章丘市| 新竹市| 乌鲁木齐县| 德化县| 龙井市| 武强县| 会宁县| 栾城县| 齐河县| 大理市| 磴口县| 罗城| 长治市| 安徽省| 阿图什市| 云梦县| 台南市| 永平县| 桂东县| 临泉县| 宁都县| 泗水县| 惠东县| SHOW| 丰顺县| 文安县| 瓮安县| 青州市| 会东县| 土默特右旗| 潜山县| 开江县| 邛崃市| 额尔古纳市| 太和县| 临邑县| 博白县| 蒲江县| 浦江县|