利用Python怎么計算單詞出現(xiàn)的次數(shù)-創(chuàng)新互聯(lián)

利用Python怎么計算單詞出現(xiàn)的次數(shù)？針對這個問題，這篇文章詳細介紹了相對應的分析和解答，希望可以幫助更多想解決這個問題的小伙伴找到更簡單易行的方法。

創(chuàng)新互聯(lián)公司服務項目包括武威網(wǎng)站建設、武威網(wǎng)站制作、武威網(wǎng)頁制作以及武威網(wǎng)絡營銷策劃等。多年來，我們專注于互聯(lián)網(wǎng)行業(yè)，利用自身積累的技術優(yōu)勢、行業(yè)經(jīng)驗、深度合作伙伴關系等，向廣大中小型企業(yè)、政府機構等提供互聯(lián)網(wǎng)行業(yè)的解決方案，武威網(wǎng)站推廣取得了明顯的社會效益與經(jīng)濟效益。目前，我們服務的客戶以成都為中心已經(jīng)輻射到武威省份的部分城市，未來相信會繼續(xù)擴大服務區(qū)域并繼續(xù)獲得客戶的支持與信任！題目：

統(tǒng)計一個文件中每個單詞出現(xiàn)的次數(shù)，列出出現(xiàn)頻率最多的5個單詞。

前言：

這道題在實際應用場景中使用比較廣泛，比如統(tǒng)計歷年來四六級考試中出現(xiàn)的高頻詞匯，記得李笑來就利用他的編程技能出版過一本背單詞的暢銷書，就是根據(jù)詞頻來記單詞，深受學生喜歡。這就是一個把編程技能用來解決實際問題的典型場景。另外，在數(shù)據(jù)分析時，那些詞云效果本質上都是基于詞頻統(tǒng)計來調整字體的大小，如果你能熟練運用Python中的知識來解決問題的話，說明你真的入門Python了。

分析

本題主要考察以下幾個方面的知識點：

1、如何正確讀寫文件

在python中讀寫文件可以使用內置函數(shù)open()，而 open 函數(shù)在python2 和 python3 中有一定的區(qū)別，比如 Python 中可以指定讀寫文件的編碼格式，而 Python 則不可以，為了同時兼容2和3，我們通常會使用io模塊下面的 open 函數(shù)，大家可以查文檔搞清楚它們之間的區(qū)別，培養(yǎng)主動學習能力和查資料的習慣。

另外一點是讀寫文件完成之后是需要關閉文件描述符的，除了可以使用 try...except...finally的語法之后，我們還可以使用更優(yōu)雅的 with … as 的語法來自動關閉文件。

2、如何對數(shù)據(jù)進行排序

sorted函數(shù)是一個使用頻率很高的內置函數(shù)，它的用法也很強大，因為它可以通過指定參數(shù) key 來進行自定義排序，也就意味著你不僅可以對數(shù)字排序、對字母排序、還可以對列表、字典、自定義的對象進行排序，你只需要要告訴 sorted 函數(shù)的排序規(guī)則是什么，比如一個people對象，我既可以根據(jù)年齡排序也可以根據(jù)身高體重來排序，所以這個函數(shù)時非常靈活的，另外，對于列表對象有自帶的 sort 方法，如果能區(qū)分清楚 list.sort 與 sorted 之間區(qū)別那說明你已經(jīng)能靈活運用了。

3、字典數(shù)據(jù)類型的運用

做詞頻統(tǒng)計，用字典無疑是最合適的數(shù)據(jù)類型，單詞作為字典的key，單詞出現(xiàn)的次數(shù)作為字典的 value，很方便地就記錄好了每個單詞的頻率，字典很像我們的電話本，每個名字關聯(lián)一個電話號碼。另外，字典大的特點就是它的查詢速度會非常快。理想情況下時間復雜度為O(1)，我是說理想情況，如果你想深入了解字典的話，建議看看這篇文章 https://www.laurentluce.com/posts/python-dictionary-implementation/

4、正則表達式的運用

對文本、字符串處理，正則表達式簡直是神器，無論是做數(shù)據(jù)爬蟲還是數(shù)據(jù)清洗使用非常廣泛，當然，正則表達式并不是Python特有的東西，所有編程語言都支持，我們要做的除了學習正則表達式還有他的API，只有熟悉了API我們才能運用到實際場景中去。關于正則表達式推薦一篇文章：http://www.cnblogs.com/huxi/archive/2010/07/04/1771073.html ，另外我還發(fā)現(xiàn)有同學引入了jieba分詞庫，這個庫在做中文分詞非常有用，感興趣的可以去了解一下。

實現(xiàn)

分析完之后，我們實現(xiàn)起來其實是非常快的。所以我們在拿到一個需求的時候，首先肯定是把需求弄清楚，想想大概可以用哪些技術來實現(xiàn)，隨后才是動手寫代碼，其實我們在工作上，真正寫代碼的時間還不到一半。

# -*- coding:utf-8 -*-
import io
import re
class Counter:
 def __init__(self, path):
 """
 :param path: 文件路徑
 """
 self.mapping = dict()
 with io.open(path, encoding="utf-8") as f:
  data = f.read()
  words = [s.lower() for s in re.findall("\w+", data)]
  for word in words:
  self.mapping[word] = self.mapping.get(word, 0) + 1
 def most_common(self, n):
 assert n > 0, "n should be large than 0"
 return sorted(self.mapping.items(), key=lambda item: item[1], reverse=True)[:n]
if __name__ == '__main__':
 most_common_5 = Counter("importthis.txt").most_common(5)
 for item in most_common_5:
 print(item)

打印結果：

('is', 10)
('better', 8)
('than', 8)
('the', 6)
('to', 5)

關于利用Python怎么計算單詞出現(xiàn)的次數(shù)問題的解答就分享到這里了，希望以上內容可以對大家有一定的幫助，如果你還有很多疑惑沒有解開，可以關注創(chuàng)新互聯(lián)行業(yè)資訊頻道了解更多相關知識。

新聞標題：利用Python怎么計算單詞出現(xiàn)的次數(shù)-創(chuàng)新互聯(lián)
當前URL：http://www.chinadenli.net/article12/dcijgc.html

成都網(wǎng)站建設公司_創(chuàng)新互聯(lián)，為您提供電子商務、企業(yè)建站、定制網(wǎng)站、軟件開發(fā)、網(wǎng)站排名、網(wǎng)站策劃

聲明：本網(wǎng)站發(fā)布的內容（圖片、視頻和文字）以用戶投稿、用戶轉載內容為主，如果涉及侵權請盡快告知，我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場，如需處理請聯(lián)系客服。電話：028-86922220；郵箱：631063699@qq.com。內容未經(jīng)允許不得轉載，或轉載時需注明來源：創(chuàng)新互聯(lián)

猜你還喜歡下面的內容

欧美一区二区三区老妇人-欧美做爰猛烈大尺度电-99久久夜色精品国产亚洲a-亚洲福利视频一区二区

利用Python怎么計算單詞出現(xiàn)的次數(shù)-創(chuàng)新互聯(lián)