php在線詞典數(shù)據(jù)采集 php 數(shù)據(jù)庫

php采集大數(shù)據(jù)的方案

1、建議你讀寫數(shù)據(jù)和下載圖片分開，各用不同的進(jìn)程完成。

創(chuàng)新互聯(lián)建站專注于企業(yè)營(yíng)銷型網(wǎng)站建設(shè)、網(wǎng)站重做改版、金州網(wǎng)站定制設(shè)計(jì)、自適應(yīng)品牌網(wǎng)站建設(shè)、成都h5網(wǎng)站建設(shè)、成都做商城網(wǎng)站、集團(tuán)公司官網(wǎng)建設(shè)、成都外貿(mào)網(wǎng)站建設(shè)公司、高端網(wǎng)站制作、響應(yīng)式網(wǎng)頁設(shè)計(jì)等建站業(yè)務(wù)，價(jià)格優(yōu)惠性價(jià)比高，為金州等各大城市提供網(wǎng)站開發(fā)制作服務(wù)。

比如說，取數(shù)據(jù)用get-data.php，下載圖片用get-image.php。

2、多進(jìn)程的話，php可以簡(jiǎn)單的用pcntl_fork()。這樣可以并發(fā)多個(gè)子進(jìn)程。

但是我不建議你用fork，我建議你安裝一個(gè)gearman worker。這樣你要并發(fā)幾個(gè)，就啟幾個(gè)worker，寫代碼簡(jiǎn)單，根本不用在代碼里考慮thread啊，process等等。

3、綜上，解決方案這樣：

（1）安裝gearman worker。

（2）寫一個(gè)get-data.php，在crontab里設(shè)置它每5分鐘執(zhí)行一次，只負(fù)責(zé)讀數(shù)據(jù)，然后把讀回來的數(shù)據(jù)一條一條的扔到 gearman worker的隊(duì)列里；

然后再寫一個(gè)處理數(shù)據(jù)的腳本作為worker，例如叫process-data.php，這個(gè)腳本常駐內(nèi)存。它作為worker從geraman 隊(duì)列里讀出一條一條的數(shù)據(jù)，然后跟你的數(shù)據(jù)庫老數(shù)據(jù)比較，進(jìn)行你的業(yè)務(wù)邏輯。如果你要10個(gè)并發(fā)，那就啟動(dòng)10個(gè)process-data.php好了。處理完后，如果圖片地址有變動(dòng)需要下載圖片，就把圖片地址扔到 gearman worker的另一個(gè)隊(duì)列里。

（3）再寫一個(gè)download-data.php，作為下載圖片的worker，同樣，你啟動(dòng)10個(gè)20個(gè)并發(fā)隨便你。這個(gè)進(jìn)程也常駐內(nèi)存運(yùn)行，從gearman worker的圖片數(shù)據(jù)隊(duì)列里取數(shù)據(jù)出來，下載圖片

4、常駐進(jìn)程的話，就是在代碼里寫個(gè)while(true)死循環(huán)，讓它一直運(yùn)行好了。如果怕內(nèi)存泄露啥的，你可以每循環(huán)10萬次退出一下。然后在crontab里設(shè)置，每分鐘檢查一下進(jìn)程有沒有啟動(dòng)，比如說這樣啟動(dòng)3個(gè)process-data worker進(jìn)程：

* * * * * flock -xn /tmp/process-data.1.lock -c '/usr/bin/php /process-data.php /dev/null 21'

* * * * * flock -xn /tmp/process-data.2.lock -c '/usr/bin/php /process-data.php /dev/null 21'

* * * * * flock -xn /tmp/process-data.3.lock -c '/usr/bin/php /process-data.php /dev/null 21'

不知道你明白了沒有

在線詞典數(shù)據(jù)怎么采集？請(qǐng)大家給個(gè)思路！參考資料(php的)。謝謝

雖然我沒有做過采集在線詞典，

不過看了下百度詞典，可以采集，給個(gè)參考思路。

1、做一個(gè)本地的單詞庫

2、php循環(huán)一條一條讀取詞語庫

3、php采集 URL地址：百度詞典網(wǎng)址/s？wd=單詞，讀取html源碼php正則匹配內(nèi)容。

4、數(shù)據(jù)入庫。

怎么用php采集網(wǎng)站數(shù)據(jù)

簡(jiǎn)單的分了幾個(gè)步驟：

1、確定采集目標(biāo)

2、獲取目標(biāo)遠(yuǎn)程頁面內(nèi)容（curl、file_get_contents）

3、分析頁面html源碼，正則匹配你需要的內(nèi)容（preg_match、preg_match_all），這一步最為重要，不同頁面正則匹配規(guī)則不一樣

4、入庫

php 百度知道數(shù)據(jù)采集

問題其實(shí)不難，自己都能寫。給你幾個(gè)思路吧：

1.在百度知道中，輸入linux，然后會(huì)出現(xiàn)列表。復(fù)制瀏覽器地址欄內(nèi)容。

然后翻頁，在復(fù)制地址欄內(nèi)容，看看有什么不同，不同之處，就是你要循環(huán)分頁的i值。

當(dāng)然這個(gè)是笨方法。

2.使用php的file或者file_get_contents函數(shù)，獲取鏈接URL的內(nèi)容。

3.通過php正則表達(dá)式，獲取你需要的3個(gè)字段內(nèi)容。

4.寫入數(shù)據(jù)庫。

需要注意的是，百度知道有可能做了防抓取的功能，你剛一抓幾個(gè)頁面，可能會(huì)被禁止。

建議也就抓10頁數(shù)據(jù)。

其實(shí)不難，你肯定寫的出來。還有，網(wǎng)上應(yīng)該有很多抓取工具，你找找看，然后將抓下來的數(shù)據(jù)

在做分析。寫入數(shù)據(jù)庫。

PHP 數(shù)據(jù)采集太慢

一頁一頁采啊，你要是想把N個(gè)網(wǎng)頁一下子采下來，在瀏覽器中肯定不行，你可以用php.exe在命令行下運(yùn)行你的采集腳本。如果你想在瀏覽器上采，你得一次采集一個(gè)頁面，然后用window.location.href轉(zhuǎn)向，把下一個(gè)要采集的地址傳過去，這樣一頁一頁的循環(huán)來采集。

網(wǎng)站名稱：php在線詞典數(shù)據(jù)采集 php 數(shù)據(jù)庫
URL分享：http://www.chinadenli.net/article48/dooipep.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián)，為您提供動(dòng)態(tài)網(wǎng)站、關(guān)鍵詞優(yōu)化、手機(jī)網(wǎng)站建設(shè)、電子商務(wù)、靜態(tài)網(wǎng)站、做網(wǎng)站

聲明：本網(wǎng)站發(fā)布的內(nèi)容（圖片、視頻和文字）以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主，如果涉及侵權(quán)請(qǐng)盡快告知，我們將會(huì)在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng)，如需處理請(qǐng)聯(lián)系客服。電話：028-86922220；郵箱：631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載，或轉(zhuǎn)載時(shí)需注明來源：創(chuàng)新互聯(lián)

猜你還喜歡下面的內(nèi)容

欧美一区二区三区老妇人-欧美做爰猛烈大尺度电-99久久夜色精品国产亚洲a-亚洲福利视频一区二区