成人免费xxxxx在线视频软件_久久精品久久久_亚洲国产精品久久久_天天色天天色_亚洲人成一区_欧美一级欧美三级在线观看

北大開(kāi)源全新中文分詞工具包:準(zhǔn)確率遠(yuǎn)超THULAC、結(jié)巴分詞

新聞 開(kāi)發(fā)工具
最近,北大開(kāi)源了一個(gè)中文分詞工具包,它在多個(gè)分詞數(shù)據(jù)集上都有非常高的分詞準(zhǔn)確率。其中廣泛使用的結(jié)巴分詞誤差率高達(dá) 18.55% 和 20.42,而北大的 pkuseg 只有 3.25% 與 4.32%。

 最近,北大開(kāi)源了一個(gè)中文分詞工具包,它在多個(gè)分詞數(shù)據(jù)集上都有非常高的分詞準(zhǔn)確率。其中廣泛使用的結(jié)巴分詞誤差率高達(dá) 18.55% 和 20.42,而北大的 pkuseg 只有 3.25% 與 4.32%。

pkuseg 是由北京大學(xué)語(yǔ)言計(jì)算與機(jī)器學(xué)習(xí)研究組研制推出的一套全新的中文分詞工具包。它簡(jiǎn)單易用,支持多領(lǐng)域分詞,在不同領(lǐng)域的數(shù)據(jù)上都大幅提高了分詞的準(zhǔn)確率。

  • 項(xiàng)目地址:https://github.com/lancopku/PKUSeg-python

pkuseg 具有如下幾個(gè)特點(diǎn):

  • 高分詞準(zhǔn)確率:相比于其他的分詞工具包,該工具包在不同領(lǐng)域的數(shù)據(jù)上都大幅提高了分詞的準(zhǔn)確度。根據(jù)北大研究組的測(cè)試結(jié)果,pkuseg 分別在示例數(shù)據(jù)集(MSRA 和 CTB8)上降低了 79.33% 和 63.67% 的分詞錯(cuò)誤率。

  • 多領(lǐng)域分詞:研究組訓(xùn)練了多種不同領(lǐng)域的分詞模型。根據(jù)待分詞的領(lǐng)域特點(diǎn),用戶可以自由地選擇不同的模型。

  • 支持用戶自訓(xùn)練模型:支持用戶使用全新的標(biāo)注數(shù)據(jù)進(jìn)行訓(xùn)練。

此外,作者們還選擇 THULAC、結(jié)巴分詞等國(guó)內(nèi)代表分詞工具包與 pkuseg 做性能比較。他們選擇 Linux 作為測(cè)試環(huán)境,在新聞數(shù)據(jù)(MSRA)和混合型文本(CTB8)數(shù)據(jù)上對(duì)不同工具包進(jìn)行了準(zhǔn)確率測(cè)試。此外,測(cè)試使用的是第二屆國(guó)際漢語(yǔ)分詞評(píng)測(cè)比賽提供的分詞評(píng)價(jià)腳本。評(píng)測(cè)結(jié)果如下:

我們可以看到,最廣泛使用的結(jié)巴分詞準(zhǔn)確率***,清華構(gòu)建的 THULAC 分詞準(zhǔn)確率也沒(méi)有它高。當(dāng)然,pkuseg 是在這些數(shù)據(jù)集上訓(xùn)練的,因此它在這些任務(wù)上的準(zhǔn)確率也會(huì)更高一些。

預(yù)訓(xùn)練模型

分詞模式下,用戶需要加載預(yù)訓(xùn)練好的模型。研究組提供了三種在不同類型數(shù)據(jù)上訓(xùn)練得到的模型,根據(jù)具體需要,用戶可以選擇不同的預(yù)訓(xùn)練模型。以下是對(duì)預(yù)訓(xùn)練模型的說(shuō)明:

  • MSRA:在 MSRA(新聞?wù)Z料)上訓(xùn)練的模型。新版本代碼采用的是此模型。

  • CTB8:在 CTB8(新聞文本及網(wǎng)絡(luò)文本的混合型語(yǔ)料)上訓(xùn)練的模型。

  • WEIBO:在微博(網(wǎng)絡(luò)文本語(yǔ)料)上訓(xùn)練的模型。

其中,MSRA 數(shù)據(jù)由第二屆國(guó)際漢語(yǔ)分詞評(píng)測(cè)比賽提供,CTB8 數(shù)據(jù)由 LDC 提供,WEIBO 數(shù)據(jù)由 NLPCC 分詞比賽提供。在 GitHub 項(xiàng)目中,這三個(gè)預(yù)訓(xùn)練模型都提供了下載地址。

安裝與使用

pkuseg 的安裝非常簡(jiǎn)單,我們可以使用 pip 安裝,也可以直接從 GitHub 下載:

  1. pip install pkuseg 

使用 pkuseg 實(shí)現(xiàn)分詞也很簡(jiǎn)單,基本上和其它分詞庫(kù)的用法都差不多:

  1. '''代碼示例1: 使用默認(rèn)模型及默認(rèn)詞典分詞''' 
  2. import pkuseg 
  3.  
  4. #以默認(rèn)配置加載模型 
  5. seg = pkuseg.pkuseg() 
  6. #進(jìn)行分詞 
  7. text = seg.cut('我愛(ài)北京天安門'
  8. print(text) 
  9.  
  10. '''代碼示例2: 設(shè)置用戶自定義詞典''' 
  11. import pkuseg 
  12.  
  13. #希望分詞時(shí)用戶詞典中的詞固定不分開(kāi) 
  14. lexicon = ['北京大學(xué)''北京天安門'
  15. #加載模型,給定用戶詞典 
  16. seg = pkuseg.pkuseg(user_dict=lexicon) 
  17. text = seg.cut('我愛(ài)北京天安門'
  18. print(text) 
  19.  
  20. '''代碼示例3''' 
  21. import pkuseg 
  22.  
  23. #假設(shè)用戶已經(jīng)下載好了ctb8的模型并放在了'./ctb8'目錄下,通過(guò)設(shè)置model_name加載該模型 
  24. seg = pkuseg.pkuseg(model_name='./ctb8'
  25. text = seg.cut('我愛(ài)北京天安門'
  26. print(text) 

對(duì)于大型文本數(shù)據(jù)集,如果需要快速分詞的話,我們也可以采用多線程的方式:

  1. '''代碼示例4''' 
  2. import pkuseg 
  3. #對(duì)input.txt的文件分詞輸出到output.txt中,使用默認(rèn)模型和詞典,開(kāi)20個(gè)進(jìn)程 
  4. pkuseg.test('input.txt''output.txt', nthread=20

***,pkuseg 還能重新訓(xùn)練一個(gè)分詞模型:

  1. '''代碼示例5''' 
  2. import pkuseg 
  3.  
  4. #訓(xùn)練文件為'msr_training.utf8',測(cè)試文件為'msr_test_gold.utf8',模型存到'./models'目錄下,開(kāi)20個(gè)進(jìn)程訓(xùn)練模型 
  5. pkuseg.train('msr_training.utf8''msr_test_gold.utf8''./models', nthread=20

這些都是 GitHub 上的示例,詳細(xì)的內(nèi)容請(qǐng)參考 GitHub 項(xiàng)目,例如參數(shù)說(shuō)明和參考論文等。

責(zé)任編輯:張燕妮 來(lái)源: 機(jī)器之心
相關(guān)推薦

2017-06-26 15:15:24

開(kāi)源語(yǔ)音識(shí)別工具包

2012-03-16 10:07:30

IK AnalyzerJava

2016-09-18 23:56:51

Java開(kāi)源中文分詞器

2018-11-14 10:01:30

谷歌開(kāi)源機(jī)器學(xué)習(xí)

2025-03-11 08:50:00

2011-06-03 16:04:05

SEO分詞

2024-11-04 08:01:19

Node.js底層分詞

2025-05-06 15:32:23

模型AI測(cè)試

2024-11-11 10:00:00

ChatGPT模型

2018-06-12 07:15:18

阿里巴巴技術(shù)語(yǔ)音識(shí)別

2017-02-23 10:50:32

Python微博數(shù)據(jù)

2023-07-26 15:13:33

人工智能OpenAI

2022-04-13 10:31:04

微軟Jigsaw大型語(yǔ)言模型

2022-09-07 08:16:09

MySQL索引

2019-11-20 15:01:55

開(kāi)源技術(shù) 趨勢(shì)

2023-12-12 13:51:00

AI訓(xùn)練

2016-02-16 13:21:33

2021-10-11 17:27:50

框架計(jì)算機(jī)開(kāi)發(fā)

2021-04-12 08:17:12

ElasticSear分詞中文

2011-08-16 16:24:28

全文檢索數(shù)據(jù)挖掘
點(diǎn)贊
收藏

51CTO技術(shù)棧公眾號(hào)

主站蜘蛛池模板: 免费久久久 | 美女视频h | 性在线 | 黄色av网站在线观看 | 日本不卡免费新一二三区 | 成人精品视频 | 99久热 | 国产欧美一区二区三区久久 | 97色在线视频 | 亚洲一区二区三区在线播放 | 国产探花 | 亚洲精品久久久久久国产精华液 | 视频在线亚洲 | 日一区二区 | 91精品一区 | av大片在线观看 | 成人av看片| 97精品国产97久久久久久免费 | 国产精品国产三级国产aⅴ无密码 | 亚洲综合色视频在线观看 | 成人精品毛片 | 天天插天天狠天天透 | 特级做a爰片毛片免费看108 | 一级毛片免费看 | 亚洲成人激情在线观看 | 伊人精品 | 黄网站涩免费蜜桃网站 | 精品国产欧美一区二区 | 在线看亚洲 | 九九精品久久久 | 97人人澡人人爽91综合色 | 国产美女自拍视频 | 欧美视频一区二区三区 | 国产男女视频网站 | 国产乱码精品一区二区三区五月婷 | 男女免费观看在线爽爽爽视频 | www.五月天婷婷.com | 欧美精品欧美精品系列 | 97国产精品视频 | 免费看一区二区三区 | 国产精品国产三级国产aⅴ中文 |