如何下载 NLTK 数据?

2025-01-21 09:01:00
admin
原创
81
摘要:问题描述:更新后的答案:NLTK 适用于 2.7。我以前用的是 3.2。我卸载了 3.2 并安装了 2.7。现在它可以正常工作了!!我已经安装了 NLTK 并尝试下载 NLTK 数据。我所做的是按照此网站上的说明进行操作: http: //www.nltk.org/data.html我下载了 NLTK,安装了...

问题描述:

更新后的答案:NLTK 适用于 2.7。我以前用的是 3.2。我卸载了 3.2 并安装了 2.7。现在它可以正常工作了!!

我已经安装了 NLTK 并尝试下载 NLTK 数据。我所做的是按照此网站上的说明进行操作: http: //www.nltk.org/data.html

我下载了 NLTK,安装了它,然后尝试运行以下代码:

>>> import nltk
>>> nltk.download()

它给了我如下错误信息:

Traceback (most recent call last):
  File "<pyshell#6>", line 1, in <module>
    nltk.download()
AttributeError: 'module' object has no attribute 'download'
 Directory of C:Python32Libsite-packages

尝试了nltk.download()nltk.downloader(),都给出了错误消息。

然后我用来help(nltk)拉出包裹,它显示以下信息:

NAME
    nltk

PACKAGE CONTENTS
    align
    app (package)
    book
    ccg (package)
    chat (package)
    chunk (package)
    classify (package)
    cluster (package)
    collocations
    corpus (package)
    data
    decorators
    downloader
    draw (package)
    examples (package)
    featstruct
    grammar
    help
    inference (package)
    internals
    lazyimport
    metrics (package)
    misc (package)
    model (package)
    parse (package)
    probability
    sem (package)
    sourcedstring
    stem (package)
    tag (package)
    test (package)
    text
    tokenize (package)
    toolbox
    tree
    treetransforms
    util
    yamltags

FILE
    c:python32libsite-packages
ltk

我确实在那里看到了下载器,但不确定它为什么不工作。Python 3.2.2,系统 Windows Vista。


解决方案 1:

总结

要下载特定的数据集/模型,请使用该nltk.download()函数,例如,如果您要下载punkt句子标记器,请使用:

$ python3
>>> import nltk
>>> nltk.download('punkt')

如果您不确定需要哪些数据/模型,您可以从以下基本数据 + 模型列表开始:

>>> import nltk
>>> nltk.download('popular')

它将下载“热门”资源列表,其中包括:

<collection id="popular" name="Popular packages">
      <item ref="cmudict" />
      <item ref="gazetteers" />
      <item ref="genesis" />
      <item ref="gutenberg" />
      <item ref="inaugural" />
      <item ref="movie_reviews" />
      <item ref="names" />
      <item ref="shakespeare" />
      <item ref="stopwords" />
      <item ref="treebank" />
      <item ref="twitter_samples" />
      <item ref="omw" />
      <item ref="wordnet" />
      <item ref="wordnet_ic" />
      <item ref="words" />
      <item ref="maxent_ne_chunker" />
      <item ref="punkt" />
      <item ref="snowball_data" />
      <item ref="averaged_perceptron_tagger" />
    </collection>

已编辑

如果有人避免从下载较大数据集时出现错误nltk,请从https://stackoverflow.com/a/38135306/610569

$ rm /Users/<your_username>/nltk_data/corpora/panlex_lite.zip
$ rm -r /Users/<your_username>/nltk_data/corpora/panlex_lite
$ python

>>> import nltk
>>> dler = nltk.downloader.Downloader()
>>> dler._update_index()
>>> dler._status_cache['panlex_lite'] = 'installed' # Trick the index to treat panlex_lite as it's already installed.
>>> dler.download('popular')

更新

从 v3.2.5 开始,当nltk_data找不到资源时, NLTK 会有更具信息性的错误消息,例如:

>>> from nltk import word_tokenize
>>> word_tokenize('x')
Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
  File "/Users/l/alvas/git/nltk/nltk/tokenize/__init__.py", line 128, in word_tokenize
    sentences = [text] if preserve_line else sent_tokenize(text, language)
  File "/Users//alvas/git/nltk/nltk/tokenize/__init__.py", line 94, in sent_tokenize
    tokenizer = load('tokenizers/punkt/{0}.pickle'.format(language))
  File "/Users/alvas/git/nltk/nltk/data.py", line 820, in load
    opened_resource = _open(resource_url)
  File "/Users/alvas/git/nltk/nltk/data.py", line 938, in _open
    return find(path_, path + ['']).open()
  File "/Users/alvas/git/nltk/nltk/data.py", line 659, in find
    raise LookupError(resource_not_found)
LookupError: 
**********************************************************************
  Resource punkt not found.
  Please use the NLTK Downloader to obtain the resource:

  >>> import nltk
  >>> nltk.download('punkt')

  Searched in:
    - '/Users/alvas/nltk_data'
    - '/usr/share/nltk_data'
    - '/usr/local/share/nltk_data'
    - '/usr/lib/nltk_data'
    - '/usr/local/lib/nltk_data'
    - ''
**********************************************************************

有关的

解决方案 2:

尝试

nltk.download('all')

这将下载所有数据,无需单独下载。

解决方案 3:

安装 Pip:在终端中运行:sudo easy_install pip

安装 Numpy(可选):运行:sudo pip install -U numpy

安装 NLTK:运行:sudo pip install -U nltk

测试安装:运行: python

然后输入:import nltk

下载语料库

跑步 :python -m nltk.downloader all

解决方案 4:

不要将文件命名为 nltk.py 我使用了相同的代码并将其命名为 nltk,并得到了与您相同的错误,我更改了文件名并且一切顺利。

解决方案 5:

这对我有用:

nltk.set_proxy('http://user:password@proxy.example.com:8080')
nltk.download()

解决方案 6:

请尝试

import nltk

nltk.download()

运行之后你会得到类似这样的结果

NLTK Downloader
---------------------------------------------------------------------------
   d) Download   l) List    u) Update   c) Config   h) Help   q) Quit
---------------------------------------------------------------------------

然后,Press d

操作如下:

Downloader> d all

完成后您将收到以下消息,然后提示Press q
完成下载所有集合

解决方案 7:

您无法调用已保存的 python 文件,nltk.py因为解释器正在从该文件读取,而不是从实际文件读取。

更改 python shell 正在读取的文件的名称并尝试您最初执行的操作:

import nltk进而nltk.download()

解决方案 8:

这非常简单......

  1. 打开 pyScripter 或任何编辑器

  2. 创建一个 python 文件,例如:install.py

  3. 在其中写入以下代码。

import nltk
nltk.download()
  1. 将会出现一个弹出窗口,单击下载。

![下载窗口]](https://i.sstatic.net/hw89E.jpg)

解决方案 9:

我遇到了类似的问题。可能需要检查您是否使用了代理。

如果是,请在下载之前设置代理:

nltk.set_proxy('http://proxy.example.com:3128', ('USERNAME', 'PASSWORD'))

解决方案 10:

如果你正在运行一个非常老版本的 nltk,那么确实没有可用的下载模块(参考)

尝试一下:

import nltk
print(nltk.__version__)

根据参考,0.9.5 之后的任何版本都应该没问题

解决方案 11:

您应该在安装 python 时将 python 添加到您的 PATH...安装后..打开 cmd 提示符类型命令-pip install nltk
然后转到 IDLE 并打开一个新文件..将其保存为 file.py..然后打开 file.py 输入以下内容:import nltk

nltk.download()

解决方案 12:

尝试从http://www.nltk.org/nltk_data/下载 zip 文件,然后解压并保存到你的 Python 文件夹中,例如 C:\ProgramData\Anaconda3\nltk_data

解决方案 13:

如果您已经保存了文件名 nltk.py,并再次将其重命名为 my_nltk_script.py。检查文件 nltk.py 是否仍然存在。如果是,则删除它们并运行文件 my_nltk.scripts.py,它应该可以工作!

解决方案 14:

就像

import nltk
nltk.download()

然后你会看到一个弹出窗口询问下载什么,选择“全部”。由于它的大小,这将需要一些时间,但最终我们会得到它。

如果你使用 Google Colab,你可以使用

nltk.download(download_dir='/content/nltkdata')

运行后,系统会要求你从列表中选择

NLTK Downloader
----------------------------------------------------------------- 
----------
d) Download   l) List    u) Update   c) Config   h) Help   q) 
Quit
----------------------------------------------------------------- 
----------
Downloader> d

在这里你必须输入 d 来表示你想要下载。之后你会被要求输入你想要下载的标识符。你可以使用 l 命令查看可用标识符的列表,或者如果你想要全部,只需在输入框中输入“all”。然后你会看到类似这样的内容 -

Downloading collection 'all'
       | 
       | Downloading package abc to /content/nltkdata...
       |   Unzipping corpora/abc.zip.
       | Downloading package alpino to /content/nltkdata...
       |   Unzipping corpora/alpino.zip.
       | Downloading package biocreative_ppi to /content/nltkdata...
       |   Unzipping corpora/biocreative_ppi.zip.
       | Downloading package brown to /content/nltkdata...
       |   Unzipping corpora/brown.zip.
       | Downloading package brown_tei to /content/nltkdata...
       |   Unzipping corpora/brown_tei.zip.
       | Downloading package cess_cat to /content/nltkdata...
       |   Unzipping corpora/cess_cat.zip.
.
.
. 
 |   Unzipping models/wmt15_eval.zip.
       | Downloading package mwa_ppdb to /content/nltkdata...
       |   Unzipping misc/mwa_ppdb.zip.
       | 
     Done downloading collection all

---------------------------------------------------------------------------
    d) Download   l) List    u) Update   c) Config   h) Help   q) Quit
---------------------------------------------------------------------------
Downloader> q
True

最后你可以输入 q 退出。

解决方案 15:

您可以尝试:

>> $ import nltk
>> $ nltk.download_shell()
>> $ d
>> $ *name of the package*

快乐的 NLP。

相关推荐
  政府信创国产化的10大政策解读一、信创国产化的背景与意义信创国产化,即信息技术应用创新国产化,是当前中国信息技术领域的一个重要发展方向。其核心在于通过自主研发和创新,实现信息技术应用的自主可控,减少对外部技术的依赖,并规避潜在的技术制裁和风险。随着全球信息技术竞争的加剧,以及某些国家对中国在科技领域的打压,信创国产化显...
工程项目管理   1565  
  为什么项目管理通常仍然耗时且低效?您是否还在反复更新电子表格、淹没在便利贴中并参加每周更新会议?这确实是耗费时间和精力。借助软件工具的帮助,您可以一目了然地全面了解您的项目。如今,国内外有足够多优秀的项目管理软件可以帮助您掌控每个项目。什么是项目管理软件?项目管理软件是广泛行业用于项目规划、资源分配和调度的软件。它使项...
项目管理软件   1354  
  信创国产芯片作为信息技术创新的核心领域,对于推动国家自主可控生态建设具有至关重要的意义。在全球科技竞争日益激烈的背景下,实现信息技术的自主可控,摆脱对国外技术的依赖,已成为保障国家信息安全和产业可持续发展的关键。国产芯片作为信创产业的基石,其发展水平直接影响着整个信创生态的构建与完善。通过不断提升国产芯片的技术实力、产...
国产信创系统   21  
  信创生态建设旨在实现信息技术领域的自主创新和安全可控,涵盖了从硬件到软件的全产业链。随着数字化转型的加速,信创生态建设的重要性日益凸显,它不仅关乎国家的信息安全,更是推动产业升级和经济高质量发展的关键力量。然而,在推进信创生态建设的过程中,面临着诸多复杂且严峻的挑战,需要深入剖析并寻找切实可行的解决方案。技术创新难题技...
信创操作系统   27  
  信创产业作为国家信息技术创新发展的重要领域,对于保障国家信息安全、推动产业升级具有关键意义。而国产芯片作为信创产业的核心基石,其研发进展备受关注。在信创国产芯片的研发征程中,面临着诸多复杂且艰巨的难点,这些难点犹如一道道关卡,阻碍着国产芯片的快速发展。然而,科研人员和相关企业并未退缩,积极探索并提出了一系列切实可行的解...
国产化替代产品目录   28  
热门文章
项目管理软件有哪些?
云禅道AD
禅道项目管理软件

云端的项目管理软件

尊享禅道项目软件收费版功能

无需维护,随时随地协同办公

内置subversion和git源码管理

每天备份,随时转为私有部署

免费试用