我已经浏览了几个小时的网页来找到适合我的解决方案,我相信这可能是一个非常小的问题。
我在启动语言模型的最初步骤中使用 fastai 的句段处理器 (SPProcesor)。
我这些步骤的代码如下所示:
bs = 48
processor = SPProcessor(lang='pl')
data_lm = (TextList.from_csv('', target_corpus, processor=processor)
.split_by_rand_pct(0.1)
.label_for_lm()
.databunch(bs=bs)
)
data_lm.save(data_lm_file)
Run Code Online (Sandbox Code Playgroud)
执行后我得到一个错误,如下所示:
~/x/miniconda3/envs/fastai/lib/python3.6/site-packages/fastai/text/data.py in process(self, ds)
466 self.sp_model,self.sp_vocab = cache_dir/'spm.model',cache_dir/'spm.vocab'
467 if not getattr(self, 'vocab', False):
--> 468 with open(self.sp_vocab, 'r', encoding=self.enc) as f: self.vocab = Vocab([line.split('\t')[0] for line in f.readlines()])
469 if self.n_cpus <= 1: ds.items = self._encode_batch(ds.items)
470 else:
FileNotFoundError: [Errno 2] No such file or directory: 'tmp/spm/spm.vocab'
Run Code Online (Sandbox Code Playgroud)
上面执行的代码的正确结果应该如下:
创建名为“tmp”
的文件夹,包含文件夹“spm”,
其中应放置 2 个文件,分别命名为:spm.vocab 和 spm.model。
相反,“tmp”文件夹与 …