我是R和tm包中的新手,所以请原谅我的愚蠢问题;-)如何在R tm包中显示纯文本语料库的文本?
我在语料库中加载了一个包含323个纯文本文件的语料库:
src <- DirSource("Korpora/technologie")
corpus <- Corpus(src)
Run Code Online (Sandbox Code Playgroud)
但是当我用语料库调用语料库时:
corpus[[1]]
Run Code Online (Sandbox Code Playgroud)
我总是得到这样的输出而不是语料库本身:
<<PlainTextDocument>>
Metadata: 7
Content: chars: 144
Content: chars: 141
Content: chars: 224
Content: chars: 75
Content: chars: 105
Run Code Online (Sandbox Code Playgroud)
如何显示语料库的文本?
谢谢!
更新可 重复的样本:我已经尝试了内置的示例文本:
> data("crude")
> crude
<<VCorpus>>
Metadata: corpus specific: 0, document level (indexed): 0
Content: documents: 20
> crude[1]
<<VCorpus>>
Metadata: corpus specific: 0, document level (indexed): 0
Content: documents: 1
> crude[[1]]
<<PlainTextDocument>>
Metadata: 15
Content: chars: 527
Run Code Online (Sandbox Code Playgroud)
如何打印文档文本?
更新2:会话信息:
> sessionInfo()
R version 3.1.3 (2015-03-09) …Run Code Online (Sandbox Code Playgroud) 当我有距离矩阵(或基于矩阵的数据框)时,如何获得与给定值对应的行和列?
例:
df <- data.frame(x = c(11:20), y= c(12:21))
dst <- dist(df)
Run Code Online (Sandbox Code Playgroud)
输出:
1 2 3 4 5 6 7 8 9
2 1.414214
3 2.828427 1.414214
4 4.242641 2.828427 1.414214
5 5.656854 4.242641 2.828427 1.414214
6 7.071068 5.656854 4.242641 2.828427 1.414214
7 8.485281 7.071068 5.656854 4.242641 2.828427 1.414214
8 9.899495 8.485281 7.071068 5.656854 4.242641 2.828427 1.414214
9 11.313708 9.899495 8.485281 7.071068 5.656854 4.242641 2.828427 1.414214
10 12.727922 11.313708 9.899495 8.485281 7.071068 5.656854 4.242641 2.828427 1.414214
现在我想输入例如11.313708并获取输出(9,1)
在Windows 7(64位)中是否存在可以消耗一定数量内存的工具?
我想在可用RAM变低时测试软件的行为。