我正在使用enron电子邮件数据集,我正在尝试删除没有"@ enron.com"的电子邮件地址(即我只想发送enron电子邮件).当我试图在没有@enron.com的情况下删除这些地址时,由于某些原因,一些电子邮件被忽略了.下面显示了一个小图,其中顶点是电子邮件地址.这是gml格式:
Creator "igraph version 0.7 Sun Mar 29 20:15:45 2015"
Version 1
graph
[
directed 1
node
[
id 0
label "csutter@enron.com"
]
node
[
id 1
label "steve_williams@eogresources.com"
]
node
[
id 2
label "kutner.stephen@enron.com"
]
node
[
id 3
label "igsinc@ix.netcom"
]
node
[
id 4
label "dbn@felesky.com"
]
node
[
id 5
label "cheryltd@tbardranch.com"
]
node
[
id 6
label "slover.eric@enron.com"
]
node
[
id 7
label "alkeister@yahoo.com"
]
node
[
id 8
label "econnors@mail.mainland.cc.tx.us"
] …Run Code Online (Sandbox Code Playgroud) 我有一个GML(图形(不是涂鸦)建模语言)文件,我想从中创建ID到标签的映射.我不知道如何做到这一点,因为我的列表操作似乎不起作用.我尝试使用指定如何使用两个分隔符的示例,但它不适用于我的文件.
有人可以指导我吗?
GML文件排列如下:
graph [
node [
id 0
label "24"
]
node [
id 1
label "25"
]
node [
id 2
label "26"
]
node [
id 3
label "27"
]
node [
id 4
label "20"
]
node [
id 5
label "21"
]
(... some more nodes)
edge [
source 0
target 75
weight 4
]
edge [
source 0
target 68
weight 2
]
(many more edges)
]
Run Code Online (Sandbox Code Playgroud)
我想提取每个节点块中的数据,并创建节点ID到节点标签的映射.例如,第一个节点的映射将是0-> 24,依此类推.我并不担心边缘信息.
在此先感谢您的帮助.
我希望能够有很多节点具有相同的标签 \xe2\x80\x94\xc2\xa0 在我的特定情况下,每个节点代表一篇新闻文章,并且应该用其新闻类别来标记它们。最终,我真正想要的是带有这些标签的 GML 文件。
\n\n这是一个小样本:
\n\nGtest = nx.Graph()\nnodes = [0, 1, 2, 3, 4]\nlabels = {0:"business", 1:"business",2:"sports", 3:"sports", 4:"politics"}\n\nfor node in nodes:\n Gtest.add_node(node)\n\nprint Gtest.nodes(data=True) \n\n""" \nthis prints:\n[(0, {}), (1, {}), (2, {}), (3, {}), (4, {})]\n\nWhich is good, I want 5 nodes.\n"""\n\nGtest = nx.relabel_nodes(Gtest, labels)\n\nprint Gtest.nodes(data=True)\n\n"""this prints:\n\n[(\'business\', {}), (\'politics\', {}), (\'sports\', {})]\n\nThere are only 3 nodes.\n"""\n\nnx.write_gml(Gtest, "gml/stackoverflow_test", stringizer = None)\n\n"""\nThis writes the GML file:\n\ngraph [\n name "()"\n node [\n id 0\n label "business"\n ]\n node …Run Code Online (Sandbox Code Playgroud) 当我尝试阅读政治书籍数据集的 gml 文件时遇到问题。我使用命令:
hh=read.table("polbooks.gml")
Run Code Online (Sandbox Code Playgroud)
Erreur dans scan(file, what, nmax, sep, dec, quote, skip, nlines, na.strings, : la ligne 2 n'avait pas 2 éléments
当我使用这个时:
library(multiplex)
hh=read.gml("polbooks.gml")
Run Code Online (Sandbox Code Playgroud)
Erreur dans (grep("graphics", edg, fixed = TRUE)[(i - 1)] + 2):(grep("graphics", : argument NA / NaN
我在每个数据集“.gml”中都有这个问题
我有一个很长的GML文件(图形建模语言),我试图用Python中的Networkx阅读.在GML文件中,节点没有标签,如下所示:
graph [
node [
id 1
]
node [
id 2
]
edge [
source 2
target 1
]
]
Run Code Online (Sandbox Code Playgroud)
我在读取文件时遇到错误:G = nx.read_gml('simple_graph.gml')
---------------------------------------------------------------------------
NetworkXError Traceback (most recent call last)
<ipython-input-39-b1b319a08668> in <module>()
----> 1 G = nx.read_gml('simple_graph.gml')
<decorator-gen-319> in read_gml(path, label, destringizer)
/usr/lib/python2.7/dist-packages/networkx/utils/decorators.pyc in _open_file(func, *args, **kwargs)
218 # Finally, we call the original function, making sure to close the fobj.
219 try:
--> 220 result = func(*new_args, **kwargs)
221 finally:
222 if close_fobj:
/usr/lib/python2.7/dist-packages/networkx/readwrite/gml.pyc in read_gml(path, label, …Run Code Online (Sandbox Code Playgroud)