小编Lon*_*guy的帖子

用于大数据的数据结构

我有一百万行的excel表.每行有100列.每行表示具有100个属性的类的实例,列值是这些属性的值.

在这里使用哪种数据结构最适合存储数百万的数据实例?

谢谢

java algorithm data-structures

3
推荐指数
1
解决办法
2500
查看次数

可以执行这些类型的SPARQL查询吗?

假设我们有一个巨大的RDF图,并希望执行以下操作:(我尝试过它并不起作用 - 想知道我是否正在构建错误的查询或rdf转储的某些问题).

select ?n ?o 
where {
    ?n <name_of_a_node> <name_of_this_node>.
    ?n ?p ?o.
    ?o <type_of_a_node> ?t.
    FILTER(REGEX(STR(?t), "president")).
}
Run Code Online (Sandbox Code Playgroud)

上面的查询说我知道节点n的名称.所以,我得到了节点n的URI.然后,我获取节点n的所有谓词和其他节点连接签名这个谓词.对于连接到节点a的每个节点o,我想查看它们的属性(类型属性)并仅检索那些在其type属性中具有子字符串的节点.

这在SPARQL中是否可行?基本上,站在节点上并查看此节点所连接的所有其他节点,然后仅检索与其属性上的其他条件匹配的节点.

否则,我应该只检索节点n所连接的所有节点,并且对于每个节点,运行另一个SPARQL查询来执行此检查?

我正在使用JENA来存储数据.

rdf semantic-web sparql jena

3
推荐指数
1
解决办法
218
查看次数

有没有办法在PySpark中读取文本文件时控制分区数

我在PySpark中使用以下命令读取文本文件

rating_data_raw = sc.textFile("/<path_to_csv_file>.csv")
Run Code Online (Sandbox Code Playgroud)

有没有办法指定RDD rating_data_raw应分成的分区数?我想指定大量的分区以实现更高的并发性.

python apache-spark rdd pyspark

3
推荐指数
1
解决办法
4826
查看次数

out.println说出来无法解决

当我写的时候out.println(),eclipse抱怨说无法解决.

我有导入java.io.*和其他servlet包.

java servlets

2
推荐指数
3
解决办法
2万
查看次数

当我们知道HashMap中的值时获取密钥

可能重复:
Java Hashmap:如何从值获取密钥?

我知道HashMap包含一个特定的整数变量作为值.如何获得与此值相关联的密钥?

java data-structures

2
推荐指数
1
解决办法
8830
查看次数

WEKA如何处理名义属性v/s数值属性?

如果我的数据集中的一列只有3个可能的值.ie 0,1和2,如果我将它们声明为标称v/s数值,那么WEKA对它们有何不同?

此外,如果我有一个列属性的大量名义值,是否有一种简单的方法来声明这个具有非常高的序数值的名义属性?

machine-learning data-mining weka

2
推荐指数
1
解决办法
8400
查看次数

为什么这段代码不会遍历reducer值两次?

我有这个代码:

public void reduce(Text key, Iterable<Text> values, Context context) 
        throws IOException, InterruptedException 
        {
            String name = null; 
            String sid = null;
            String predicate = null;
            String oid = null;
            String id = null;
            String outKey = null;
            String outVal = null;

            LinkedList<Text> valuesList = new LinkedList<Text>();
            Iterator<Text> ite = values.iterator();
            while(ite.hasNext()) {
                Text t = ite.next();
                String[] entities = t.toString().split("#-#-#-#");
                        if(entities[entities.length-1].equalsIgnoreCase("topic_name"))
                {
                    name = entities[0];
                }
                valuesList.add(t);
            }
            Iterator<Text> ite2 = valuesList.iterator();
            while(ite2.hasNext()) { 
                Text t2 = ite2.next(); 
                String[] entities …
Run Code Online (Sandbox Code Playgroud)

hadoop mapreduce hdfs

2
推荐指数
1
解决办法
3517
查看次数

使用wordnet同义词在Lucene 4.2版本中扩展查询

我正在使用Lucene 4.2,并想知道wordnet如何用于扩展此版本的Lucene的输入查询.基本上,如果我的查询是这样的

term_1 AND term_2 OR term_3
Run Code Online (Sandbox Code Playgroud)

我希望它能够扩展为

(term_1 OR term_1syn_1 OR term_1syn_2) AND (term_2 OR term_2syn_1) OR (term_3 OR term_3syn_1)
Run Code Online (Sandbox Code Playgroud)

等等.

我在StackoverFlow上查看了这类问题的其他答案,但没有一个有任何示例实现.

给定一个字符串形式的输入查询,如何使用WordNetQueryParser和SynonymMap类扩展它?

我已经下载了wordnet prolog文件,我知道_s.pl文件包含所有同义词.

任何示例代码都将受到高度赞赏.

lucene solr wordnet

2
推荐指数
1
解决办法
3307
查看次数

R如何处理多个包中存在的方法的冲突?

假设有一个方法(比如说"sample()")并且它存在于多个包中(假设两者都包含在"base"和"arules"中).现在,如果我调用sample()调用哪个包,它是否会调用包"base"或"arules",它如何决定调用哪一个?

r

2
推荐指数
1
解决办法
72
查看次数

如何检查文件每一行上的所有路径是否都是Bash中的有效路径?

我有一个文件在每一行都有不同的路径

path_1
path_2
...
Run Code Online (Sandbox Code Playgroud)

等等.

我需要检查所有这些路径是否有效.

我现在的做法是创建一个新目录(tmp),然后编写

while read line; do cp $line > tmp; done < my_paths_file
Run Code Online (Sandbox Code Playgroud)

然后检查复制到tmp目录中的文件数是否等于文件中的行数.这需要太长时间,因为我的文件中有很多行.

是否有更智能,更快捷的方法来检查所有路径的有效性?

unix bash

2
推荐指数
1
解决办法
46
查看次数