小编N2M*_*N2M的帖子

R命令检查文件每一行中的ALL CAPS序列

有一个csv数据文件,其中填充了大量原始数据,如下所示:

data.frame(
  id=1:4,
  data=c(
         "it's a programming language",
         "this data is JUNK",
         "refer www.google.com",
         "check for more information")
)
Run Code Online (Sandbox Code Playgroud)

我需要处理这些数据,并为每一行检查一个ALL CAPS序列,并用0/1条目填充一个新列.

输出文件如下:

id  data                         all_caps
1   it's a programming language         0
2   this data is JUNK                   1
3   refer www.google.com                0
4   check for more information          0
Run Code Online (Sandbox Code Playgroud)

如何用R实现这一目标?我一直在寻找这个,但是没有找到任何有效的结果来处理每一行.

r

4
推荐指数
1
解决办法
155
查看次数

Cassandra压力测试结果评估

我一直在使用cassandra-stress工具来评估我的cassandra集群已有一段时间了.

我的问题是我无法理解为我的特定用例生成的结果.

我的架构看起来像这样:

CREATE TABLE Table_test(
      ID uuid,
      Time timestamp,
      Value double,
      Date timestamp,
      PRIMARY KEY ((ID,Date), Time)
) WITH COMPACT STORAGE;
Run Code Online (Sandbox Code Playgroud)

我已经解析了一个自定义YAML文件和使用的参数信息n=10000,threads=100其余的都是默认选项(cl=one,mode=native cql3,等).Cassandra集群是一个3节点的CentOS VM设置.

自定义yaml文件的一些细节如下:

insert:
    partitions: fixed(100)
    select: fixed(1)/2
    batchtype: UNLOGGED

columnspecs:
    -name: Time
     size: fixed(1000)
    -name: ID
     size: uniform(1..100)
    -name: Date
     size: uniform(1..10)
    -name: Value
     size: uniform(-100..100)
Run Code Online (Sandbox Code Playgroud)

我到目前为止的观察如下:

  1. 使用n=10000和时间:fixed(1000),插入的行数为1000万.(10000*1000 = 10000000)
  2. 行键/分区的数量是10000(i.e n),其中一次取100个分区(这意味着100*1000 = 100000个键值对),其中一次处理50000个键值对.(这是因为select: fixed(1)/2~50%)

输出消息也确认相同:

使用[100..100]分区和[50000..50000]行(分区中总行数为[100000..100000])生成批次

对于具有上述相同配置的连续运行,我得到的结果如下:

Run Total_ops …
Run Code Online (Sandbox Code Playgroud)

cassandra datastax-enterprise datastax

4
推荐指数
1
解决办法
1478
查看次数

根据条件有效计算文件中字符串的出现次数

我的目标是以有效的方式根据条件计算文件中字符串的出现次数.

我在输入csv文件中有大约45k条记录.我需要全部读取它们并创建一个新文件,该文件描述特定持续时间内原始文件中字符串的出现次数.

输入文件:

Timestamp              Field
7/13/2013 10:30         ABC
7/13/2013 11:30         ABC
7/13/2013 10:34         ABC    
7/13/2013 10:15         CDE
7/13/2013 10:00         ABC
7/13/2013 10:14         CDE
7/13/2013 12:30         ABC
7/13/2013 00:30         ABC
7/13/2013 07:30         CDE
Run Code Online (Sandbox Code Playgroud)

主要目标是计算特定时间段内的字段出现次数.

我期待的输出是:

Slots                           ABC                      CDE
7/13/2013 00:01-03:00            1                        0
7/13/2013 03:01-06:00            0                        0    
7/13/2013 06:01-09:00            0                        1
7/13/2013 09:01-12:00            4                        2
7/13/2013 12:01-15:00            1                        0    
7/13/2013 15:01-18:00            0                        0
7/13/2013 18:01-21:00            0                        0
7/13/2013 21:01-24:00            0                        0
Run Code Online (Sandbox Code Playgroud)

我写了一个蛮力代码来完成我的工作,但需要很长的时间才能完成.我正在寻找一个有效的代码来完成这项任务.

我有一个单独的数据框,包含时间段(day_hour)和字段名称(field_data).我的强力方法是使用两个for循环来搜索两个数据帧的所有记录并相应地计算出现次数.

如果我可以使用table()在这种情况下可以提供帮助的功能,请指导我.

r

2
推荐指数
1
解决办法
476
查看次数

标签 统计

r ×2

cassandra ×1

datastax ×1

datastax-enterprise ×1