小编dfr*_*kow的帖子

unix skip-header bash函数

在stackoverflow的某个地方,我得到了一个名为"body"的bash函数,它将回显文件的标题(第一行),并将正文(其余行)传递给stdout.这对我来说非常有用,可以处理带有标题的文件.

例:

FILE.CSV:

field1,field2
a,2
b,1
Run Code Online (Sandbox Code Playgroud)

命令:

$ sort -k2,2 -nr file.csv -t,
a,2
b,1
field1,field2

$ cat file.csv | body sort -nr -t, -k2,2
field1,field2
a,2
b,1
Run Code Online (Sandbox Code Playgroud)

不是一个很好的例子,但它显示标题保持在最顶层.

谷歌搜索和搜索stackoverflow的分钟没有透露任何结果.

任何人都可以找到或重建这样的功能吗?

bash

3
推荐指数
1
解决办法
5373
查看次数

如何在计算方框之前让geom_boxplot应用y-limits?

这是一个箱线图:

qplot(cyl, mpg, data=mtcars) +
  geom_boxplot() +
  scale_y_continuous()
Run Code Online (Sandbox Code Playgroud)

看起来像这样: 在此输入图像描述

现在我为y轴添加限制:

qplot(cyl, mpg, data=mtcars) +
  geom_boxplot() +
  scale_y_continuous(limits=c(0,20))
Run Code Online (Sandbox Code Playgroud)

整个画面变化:

在此输入图像描述

我如何获得与第一张相同的图片,只是显示y = 0到20的"视口"?

而..第二张图片是什么?看起来实际上缺少数据(例如:cyl = 4的3-4分).

r ggplot2

3
推荐指数
1
解决办法
4097
查看次数

在R中打印命名向量?

假设我有这个命名向量:

> foo = setNames(c("one", "two"), c(1, 2))
> foo
    1     2 
"one" "two" 
> names(foo)
[1] "1" "2"
> foo
    1     2 
"one" "two" 
Run Code Online (Sandbox Code Playgroud)

打印以下内容的最简单方法是什么:

1: one, 2: two
Run Code Online (Sandbox Code Playgroud)

我只想要它进行调试.

可以有或没有引号,我不挑剔.

我有这个,但它似乎非常健谈:

the_vec = c()
for (idx in 1:length(foo)) {
  the_vec = c(the_vec, paste(idx, ":", foo[idx], sep=""))
}
paste(the_vec, collapse=", ")
Run Code Online (Sandbox Code Playgroud)

输出:

[1] "1:one, 2:two"
Run Code Online (Sandbox Code Playgroud)

r

3
推荐指数
1
解决办法
1881
查看次数

如何在 R Jupyter 笔记本中格式化 R 表?

假设我正在使用带有 R 内核的 Jupyter 笔记本,并且我想格式化一个表格,以便 p_value < 0.01 的任何行都以粗体显示。如何?

环顾四周,我可以找到 Jupyter 中没有的 R 样式,R 中没有的 Jupyter 样式等等,但不是我想要的。

r jupyter-notebook jupyter-irkernel

3
推荐指数
1
解决办法
3102
查看次数

如何将字符串公式传递给 R 的 lm 并查看摘要中的公式?

在下面的 R 会话中,summary(model)将公式显示为model_str。如何让它显示为mpg ~ cyl + hp同时仍然能够通过字符串设置模型公式?

> data(mtcars)
> names(mtcars)
 [1] "mpg"  "cyl"  "disp" "hp"   "drat" "wt"   "qsec" "vs"   "am"   "gear" "carb"
> model_str <- 'mpg ~ cyl + hp'
> model <- lm(model_str, data=mtcars)
> summary(model)

Call:
lm(formula = model_str, data = mtcars)

Residuals:
    Min      1Q  Median      3Q     Max 
-4.4948 -2.4901 -0.1828  1.9777  7.2934 

Coefficients:
            Estimate Std. Error t value Pr(>|t|)    
(Intercept) 36.90833    2.19080  16.847  < 2e-16 ***
cyl         -2.26469    0.57589  -3.933 …
Run Code Online (Sandbox Code Playgroud)

r lm

3
推荐指数
1
解决办法
108
查看次数

dplyr group_by 列名向量?

我曾经能够group_by_使用字符串作为列名(“标准评估”),但现在已弃用。

> data(mtcars)
> mtcars %>% group_by_('mpg') %>% tally() %>% head(2)
# A tibble: 2 x 2
    mpg     n
  <dbl> <int>
1  10.4     2
2  13.3     1
Warning message:
`group_by_()` is deprecated as of dplyr 0.7.0.
Please use `group_by()` instead.
See vignette('programming') for more help
Run Code Online (Sandbox Code Playgroud)

此外,看起来也许按多个列进行分组从未与 group_by_ 一起使用?

> mtcars %>% group_by_(c('mpg', 'cyl')) %>% tally() %>% head(2)
# A tibble: 2 x 2
    mpg     n
  <dbl> <int>
1  10.4     2
2  13.3     1
Run Code Online (Sandbox Code Playgroud)

如何使用列名称向量获得适当的计数?

例如,结果如下所示:

> mtcars %>% …
Run Code Online (Sandbox Code Playgroud)

r dplyr

3
推荐指数
1
解决办法
1041
查看次数

如何在Redshift中解析主机的字符串?

我正在寻找一个与Hive的parse_url(......,'HOST')相当的Postgres(实际上是Redshift ).

Postgres docs say it has a URL parser as part of its full text search. This blog post has a regex which may or may not be bulletproof. What is best?

amazon-redshift

2
推荐指数
2
解决办法
8032
查看次数

如何转置 R Markdown 文档中的表格?

假设我打印一个名为 summary_table 的数据框,如下所示:

summary_table = data.frame(a=c(1,2,3), b=c(11,12,13),c=c(21,22,23),d=c(31,32,33),e=c(41,42,43),f=c(51,52,53),g=c(61,62,63),h=c(71,72,73),i=c(81,82,83),j=c(91,92,93),k=c(101,102,103),l=c(111,112,113))

print(xtable(summary_table,
         align=rep("r",13),
         caption="A summary of stuff."),
  table.placement="H")
Run Code Online (Sandbox Code Playgroud)

现在假设 summary_table 只有三行,但有十二列。我想翻转(转置)表格,使列变成行。

有什么简便的方法吗?

r r-markdown

2
推荐指数
1
解决办法
4410
查看次数

无需额外查询即可获取SQLite3中受UPDATE影响的行

有没有一种方法可以更新 SQLite3 数据库中的行并获取这些更新的行,而不需要在我经常调用的函数中使用SELECTfollow by UPDATE,而无需进行第二次查询或执行任何比SELECTfollow by慢的操作UPDATE?使用触发器和中间表不算数,因为它仍然比我想要的慢。我正在使用标准sqlite3C 库。

例子:

UPDATE "ACTIVE"
SET confirmed2 = '%d'
WHERE username2 = '%s' AND activity = '%d'
Run Code Online (Sandbox Code Playgroud)

我正在更新“ACTIVE”表的行。我还想检索“username2”和“activity”是某一对值的所有行,以便我可以检查另一列的值“username1”。由于该UPDATE命令已经在查询这些行来更新它们,因此应该(但可能没有)有一种方法可以让我获取这些行而不需要再次查询。我可以获得受影响的行,但找不到有关获取行数据的任何信息。

c sqlite sql-update

2
推荐指数
1
解决办法
5566
查看次数

项目中每个人的默认 git 预提交挂钩?

按照这些指示进行操作安装 flake8 预提交挂钩:flake8 --install-hook git。如何让每个人都默认使用此预提交挂钩?

看起来它改变了我自己的沙箱(.git/hooks/pre-commit),但是没有任何东西可以提交或推送。项目中的其他开发人员不会获得预提交挂钩,除非他们自己安装它。

我希望它像 .gitignore 一样,其中有一个文件保存在源代码控制中,我们都可以更新和版本控制。

git flake8

2
推荐指数
1
解决办法
1805
查看次数