小编nev*_*int的帖子

在Unix上连接文本文件中的多个字段

我该怎么做?

File1看起来像这样:

foo 1 scaf 3 
bar 2 scaf 3.3
Run Code Online (Sandbox Code Playgroud)

File2看起来像这样:

foo 1 scaf 4.5
foo 1 boo 2.3
bar 2 scaf 1.00
Run Code Online (Sandbox Code Playgroud)

我想要做的是找到 在字段1,2和3相同时在File1和File2中共同出现的行.

有办法吗?

unix linux bash join

13
推荐指数
4
解决办法
3万
查看次数

如何将Perl数组分区为相同大小的块?

我有一个固定大小的数组,其中数组的大小始终为3.

my @array = ('foo', 'bar', 'qux', 'foo1', 'bar', 'qux2', 3, 4, 5);
Run Code Online (Sandbox Code Playgroud)

我如何聚类数组成员,以便我们可以得到一个数组3的数组:

$VAR = [ ['foo','bar','qux'],
         ['foo1','bar','qux2'],
         [3, 4, 5] ];
Run Code Online (Sandbox Code Playgroud)

perl

12
推荐指数
4
解决办法
1万
查看次数

如何在heatmap.2()中为原始数据指定色标

我的数据看起来像这样:

                         Name    h1    h2    h3    h4    h5
1            1420468_at_Asb17 0.000 2.328 0.000 0.000 0.000
2    1430261_at_1700024J04Rik 1.236 2.050 0.000 0.000 0.000
3           1431788_at_Fabp12 0.000 2.150 0.000 0.000 0.587
4    1433187_at_B230112I24Rik 0.000 2.240 1.343 0.000 1.383
5        1434430_s_at_Adora2b 0.000 2.006 1.459 0.000 1.272
6           1435217_at_Gm7969 0.727 2.350 1.494 0.976 0.000
7          1436717_x_at_Hbb-y 0.000 2.712 0.000 0.000 0.000
8            1440859_at_Akap6 0.000 2.053 0.000 0.000 1.840
9              1442625_at_--- 0.000 2.064 1.173 0.000 1.035
10           1443715_at_Rbm24 0.969 2.219 0.000 0.000 0.000
11             1445520_at_--- 0.000 …
Run Code Online (Sandbox Code Playgroud)

plot r

12
推荐指数
1
解决办法
3万
查看次数

在Pandas中将列拆分为多行的快速方法

我有以下数据框:

import pandas as pd
df = pd.DataFrame({ 'gene':["foo",
                            "bar // lal",
                            "qux",
                            "woz"], 'cell1':[5,9,1,7], 'cell2':[12,90,13,87]})
df = df[["gene","cell1","cell2"]]
df
Run Code Online (Sandbox Code Playgroud)

看起来像这样:

Out[6]:
         gene  cell1  cell2
0         foo      5     12
1  bar // lal      9     90
2         qux      1     13
3         woz      7     87
Run Code Online (Sandbox Code Playgroud)

我想要做的是拆分'基因'列,使其结果如下:

         gene  cell1  cell2
         foo      5     12
         bar      9     90
         lal      9     90
         qux      1     13
         woz      7     87
Run Code Online (Sandbox Code Playgroud)

我目前的做法是:

import pandas as pd
import timeit

def create():
    df = pd.DataFrame({ 'gene':["foo",
                            "bar // lal",
                            "qux",
                            "woz"], …
Run Code Online (Sandbox Code Playgroud)

python pandas

12
推荐指数
1
解决办法
6813
查看次数

如何在Pandas数据框中扩展列

我有以下pandas数据框:

import pandas as pd
import numpy as np
df = pd.DataFrame({
               'fc': [100,100,112,1.3,14,125],
               'sample_id': ['S1','S1','S1','S2','S2','S2'],
               'gene_symbol': ['a', 'b', 'c', 'a', 'b', 'c'],
               })

df = df[['gene_symbol', 'sample_id', 'fc']]
df
Run Code Online (Sandbox Code Playgroud)

产生这个:

Out[11]:
  gene_symbol sample_id     fc
0           a        S1  100.0
1           b        S1  100.0
2           c        S1  112.0
3           a        S2    1.3
4           b        S2   14.0
5           c        S2  125.0
Run Code Online (Sandbox Code Playgroud)

我sample_id该如何传播以便最终得到这个:

gene_symbol    S1   S2
a             100   1.3
b             100   14.0
c             112   125.0
Run Code Online (Sandbox Code Playgroud)

python pivot dataframe pandas

12
推荐指数
1
解决办法
7730
查看次数

如何理解RandomForestExplainer输出(R包)

我有以下代码,它基本上尝试使用randomForest预测Species来自iris数据.我真正想要的是找到解释物种分类的最佳特征(变量).我发现包randomForestExplainer是最好的服务目的.

library(randomForest)
library(randomForestExplainer)
forest <- randomForest::randomForest(Species ~ ., data = iris, localImp = TRUE)
importance_frame <- randomForestExplainer::measure_importance(forest)
randomForestExplainer::plot_multi_way_importance(importance_frame, size_measure = "no_of_nodes")
Run Code Online (Sandbox Code Playgroud)

代码的结果产生了这个图:

在此输入图像描述

根据情节,解释为什么Petal.Length和Petal.Width是最佳因素的关键因素是这些(解释基于小插图):

  1. mean_min_depth - 以参数mean_sample指定的三种方式之一计算的平均最小深度,
  2. times_a_root - 使用Xj分割根节点的树的总数(即,基于Xj的值将整个样本分成两个),
  3. no_of_nodes - 使用Xj进行拆分的节点总数(如果树浅,通常等于no_of_trees),

我不清楚为什么高times_a_root而且no_of_nodes更好?低价mean_min_depth更好?

有什么直观的解释?

该小品信息不能帮助.

r machine-learning random-forest

12
推荐指数
1
解决办法
281
查看次数

用Sed删除字符串的部分

我有这样的数据行:

sp_A0A342_ATPB_COFAR_6_+_contigs_full.fasta
sp_A0A342_ATPB_COFAR_9_-_contigs_full.fasta
sp_A0A373_RK16_COFAR_10_-_contigs_full.fasta
sp_A0A373_RK16_COFAR_8_+_contigs_full.fasta
sp_A0A4W3_SPEA_GEOSL_15_-_contigs_full.fasta
Run Code Online (Sandbox Code Playgroud)

如何sed为每行删除第4列(_分隔)后的部分字符串.最后屈服:

sp_A0A342_ATPB_COFAR
sp_A0A342_ATPB_COFAR
sp_A0A373_RK16_COFAR
sp_A0A373_RK16_COFAR
sp_A0A4W3_SPEA_GEOSL
Run Code Online (Sandbox Code Playgroud)

unix linux bash sed

11
推荐指数
1
解决办法
3万
查看次数

如何在R中绘制多条线

我有一个看起来像这样的数据:

#d  TRUE    FALSE   Cutoff
4   28198   0   0.1
4   28198   0   0.2
4   28198   0   0.3
4   28198   13  0.4
4   28251   611 0.5
4   28251   611 0.6
4   28251   611 0.7
4   28251   611 0.8
4   28251   611 0.9
4   28251   611 1
6   19630   0   0
6   19630   0   0.1
6   19630   0   0.2
6   19630   0   0.3
6   19630   0   0.4
6   19636   56  0.5
6   19636   56  0.6
6   19636   56  0.7
6   19636   56 …
Run Code Online (Sandbox Code Playgroud)

plot r

11
推荐指数
2
解决办法
1万
查看次数

如何命名data.frame的未命名第一列

我有一个如下所示的数据框:

> mydf
                   val1     val2
hsa-let-7a         2.139890 -0.03477569
hsa-let-7b         2.102590  0.04108795
hsa-let-7c         2.061705  0.02375882
hsa-let-7d         1.938950 -0.04364545
hsa-let-7e         1.889000 -0.10575235
hsa-let-7f         2.264296  0.08465690
Run Code Online (Sandbox Code Playgroud)

请注意,从3列只有第2和第3列是名称.我想要做的是命名第一列(加上重命名第二和第三列).

但为什么这个命令失败了?

colnames(mydf) <- c("COL1","VAL1","VAL2");
Run Code Online (Sandbox Code Playgroud)

什么是正确的方法呢?

它给了我:

Error in `colnames<-`(`*tmp*`, value = c("COL1", "VAL1", "VAL2" :
  'names' attribute [3] must be the same length as the vector [2]
Run Code Online (Sandbox Code Playgroud)

r dataframe

11
推荐指数
1
解决办法
2万
查看次数

为什么Conda在激活环境后无法调用正确的Python版本?

我在Linux下有以下conda环境:

$ conda info -e
# conda environments:
#
py33                     /u21/coyotito/.anaconda/envs/py33
root                  *  /u21/coyotito/.anaconda
Run Code Online (Sandbox Code Playgroud)

并py33使用此命令创建:

$ conda create -n py33 python=3.3 anaconda
Run Code Online (Sandbox Code Playgroud)

问题是当我激活py33它仍然无法调用Python版本3.3.

[coyotito@pearl ~]$ source activate py33
(coyotito)[coyotito@pearl ~]$ python --version
Python 2.7.10 :: Anaconda 2.1.0 (64-bit)
(coyotito)[coyotito@pearl ~]$ conda info -e
# conda environments:
#
py33                     /u21/coyotito/.anaconda/envs/py33
root                  *  /u21/coyotito/.anaconda
Run Code Online (Sandbox Code Playgroud)

即它仍然调用旧的python.另请注意,括号下的提示不是(py33).

(coyotito)[coyotito@pearl ~]$ which python
~/.anaconda/bin/python
Run Code Online (Sandbox Code Playgroud)

在新环境中代替python:

~/.anaconda/envs/py33/bin/python3.3
Run Code Online (Sandbox Code Playgroud)

我该如何解决这个问题?

更新

我的PATH环境~/.bash_profile如下所示:

export PATH=$HOME/.anaconda/bin:$PATH
Run Code Online (Sandbox Code Playgroud)

python anaconda

11
推荐指数
5
解决办法
3246
查看次数

标签 统计

r ×4

python ×3

bash ×2

dataframe ×2

linux ×2

pandas ×2

plot ×2

unix ×2

anaconda ×1

join ×1

machine-learning ×1

perl ×1

pivot ×1

random-forest ×1

sed ×1