我该怎么做?
File1看起来像这样:
foo 1 scaf 3
bar 2 scaf 3.3
Run Code Online (Sandbox Code Playgroud)
File2看起来像这样:
foo 1 scaf 4.5
foo 1 boo 2.3
bar 2 scaf 1.00
Run Code Online (Sandbox Code Playgroud)
我想要做的是找到 在字段1,2和3相同时在File1和File2中共同出现的行.
有办法吗?
我有一个固定大小的数组,其中数组的大小始终为3.
my @array = ('foo', 'bar', 'qux', 'foo1', 'bar', 'qux2', 3, 4, 5);
Run Code Online (Sandbox Code Playgroud)
我如何聚类数组成员,以便我们可以得到一个数组3的数组:
$VAR = [ ['foo','bar','qux'],
['foo1','bar','qux2'],
[3, 4, 5] ];
Run Code Online (Sandbox Code Playgroud) 我的数据看起来像这样:
Name h1 h2 h3 h4 h5
1 1420468_at_Asb17 0.000 2.328 0.000 0.000 0.000
2 1430261_at_1700024J04Rik 1.236 2.050 0.000 0.000 0.000
3 1431788_at_Fabp12 0.000 2.150 0.000 0.000 0.587
4 1433187_at_B230112I24Rik 0.000 2.240 1.343 0.000 1.383
5 1434430_s_at_Adora2b 0.000 2.006 1.459 0.000 1.272
6 1435217_at_Gm7969 0.727 2.350 1.494 0.976 0.000
7 1436717_x_at_Hbb-y 0.000 2.712 0.000 0.000 0.000
8 1440859_at_Akap6 0.000 2.053 0.000 0.000 1.840
9 1442625_at_--- 0.000 2.064 1.173 0.000 1.035
10 1443715_at_Rbm24 0.969 2.219 0.000 0.000 0.000
11 1445520_at_--- 0.000 …Run Code Online (Sandbox Code Playgroud) 我有以下数据框:
import pandas as pd
df = pd.DataFrame({ 'gene':["foo",
"bar // lal",
"qux",
"woz"], 'cell1':[5,9,1,7], 'cell2':[12,90,13,87]})
df = df[["gene","cell1","cell2"]]
df
Run Code Online (Sandbox Code Playgroud)
看起来像这样:
Out[6]:
gene cell1 cell2
0 foo 5 12
1 bar // lal 9 90
2 qux 1 13
3 woz 7 87
Run Code Online (Sandbox Code Playgroud)
我想要做的是拆分'基因'列,使其结果如下:
gene cell1 cell2
foo 5 12
bar 9 90
lal 9 90
qux 1 13
woz 7 87
Run Code Online (Sandbox Code Playgroud)
我目前的做法是:
import pandas as pd
import timeit
def create():
df = pd.DataFrame({ 'gene':["foo",
"bar // lal",
"qux",
"woz"], …Run Code Online (Sandbox Code Playgroud) 我有以下pandas数据框:
import pandas as pd
import numpy as np
df = pd.DataFrame({
'fc': [100,100,112,1.3,14,125],
'sample_id': ['S1','S1','S1','S2','S2','S2'],
'gene_symbol': ['a', 'b', 'c', 'a', 'b', 'c'],
})
df = df[['gene_symbol', 'sample_id', 'fc']]
df
Run Code Online (Sandbox Code Playgroud)
产生这个:
Out[11]:
gene_symbol sample_id fc
0 a S1 100.0
1 b S1 100.0
2 c S1 112.0
3 a S2 1.3
4 b S2 14.0
5 c S2 125.0
Run Code Online (Sandbox Code Playgroud)
我sample_id该如何传播以便最终得到这个:
gene_symbol S1 S2
a 100 1.3
b 100 14.0
c 112 125.0
Run Code Online (Sandbox Code Playgroud) 我有以下代码,它基本上尝试使用randomForest预测Species来自iris数据.我真正想要的是找到解释物种分类的最佳特征(变量).我发现包randomForestExplainer是最好的服务目的.
library(randomForest)
library(randomForestExplainer)
forest <- randomForest::randomForest(Species ~ ., data = iris, localImp = TRUE)
importance_frame <- randomForestExplainer::measure_importance(forest)
randomForestExplainer::plot_multi_way_importance(importance_frame, size_measure = "no_of_nodes")
Run Code Online (Sandbox Code Playgroud)
代码的结果产生了这个图:
根据情节,解释为什么Petal.Length和Petal.Width是最佳因素的关键因素是这些(解释基于小插图):
mean_min_depth - 以参数mean_sample指定的三种方式之一计算的平均最小深度,times_a_root - 使用Xj分割根节点的树的总数(即,基于Xj的值将整个样本分成两个),no_of_nodes - 使用Xj进行拆分的节点总数(如果树浅,通常等于no_of_trees),我不清楚为什么高times_a_root而且no_of_nodes更好?低价mean_min_depth更好?
有什么直观的解释?
该小品信息不能帮助.
我有这样的数据行:
sp_A0A342_ATPB_COFAR_6_+_contigs_full.fasta
sp_A0A342_ATPB_COFAR_9_-_contigs_full.fasta
sp_A0A373_RK16_COFAR_10_-_contigs_full.fasta
sp_A0A373_RK16_COFAR_8_+_contigs_full.fasta
sp_A0A4W3_SPEA_GEOSL_15_-_contigs_full.fasta
Run Code Online (Sandbox Code Playgroud)
如何sed为每行删除第4列(_分隔)后的部分字符串.最后屈服:
sp_A0A342_ATPB_COFAR
sp_A0A342_ATPB_COFAR
sp_A0A373_RK16_COFAR
sp_A0A373_RK16_COFAR
sp_A0A4W3_SPEA_GEOSL
Run Code Online (Sandbox Code Playgroud) 我有一个看起来像这样的数据:
#d TRUE FALSE Cutoff
4 28198 0 0.1
4 28198 0 0.2
4 28198 0 0.3
4 28198 13 0.4
4 28251 611 0.5
4 28251 611 0.6
4 28251 611 0.7
4 28251 611 0.8
4 28251 611 0.9
4 28251 611 1
6 19630 0 0
6 19630 0 0.1
6 19630 0 0.2
6 19630 0 0.3
6 19630 0 0.4
6 19636 56 0.5
6 19636 56 0.6
6 19636 56 0.7
6 19636 56 …Run Code Online (Sandbox Code Playgroud) 我有一个如下所示的数据框:
> mydf
val1 val2
hsa-let-7a 2.139890 -0.03477569
hsa-let-7b 2.102590 0.04108795
hsa-let-7c 2.061705 0.02375882
hsa-let-7d 1.938950 -0.04364545
hsa-let-7e 1.889000 -0.10575235
hsa-let-7f 2.264296 0.08465690
Run Code Online (Sandbox Code Playgroud)
请注意,从3列只有第2和第3列是名称.我想要做的是命名第一列(加上重命名第二和第三列).
但为什么这个命令失败了?
colnames(mydf) <- c("COL1","VAL1","VAL2");
Run Code Online (Sandbox Code Playgroud)
什么是正确的方法呢?
它给了我:
Error in `colnames<-`(`*tmp*`, value = c("COL1", "VAL1", "VAL2" :
'names' attribute [3] must be the same length as the vector [2]
Run Code Online (Sandbox Code Playgroud) 我在Linux下有以下conda环境:
$ conda info -e
# conda environments:
#
py33 /u21/coyotito/.anaconda/envs/py33
root * /u21/coyotito/.anaconda
Run Code Online (Sandbox Code Playgroud)
并py33使用此命令创建:
$ conda create -n py33 python=3.3 anaconda
Run Code Online (Sandbox Code Playgroud)
问题是当我激活py33它仍然无法调用Python版本3.3.
[coyotito@pearl ~]$ source activate py33
(coyotito)[coyotito@pearl ~]$ python --version
Python 2.7.10 :: Anaconda 2.1.0 (64-bit)
(coyotito)[coyotito@pearl ~]$ conda info -e
# conda environments:
#
py33 /u21/coyotito/.anaconda/envs/py33
root * /u21/coyotito/.anaconda
Run Code Online (Sandbox Code Playgroud)
即它仍然调用旧的python.另请注意,括号下的提示不是(py33).
(coyotito)[coyotito@pearl ~]$ which python
~/.anaconda/bin/python
Run Code Online (Sandbox Code Playgroud)
在新环境中代替python:
~/.anaconda/envs/py33/bin/python3.3
Run Code Online (Sandbox Code Playgroud)
我该如何解决这个问题?
更新
我的PATH环境~/.bash_profile如下所示:
export PATH=$HOME/.anaconda/bin:$PATH
Run Code Online (Sandbox Code Playgroud)