小编Ros*_*ini的帖子

使用ddply的cumsum

我需要在ddply或者聚合中使用group by,如果这更容易的话.我不确定如何做到这一点,因为我需要使用cumsum作为我的聚合函数.这就是我的数据:

level1      level2  hour     product 
A           tea     0          7
A           tea     1          2
A           tea     2          9
A           coffee  17         7
A           coffee  18         2
A           coffee  20         4
B           coffee  0          2
B           coffee  1          3
B           coffee  2          4
B           tea     21         3
B           tea     22         1
Run Code Online (Sandbox Code Playgroud)

预期产量:

A     tea     0   7
A     tea     1   9
A     tea     2   18
A     coffee  17  7
A     coffee  18  9
A     coffee  20  13
B     coffee  0   2
B …
Run Code Online (Sandbox Code Playgroud)

aggregate r plyr

12
推荐指数
2
解决办法
4848
查看次数

softmax函数解释的导数

我试图计算softmax的激活函数的导数.我发现了这个:https: //math.stackexchange.com/questions/945871/derivative-of-softmax-loss-function似乎没有给出正确的推导,我们将如何得到i = j和i的答案!= j .有人可以解释一下!当涉及求和时,我与衍生物混淆,如softmax激活函数的分母.

calculus derivative neural-network softmax

9
推荐指数
2
解决办法
1万
查看次数

Jupyter使用了错误版本的python

嗨,我已经安装了python 2.7,但没有删除2.6.我已经添加了2.7的路径,也作为别名,但似乎当我做jupyter笔记本,它试图访问2.6

> jupyter notebook
Traceback (most recent call last):
File "jupyter-notebook", line 7, in <module>
 from notebook.notebookapp import main
 File "/usr/lib/python2.6/site-packages/notebook/__init__.py", line 25, in <module>
from .nbextensions import install_nbextension
File "/usr/lib/python2.6/site-packages/notebook/nbextensions.py", line 226, in  <module>
from traitlets import Bool, Enum, Unicode
File "/usr/lib/python2.6/site-packages/traitlets/__init__.py", line 1, in <module>
from .traitlets import *
File "/usr/lib/python2.6/site-packages/traitlets/traitlets.py", line 1291
return {n: t for (n, t) in cls.class_traits(**metadata).items()
               ^
Run Code Online (Sandbox Code Playgroud)

我的python版本似乎指向2.7

$ python --version
Python 2.7.6
Run Code Online (Sandbox Code Playgroud)

以及我的哪个python似乎给出了正确的输出:

$ which python
alias python='/usr/local/bin/python2.7'
/usr/local/bin/python2.7
Run Code Online (Sandbox Code Playgroud)

我为这两个版本的python安装了pip.我不知道如何解决这个问题:(

python python-2.6 jupyter jupyter-notebook

8
推荐指数
1
解决办法
1万
查看次数

将元组列表作为参数传递给scala中的spark udf

我试图将一个元组列表传递给scala中的udf.我不确定如何为此精确定义数据类型.我试图将它作为整行传递,但它无法真正解决它.我需要根据元组的第一个元素对列表进行排序,然后再发送n个元素.我为udf尝试了以下定义

def udfFilterPath = udf((id: Long, idList: Array[structType[Long, String]] )

def udfFilterPath = udf((id: Long, idList: Array[Tuple2[Long, String]] )

def udfFilterPath = udf((id: Long, idList: Row)
Run Code Online (Sandbox Code Playgroud)

这就是idList的样子:

[[1234,"Tony"], [2345, "Angela"]]
[[1234,"Tony"], [234545, "Ruby"], [353445, "Ria"]]
Run Code Online (Sandbox Code Playgroud)

这是一个如上所述的100行数据帧.我把udf称为如下:

testSet.select("id", "idList").withColumn("result", udfFilterPath($"id", $"idList")).show
Run Code Online (Sandbox Code Playgroud)

当我打印数据帧的架构时,它将其作为结构数组读取.idList本身是通过在由密钥分组并存储在数据帧中的元组列上执行收集列表来生成的.关于我做错了什么的任何想法?谢谢!

scala apache-spark udf

4
推荐指数
1
解决办法
2604
查看次数