我需要在ddply或者聚合中使用group by,如果这更容易的话.我不确定如何做到这一点,因为我需要使用cumsum作为我的聚合函数.这就是我的数据:
level1 level2 hour product
A tea 0 7
A tea 1 2
A tea 2 9
A coffee 17 7
A coffee 18 2
A coffee 20 4
B coffee 0 2
B coffee 1 3
B coffee 2 4
B tea 21 3
B tea 22 1
Run Code Online (Sandbox Code Playgroud)
预期产量:
A tea 0 7
A tea 1 9
A tea 2 18
A coffee 17 7
A coffee 18 9
A coffee 20 13
B coffee 0 2
B …Run Code Online (Sandbox Code Playgroud) 我试图计算softmax的激活函数的导数.我发现了这个:https: //math.stackexchange.com/questions/945871/derivative-of-softmax-loss-function似乎没有给出正确的推导,我们将如何得到i = j和i的答案!= j .有人可以解释一下!当涉及求和时,我与衍生物混淆,如softmax激活函数的分母.
嗨,我已经安装了python 2.7,但没有删除2.6.我已经添加了2.7的路径,也作为别名,但似乎当我做jupyter笔记本,它试图访问2.6
> jupyter notebook
Traceback (most recent call last):
File "jupyter-notebook", line 7, in <module>
from notebook.notebookapp import main
File "/usr/lib/python2.6/site-packages/notebook/__init__.py", line 25, in <module>
from .nbextensions import install_nbextension
File "/usr/lib/python2.6/site-packages/notebook/nbextensions.py", line 226, in <module>
from traitlets import Bool, Enum, Unicode
File "/usr/lib/python2.6/site-packages/traitlets/__init__.py", line 1, in <module>
from .traitlets import *
File "/usr/lib/python2.6/site-packages/traitlets/traitlets.py", line 1291
return {n: t for (n, t) in cls.class_traits(**metadata).items()
^
Run Code Online (Sandbox Code Playgroud)
我的python版本似乎指向2.7
$ python --version
Python 2.7.6
Run Code Online (Sandbox Code Playgroud)
以及我的哪个python似乎给出了正确的输出:
$ which python
alias python='/usr/local/bin/python2.7'
/usr/local/bin/python2.7
Run Code Online (Sandbox Code Playgroud)
我为这两个版本的python安装了pip.我不知道如何解决这个问题:(
我试图将一个元组列表传递给scala中的udf.我不确定如何为此精确定义数据类型.我试图将它作为整行传递,但它无法真正解决它.我需要根据元组的第一个元素对列表进行排序,然后再发送n个元素.我为udf尝试了以下定义
def udfFilterPath = udf((id: Long, idList: Array[structType[Long, String]] )
def udfFilterPath = udf((id: Long, idList: Array[Tuple2[Long, String]] )
def udfFilterPath = udf((id: Long, idList: Row)
Run Code Online (Sandbox Code Playgroud)
这就是idList的样子:
[[1234,"Tony"], [2345, "Angela"]]
[[1234,"Tony"], [234545, "Ruby"], [353445, "Ria"]]
Run Code Online (Sandbox Code Playgroud)
这是一个如上所述的100行数据帧.我把udf称为如下:
testSet.select("id", "idList").withColumn("result", udfFilterPath($"id", $"idList")).show
Run Code Online (Sandbox Code Playgroud)
当我打印数据帧的架构时,它将其作为结构数组读取.idList本身是通过在由密钥分组并存储在数据帧中的元组列上执行收集列表来生成的.关于我做错了什么的任何想法?谢谢!
aggregate ×1
apache-spark ×1
calculus ×1
derivative ×1
jupyter ×1
plyr ×1
python ×1
python-2.6 ×1
r ×1
scala ×1
softmax ×1
udf ×1