我有一个tar.gz文件,我是由pigz(并行gzip)制作的.我想计算压缩文件中的文件数而不解压缩.
我用这个命令:
tar -tzf file.tar.gz
Run Code Online (Sandbox Code Playgroud)
但是我收到一个错误:
tar: This does not look like a tar archive
tar: Skipping to next header
Run Code Online (Sandbox Code Playgroud)
是因为我使用了pigz而不是gzip?如果是的话,我现在怎么算这些呢?
提前致谢.
我觉得这是一个基本问题,所以请随时引导我访问任何资源:
对于本地中存在的任何包,我的 conda 环境在 yaml 文件中指定的包版本之前使用 .local。如果可能的话,如何让它忽略 .local?
我正在使用 PyCharm 和 Ubuntu。
如果我可以提供更多信息,请告诉我。
尝试在Windows中安装应用程序会产生以下消息:
打开安装日志文件时出错.验证指定的位置是否存在且是否可写.
当您尝试安装应用程序时,将创建一个临时文件夹,例如
Administrator\AppData\Local\{F2234F94-BDEB-4DBD-9ACB-D3AB5C8526C5}
{F2234F94-BDEB-4DBD-9ACB-D3AB5C8526C5}.转到此目录并双击该.MSI文件,安装将重新启动并成功.
我想通过辅助级别的多个值对MultiIndex DataFrame进行切片.例如,在以下DataFrame中:
val1 val2
ind1 ind2 ind3
1 6 s1 10 8
2 7 s1 20 6
3 8 s2 30 4
4 9 s2 50 2
5 10 s3 60 0
Run Code Online (Sandbox Code Playgroud)
我希望只切片中的行ind3 == s1 或 ind3 == s3:
val1 val2
ind1 ind2
1 6 10 8
2 7 20 6
5 10 60 0
Run Code Online (Sandbox Code Playgroud)
最好的假设选项是传递多个参数.xs,因为可以明确说明所需的参数level.
我显然可以连接所有切片的单值DataFrame:
In[2]: pd.concat([df.xs('s1',level=2), df.xs('s3',level=2)])
Out[2]:
val1 val2
ind1 ind2
1 6 10 8
2 7 20 6 …Run Code Online (Sandbox Code Playgroud) 从文档中:
嵌入式发行版是一个包含最小Python环境的ZIP文件。
听起来不错!Python的64位Windows嵌入式v3.6.5仅13MB。作为编译的替代方法,我想将一些python脚本以及在未安装Python的Win10机器上运行它们所需的最低要求一起压缩。
现在,我几乎总是需要导入其他软件包来提供功能。但是,如果我想与该嵌入式版本的Python一起发送python脚本,就无法确定该怎么做。例如,如果我的脚本使用numpy,如何在“嵌入”中包含该库?即,这样我就可以在任何Win10机器上解压缩单个部署文件并立即执行我的脚本吗?
(通常pip install numpy会创建一个超过50MB的Lib子目录!但是对于“嵌入式”部署,我不需要任何调试支持,也不需要大量文件中包含的任何其他内容。)
我的 Jupiter 笔记本被压坏了,所以我必须重新安装笔记本,但在新的 Jupiter 笔记本中,我无法运行 pandas。
import pandas as pd
Run Code Online (Sandbox Code Playgroud)
AttributeError Traceback (most recent call last)
~\AppData\Local\Temp/ipykernel_6860/4080736814.py in <module>
----> 1 import pandas as pd
~\anaconda3\lib\site-packages\pandas\__init__.py in <module>
20
21 # numpy compat
---> 22 from pandas.compat import (
23 np_version_under1p18 as _np_version_under1p18,
24 is_numpy_dev as _is_numpy_dev,
~\anaconda3\lib\site-packages\pandas\compat\__init__.py in <module>
12 import warnings
13
---> 14 from pandas._typing import F
15 from pandas.compat.numpy import (
16 is_numpy_dev,
~\anaconda3\lib\site-packages\pandas\_typing.py in <module>
82 # array-like
83
---> 84 ArrayLike = Union["ExtensionArray", np.ndarray] …Run Code Online (Sandbox Code Playgroud) 给定具有列Col1,Col2和Col3的表"ABC",可以自动生成如下内容:
SELECT
Col1 AS 'ABC_Col1',
Col2 AS 'ABC_Col2',
Col3 AS 'ABC_Col3'
FROM ABC
Run Code Online (Sandbox Code Playgroud)
我有一个没有固定列的表(用户能够追加他们自己的列),我仍然需要列前缀(因为在JOIN/CTE中需要它与其他表也有名为Col1,Col2的列等等...)
因此,我希望能够写出这样的东西:
SELECT
T0.* AS 'ABC_T.*',
FROM ABC T0
Run Code Online (Sandbox Code Playgroud)
这当然不是有效的SQL,但它可以以某种方式完成,所以"*"列都获得相同的前缀?
当Merge into做一个insert用下面的语句,Scope_Identity返回正确的代理键信息.但是当update执行两者Scope_Identity并@@Identity返回下一个可用的代理键时.当我添加的时候output,我update和两个都得到了null insert.
如何在update和insert?上返回代理键?
DECLARE @Surrogate_KEY bigint
MERGE INTO [dbo].[MyTable] ChangeSet
USING (SELECT @NaturalKey1 AS NaturalKey1,
@NaturalKey2 AS NaturalKey2,
@NaturalKey3 AS NaturalKey3,
@Surrogate_KEY AS Surrogate_KEY) CurrentSet
ON ChangeSet.NaturalKey1 = CurrentSet.NaturalKey1 AND
ChangeSet.NaturalKey2 = CurrentSet.NaturalKey2 AND
ChangeSet.NaturalKey3 = CurrentSet.NaturalKey3
WHEN MATCHED THEN
UPDATE SET blah, blah, blah
WHEN NOT MATCHED
THEN INSERT VALUES
(
blah, blah, blah
) …Run Code Online (Sandbox Code Playgroud) 我有一个A包含列数据的表:
mdr1222
-------
pprgd24
-------
invalid
-------
invalid
abc2345
Run Code Online (Sandbox Code Playgroud)
我想得到无效和空白的计数(---)。我试过 :
SELECT count(data)
from A
where data = 'invalid' and null
Run Code Online (Sandbox Code Playgroud)
但它不起作用。有人可以帮我弄清楚我在这里做错了什么吗?
我怀疑许多研究时间序列数据的人已经遇到过这个问题,而且大熊猫似乎没有提供直接的解决方案(还有!):
假设:
所以对于M freq,最后一个是19MAY-18JUN,前一个是19APR-18MAY,依此类推......
ts.resample('M', how='ohlc')
Run Code Online (Sandbox Code Playgroud)
将进行重新取样,但"M"为'end_of_month'期间,因此结果将给出2014-05的整月和2014-06的2周期间,因此您的最后一个栏将不是'月度栏' .那不是我们想要的!
有了2M频率,根据我的样本时间序列,我的测试给了我标记为2014-07-31的最后一个条(以前标记为2014-05-31),这是非常误导,因为没有关于JUL的数据....假设的最后2个月的酒吧再次覆盖了最近的2周.
使用以下命令可以轻松创建正确的DatetimeIndex:
pandas.date_range(end='2014-06-18', freq='2M', periods=300) + datetime.timedelta(days=18)
Run Code Online (Sandbox Code Playgroud)
(Pandas文档更喜欢通过做同样的事情
pandas.date_range(end='2014-06-18', freq='2M', periods=300) + pandas.tseries.offsets.DateOffset(days=18)
Run Code Online (Sandbox Code Playgroud)
但是我的测试显示这种方法,虽然更多'pandaïc'慢了2倍!)
无论哪种方式,我们都无法将正确的DatetimeIndex应用于ts.resample().
似乎pandas开发团队(Pandas中的日期范围)意识到了这个问题,但与此同时,你怎么能解决这个问题,让OHLC的滚动频率在时间序列的最后一天得到锚定?