小编Vin*_*aes的帖子

如何将 Pandas DataFrame 转换为 Huggingface Dataset 对象?

我有以下 df:

import pandas as pd
df = pd.DataFrame({"foo": ["bar", "baz"]})
Run Code Online (Sandbox Code Playgroud)

如何转换为 Huggingface 数据集?

huggingface-datasets

11
推荐指数
1
解决办法
7305
查看次数

如何从 MLflow 模型注册表加载最新模型版本?

我可以使用 mlflow 客户端加载模型的特定版本:

import mlflow

model_version = 1

model = mlflow.pyfunc.load_model(
    model_uri=f"models:/c3760a15e6ac48f88ad7e5af940047d4/{model_version}"
)
Run Code Online (Sandbox Code Playgroud)

但是有没有办法加载最新的模型版本呢?

mlflow mlops

6
推荐指数
1
解决办法
8703
查看次数

诗歌添加火炬出现错误:无法找到 nvidia-cudnn-cu11 的安装候选

在 mac m1 蒙特利上运行

\n

在干净的环境中安装带有诗歌的火炬会给我带来以下运行时错误:

\n
\xe2\x9c\x97 python --version    \nPython 3.8.13\n\n\xe2\x9c\x97 poetry --version\nPoetry (version 1.2.2)\n\n\xe2\x9c\x97 poetry add torch\nUsing version ^1.13.0 for torch\n\nUpdating dependencies\nResolving dependencies... (0.1s)\n\nPackage operations: 5 installs, 0 updates, 0 removals\n\n  \xe2\x80\xa2 Installing nvidia-cublas-cu11 (11.10.3.66): Pending...\n  \xe2\x80\xa2 Installing nvidia-cuda-nvrtc-cu11 (11.7.99): Failed\n\n  RuntimeError\n\n  \xe2\x80\xa2 Installing nvidia-cuda-nvrtc-cu11 (11.7.99): Failed\n\n  RuntimeError\n\n  \xe2\x80\xa2 Installing nvidia-cublas-cu11 (11.10.3.66): Failed\n  \xe2\x80\xa2 Installing nvidia-cuda-nvrtc-cu11 (11.7.99): Failed\n\n\n  \xe2\x80\xa2 Installing nvidia-cudnn-cu11 (8.5.0.96): Failed\n\n  RuntimeError\n\n  Unable to find installation candidates for nvidia-cudnn-cu11 (8.5.0.96)\n\n  at ~/Library/Application Support/pypoetry/venv/lib/python3.8/site-packages/poetry/installation/chooser.py:103 in choose_for\n       99\xe2\x94\x82 …
Run Code Online (Sandbox Code Playgroud)

torch python-poetry

6
推荐指数
1
解决办法
4208
查看次数

在没有 Spark 上下文的情况下在推理时使用 PySpark 管道模型

工作流程:

  • 为了预处理我们的原始数据,我们使用 PySpark。由于数据的大小,我们需要使用 Spark。
  • PySpark 预处理作业使用管道模型,允许您将预处理逻辑导出到文件。
  • 通过管道模型导出预处理逻辑,您可以在推理时加载管道模型。像这样,您不需要对预处理逻辑进行两次编码。
  • 在推理时,我们更愿意在没有 Spark 上下文的情况下执行预处理步骤。Spark Context 在推理时是多余的,它会减慢执行推理所需的时间。

我正在查看Mleap,但这仅支持 Scala 语言在没有 Spark 上下文的情况下进行推理。由于我们使用 PySpark,所以坚持使用 Python 语言会很好。

问题:什么是一个好的替代方案,可以让您在训练阶段在 (Py)Spark 中构建管道模型,并让您使用 Python 语言重用此管道模型,而不需要 Spark 上下文?

machine-learning inference-engine pyspark apache-spark-ml data-science

5
推荐指数
0
解决办法
391
查看次数

如何在调用 sagemaker 端点时构建“text/csv”有效负载

我的训练数据看起来像

df = pd.DataFrame({'A' : [2, 5], 'B' : [1, 7]})
Run Code Online (Sandbox Code Playgroud)

我在 AWS Sagemaker 中训练了一个模型,并将该模型部署在端点后面。端点接受“text/csv”形式的有效负载。

要使用 boto3 调用端点,您可以执行以下操作:

import boto3
client = boto3.client('sagemaker-runtime')
response = client.invoke_endpoint(
    EndpointName="my-sagemaker-endpoint-name",
    Body= my_payload_as_csv,
    ContentType = 'text/csv')
Run Code Online (Sandbox Code Playgroud)

如何从我的 Dataframe 构建有效负载“my_payload_as_csv”以便正确调用 Sagemaker 端点?

amazon-web-services pandas boto3 amazon-sagemaker

5
推荐指数
1
解决办法
4654
查看次数

使用 Apple arkit 检测空白或统一颜色的墙壁

现在可以使用 ios 11.3 和 apple arkit 1.5 检测垂直平面(一个很好的例子:ARKit 垂直平面检测)。

但有一个条件;您的墙上需要有一些颜色差异或结构才能被检测到。

是否也可以检测空白墙壁或具有 1 种颜色的墙壁?

augmented-reality swift ios11 arkit

4
推荐指数
1
解决办法
2106
查看次数

如何将数据帧转换为 Great_expectations 数据集?

我有一个 pandas 或 pyspark 数据框df,我想在其中运行期望。我的数据框已经在内存中了。如何将我的数据框转换为great_expectations 数据集?

这样我就可以这样做:

df.expect_column_to_exist("my_column")
Run Code Online (Sandbox Code Playgroud)

python pandas pyspark great-expectations

4
推荐指数
1
解决办法
4763
查看次数

pandas pivot_table保持索引

我有一个数据帧:

   day_bucket  label  numeric_value
0  2011-01-21  birds              4
1  2011-01-22  birds              0
2  2011-01-23  birds              7
3  2011-01-24  birds              3
Run Code Online (Sandbox Code Playgroud)

我想透过这个数据帧,以便我有一个列birds低于它的列.

pd.pivot_table(df, values='numeric_value', index='day_bucket',columns='label')  
Run Code Online (Sandbox Code Playgroud)

得到:

label       birds
day_bucket             
2011-01-21  4
2011-01-22  0
2011-01-23  7
2011-01-24  3
Run Code Online (Sandbox Code Playgroud)

我应该怎么做保持索引?结果如下:

    day_bucket birds    
0   2011-01-21  4
1   2011-01-22  0
2   2011-01-23  7
3   2011-01-24  3 
Run Code Online (Sandbox Code Playgroud)

python pivot pivot-table pandas

3
推荐指数
2
解决办法
5440
查看次数

滚动意味着窗口增加

我有一个范围

np.arange(1,11) # [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]
Run Code Online (Sandbox Code Playgroud)

对于每个元素,我,在我的范围内,我想计算从元素i = 0到我当前元素的平均值.结果将是这样的:

array([ 1. ,  1.5,  2. ,  2.5,  3. ,  3.5,  4. ,  4.5,  5. ,  5.5])
 # got this result via np.cumsum(np.arange(1,11,dtype=np.float32))/(np.arange(1, 11))
Run Code Online (Sandbox Code Playgroud)

我想知道numpy/pandas中是否没有开箱即用功能给我这个结果?

python numpy pandas

3
推荐指数
1
解决办法
655
查看次数

从 PySpark 中的 s3 子目录读取数据

我想从 S3 存储桶中读取所有 parquet 文件,包括子目录中的所有文件(这些实际上是前缀)。

在 S3 URL 中使用通配符 (*) 仅适用于指定文件夹中的文件。例如,使用此代码将仅读取target/文件夹下的镶木地板文件。

df = spark.read.parquet("s3://bucket/target/*.parquet")
df.show()
Run Code Online (Sandbox Code Playgroud)

假设我的 s3 存储桶中有这样的结构:

"s3://bucket/target/2020/01/01/some-file.parquet"
"s3://bucket/target/2020/01/02/some-file.parquet"
Run Code Online (Sandbox Code Playgroud)

上面的代码会引发异常:

pyspark.sql.utils.AnalysisException: 'Path does not exist: s3://mailswitch-extract-underwr-prod/target/*.parquet;'
Run Code Online (Sandbox Code Playgroud)

如何从 s3 存储桶的子目录中读取所有 parquet 文件?

为了运行我的代码,我将 AWS Glue 2.0 与 Spark 2.4 和 python 3 结合使用。

apache-spark parquet pyspark aws-glue

3
推荐指数
1
解决办法
1万
查看次数

concourse 中的 docker-image 和registry-image 有什么区别?

在大厅的部分下resources,我有时会遇到 type registry-image,有时会遇到 type docker-image。

resources:

  - name: some-image   
    type: registry-image      
    source:                   
      repository: 1234567890.dkr.ecr.eu-west-1.amazonaws.com/some-image
      tag: 2.4.5              

  - name: other-image
    type: docker-image
    source:
      repository: 1234567890.dkr.ecr.eu-west-1.amazonaws.com/other-image
      tag: latest
Run Code Online (Sandbox Code Playgroud)

它们看起来很相似,但到底有什么区别呢?

docker concourse concourse-resource-types

2
推荐指数
1
解决办法
2351
查看次数