小编Chr*_*son的帖子

将 BigQuery 中的可为空数据输入 Tensorflow Transform

我们正在尝试构建一个管道,在 TensorFlow 中进行训练之前,从 BigQuery 获取数据,通过 TensorFlow Transform 运行。

管道已启动并正在运行,但我们在 BigQuery 中处理空值时遇到困难。

我们使用 Beam 从 BigQuery 加载:

    raw_data = (pipeline
                | '{}_read_from_bq'.format(step) >> beam.io.Read(
                    beam.io.BigQuerySource(query=source_query,
                                           use_standard_sql=True,
                                           )))
Run Code Online (Sandbox Code Playgroud)

我正在使用数据集元数据,尝试FixedLenFeature各种VarLenFeature列:

    # Categorical feature schema
    categorical_features = {
        column_name: tf.io.FixedLenFeature([], tf.string) for column_name in categorical_columns
    }
    raw_data_schema.update(categorical_features)

    # Numerical feature schema
    numerical_features = {
        column_name: tf.io.VarLenFeature(tf.float32) for column_name in numerical_columns
    }
    raw_data_schema.update(numerical_features)

    # Create dataset_metadata given raw_data_schema
    raw_metadata = dataset_metadata.DatasetMetadata(
        schema_utils.schema_from_feature_spec(raw_data_schema))
Run Code Online (Sandbox Code Playgroud)

正如预期的那样,如果您尝试将 BigQuery NULL 输入到 a 中FixedLenFeature,它就会中断。

但是,当我尝试输入字符串或整数 …

python google-bigquery tensorflow apache-beam tensorflow-transform

6
推荐指数
1
解决办法
673
查看次数