小编ygu*_*guw的帖子

如何在Django中序列化(JSON)FileField

我是Django的新手,并试图构建一个应用程序,为我的项目测试一些东西.我想阅读表单 - 做一些验证,然后将输入发送到另一个模块(比如一个单独运行的调度程序).调度程序rest api将使用表单数据(即文件)调用,调度程序将数据加载到模型中.我在调用rest api之前使用python请求并将数据序列化为json.这是我收到错误的地方.Django on request.FILES创建一个InMemoryUploadedFile类,它将数据加载到内存中,并将其序列化为Json并不简单.我尝试寻找其他方式(如图像序列化示例)但无法解决此问题.

forms.py

class UploadDatasetForm(forms.Form):
    docfile = forms.FileField(label='Choose file')
Run Code Online (Sandbox Code Playgroud)

views.py

def test_upload(request):
    if request.method == 'POST':
        form = UploadDatasetForm(request.POST, request.FILES)
        if form.is_valid():
            in_file = request.FILES['docfile']
            payload = {'doc_file': in_file}
            msg = json.dumps(payload)
            URL = 'http://localhost:8880/form'
            r = requests.post(URL, data=msg)
    return HttpResponse(json.dumps(r.text), content_type="application/json")
Run Code Online (Sandbox Code Playgroud)

错误:

raise TypeError(repr(o) + " is not JSON serializable")
TypeError: <InMemoryUploadedFile: A_test.csv (text/csv)> is not JSON serializable
Run Code Online (Sandbox Code Playgroud)

任何帮助将不胜感激.非常感谢.

django serialization json django-forms django-views

8
推荐指数
1
解决办法
2106
查看次数

如何使用python在Spark中执行.sql文件

from pyspark import SparkConf, SparkContext
from pyspark.sql import SQLContext

conf = SparkConf().setAppName("Test").set("spark.driver.memory", "1g")
sc = SparkContext(conf = conf)

sqlContext = SQLContext(sc)

results = sqlContext.sql("/home/ubuntu/workload/queryXX.sql")
Run Code Online (Sandbox Code Playgroud)

当我使用以下命令执行此命令时:python test.py它给了我一个error

y4j.protocol.Py4JJavaError:调用o20.sql时发生错误。:java.lang.RuntimeException:[1.1]错误:预期“有”但找到了“ /”

/home/ubuntu/workload/queryXX.sql

at scala.sys.package$.error(package.scala:27)
Run Code Online (Sandbox Code Playgroud)

我对Spark非常陌生,在这里我需要帮助以继续前进。

python apache-spark apache-spark-sql pyspark

7
推荐指数
2
解决办法
1万
查看次数

如何停止/杀死以守护程序模式启动的气流调度程序

我和气流的新手,并在守护程序模式下意外启动了气流调度程序。现在,我想终止调度程序并可能重新启动它。我试着做

    sudo kill -9 <list of pids>
    pkill <name>
Run Code Online (Sandbox Code Playgroud)

什么都没发生。当我跑步

    ps aux | grep 'airflow scheduler'
Run Code Online (Sandbox Code Playgroud)

我看到以下条目:

    user1   2907  6.0  1.0 329788 62996 ?        Sl   17:37   1:26 /users/user1/anaconda2/bin/python /users/user1/anaconda2/bin/airflow scheduler -D
    user1   2909  0.0  0.9 327576 58948 ?        Sl   17:37   0:00 /users/user1/anaconda2/bin/python /users/user1/anaconda2/bin/airflow scheduler -D
    user1   2910  0.0  0.9 327576 58944 ?        Sl   17:37   0:00 /users/user1/anaconda2/bin/python /users/user1/anaconda2/bin/airflow scheduler -D
    user1   2911  0.0  0.9 327576 58944 ?        Sl   17:37   0:00 /users/user1/anaconda2/bin/python /users/user1/anaconda2/bin/airflow scheduler -D
Run Code Online (Sandbox Code Playgroud)

...等等,对于35行具有不同的pid。

关于如何在不重新启动机器的情况下停止/杀死气流计划程序的任何建议。我还检查了pid文件中的调度程序,并尝试杀死该pid,但没有任何效果。

任何帮助表示赞赏。谢谢!

linux airflow apache-airflow airflow-scheduler

7
推荐指数
2
解决办法
8223
查看次数

尝试从 S3 加载模型时,无法从链中的任何提供商加载 AWS 凭证 - 错误

我有一个 MLLib 模型保存在 S3 上的文件夹中,例如存储桶名称/测试模型。现在,我有一个 Spark 集群(假设现在在一台机器上)。我正在运行以下命令来加载模型:

pyspark --packages com.amazonaws:aws-java-sdk:1.7.4,org.apache.hadoop:hadoop-aws:2.7.3
Run Code Online (Sandbox Code Playgroud)

然后,

sc.setSystemProperty("com.amazonaws.services.s3.enableV4", "true")
hadoopConf = sc._jsc.hadoopConfiguration()
hadoopConf.set("fs.s3a.awsAccessKeyId", AWS_ACCESS_KEY)
hadoopConf.set("fs.s3a.awsSecretAccessKey", AWS_SECRET_KEY)
hadoopConf.set("fs.s3a.endpoint", "s3.us-east-1.amazonaws.com")
hadoopConf.set("com.amazonaws.services.s3a.enableV4", "true")
hadoopConf.set("fs.s3a.impl", "org.apache.hadoop.fs.s3a.S3AFileSystem")
from pyspark.ml.classification import RandomForestClassifier, RandomForestClassificationModel
m1 = RandomForestClassificationModel.load('s3a://test-bucket/test-model')
Run Code Online (Sandbox Code Playgroud)

我收到以下错误:

Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
  File "/home/user/.local/lib/python3.6/site-packages/pyspark/ml/util.py", line 362, in load
    return cls.read().load(path)
  File "/home/user/.local/lib/python3.6/site-packages/pyspark/ml/util.py", line 300, in load
    java_obj = self._jread.load(path)
  File "/home/user/.local/lib/python3.6/site-packages/pyspark/python/lib/py4j-0.10.7-src.zip/py4j/java_gateway.py", line 1257, in __call__
  File "/home/user/.local/lib/python3.6/site-packages/pyspark/sql/utils.py", line 63, in deco
    return f(*a, **kw)
  File "/home/user/.local/lib/python3.6/site-packages/pyspark/python/lib/py4j-0.10.7-src.zip/py4j/protocol.py", …
Run Code Online (Sandbox Code Playgroud)

amazon-s3 amazon-web-services apache-spark pyspark apache-spark-mllib

6
推荐指数
1
解决办法
4万
查看次数

如何在spark中打印python中的rdd

我在HDFS上有两个文件,我只想在一个列上说这个两个文件加上员工ID.

我试图简单地打印文件,以确保我们从HDFS正确读取.

lines = sc.textFile("hdfs://ip:8020/emp.txt")
print lines.count()
Run Code Online (Sandbox Code Playgroud)

我也尝试过foreach和println函数,但是我无法显示文件数据.我在python中工作,对python和spark都是全新的.

python apache-spark apache-spark-sql pyspark

5
推荐指数
1
解决办法
2万
查看次数

Wget 503不可用错误

$ wget www.amazon.com
Resolving www.amazon.com... 205.251.242.54
Connecting to www.amazon.com|205.251.242.54|:80... connected.
HTTP request sent, awaiting response... 503 Service Unavailable
2015-10-12 23:27:24 ERROR 503: Service Unavailable.
Run Code Online (Sandbox Code Playgroud)

我正在尝试wget在URL 上发出此错误。我需要存储HTML文件,我希望wget可以工作:(

我尝试使用该--no-proxy选项,但无济于事。

wget web-scraping

5
推荐指数
2
解决办法
6742
查看次数