小编Jac*_*ing的帖子

Keras Tokenizer方法究竟做了什么?

有时,情况要求我们执行以下操作:

from keras.preprocessing.text import Tokenizer
tokenizer = Tokenizer(num_words=my_max)
Run Code Online (Sandbox Code Playgroud)

然后,我们总是念诵这句口头禅:

tokenizer.fit_on_texts(text) 
sequences = tokenizer.texts_to_sequences(text)
Run Code Online (Sandbox Code Playgroud)

虽然我(或多或少)了解总效应是什么,但无论我做了多少研究(显然包括文档),我都无法弄清楚每个人分别做了什么.我不认为我没见过另一个.

那么每个人做什么?在任何情况下你都会使用其中任何一个吗?如果没有,为什么不将它们简单地组合成如下:

sequences = tokenizer.fit_on_texts_to_sequences(text)
Run Code Online (Sandbox Code Playgroud)

抱歉,如果我遗漏了一些明显的东西,但我对此很陌生.

python nlp keras

27
推荐指数
3
解决办法
2万
查看次数

在 Python 中获取站点的所有 XHR 请求

我想在 python 中制作一个程序,打印出一个站点的所有 xhr 请求。

我可以使用检查工具执行此操作,方法是转到 Network -> XHR,但我想运行执行此操作的代码。

在此处输入图片说明

代码应该给出一个带有名称键的字典,以及带有相应请求 URL、请求方法、内容类型和远程地址的字典值。

例如:

aDict = {'randomfile.js?_=1581185731016': {'url': 'https://softwaresat.netlify.com/randomfile.js?_=1581185731016', 'method': 'GET', 'address': '104.248.60.43:443'}}

Run Code Online (Sandbox Code Playgroud)

python firefox google-chrome xmlhttprequest python-requests

5
推荐指数
1
解决办法
946
查看次数

我应该使用哪一个:前置:: 或前置兄弟::?

我正在犹豫是否要编写precedingpreceding-sibling使用 XSL,例如下面的示例 xml。

<sales_division>
  <team area="Tokyo">
    <staff>Sato</staff>
    <staff>Tanaka</staff>
  </team>
  <team area="Osaka">
    <staff>Ueda</staff>
    <staff>Suzuki</staff>
  </team>
</sales_division>
Run Code Online (Sandbox Code Playgroud)

如果当前节点是,并且我想获取的team(@Osaka)第一个子节点,我应该如何正确编写 Xpath ?staff(Sato)team(@Tokyo)

我猜想以下三个选项。

1) preceding-sibling::team/staff[1]<br>
2) preceding::staff[2]<br>
3) ../team[1]/staff[1]
Run Code Online (Sandbox Code Playgroud)

请给我你的建议和意见。

xml xslt xpath

4
推荐指数
1
解决办法
8773
查看次数

Cufon线高不起作用

我正在使用Cufon(http://wiki.github.com/sorccu/cufon/about)在我的网站上使用特殊字体.但是当我在CSS中应用行高时,它不会影响我的Cufon字体.但在IE中它确实有效.这种行为可能是什么原因?

css fonts cufon

3
推荐指数
1
解决办法
1万
查看次数

Google数据融合执行错误“INVALID_ARGUMENT:'DISKS_TOTAL_GB'配额不足。请求3000.0,可用2048.0。”

我正在尝试使用 Google Data Fusion 免费版本将简单的 CSV 文件从 GCS 加载到 BQ。管道因错误而失败。它读着

com.google.api.gax.rpc.InvalidArgumentException: io.grpc.StatusRuntimeException: INVALID_ARGUMENT: Insufficient 'DISKS_TOTAL_GB' quota. Requested 3000.0, available 2048.0.
    at com.google.api.gax.rpc.ApiExceptionFactory.createException(ApiExceptionFactory.java:49) ~[na:na]
    at com.google.api.gax.grpc.GrpcApiExceptionFactory.create(GrpcApiExceptionFactory.java:72) ~[na:na]
    at com.google.api.gax.grpc.GrpcApiExceptionFactory.create(GrpcApiExceptionFactory.java:60) ~[na:na]
    at com.google.api.gax.grpc.GrpcExceptionCallable$ExceptionTransformingFuture.onFailure(GrpcExceptionCallable.java:97) ~[na:na]
    at com.google.api.core.ApiFutures$1.onFailure(ApiFutures.java:68) ~[na:na]
Run Code Online (Sandbox Code Playgroud)

Mapreduce 和 Spark 执行管道都会重复相同的错误。感谢您为解决此问题提供的任何帮助。谢谢

问候卡

data-processing google-cloud-platform data-ingestion data-pipeline google-cloud-data-fusion

3
推荐指数
1
解决办法
5230
查看次数

pandas apply upper() 分别作用于两个字符串列中的每一个,但不能一起作用

我有一个简单的数据框:

    a       b
 0  horse  cat
 1  dog    elephant
Run Code Online (Sandbox Code Playgroud)

跑步:

df.loc[:,'a'].apply(lambda x: x.upper())
Run Code Online (Sandbox Code Playgroud)

或者

df.loc[:,'b'].apply(lambda x: x.upper())
Run Code Online (Sandbox Code Playgroud)

使相应列中的动物大写。然而,运行

df.loc[:,'a':'b'].apply(lambda x: x.upper())
Run Code Online (Sandbox Code Playgroud)

或者

df.loc[:,['a','b']].apply(lambda x: x.upper())
Run Code Online (Sandbox Code Playgroud)

结果是“AttributeError:(“'Series' 对象没有属性'upper'”,'occurred at index a')”。

显然,我想知道如何修复它(即,能够同时大写两列)。但我也想知道一个列如何可以单独拥有属性 'upper',但是当 lambda 作为多列的一部分应用于它时会丢失它。

python lambda pandas

2
推荐指数
1
解决办法
2169
查看次数

AdaBoostClassifier 和“SAMME.R”算法

需要一段时间才能回答实际问题,所以请耐心等待。AdaBoost 文档指出,它“是一个元估计器,首先在原始数据集上拟合分类器,然后在同一数据集上拟合分类器的其他副本,但会调整错误分类实例的权重”。为此,必需的参数之一是base_estimator。为了与base_estimator一起使用AdaBoostClassifer,“需要支持样本加权”。

\n\n

所以我的第一个问题是 - 哪些分类器为样本加权提供支持?我做了一些研究,幸运的是,比我聪明的人找到了答案。稍微更新一下,它的工作原理如下:通过运行

\n\n
from sklearn.utils.testing import all_estimators \n\nprint(all_estimators(type_filter=\'classifier\'))\n
Run Code Online (Sandbox Code Playgroud)\n\n

您将获得所有分类器的列表(结果有 31 个!)。然后,如果你跑

\n\n
import inspect\n\nfor name, clf in all_estimators(type_filter=\'classifier\'):\n    if \'sample_weight\' in inspect.getfullargspec(clf().fit)[0]:\n        print(name)\n
Run Code Online (Sandbox Code Playgroud)\n\n

您可以获得为样本加权提供支持的所有分类器的列表(其中 21 个,出于好奇)。

\n\n

到目前为止,一切都很好。但现在我们必须处理另一个 AdaBoostClassifer参数,即algorithm。您有两个选择:{\xe2\x80\x98SAMME\xe2\x80\x99, \xe2\x80\x98SAMME.R\xe2\x80\x99}, optional (default=\xe2\x80\x99SAMME.R\xe2\x80\x99)。我们被告知“使用 SAMME.R 真实提升算法 base_estimator必须支持类概率的计算”。这就是我陷入困境的地方。在线搜索,我只能找到两个与 \xe2\x80\x98SAMME.R\xe2\x80\x99 一起使用的分类器作为algorithm: DecisionTreeClassifier(这是默认值)和 的参数RandomForestClassifier

\n\n

那么问题来了 - 21 个兼容的其他分类器中还有哪些AdaBoostClassifer为类别概率的计算提供支持?

\n\n

谢谢。

\n

adaboost scikit-learn ensemble-learning

2
推荐指数
1
解决办法
2440
查看次数

抛出错误:XDMP-UNEXPECTED:(错误:XPST0003)意外的令牌语法错误,意外的For_,期待Order_或Return_或Stable_

一旦在 qconsole Marklogic 中运行以下代码,我就会遇到以下错误

XDMP-UNEXPECTED: (err:XPST0003) 意外的令牌语法错误,意外的 For_,需要 Order_ 或 Return_ 或 Stable_

let $prices := fn:doc('/training/prices.xml')/prices
let $order := fn:doc('/training/order.xml')/order
where $prices/priceList/prod[@num=$order/item/@num]
for $kk in $prices/priceList/prod[@num=$order/item/@num]
return 
<item>
{$kk}
</item>
Run Code Online (Sandbox Code Playgroud)

谢谢..

xpath xquery marklogic

2
推荐指数
1
解决办法
149
查看次数

一个字符串乘以一个整数?

例如,在python中,我可以做到这一点

"X" * 3
Run Code Online (Sandbox Code Playgroud)

或者,更重要的是(在这种情况下)

"XO" * 3
Run Code Online (Sandbox Code Playgroud)

和分别得到XXXXOXOXO

我正在尝试使用 xpath/xquery 复制它。理想情况下,它应该是这样的

"XO" * count(something)
Run Code Online (Sandbox Code Playgroud)

我能得到的最接近的方法是通过创建一个长度接近我对将count(something)是什么的估计的字符串来伪造输出,然后用substring(). 所以如果我count(something)回来2

substring("XXX",1,count(//something))
Run Code Online (Sandbox Code Playgroud)

会回来XX。如果我的字符串是XO,它会稍微复杂一些,在这种情况下,我必须将其修改为

substring("XOXOXO",1,count(//something) * 2)
Run Code Online (Sandbox Code Playgroud)

得到XOXO

但是,除了感觉很笨拙之外,这些还需要估计count()和创建正确长度的字符串(+ 一些安全余量)。

有没有更好的方法在 xpath 或 xquery 中做到这一点?

xpath xquery

1
推荐指数
1
解决办法
38
查看次数

在 Jupyter 中打印彩色 f 字符串并混合使用转义字符

我知道以前有人问过类似的问题,但我找不到任何确切的内容。假设我有这个清单:

tags = ['<div>','<body>','<h1>']
Run Code Online (Sandbox Code Playgroud)

我可以在这里轻松使用 f 字符串:

for tag in tags:
   print(f'this is your tag: {tag}')
Run Code Online (Sandbox Code Playgroud)

输出:

this is your tag: <div>
this is your tag: <body>
this is your tag: <h1>
Run Code Online (Sandbox Code Playgroud)

到目前为止,一切都很好。但我真正想做的是获得相同的输出,但标签名称打印为例如红色。这就是我遇到括号问题的地方。如果我使用:

from IPython.display import HTML as html_print

for tag in tags:
     html_print(f'this is your tag: {tag}')
Run Code Online (Sandbox Code Playgroud)

即使我删除标签,也不会打印任何内容。

我试过:

from IPython.display import Markdown, display
Run Code Online (Sandbox Code Playgroud)

然后首先:

for tag in tags:
   display(f'this is your tag: {tag}')
Run Code Online (Sandbox Code Playgroud)

这就像常规操作一样print.

但是,如果我尝试:

for tag in tags:    
   display(Markdown((f'this is your tag: {tag}')))
Run Code Online (Sandbox Code Playgroud)

输出是:

this …
Run Code Online (Sandbox Code Playgroud)

python string escaping ipython jupyter-notebook

0
推荐指数
1
解决办法
2910
查看次数