我是Python的新手(我也没有任何编程培训),所以在我提问时请记住这一点.
我正在尝试搜索检索到的网页,并使用指定的模式查找所有链接.我已经在其他脚本中成功完成了这项工作,但我收到的错误是
Run Code Online (Sandbox Code Playgroud)raise error, v # invalid expressionsre_constants.error:多次重复
我不得不承认我不知道为什么,但同样,我是Python和正则表达式的新手.但是,即使我不使用模式并使用特定链接(只是为了测试匹配),我也不相信我会返回任何匹配(当我打印match.group(0)时,没有任何内容发送到窗口.链接我测试的是下面评论的.
有任何想法吗?通过示例学习通常更容易,但是您可以给予的任何建议都非常感谢!
獾
import urllib2
from BeautifulSoup import BeautifulSoup
import re
url = "http://forums.epicgames.com/archive/index.php?f-356-p-164.html"
page = urllib2.urlopen(url).read()
soup = BeautifulSoup(page)
pattern = r'<a href="http://forums.epicgames.com/archive/index.php?t-([0-9]+).html">(.?+)</a> <i>((.?+) replies)'
#pattern = r'href="http://forums.epicgames.com/archive/index.php?t-622233.html">Gears of War 2: Horde Gameplay</a> <i>(20 replies)'
for match in re.finditer(pattern, page, re.S):
print match(0)
Run Code Online (Sandbox Code Playgroud) 我希望arulesSequences在R中使用该软件包.但是,我不知道如何将我的数据框强制转换为可以利用此软件包的对象.
这是一个复制我的数据结构的玩具数据集:
ids <- c(rep("X", 5), rep("Y", 5), rep("Z", 5))
seq <- rep(1:5,3)
val <- sample(LETTERS, 15, replace=T)
df <- data.frame(ids, seq, val)
df
ids seq val
1 X 1 T
2 X 2 H
3 X 3 V
4 X 4 A
5 X 5 X
6 Y 1 D
7 Y 2 B
8 Y 3 A
9 Y 4 D
10 Y 5 P
11 Z 1 Q
12 Z 2 R
13 Z 3 …Run Code Online (Sandbox Code Playgroud) 我正在尝试使用 R/Python 和 Sendgrid 的电子邮件 API 构建客户端报告引擎。我可以发送电子邮件,但我需要做的最后一件事是附加客户的 CSV 报告。
我尝试了多种方法,包括对文件进行 base64 编码并将字符串从 R 写入磁盘到 python,但不是运气。也就是说,我似乎陷入了这个错误:
类型错误:“字节”类型的对象不是 JSON 可序列化的
我到达那里的代码是:
with open('raw/test-report.csv', 'rb') as fd:
b64data = base64.b64encode(fd.read())
attachment = Attachment()
attachment.content = b64data
attachment.filename = "your-lead-report.csv"
mail.add_attachment(attachment)
Run Code Online (Sandbox Code Playgroud)
令人困惑的是,如果我简单地b64data用线替换
attachment.content = 'TG9yZW0gaXBzdW0gZG9sb3Igc2l0IGFtZXQsIGNvbnNlY3RldHVyIGFkaXBpc2NpbmcgZWxpdC4gQ3JhcyBwdW12'
Run Code Online (Sandbox Code Playgroud)
发送带有附件的电子邮件。
作为参考,我一直在使用:
https://github.com/sendgrid/sendgrid-python
和
在我的项目的最后一步之前没有任何问题。
任何帮助将不胜感激。值得注意的是,我的强项是在R,但我通常可以python在互联网的帮助下一起破解。
有没有人将R包连接到QuickBooks?我知道有一个ODBC驱动程序可以买到.只是想知道是否有人已经走了这条路.
任何见解将不胜感激!
〜布洛克
我搜索了SO并看到了关于该主题的一些问题,但我没有找到任何与Windows直接相关的内容(我以前的帖子是针对Linux的).
更具体地说,我想使用twitteR包,但我无法使用身份验证.到目前为止,我已经可以访问其他机器,但这一次,我需要完全保留在Windows中.我怎么能绕过这个?
这是错误:
Error in curlPerform(curl = curl, URL = url, postfields = fields, writefunction = reader$update, :
SSL certificate problem, verify that the CA cert is OK. Details:
error:14090086:SSL routines:SSL3_GET_SERVER_CERTIFICATE:certificate verify failed
Run Code Online (Sandbox Code Playgroud)
编辑:从twitteR包的文档生成....的代码
cred <- OAuthFactory$new(consumerKey = KEY,
consumerSecret = SECRET,
requestURL = "https://api.twitter.com/oauth/request_token",
accessURL = "https://api.twitter.com/oauth/access_token",
authURL = "https://api.twitter.com/oauth/authorize")
cred$handshake()
Run Code Online (Sandbox Code Playgroud) 我很难过.通常,read.csv按预期工作,但我遇到了行为意外的问题.这很可能是我的用户错误,但任何帮助将不胜感激.
这是文件的URL
http://nces.ed.gov/ipeds/datacenter/data/SFA0910.zip
Run Code Online (Sandbox Code Playgroud)
这是我的代码来获取文件,解压缩并读取它:
URL <- "http://nces.ed.gov/ipeds/datacenter/data/SFA0910.zip"
download.file(URL, destfile="temp.zip")
unzip("temp.zip")
tmp <- read.table("sfa0910.csv",
header=T, stringsAsFactors=F, sep=",", row.names=NULL)
Run Code Online (Sandbox Code Playgroud)
这是我的问题.当我在Excel中打开数据csv数据时,数据看起来像预期的那样.当我将数据读入R时,第一列实际上被命名为row.names.R正在读取一行额外的数据,但我无法弄清楚导致row.names成为列的"错误".简单来说,看起来数据已经转移了.
然而,奇怪的是R中的最后一列似乎包含正确的数据.
以下是前几列中的几行:
tmp[1:5,1:7]
row.names UNITID XSCUGRAD SCUGRAD XSCUGFFN SCUGFFN XSCUGFFP
1 100654 R 4496 R 1044 R 23
2 100663 R 10646 R 1496 R 14
3 100690 R 380 R 5 R 1
4 100706 R 6119 R 774 R 13
5 100724 R 4638 R 1209 R 26
Run Code Online (Sandbox Code Playgroud)
关于我可能做错什么的任何想法?
我知道有很多关于在Windows 7 32位上启动和运行rpy2的帖子.我已经引用了很多这些并尝试了他们的解决方案,包括使用PypeR.
我没有在我的路径中明确设置R_HOME变量,但根据这个问题,我确认R在我的PATH中(我可以R在命令行输入并让R运行)甚至复制了i386文件夹中的所有文件到父bin文件夹.
我的问题粘贴在下面.有什么想法吗?
In [5]: from rpy2 import robjects
---------------------------------------------------------------------------
RuntimeError Traceback (most recent call last)
<ipython-input-5-1f019d00d232> in <module>()
----> 1 from rpy2 import robjects
C:\Anaconda\lib\site-packages\rpy2\robjects\__init__.py in <module>()
16 import rpy2.rlike.container as rlc
17
---> 18 from rpy2.robjects.robject import RObjectMixin, RObject
19 from rpy2.robjects.vectors import *
20 from rpy2.robjects.functions import Function, SignatureTranslatedFunction
C:\Anaconda\lib\site-packages\rpy2\robjects\robject.py in <module>()
3 import rpy2.rinterface
4
----> 5 rpy2.rinterface.initr()
6
7 import conversion
RuntimeError: R_HOME not defined.
Run Code Online (Sandbox Code Playgroud) 我正在整理一个R数据包,直到现在我一直在记录数据集.以下内容包含在名为package repo文件夹中charges_ay.R的R文件中.
#' Student Charges for Academic Year programs.
#'
#' For more information, download a data dictionary from the IPEDS website.
#'
#' Survey years 2002 - 2014.
#'
#' @source http://nces.ed.gov/ipeds/datacenter/DataFiles.aspx
#' @format Data frame with columns
"charges_ay"
Run Code Online (Sandbox Code Playgroud)
当我尝试devtools::document从包的基础运行时(就像我对其他文件一样),我收到以下错误:
> devtools::document()
Updating ripeds documentation
Loading ripeds
Error: 'charges_ay' is not an exported object from 'namespace:ripeds'
Run Code Online (Sandbox Code Playgroud)
鉴于到目前为止一切工作正常,我有点困惑,因为进程和文件文档都是一样的.
任何帮助将不胜感激!
我对设置远程服务器很陌生,但我今天玩得很开心,希望我可以在设置时利用云配置文件,以便在服务器启动时设置一些环境变量。
在 Digital Ocean 上启动机器时,如何以编程方式设置环境变量?关键是我想自动化设置并避免以交互方式定义这些变量。
提前致谢。
我使用日期字段成功创建了直方图.
hist(df.sat$created_at, breaks="hours", freq=T, xlab="Time",
main="Sat Volume")
Run Code Online (Sandbox Code Playgroud)
我的问题是,当我尝试使用col="red"两个条形填充条形时,两个x/y轴都变为红色,当我只想要条形时.只填充酒吧的最佳方式是什么?

以下是一些数据:
> dput(df.sat$created_at[sample(c(1:9000), 50)])
structure(list(sec = c(41, 3, 13, 11, 49, 55, 19, 21, 6, 15,
54, 45, 45, 39, 50, 27, 35, 25, 22, 35, 42, 31, 45, 29, 1, 3,
8, 47, 38, 2, 13, 29, 34, 42, 15, 19, 3, 39, 41, 12, 34, 50,
15, 27, 0, 29, 47, 26, 21, 5), min = c(46L, 38L, 4L, 35L, 26L,
56L, 9L, 52L, 51L, 15L, 49L, 3L, …Run Code Online (Sandbox Code Playgroud)