小编kri*_*nan的帖子

使用tor和python来刮掉谷歌学者

我正在开展一个项目来分析如何引用期刊文章.我有一个大型的期刊文章名称文件.我打算将它们传递给Google学术搜索,并查看每个引用的引用次数.

这是我遵循的策略:

  1. 使用http://www.icir.org/christian/scholar.html上的 "scholar.py" .这是一个预先编写的python脚本,可以搜索谷歌学者并以CSV格式返回首次点击的信息(包括引用次数)

  2. 谷歌学者在一定数量的搜索后阻止你(我有大约3000个文章标题要查询).我发现,大多数人使用Tor(如何通过Tor的在Python?让urllib2的请求,并防止自定义Web爬虫被封锁)来解决这个问题.Tor是一种服务,每隔几分钟就会为您提供一个随机IP地址.

我有scholar.py和tor成功设置和工作.我不熟悉python或库urllib2,并想知道scholar.py需要进行哪些修改,以便查询通过Tor进行路由.

我也很乐意为大众谷歌学者查询提供一种更容易(并且可能有很大差异)的方法,如果存在的话.

提前致谢

python tor web-scraping google-scholar

10
推荐指数
1
解决办法
5627
查看次数

R:替换字符串中的外来字符

我正在处理大量数据,主要是非英文字符的名称.我的目标是将这些名称与在美国收集的一些信息相匹配.

也就是说,我可能希望将名称'Sølvsten'(从某些名称列表)与'Soelvsten'(存储在某些美国数据库中的名称)相匹配.这是我写的一个函数来做这件事.它显然很笨拙,有点随意,但我想知道是否有一个简单的R函数将这些外来字符转换为最近的英国邻居.我知道可能没有任何标准的方法来进行这种转换,但我只是好奇是否有转换可以通过R函数完成.

# a function to replace foreign characters
replaceforeignchars <- function(x)
{
    require(gsubfn);
    x <- gsub("š","s",x)
    x <- gsub("œ","oe",x)
    x <- gsub("ž","z",x)
    x <- gsub("ß","ss",x)
    x <- gsub("þ","y",x)
    x <- gsub("à","a",x)
    x <- gsub("á","a",x)
    x <- gsub("â","a",x)
    x <- gsub("ã","a",x)
    x <- gsub("ä","a",x)
    x <- gsub("å","a",x)
    x <- gsub("æ","ae",x)
    x <- gsub("ç","c",x)
    x <- gsub("è","e",x)
    x <- gsub("é","e",x)
    x <- gsub("ê","e",x)
    x <- gsub("ë","e",x)
    x <- gsub("ì","i",x)
    x <- gsub("í","i",x)
    x <- gsub("î","i",x)
    x <- gsub("ï","i",x)
    x <- gsub("ð","d",x) …
Run Code Online (Sandbox Code Playgroud)

r string-matching

10
推荐指数
3
解决办法
7349
查看次数

在org-mode中将文本行转换为Todos或Check框

我正在尝试将文本行转换为待办事项或org-mode中的复选框项目.例如,如果我有:

第1行

第2行

第3行

我想将其转换为其中之一

*TODO第1行

*TODO第2行

*TODO第3行

要么

  • []第1行

  • []第2行

  • []第3行

我知道这C-c -会将所选区域转换为列表(来源):

  • 第1行

  • 第2行

  • 第3行

但有没有办法将其转换为带有复选框的列表(或者Todos的行?)

提前致谢!

org-mode

9
推荐指数
1
解决办法
2172
查看次数

发布组织文件的问题

我按照worg中给出的指令将org文件发布到HTML.这看起来像是HTML发布练习中最普通的组织.正如所建议的,我评估了以下块:

    (require 'org-publish)
(setq org-publish-project-alist
      '(
    ("org-notes"
     :base-directory "~/www/"
     :base-extension "org"
     :publishing-directory "~/public_html/"
     :recursive t
     :publishing-function org-publish-org-to-html
     :headline-levels 4             ; Just the default for this project.
     :auto-preamble t
     )
    ("org-static"
     :base-directory "~/www/"
     :base-extension "css\\|js\\|png\\|jpg\\|gif\\|pdf\\|mp3\\|ogg\\|swf"
     :publishing-directory "~/public_html/"
     :recursive t
     :publishing-function org-publish-attachment
     )
    ("org" :components ("org-notes" "org-static"))
       ;; ... add all the components here (see below)...
      ))
Run Code Online (Sandbox Code Playgroud)

但是当我跑步时M-x org-publish-project RET org RET,我收到以下错误:

Symbol's value as variable is void: org-export-html-special-string-regexps
Run Code Online (Sandbox Code Playgroud)

一些谷歌搜索表明这可能是由于安装了多个版本的组织.我认为这不是我的情况.我在Mac OS X上安装了一个新的(1天)GNU Emacs,随后我使用更新到最近的组织模式M-x package-install. …

emacs org-mode

8
推荐指数
1
解决办法
1693
查看次数

组织捕获和计时行为不端

我相信你们中的一些人可能已经(从我最近的一系列问题)中收集到了我在emacs上设置组织模式并走过Brent Hansen令人印象深刻的组织设置.他是一个时髦的狂热分子,我喜欢他为追踪项目花费的时间而做的很多事情.

我(想)没有搞砸了设置,但每当我尝试从我们的任务中完成时,我会得到一个带有很多胡言乱语的错误(下面报道).我试图看看是否有一些模式可以解决错误但却无法发现它们.它们似乎经常发生,但不是所有的时间都使得调试它们更加痛苦.

通常情况下,当我从一个任务中退出时(但有时也是我的时钟),我收到这样的消息

save-excursion: Wrong number of arguments: #[(drawer pos) "rÂ!
Ã!pq~bÄÅ    ÆQÇ\"$ÈÉ!+" [pos drawer markerp marker-buffer org-in-regexp "^[     ]*:" ":[    ]*
[   ]*:END:[    ]*
?" 2 replace-match ""] 4 ("/Users/krishnan/.emacs.d/elpa/org-20140210/org.elc" . 450779)], 1
[a-z..]:Set [SPC]:clear [2 times]
Run Code Online (Sandbox Code Playgroud)

与往常一样,我很乐意跟进可能有助于发现错误来源的问题.我无法辨别出标准做法是否包含我的整个.emacs等,但我很乐意根据需要发布跟进信息.

提前谢谢了!

编辑1:关注 @ iqbal-ansari,我做M-x toggle-debug-on-error了以下产生以下的垃圾:

Debugger entered--Lisp error: (wrong-number-of-arguments #[(drawer pos) "r\302!\203
\303!\202pq\210\212\214~\210b\210\304\305   \306Q\307\"\205$\310\311!+\207" [pos drawer markerp marker-buffer org-in-regexp "^[     ]*:" ":[    ]*
[   ]*:END:[    ]*
?" 2 replace-match ""] 4 ("/Users/krishnan/.emacs.d/elpa/org-20140210/org.elc" . 450779)] 1)
  org-remove-empty-drawer-at(307) …
Run Code Online (Sandbox Code Playgroud)

gtd emacs org-mode

7
推荐指数
2
解决办法
1610
查看次数

组织模式不导出为PDF

我的组织模式拒绝从相应的组织文件中导出生成的PDF文件.我正在运行org-mode v 7.9.x并怀疑问题可能是因为我有一个旧版本的org-mode.因此,我现在正在运行最新版本的org-mode(v 8.2.2),但问题仍然存在.

经过一番调查,我发现了以下内容.org-mode很好地将我的.org文件导出到.tex.但是如果我试图让org-mode导出器创建.tex文件并处理为PDF,(Cc Ce lp),我得到错误`PDF file ./test.pdf not generated'.但是,如果我在org-mode创建的.tex文件上从终端运行pdflatex,则生成的PDF没有错误.

所以我最好的猜测是org-mode正在创建一个"漂亮的".tex文件,但是我的emacs的内容阻止了.tex文件被处理为.pdf.不幸的是,我在emacs上已经非常了解,并且无法确切地知道问题所在.

关于我能做什么的任何想法?

pdf emacs latex pdflatex org-mode

5
推荐指数
1
解决办法
6261
查看次数

使用美丽的汤来清理scrapy中的HTML

我正在使用scrapy来尝试从Google学术搜索中获取一些我需要的数据.以下面的链接为例:http : //scholar.google.com/scholar?q=intitle%3Apython+xpath

现在,我想从这个页面上删除所有标题.我遵循的流程如下:

scrapy shell "http://scholar.google.com/scholar?q=intitle%3Apython+xpath"
Run Code Online (Sandbox Code Playgroud)

这给了我scrapy外壳,我在其中:

>>> sel.xpath('//h3[@class="gs_rt"]/a').extract()

[
 u'<a href="http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.122.4438&amp;rep=rep1&amp;type=pdf"><b>Python </b>Paradigms for XML</a>', 
 u'<a href="https://svn.eecs.jacobs-university.de/svn/eecs/archive/bsc-2009/sbhushan.pdf">NCClient: A <b>Python </b>Library for NETCONF Clients</a>', 
 u'<a href="http://hal.archives-ouvertes.fr/hal-00759589/">PALSE: <b>Python </b>Analysis of Large Scale (Computer) Experiments</a>', 
 u'<a href="http://i.iinfo.cz/r2/kd/xmlprague2007.pdf#page=53"><b>Python </b>and XML</a>', 
 u'<a href="http://www.loadaveragezero.com/app/drx/Programming/Languages/Python/">drx: <b>Python </b>Programming Language [Computers: Programming: Languages: <b>Python</b>]-loadaverageZero</a>', 
 u'<a href="http://www.worldcolleges.info/sites/default/files/py10.pdf">XML and <b>Python </b>Tutorial</a>', 
 u'<a href="http://dl.acm.org/citation.cfm?id=2555791">Zato\u2014agile ESB, SOA, REST and cloud integrations in <b>Python</b></a>', 
 u'<a href="ftp://ftp.sybex.com/4021/4021index.pdf">XML Processing with Perl, <b>Python</b>, and PHP</a>', 
 u'<a href="http://books.google.com/books?hl=en&amp;lr=&amp;id=El4TAgAAQBAJ&amp;oi=fnd&amp;pg=PT8&amp;dq=python+xpath&amp;ots=RrFv0f_Y6V&amp;sig=tSXzPJXbDi6KYnuuXEDnZCI7rDA"><b>Python </b>&amp; XML</a>', 
 u'<a href="https://code.grnet.gr/projects/ncclient/repository/revisions/efed7d4cd5ac60cbb7c1c38646a6d6dfb711acc9/raw/docs/proposal.pdf">A <b>Python </b>Module for NETCONF …
Run Code Online (Sandbox Code Playgroud)

xpath scrapy

5
推荐指数
1
解决办法
4067
查看次数

组织议程缓冲区不再显示议程项目

我最近决定重做我的整个组织设置,使其更有效率.我以前在我的机器上都有.org文件,但它们现在位于2个文件夹中:

~/work/org
~/personal/org
Run Code Online (Sandbox Code Playgroud)

我重置了org-mode查找议程文件的位置

;; set agenda files
(setq org-agenda-files (quote ("~/work/org"
                   "~/personal/org")))
Run Code Online (Sandbox Code Playgroud)

但是,当我拉出todo list(C-c a t)时,我得到了表单的错误:

Non-existent agenda file [filename]. [R]emove from list or [A]bort?
Run Code Online (Sandbox Code Playgroud)

对于旧列表中的文件.如果我删除所有这些文件,我最终得到一个Org Agenda缓冲区,它只显示:

Global list of TODO items of type: ALL
Available with `N r': (0)[ALL]
Run Code Online (Sandbox Code Playgroud)

对我做错了什么的想法?

emacs org-mode

4
推荐指数
1
解决办法
3016
查看次数