小编Jas*_*ouk的帖子

mysql - 删除CHAR(13)CHAR(13)

我是sql的新手,我正在尝试从我从csv文件导入的列中删除回车符和换行符.
我正在使用代码:

SELECT replace(replace(column,CHAR(13),''),CHAR(10),'')
FROM table
Run Code Online (Sandbox Code Playgroud)

它正确地找到所有CR和LF,但它不更新数据库.请指教..提前谢谢!非常感激.

sql mysqli line-breaks carriage-return

4
推荐指数
1
解决办法
2万
查看次数

Scrapy 不听拒绝规则

出于某种原因,scrapy 在我的拒绝规则中解析来自 URL 的数据:我从包含 /browse/、/search/、/ip/ 的 URL 获取解析数据。
我不确定这是哪里出了问题。

请指教,谢谢!请在下面找到我的代码:

from scrapy.selector import HtmlXPathSelector
from scrapy.contrib.spiders import CrawlSpider, Rule
from scrapy.contrib.linkextractors.sgml import SgmlLinkExtractor

from wallspider.items import Website


class mydomainSpider(CrawlSpider):
    name = "tp"
    allowed_domains = ["www.mydomain.com"]
    start_urls = ["http://www.mydomain.com",]

    """/tp/ page type to crawl"""

    rules = (Rule (SgmlLinkExtractor(allow=('/tp/', ),
        deny=(
            'browse/',
            'browse-ng.do?',
            'search-ng.do?',
            'facet=',
            'ip/',
            'page/'
            'search/',
            '/[1-9]$',
            '(bti=)[1-9]+(?:\.[1-9]*)?',
            '(sort_by=)[a-zA-Z]',
            '(sort_by=)[1-9]+(?:\.[1-9]*)?',
            '(ic=32_)[1-9]+(?:\.[1-9]*)?',
            '(ic=60_)[0-9]+(?:\.[0-9]*)?',
            '(search_sort=)[1-9]+(?:\.[1-9]*)?', )
            ,)
    , callback="parse_items", follow= True),
    )

    def parse_items(self, response):
        hxs = HtmlXPathSelector(response)
        sites = hxs.select('//html')
        items …
Run Code Online (Sandbox Code Playgroud)

python web-crawler scrapy

2
推荐指数
1
解决办法
361
查看次数

Scrapy忽略noindex

我正在抓取大量的网址,并想知道是否有可能让scrapy不解析带有'meta name ="robots"content ="noindex"'的网页?查看此处列出的拒绝规则http://doc.scrapy.org/en/latest/topics/link-extractors.html,看起来deny规则仅适用于URL.你有scrapy忽略xpath吗?

from scrapy.selector import HtmlXPathSelector
from scrapy.contrib.spiders import CrawlSpider, Rule
from scrapy.contrib.linkextractors.sgml import SgmlLinkExtractor

from wallspider.items import Website


class Spider(CrawlSpider):
    name = "browsetest"
    allowed_domains = ["www.mydomain.com"]
    start_urls = ["http://www.mydomain.com",]

    rules = (
        Rule(SgmlLinkExtractor(allow=('/browse/')), callback="parse_items", follow= True),
        Rule(SgmlLinkExtractor(allow=(),unique=True,deny=('/[1-9]$', '(bti=)[1-9]+(?:\.[1-9]*)?', '(sort_by=)[a-zA-Z]', '(sort_by=)[1-9]+(?:\.[1-9]*)?', '(ic=32_)[1-9]+(?:\.[1-9]*)?', '(ic=60_)[0-9]+(?:\.[0-9]*)?', '(search_sort=)[1-9]+(?:\.[1-9]*)?', 'browse-ng.do\?', '/page/', '/ip/', 'out\+value', 'fn=', 'customer_rating', 'special_offers', 'search_sort=&', 'facet=' ))),
    )

    def parse_items(self, response):
        hxs = HtmlXPathSelector(response)
        sites = hxs.select('//html')
        items = []

        for site in sites:
            item = Website()
            item['url'] = …
Run Code Online (Sandbox Code Playgroud)

python web-crawler scrapy

1
推荐指数
1
解决办法
1016
查看次数

Scrapyd:将 CSV 文件写入远程服务器

我正在尝试在 EC2 上安排一个爬网程序,并将输出导出到一个 csv 文件 cppages-nov.csv,同时创建一个作业目录,我需要暂停爬网,但它没有创建任何文件。我是否使用了正确的饲料出口?

curl http://awsserver:6800/schedule.json -d project=wallspider -d spider=cppages -d JOBDIR=/home/ubuntu/scrapy/sitemapcrawl/crawls/cppages-nov -d FEED_URI=/home/ubuntu/scrapy/sitemapcrawl/cppages-nov.csv -d FEED_FORMAT=csv
Run Code Online (Sandbox Code Playgroud)

python scrapy scrapyd

1
推荐指数
1
解决办法
712
查看次数