Hay*_*yan 5 apache solr web-crawler nutch
抓取我的网站时遇到问题...有一个带有两个下拉列表的表单....当我开始抓取时,抓取工具只从表单中获取部分链接....从第一个下拉列表中从第二个下拉列表中选择部分选项....我尝试在nutch-defaults.xml文件中更改一些配置,但一切都是相同的......
I change
fetcher.threads.per.queue 1 - 10
db.ignore.internal.links true - false
db.ignore.external.links false - true
http.content.limit 65536 - 65536000
file.content.limit 65536 - 65536000
db.update.max.inlinks 10.000 - 100.000
Run Code Online (Sandbox Code Playgroud)
有没有其他选择,可以帮助我抓取我的表格中的所有选项...... ?? 谢谢你的回答.
抱歉,代表太低,无法发表评论!
你有链接吗。
还有下拉菜单 ajax 或其他一些奇特的东西。内存中的 Nutch 只会抓取页面上的内容。即,如果您在页面加载时加载前 10 个,而仅在用户滚动时使用服务加载其余部分,我相信它找不到它。
页面上有更多信息会很好......
罗宾干杯