Cha*_*abh 18 solr nutch saml full-text-indexing manifoldcf
我试图抓取网站,更具体地Google Site使用ManifoldCF具有SAML认证和索引抓取的数据到Apache Solr实现.但是当我抓取URL时,它会让我302重定向到登录页面然后说RESPONSECODENOTINDEXABLE.
我不确定我是否正确认证.在manifoldCF中,我们有HTTP basic身份验证选项NTLM authentication和Session-based访问凭证身份验证方法.我使用的Session based身份验证方法更像是基于表单的身份验证而不是SAML身份验证.
有没有人使用带有SAML身份验证的manifoldCF来抓取网站?如果没有manifoldCF,有人能够通过Apache Nutch实现这一点,因为我担心,它也只提供HTTP基本Digest和NTLM身份验证.
任何见解都会有所帮助.如果有人认为可以轻松完成,可以提供有关该问题的更多信息.基本上,当我抓取https://sites.google.com/a/my-sub-domain.com时,它会重定向到SSO登录页面,并且抓取工具拒绝抓取任何更多,从而产生302错误.这是一个基于内联网的网站.
小智 0
不确定这是否有帮助,请尝试一下。在 nutch 中,我们可以提供登录页面的凭据,conf 目录中有 httpclient-auth.xml 文件。您可以在那里提供您的主机名以及凭据。
<auth-configuration>
<credentials username="admin" password="admin123">
<authscope host="hostname" realm="login"/>
<default/>
</credentials>
</auth-configuration>
Run Code Online (Sandbox Code Playgroud)
同样,您可以向此配置添加任意数量的凭据。
要抓取 https 站点,请将 nutch-conf.xml 中的 plugin.includes 属性从 protocol-http 更改为 protocol-httpclient
| 归档时间: |
|
| 查看次数: |
907 次 |
| 最近记录: |