TermQuery不会返回已知的搜索词,但WildcardQuery会这样做

Mar*_*idy 7 lucene lucene.net sitecore sitecore6

我希望有足够洞察Lucene内部运作的人可能能够指出我正确的方向=)

我将跳过大部分周围的相关代码,并切入正确的追逐.我有一个Lucene索引,我将以下字段添加到索引中(变量由其文字值替换):

document.Add( new Field("Typenummer", "E5CEB501A244410EB1FFC4761F79E7B7", 
                        Field.Store.YES , Field.Index.UN_TOKENIZED));
Run Code Online (Sandbox Code Playgroud)

稍后,当我搜索我的索引(使用其他类型的查询)时,我能够验证该字段确实出现在我的索引中 - 比如循环遍历Document.GetFields()返回的所有Fields

Field: Typenummer, Value: E5CEB501A244410EB1FFC4761F79E7B7
Run Code Online (Sandbox Code Playgroud)

到现在为止还挺好 :-)

现在真正的问题是 - 为什么我不能使用TermQuery来搜索这个值并实际获得结果.

此代码产生0次点击:

// Returns 0 hits
bq.Add( new TermQuery( new Term( "Typenummer", 
        "E5CEB501A244410EB1FFC4761F79E7B7" ) ), BooleanClause.Occur.MUST );
Run Code Online (Sandbox Code Playgroud)

但是,如果我将其切换为WildcardQuery(没有通配符),我会得到我期望的1点击.

// returns the 1 hit I expect
bq.Add( new WildcardQuery( new Term( "Typenummer", 
        "E5CEB501A244410EB1FFC4761F79E7B7" ) ), BooleanClause.Occur.MUST );
Run Code Online (Sandbox Code Playgroud)

我检查了字段长度,我已经检查过我使用相同的分析仪等等,我仍然在方块1上为什么会这样.

任何人都可以指出我应该看的方向吗?

Mar*_*idy 8

我终于弄清楚发生了什么.我正在扩展这个问题的标签,因为它,令我惊讶的是,实际上结果是CMS存在这个特殊问题的问题.总之,问题归结为:

  1. 该字段存储在UN_TOKENIZED中,这意味着Lucene将按照"原样"存储它
  2. 我粘贴的BooleanQuery片段被发送到PreparedQuery包装器内的Sitecore SearchManager
  3. 我期望的行为是,我的查询(已经准备好了)将不会改变为Lucene API
  4. 事实证明我错了.它通过一个RewriteQuery方法复制了我的整组嵌套查询的原样,但有一个例外 - 所有期限参数通过一个LowercaseStrategy通过()
  5. 正如我索引大写期限(UN_TOKENIZED)和Sitecore的改变了我PreparedQuery为小写 - 0结果返回

我不打算开始讨论这是"按设计"还是"通过设计缺陷"Lucene Wrapper API的实现 - 我只是注意到在使用PreparedQuery重载时重写我的查询对我来说......意外的;-)

进一步的教导; 将字段存储为TOKENIZED也会消除此问题,因为默认情况下StandardAnalyzer会小写所有标记.