我有这个按字母顺序排列的巨大索引,我需要获取特定术语的行.逐行读取文件并检查我是否得到了正确的术语对我来说似乎没有效率,因此索引的大小(我们将英语维基百科语料库编入索引).
因此,我正在寻找一种在线上进行二分搜索的方法.我使用LineNumberReader来有效地获取行数,但似乎没有有效的解决方案来从文件中获取第n行.
我想知道是否读取行直到我在第n行,检查它是否是正确的术语并根据二进制搜索算法采取行动(可能再次读取行,因为我需要一行我已经跳过)更有效那么只是逐行检查条款?
任何其他建议也非常欢迎!
请注意,我需要获取一组行,具体取决于要搜索的术语集.