盲目地对输入数据的新趋势进行分类

Car*_*son 5 statistics artificial-intelligence classification bayesian

谷歌新闻如何自动对新兴主题的文件进行分类和排名,如"奥巴马的2011年预算"?

我有一堆用棒球数据标记的文章,如球员名称和与文章的相关性(感谢,opencalais),并且很想创建一个谷歌新闻风格的界面,排列和显示新帖子,特别是新兴话题.我认为一个朴素的贝叶斯分类器可以用一些静态类别进行训练,但这并不能真正跟踪"这个球员刚刚被交易到这个球队,这些其他球员也参与了"的趋势.

mjv*_*mjv 4

毫无疑问,谷歌新闻可能会使用其他技巧(甚至是它们的组合),但一种相对便宜的技巧,从计算上来说,从自由文本推断主题将利用 NLP 概念,即一个单词只有在与其他单词连接时才能获得其含义。
易于从多个文档中发现新主题类别的算法可以概述如下:

  • POS(词性)标记文本
    我们可能希望更多地关注名词,甚至更关注命名实体(例如Obama或New England)
  • 规范化文本
    特别是用词干替换词形变化的词。甚至可以用相应的命名实体替换一些形容词(例如:Parisian ==> Paris,legal ==> law)
    此外,删除干扰词和干扰表达。
  • 从手动维护的“当前/重复出现的热门词”列表中识​​别一些词(超级碗、选举、丑闻...)
    这可以在后续步骤中使用,为某些 N 元词提供更多权重
  • 枚举每个文档中找到的所有 N 元语法(其中 N 为 1,即 4 或 5)。
    请务必分别计算给定文档中每个 N 元语法的出现次数以及引用给定 N 的文档数量-公克
  • 最常被引用的 N 元语法(即在大多数文档中引用的 N 元语法)可能是主题。
  • 识别现有主题(从已知主题列表中)
  • [可选]手动查看新主题

还可以更改此一般配方以利用文档及其文本的其他属性。例如,文档来源(例如 cnn/sports 与 cnn/politics ...)可用于选择特定领域的词典。另一个示例,该过程可以或多或少地强调来自文档标题(或具有特定标记的文本的其他区域)的单词/表达。