如何为搜索引擎设计数据库架构?

Tho*_*nan 1 database search

我正在使用curl,libxml2和mysql在C中编写一个小型搜索引擎.基本计划是使用curl抓取页面,使用libxml2解析它们,然后遍历DOM并查找所有链接.然后遍历其中的每一个,并重复,同时更新维护URL之间关系的SQL数据库.

我的问题是:我怎样才能最好地代表网址之间的关系?

Man*_*tis 7

为什么不使用这些示例列的基本网址表(即www.google.com/)和连接表:

  • 起始页面ID(来自url表)
  • 结束页面ID(来自url表)
  • url的尾随目录作为另外两列中的字符串

这将允许您加入某些网址并选择您想要的信息.

您的解决方案似乎更适合非关系数据存储,例如列存储.

大多数搜索引擎索引不存储在关系数据库中,而是存储在内存中以最小化检索时间.