我正在使用curl,libxml2和mysql在C中编写一个小型搜索引擎.基本计划是使用curl抓取页面,使用libxml2解析它们,然后遍历DOM并查找所有链接.然后遍历其中的每一个,并重复,同时更新维护URL之间关系的SQL数据库.
我的问题是:我怎样才能最好地代表网址之间的关系?
为什么不使用这些示例列的基本网址表(即www.google.com/)和连接表:
这将允许您加入某些网址并选择您想要的信息.
您的解决方案似乎更适合非关系数据存储,例如列存储.
大多数搜索引擎索引不存储在关系数据库中,而是存储在内存中以最小化检索时间.