我有一个Django应用程序,我需要在其中实现一个简单的趋势/排名算法.我很遗憾:
我有两个型号,Book和Reader.每天晚上,新书都会添加到我的数据库中.每本书的读者数量每晚都会更新,即一本书将有多个读者统计记录(每天一个记录).
在给定时期(过去一周,过去一个月或过去一年),我想列出最受欢迎的书籍,我应该使用哪种算法?
流行度不需要以任何方式实时实现,因为每本书的读者数量仅每日更新.
我发现在另一篇SO 帖子中引用了一篇文章,展示了他们如何计算趋势维基百科的文章,但帖子只显示了当前趋势的计算方式.
正如有人在SO上指出的那样,这是一个非常简单的基线趋势算法,只计算两个数据点之间的斜率,所以我猜它显示了昨天和今天之间的趋势.
我不是在寻找像Hacker News,Reddit等那样的超级复杂趋势算法.
我只有两个数据轴,读卡器数和日期.
关于我应该实现什么和如何实现的任何想法.对于那些从未使用任何统计/算法相关的人来说,这似乎是一项非常艰巨的任务.
在此先感谢大家.
twitter使用什么算法来确定您在search.twitter.com上可以看到的10个主题?我想实现该算法,我还想展示50个最受欢迎的主题(而不是10个).你能描述最有效的算法吗?
谢谢!
(Twitters API可以在http://apiwiki.twitter.com/REST%20API%20Documentation找到)
此外,我希望能够通过搜索公共时间线来实现该算法 - http://twitter.com/statuses/public_timeline.rss
我发现自己需要处理捕获的网络流量tcpdump.阅读流量并不难,但有点棘手的是发现流量中出现"峰值"的地方.我最关心的是TCP SYN数据包,我想要做的是找到某个目标端口的流量突然上升的日子.有相当多的数据需要处理(大约一年).
我到目前为止所尝试的是使用指数移动平均线,这足以让我得到一些有趣的措施,但比较我所看到的外部数据源似乎有点过于激进不正常.
我考虑过使用指数移动平均线和历史数据的组合(可能是过去7天,认为应该每周一次到我所看到的周期),因为我读过的一些论文似乎有设法以这种方式模拟资源使用并获得成功.
那么,有没有人知道一个好的方法或某个地方去阅读这类事情.
我一直在使用的移动平均线看起来大致如下:
avg = avg+0.96*(new-avg)
Run Code Online (Sandbox Code Playgroud)
随着avg作为EMA和new作为新措施.我一直在试验使用什么阈值,但发现"必须是一个给定的因子高于在权衡新值之前的平均值"和"必须至少高3"才能得到最差的结果.
我目前正在构建一个应用程序,我正在为(目前)大约15,000种产品导入统计数据.目前,如果我要从一个来源为每天的统计数据维护一个数据库表,那么每天将增加15,000行数据(假设每行5-10个字段主要是浮点数,int).显然每年将500多万条记录等同于一张表.
这并不像我想到从其他来源引入数据(因此每个新来源增加500万条记录的数据库).
现在数据是基于统计/趋势的数据,并且每条记录每天基本上写入1次,并且读取数量很多.出于动态报告和绘图的目的,我需要根据规则(日期范围,值范围等)快速访问数据子集.
我的问题是,这是存储数据的最佳方式(MySQL InnoDb表),还是有更好的方法来存储和处理统计/趋势数据?
此时我抛出的其他选项:1.多个数据库(每个产品一个),每个数据源都有单独的表.(即数据库:产品A,表(一个或多个):Source_A,Source_B,Source_C)2.一个数据库中,多个表(每个产品/数据源)(即数据库:产品信息,表(一个或多个):ProductA_SourceA,ProductA_SourceB等)3.factual数据库中的所有或特定产品信息以及statisticalcsv,xml,json,(平面文件)中不同目录中的所有数据.
到目前为止,这些选项都不是很易于管理,每个选项都有其优缺点.在进入alpha开发阶段之前,我需要一个合理的解决方案.
如何从此页面获取帖子:https://www.tumblr.com/explore/trending through API?
我查看了文档,但一无所获.
我已经为我的搜索实现了弹性搜索,并且很好地感觉它可以很容易地用于寻找趋势,但它是我的舌头,如何开始去做这样的事情.任何人都可以指出我正确的方向或给我一些关键词,以进一步研究可能使这成为可能吗?
我有一个store_visits具有以下结构的表:
store_visits:
store_name: string
visit_count: integer
visit_date: date
Run Code Online (Sandbox Code Playgroud)
我的目标是创建一个查询,对于每个商店和给定的日期范围,将计算:
AVG(visit_count))访问的相对增加/减少率仅用于定向目的.它始终是线性比例.
我花了一天时间尝试构建MySQL查询来做到这一点,并且无法理解它.
任何帮助将不胜感激.
谢谢,-Scott
我正在开发一个包含很多项目的高吞吐量站点,我正在考虑实施"现在趋势"类型的功能,这将允许用户快速获得许多人最近查看过的前N项的优先列表,随着观看次数减少,逐渐消失.
关于如何做到这一点的一个想法是对项目的近期视图给予更多权重,例如过去15分钟项目的每个视图的权重为16,过去1中项目的每个视图的权重为8小时,过去4小时内物品的重量为4等,但我不知道这是否是接近它的正确方法.
我想在Redis中做到这一点,我们过去在Redis上取得了很好的成功.
在技术上和确定趋势的最佳方法是什么?
第一个答案提示解决方案,但我正在寻找更多细节 - 开始赏金.
这些都是不错的想法,但还不够详细.一个得到了一半的赏金,但问题仍未解决.
我遇到了以下问题:
使用Twitter API和tweepy模块,我想监控趋势主题并从数据中提取主题标签.
这段代码:
#!/usr/bin/env python
# -*- coding: utf-8 -*-
import tweepy, json
CONSUMER_KEY = 'key'
CONSUMER_SECRET = 'secret'
ACCESS_KEY = 'key'
ACCESS_SECRET = 'secret'
auth = tweepy.OAuthHandler(CONSUMER_KEY, CONSUMER_SECRET)
auth.set_access_token(ACCESS_KEY, ACCESS_SECRET)
api = tweepy.API(auth)
trends1 = api.trends_place(1)
print trends1
Run Code Online (Sandbox Code Playgroud)
给我关于全局趋势主题的数据,结构如下:
[{u'created_at': u'2014-04-16T12:13:15Z', u'trends': [{u'url': u'http://twitter.com/search?q=%22South+Korea%22', u'query': u'%22South+Korea%22', u'name': u'South Korea', u'promoted_content': None}, {u'url': u'http://twitter.com/search?q=%23FETUSONEDIRECTIONDAY', u'query': u'%23FETUSONEDIRECTIONDAY', u'name': u'#FETUSONEDIRECTIONDAY', u'promoted_content': None}, {u'url': u'http://twitter.com/search?q=%23PrayForSouthKorea', u'query': u'%23PrayForSouthKorea', u'name': u'#PrayForSouthKorea', u'promoted_content': None}, {u'url': u'http://twitter.com/search?q=%23GaraGaraRP', u'query': u'%23GaraGaraRP', u'name': u'#GaraGaraRP', u'promoted_content': None}, {u'url': u'http://twitter.com/search?q=%23%D8%A5%D8%B3%D9%85_%D8%A3%D9%85%D9%8A_%D8%A8%D8%AC%D9%88%D8%A7%D9%84%D9%8A', u'query': …Run Code Online (Sandbox Code Playgroud) 有一个很好的选择使用此URL获取GitHub上的热门开发者列表 https://github.com/trending/developers
我只是想知道是否可以通过一些REST API获取相同的数据.请帮忙.
我在MongoDB中有一组文档,其中包含有关推文大小的"描述"值.我需要从中生成趋势主题列表.显然这是一个已解决的问题,但我无法找到一个明确的答案/宝石,无需自己编写代码即可完成工作.
我在我的应用程序中使用ruby&mongoid.
是否有任何红宝石宝石可以帮助或处理这个?谢谢.
嘿家伙我正在尝试开发一个从数据库中返回趋势文章的查询.
热门文章基于过去24小时内的大多数观点.这是迄今为止的代码:
$trending = Article::whereHas('view', function ($query) {
$query->where('created_at', '>=', Carbon::now()->subHours(24));
})
->with('view')
->orderBy('created_at', 'DESC')
->get();
return $trending;
}
Run Code Online (Sandbox Code Playgroud)
文章模型具有以下关系:
public function view()
{
return $this->hasMany('ArticleView', 'article_id');
}
Run Code Online (Sandbox Code Playgroud)
该查询有效,但我还需要按视图计数对文章进行排序.例如,显示当前趋势文章,但具有最多视图计数的artticles不是从头到尾排序(显然 - 它们按created_at排序)
帮助赞赏