我需要使用opencv收集样本图像(负图像,或者也称为背景图像)进行haar训练.据说我需要有很多.大约5000或10000.你知道从哪里得到它们吗?
我现在正在训练鳕鱼.我可以自己解决一些任务,但有些任务有问题.这项任务的难度是<**>.这是中等的,但我停滞不前.
问题:
您将获得一个由N个整数组成的非空零索引数组A. 对于每个数字A [i],使得0≤i<N,我们想要计算不是A [i]的除数的数组的元素的数量.我们说这些元素是非除数.例如,考虑整数N = 5和数组A,以便:
A[0] = 3
A[1] = 1
A[2] = 2
A[3] = 3
A[4] = 6
Run Code Online (Sandbox Code Playgroud)
对于以下元素:
A[0] = 3, the non-divisors are: 2, 6,
A[1] = 1, the non-divisors are: 3, 2, 3, 6,
A[2] = 2, the non-divisors are: 3, 3, 6,
A[3] = 3, the non-divisors are: 2, 6,
A[6] = 6, there aren't any non-divisors.
Run Code Online (Sandbox Code Playgroud)
写一个函数:
class Solution { public int[] solution(int[] A); }
Run Code Online (Sandbox Code Playgroud)
在给定由N个整数组成的非空零索引数组A的情况下,返回表示非除数的数的整数序列.序列应返回为:
我想针对特定问题开发自我训练算法.为了简单起见,我将其简化为简单的例子.
更新:我添加了一个有效的解决方案作为下面这个问题的答案.
假设我有一个来自数据库的大量实体列表.每个实体属于同一类型,并具有4个byte类型的属性.
public class Entity
{
public byte Prop1 { get; set; }
public byte Prop2 { get; set; }
public byte Prop3 { get; set; }
public byte Prop4 { get; set; }
}
Run Code Online (Sandbox Code Playgroud)
现在,我想根据一个简单的条件动态测试每个实体的一个或多个属性.这基本上意味着我想针对这种情况测试所有属性的所有可能组合.
为了完成这项工作,我为属性创建了一个位掩码.
[Flags]
public enum EEntityValues
{
Undefined = 0,
Prop1 = 1,
Prop2 = 2,
Prop3 = 4,
Prop4 = 8,
}
Run Code Online (Sandbox Code Playgroud)
并添加了一种获取位掩码最大值的方法.对于此示例,返回15(1 + 2 + 4 + 8).
public static int GetMaxValue<T>() where T : struct
{
return Enum.GetValues( typeof(T) ).Cast<int>().Sum();
} …Run Code Online (Sandbox Code Playgroud) 我正在使用队列使用下面的代码将我的训练示例提供给我的网络,并且它正常工作.
但是,我希望每n次迭代能够提供一些测试数据,但我真的不知道应该如何进行.我应该暂时停止队列并手动提供测试数据吗?我应该创建另一个队列来测试数据吗?
编辑:这样做的正确方法是创建一个单独的文件,比如eval.py连续读取最后一个检查点并评估网络?这就是他们在CIFAR10示例中的做法.
batch = 128 # size of the batch
x = tf.placeholder("float32", [None, n_steps, n_input])
y = tf.placeholder("float32", [None, n_classes])
queue = tf.RandomShuffleQueue(capacity=4*batch,
min_after_dequeue=3*batch,
dtypes=[tf.float32, tf.float32],
shapes=[[n_steps, n_input], [n_classes]])
enqueue_op = queue.enqueue_many([x, y])
X_batch, Y_batch = queue.dequeue_many(batch)
sess = tf.Session()
def load_and_enqueue(data):
while True:
X, Y = data.get_next_batch(batch)
sess.run(enqueue_op, feed_dict={x: X, y: Y})
train_thread = threading.Thread(target=load_and_enqueue, args=(data))
train_thread.daemon = True
train_thread.start()
for _ in xrange(max_iter):
sess.run(train_op)
Run Code Online (Sandbox Code Playgroud) 我收到一个奇怪的错误
Error in `[.data.frame`(data, , lvls[1]) : undefined columns selected
Run Code Online (Sandbox Code Playgroud)
当我使用插入符号训练glmnet模型时的消息.我对序数模型使用了基本相同的代码和相同的预测器(y然后只是使用不同的因子)并且它工作正常.它耗费了400个核心小时来计算,所以我不能在这里展示它.
#Source a small subset of data
source("https://gist.githubusercontent.com/FredrikKarlssonSpeech/ebd9fccf1de6789a3f529cafc496a90c/raw/efc130e41c7d01d972d1c69e59bf8f5f5fea58fa/voice.R")
trainIndex <- createDataPartition(notna$RC, p = .75,
list = FALSE,
times = 1)
training <- notna[ trainIndex[,1],] %>%
select(RC,FCoM_envel:ATrPS_freq,`Jitter->F0_abs_dif`:RPDE)
testing <- notna[-trainIndex[,1],] %>%
select(RC,FCoM_envel:ATrPS_freq,`Jitter->F0_abs_dif`:RPDE)
fitControl <- trainControl(## 10-fold CV
method = "CV",
number = 10,
allowParallel=TRUE,
savePredictions="final",
summaryFunction=twoClassSummary)
vtCVFit <- train(x=training[-1],y=training[,"RC"],
method = "glmnet",
trControl = fitControl,
preProcess=c("center", "scale"),
metric="Kappa"
)
Run Code Online (Sandbox Code Playgroud)
我无法找到任何明显错误的数据.没有NAs
table(is.na(training))
FALSE
43166
Run Code Online (Sandbox Code Playgroud)
并且不明白为什么它会尝试在列数之外进行索引.
有什么建议?
我有一个 ML 模型,它在一百万个数据集上进行训练(文本的监督分类),但是我希望在新数据(训练数据)出现后立即再次训练相同的模型。
这个过程是连续的,我不想在每次收到新数据集时失去模型预测的能力。我不想将新数据与我的历史数据(约 100 万个样本)合并以再次训练。
因此,理想的情况是该模型在一段时间内对所有数据进行逐渐训练,并在每次收到新的训练集数据时保留模型的智能。避免重新训练所有历史数据的最佳方法是什么?代码示例会对我有帮助。
python nlp machine-learning training-data supervised-learning
所以我有一个包含子文件夹的主文件夹,子文件夹又包含数据集的图像,如下所示。
-main_db
---CLASS_1
-----img_1
-----img_2
-----img_3
-----img_4
---CLASS_2
-----img_1
-----img_2
-----img_3
-----img_4
---CLASS_3
-----img_1
-----img_2
-----img_3
-----img_4
我需要将这个数据集分成两部分,即训练数据(70%)和测试数据(30%)。下面是我想要实现的层次结构
-main_db
---training_data
-----CLASS_1
-------img_1
-------img_2
-------img_3
-------img_4
---CLASS_2
-------img_1
-------img_2
-------img_3
-------img_4
---testing_data
-----CLASS_1
-------img_5
-------img_6
-------img_7
-------img_8
---CLASS_2
-------img_5
-------img_6
-------img_7
-------img_8
任何帮助表示赞赏。谢谢
我试过这个模块。但这对我不起作用。该模块根本没有被导入。
https://github.com/jfilter/split-folders
这正是我想要的。
我想知道训练数据集,测试数据集和gound真理之间的关系.我分别知道每个人的意思,但我看不出他们之间的关系,特别是地面真相和训练数据.
我认识的人已经拥有 Google Colab Pro 帐户,我需要使用它一段时间来训练深度学习模型。他/她可以在不共享 Google 凭据的情况下将其帐户借给我吗?我知道这可以在 Gmail 中完成,但不知道是否可以使用 Colab Pro 完成,或者如果可以,如何完成。TIA
我一直在尝试在 wikitext-2 数据集上微调 GPT2(只是为了帮助自己学习该过程),但我遇到了一条我以前从未见过的警告消息:
\n“未设置注意掩码和填充令牌 ID。因此,您可能会观察到意外行为。请传递您的输入attention_mask以获得可靠的结果。\n设置pad_token_id为eos_token_id:50256 以进行开放式生成。”
这看起来很奇怪,因为我在实例化 tokenizer 时在代码中明确指定了 EOS 令牌:
\ntokenizer = GPT2Tokenizer.from_pretrained(\'gpt2\', bos_token=\'<|startoftext|>\', eos_token=\'<|endoftext|>\', pad_token=\'<|pad|>\')\nRun Code Online (Sandbox Code Playgroud)\n训练在没有崩溃的情况下完成,我的损失在每个时期都有所改善,但是当我推断模型时,它输出绝对的乱码 - 有时只生成一个单词而没有其他任何东西。我认为我收到的警告消息与模型表现不佳之间存在联系。
\n我从这里获得了训练、有效、测试数据(我使用了 .raw 文件) - https://blog.salesforceairesearch.com/the-wikitext-long-term-dependency-language-modeling-dataset/
\n我在数据集的原始 txt 文件中手动添加了 <|startoftext|> 和 <|endoftext|> 。生成的训练数据类似于这两个示例(取自文本文件的中间):
\n...\n<|startoftext|>\n= Perfect Dark ( 2010 video game ) = \n \n Perfect Dark is a remastered release of the first @-@ person shooter video game by the same name . Developed by 4J Studios …Run Code Online (Sandbox Code Playgroud) training-data ×10
algorithm ×2
python ×2
.net ×1
arrays ×1
c# ×1
fine-tuning ×1
glmnet ×1
gpt-2 ×1
java ×1
nlp ×1
opencv ×1
python-3.x ×1
queue ×1
r ×1
r-caret ×1
tensorflow ×1
tokenize ×1