标签: training-data

哪里可以获得haound训练的背景样本图像?

我需要使用opencv收集样本图像(负图像,或者也称为背景图像)进行haar训练.据说我需要有很多.大约5000或10000.你知道从哪里得到它们吗?

opencv training-data

8
推荐指数
1
解决办法
8870
查看次数

CountNonDivisible - Codility训练任务

我现在正在训练鳕鱼.我可以自己解决一些任务,但有些任务有问题.这项任务的难度是<**>.这是中等的,但我停滞不前.

问题:


您将获得一个由N个整数组成的非空零索引数组A. 对于每个数字A [i],使得0≤i<N,我们想要计算不是A [i]的除数的数组的元素的数量.我们说这些元素是非除数.例如,考虑整数N = 5和数组A,以便:

A[0] = 3
A[1] = 1
A[2] = 2
A[3] = 3
A[4] = 6
Run Code Online (Sandbox Code Playgroud)

对于以下元素:

A[0] = 3, the non-divisors are: 2, 6,
A[1] = 1, the non-divisors are: 3, 2, 3, 6,
A[2] = 2, the non-divisors are: 3, 3, 6,
A[3] = 3, the non-divisors are: 2, 6,
A[6] = 6, there aren't any non-divisors.
Run Code Online (Sandbox Code Playgroud)

写一个函数:

class Solution { public int[] solution(int[] A); }
Run Code Online (Sandbox Code Playgroud)

在给定由N个整数组成的非空零索引数组A的情况下,返回表示非除数的数的整数序列.序列应返回为:

  • 结构结果(在C中),
  • 或整数向量(用C++表示),
  • 或记录结果(以帕斯卡为单位),
  • 或整数数组(使用任何其他编程语言). …

java arrays algorithm training-data

8
推荐指数
3
解决办法
9890
查看次数

自我训练算法

我想针对特定问题开发自我训练算法.为了简单起见,我将其简化为简单的例子.

更新:我添加了一个有效的解决方案作为下面这个问题的答案.

假设我有一个来自数据库的大量实体列表.每个实体属于同一类型,并具有4个byte类型的属性.

public class Entity
{
    public byte Prop1 { get; set; }
    public byte Prop2 { get; set; }
    public byte Prop3 { get; set; }
    public byte Prop4 { get; set; }
}
Run Code Online (Sandbox Code Playgroud)

现在,我想根据一个简单的条件动态测试每个实体的一个或多个属性.这基本上意味着我想针对这种情况测试所有属性的所有可能组合.

为了完成这项工作,我为属性创建了一个位掩码.

[Flags]
public enum EEntityValues
{
    Undefined = 0,
    Prop1 = 1,
    Prop2 = 2,
    Prop3 = 4,
    Prop4 = 8,
}
Run Code Online (Sandbox Code Playgroud)

并添加了一种获取位掩码最大值的方法.对于此示例,返回15(1 + 2 + 4 + 8).

public static int GetMaxValue<T>() where T : struct
{
    return Enum.GetValues( typeof(T) ).Cast<int>().Sum();
} …
Run Code Online (Sandbox Code Playgroud)

.net c# algorithm training-data neural-network

8
推荐指数
1
解决办法
425
查看次数

如何在使用队列时在tensorflow训练期间测试网络

我正在使用队列使用下面的代码将我的训练示例提供给我的网络,并且它正常工作.

但是,我希望每n次迭代能够提供一些测试数据,但我真的不知道应该如何进行.我应该暂时停止队列并手动提供测试数据吗?我应该创建另一个队列来测试数据吗?

编辑:这样做的正确方法是创建一个单独的文件,比如eval.py连续读取最后一个检查点并评估网络?这就是他们在CIFAR10示例中的做法.

batch = 128 # size of the batch
x = tf.placeholder("float32", [None, n_steps, n_input])
y = tf.placeholder("float32", [None, n_classes])

queue = tf.RandomShuffleQueue(capacity=4*batch,
                      min_after_dequeue=3*batch,
                      dtypes=[tf.float32, tf.float32],
                      shapes=[[n_steps, n_input], [n_classes]])
enqueue_op = queue.enqueue_many([x, y])
X_batch, Y_batch = queue.dequeue_many(batch)

sess = tf.Session()

def load_and_enqueue(data):
    while True:
        X, Y = data.get_next_batch(batch)
        sess.run(enqueue_op, feed_dict={x: X, y: Y})

train_thread = threading.Thread(target=load_and_enqueue, args=(data))
train_thread.daemon = True
train_thread.start()

for _ in xrange(max_iter):
    sess.run(train_op)
Run Code Online (Sandbox Code Playgroud)

queue training-data neural-network deep-learning tensorflow

8
推荐指数
1
解决办法
974
查看次数

使用插入符号训练套索模型时不可用的列

我收到一个奇怪的错误

Error in `[.data.frame`(data, , lvls[1]) : undefined columns selected
Run Code Online (Sandbox Code Playgroud)

当我使用插入符号训练glmnet模型时的消息.我对序数模型使用了基本相同的代码和相同的预测器(y然后只是使用不同的因子)并且它工作正常.它耗费了400个核心小时来计算,所以我不能在这里展示它.

#Source a small subset of data
source("https://gist.githubusercontent.com/FredrikKarlssonSpeech/ebd9fccf1de6789a3f529cafc496a90c/raw/efc130e41c7d01d972d1c69e59bf8f5f5fea58fa/voice.R")
trainIndex <- createDataPartition(notna$RC, p = .75, 
                                  list = FALSE, 
                                  times = 1)


training <- notna[ trainIndex[,1],] %>%
  select(RC,FCoM_envel:ATrPS_freq,`Jitter->F0_abs_dif`:RPDE)
testing  <- notna[-trainIndex[,1],] %>%
  select(RC,FCoM_envel:ATrPS_freq,`Jitter->F0_abs_dif`:RPDE)

fitControl <- trainControl(## 10-fold CV
  method = "CV",
  number = 10,
  allowParallel=TRUE,
  savePredictions="final",
  summaryFunction=twoClassSummary)

vtCVFit <- train(x=training[-1],y=training[,"RC"], 
                  method = "glmnet", 
                  trControl = fitControl,
                  preProcess=c("center", "scale"),
                  metric="Kappa"
)
Run Code Online (Sandbox Code Playgroud)

我无法找到任何明显错误的数据.没有NAs

table(is.na(training))

FALSE 
43166
Run Code Online (Sandbox Code Playgroud)

并且不明白为什么它会尝试在列数之外进行索引.

有什么建议?

r training-data glmnet r-caret

8
推荐指数
1
解决办法
162
查看次数

使用新数据重新训练现有的机器学习模型

我有一个 ML 模型,它在一百万个数据集上进行训练(文本的监督分类),但是我希望在新数据(训练数据)出现后立即再次训练相同的模型。

这个过程是连续的,我不想在每次收到新数据集时失去模型预测的能力。我不想将新数据与我的历史数据(约 100 万个样本)合并以再次训练。

因此,理想的情况是该模型在一段时间内对所有数据进行逐渐训练,并在每次收到新的训练集数据时保留模型的智能。避免重新训练所有历史数据的最佳方法是什么?代码示例会对我有帮助。

python nlp machine-learning training-data supervised-learning

8
推荐指数
1
解决办法
1万
查看次数

将图像数据集拆分为训练测试数据集

所以我有一个包含子文件夹的主文件夹,子文件夹又包含数据集的图像,如下所示。

-main_db

---CLASS_1

-----img_1

-----img_2

-----img_3

-----img_4

---CLASS_2

-----img_1

-----img_2

-----img_3

-----img_4

---CLASS_3

-----img_1

-----img_2

-----img_3

-----img_4

我需要将这个数据集分成两部分,即训练数据(70%)和测试数据(30%)。下面是我想要实现的层次结构

-main_db

---training_data

-----CLASS_1

-------img_1

-------img_2

-------img_3

-------img_4

---CLASS_2

-------img_1

-------img_2

-------img_3

-------img_4

---testing_data

-----CLASS_1

-------img_5

-------img_6

-------img_7

-------img_8

---CLASS_2

-------img_5

-------img_6

-------img_7

-------img_8

任何帮助表示赞赏。谢谢

我试过这个模块。但这对我不起作用。该模块根本没有被导入。

https://github.com/jfilter/split-folders

这正是我想要的。

training-data python-3.x train-test-split

8
推荐指数
4
解决办法
2万
查看次数

地面真相和训练数据集

我想知道训练数据集,测试数据集和gound真理之间的关系.我分别知道每个人的意思,但我看不出他们之间的关系,特别是地面真相和训练数据.

machine-learning training-data

7
推荐指数
1
解决办法
9569
查看次数

有没有办法在不共享 Google 凭据的情况下与其他人共享 google colab pro 帐户?

我认识的人已经拥有 Google Colab Pro 帐户,我需要使用它一段时间来训练深度学习模型。他/她可以在不共享 Google 凭据的情况下其帐户借给我吗?我知道这可以在 Gmail 中完成,但不知道是否可以使用 Colab Pro 完成,或者如果可以,如何完成。TIA

python training-data deep-learning google-colaboratory

7
推荐指数
1
解决办法
3879
查看次数

微调 GPT2 - 注意掩码和 pad token id 错误

我一直在尝试在 wikitext-2 数据集上微调 GPT2(只是为了帮助自己学习该过程),但我遇到了一条我以前从未见过的警告消息:

\n

“未设置注意掩码和填充令牌 ID。因此,您可能会观察到意外行为。请传递您的输入attention_mask以获得可靠的结果。\n设置pad_token_ideos_token_id:50256 以进行开放式生成。”

\n

这看起来很奇怪,因为我在实例化 tokenizer 时在代码中明确指定了 EOS 令牌:

\n
tokenizer = GPT2Tokenizer.from_pretrained(\'gpt2\', bos_token=\'<|startoftext|>\', eos_token=\'<|endoftext|>\', pad_token=\'<|pad|>\')\n
Run Code Online (Sandbox Code Playgroud)\n

训练在没有崩溃的情况下完成,我的损失在每个时期都有所改善,但是当我推断模型时,它输出绝对的乱码 - 有时只生成一个单词而没有其他任何东西。我认为我收到的警告消息与模型表现不佳之间存在联系。

\n

我从这里获得了训练、有效、测试数据(我使用了 .raw 文件) - https://blog.salesforceairesearch.com/the-wikitext-long-term-dependency-language-modeling-dataset/

\n

我在数据集的原始 txt 文件中手动添加了 <|startoftext|> 和 <|endoftext|> 。生成的训练数据类似于这两个示例(取自文本文件的中间):

\n
...\n<|startoftext|>\n= Perfect Dark ( 2010 video game ) = \n \n Perfect Dark is a remastered release of the first @-@ person shooter video game by the same name . Developed by 4J Studios …
Run Code Online (Sandbox Code Playgroud)

machine-learning tokenize training-data gpt-2 fine-tuning

7
推荐指数
1
解决办法
1万
查看次数