是否有关于选择数据集的分片文件数或每个分片中的记录数的指导原则?
在使用的例子中tensorflow.contrib.slim,
1024在ImageNet数据集的每个分片中都有大致记录.(tensorflow/models/inception)
600每个碎片花数据集中都有大致记录.(tensorflow/models/slim)
分片文件的数量和每个分片中的记录数是否会对训练模型和训练模型的性能产生影响?
据我所知,如果我们不将数据集拆分成多个分片,那么对数据进行混洗将不是很随机,因为capacity它RandomShuffleQueue可能小于数据集的大小.
使用多个分片还有其他优点吗?
更新
文件说
如果您有比读取文件更多的读取线程,那么为了避免您有两个线程从相同文件中读取相同示例的风险.
为什么我们不能使用50个线程来读取5个文件?
我有两个多维张量a和b.而且我想用它们的值来对它们进行排序a.
我发现tf.nn.top_k能够对张量进行排序并返回用于对输入进行排序的索引.如何使用返回的索引tf.nn.top_k(a, k=2)进行排序b?
例如,
import tensorflow as tf
a = tf.reshape(tf.range(30), (2, 5, 3))
b = tf.reshape(tf.range(210), (2, 5, 3, 7))
k = 2
sorted_a, indices = tf.nn.top_k(a, k)
# How to sort b into
# sorted_b[0, 0, 0, :] = b[0, 0, indices[0, 0, 0], :]
# sorted_b[0, 0, 1, :] = b[0, 0, indices[0, 0, 1], :]
# sorted_b[0, 1, 0, :] = b[0, 1, indices[0, …Run Code Online (Sandbox Code Playgroud) tensorflow ×2