我正在使用 Pandas 从 CSV 文件中导入大量数据,一旦读取,我将其格式化为仅包含数字数据。然后返回列表中的列表。然后每个列表包含大约 140k 位的数据。numericalData[][].
从这个列表中,我希望创建Testing和Training Data. 对于我的测试数据,我希望有 30% 的读取数据numericalData,因此我使用以下代码;
testingAmount = len(numericalData0[0]) * trainingDataPercentage / 100
Run Code Online (Sandbox Code Playgroud)
很好用。然后,我使用 numpy 从导入的每一列中选择该数量的数据numericalData;
testingData.append(np.random.choice(numericalData[x], testingAmount) )
Run Code Online (Sandbox Code Playgroud)
然后返回一个包含 38 列(循环运行)的样本,其中每列有大约 49k 个从我导入的numericalData.
问题是,我trainingData需要保留其他 70% 的数据,但我不确定如何做到这一点。我尝试比较 my 中的每个元素testingData,如果两个元素不相等,则将其添加到我的trainingData. 这导致了错误并且不起作用。接下来,我尝试testingData从导入的数据中删除选定的项,然后将该新列保存到我的trainingData,唉,这不起作用。
过去一周我只使用 python 工作,所以我对现在尝试什么有点迷茫。
我有 12 个人,我需要将他们分成 2 个不同的团队。我需要做的是为第一支球队选择 0 到 11 之间的随机 6 个数字,并为第二支球队做同样的事情,没有重叠。执行此操作的最有效方法是什么?
import random
A = random.choice([x for x in range(12)])
B = random.choice([x for x in range(12) if x != A])
C = random.choice([x for x in range(12) if (x != A) and (x != B)])
team1 = random.sample(range(0, 12), 6)
team2 = random.sample(range(0, 12), 6)
Run Code Online (Sandbox Code Playgroud)
这是我到目前为止所写的。任何帮助表示赞赏。