HDFS/hadoop的默认数据块大小为64MB.磁盘中的块大小通常为4KB.64MB块大小是什么意思? - >这是否意味着从磁盘读取的最小单位是64MB?
如果是,那么这样做有什么好处? - >在HDFS中连续访问大文件很容易吗?
我们可以通过在磁盘中使用原始的4KB块大小来做同样的事情吗?
我知道HDFS使用数据节点中的常规linux文件系统存储数据.我的HDFS块大小是128 MB.假设10 GB我的hadoop集群中有磁盘空间,这意味着HDFS最初具有80 blocks可用存储空间.
如果我创建一个小文件说12.8 MB,#available HDFS块将变为79.如果我创建另一个小文件12.8 MB会怎么样?#availbale区块会保持在79还是会降到78?在前一种情况下,HDFS基本上根据可用的可用磁盘空间重新计算每个块分配后的#available块,因此,只有在消耗了超过128 MB的磁盘空间后,#available块才会变为78.请澄清.
当我将许多小文件存储到HDFS中时,它们会存储在一个块中吗?
在我看来,根据这个讨论,这些小文件应该存储在一个块中: HDFS块大小与实际文件大小相同