我经常需要备份一组文件,其中有许多子文件夹,其中包含几个大的、相同的文件。
是否有压缩方案(.zip、.7z 等)可以自动检测到这种情况并且不会多次存储相同的文件?
我们正准备实施我们的第一个 Hadoop 集群。因此,我们从四节点设置开始。(1 个主节点和 3 个工作节点)每个节点将有 6TB 的存储空间。(6 x 1TB 磁盘)我们采用了 SuperMicro 4 节点机箱,以便所有四个节点共享一个 4U 机箱。
我们现在正在研究如何备份此解决方案以进行灾难恢复。(考虑机架或站点丢失,而不是驱动器丢失)最好的解决方案似乎是集群到集群的复制。虽然我也读过有关人们将数据复制到 NAS 或 SMB 共享的信息。此外,我们将通过传统备份方式备份主节点。我只关心 HDFS 数据。以下是我的问题:
1)对于集群到集群的复制,我可以设置一个具有大量存储空间的单节点集群作为我的异地副本吗?我不关心它的性能,只关心它的存在和保存整个数据集的能力。(恢复时间不是问题,因为该集群不是关键任务)是否可以安排副本使其每天只运行一次,等等?
2)对于 SMB 或 NAS 选项,这是如何工作的?目标盘需要格式化HDFS吗?我是否需要完整备份三个工作节点中的每一个?或者是否有一些智能脚本可以在没有奇偶校验的情况下备份数据集?我对这个解决方案不是很熟悉,只在网上看到过对它的引用。我在查找资源或信息方面运气不佳。
我也对 Hadoop HDFS 的任何其他 DR 选项持开放态度。我们的目标是获得 HDFS 数据集的完整副本,以便我们可以使用它从机架或站点丢失中恢复。
谢谢!
是否可以将远程目录备份到本地路径?
在命令中使用两个 URL 会引发
Two URLs specified. One argument should be a path.
Run Code Online (Sandbox Code Playgroud)
仅使用一个远程但指定full选项引发
--full option cannot be used when restoring or verifying
Run Code Online (Sandbox Code Playgroud)
我试过的看起来像
duplicity full ssh://username@remote:XXXX/home/username /media/removabledrive/
Run Code Online (Sandbox Code Playgroud)
XXXX 是 ssh 的自定义端口。
我们有一个全新的戴尔 PowerEdge T320,带有运行全新安装的 Windows Server 2012 R2 的 PERC S110 RAID 控制器。RAID 级别为具有两个 NTFS 分区的 RAID 5,操作系统为 1TB,数据为 7TB。该服务器是 Active Directory 域控制器和文件服务器。它尚未填充文件共享数据,目前处于预生产阶段。
在基本安装、DC 升级和软件更新之后,我立即为 Windows Server Backup 连接了一个 2TB 外置驱动器。尝试创建初始 Windows Server 备份(不包括当前空数据卷)时,备份立即失败并显示“没有足够的磁盘空间来创建卷影副本”
来自事件日志的完整消息:
Log Name: Application
Source: Microsoft-Windows-Backup
Date: 8/2/2014 11:42:44 AM
Event ID: 521
Task Category: None
Level: Error
User: SYSTEM
Computer: PPSW2K12.ppsnew.local
Description:
The backup operation that started at '?2014?-?08?-?02T15:42:23.021000000Z' has failed because the Volume Shadow Copy Service operation to create a shadow copy of the volumes …
backup vss dell-poweredge windows-server-backup windows-server-2012-r2
希望从 rsnapshot 备份转移到诸如 backupninja 之类的东西。我无法找到有关如何删除 rsnapshot 备份的明确答案。
据我所知,许多文件是硬链接,而不是实际副本。
如何在/mnt/disk1/backups/*不损害原始文件的情况下删除(daily.0、weekly.0 等)?
是不是很简单rm /mnt/disk1/backups/* -R?
我有几个 S3 存储桶,我想将访问权移交给另一个组织,就像将现有的托管客户端移交给他们一样。
查看文档后,如果我不想再负责存储桶,似乎最简单的选择是将新存储桶的内容复制到由新组织控制的新存储桶,并使任何现有应用程序写入文件从现在开始到新存储桶。
桶不是很大:
aws s3 ls --human-readable --recursive --summarize s3://some-client-bucket
# (snip… lots of files listed, all less than 10mb)
# Total Objects: 22764
# Total Size: 2.4 GiB
Run Code Online (Sandbox Code Playgroud)
但是有些存储桶是版本化的,我有一些文件的每日快照,可以追溯到去年,我也希望能够传输这些文件。
我了解在他们使用以下内容授予我访问权限后,如何将存储桶的当前内容复制到由另一个组织控制的新存储桶:
aws s3 sync s3://some-client-bucket s3://new-client-bucket --recursive
Run Code Online (Sandbox Code Playgroud)
但是,我认为这也不会跨版本移动,而且我一直依赖 S3 的每个文件版本控制,而不是自己为文件添加时间戳。
我是否必须对一些脚本进行 jerry-rig 以:
或者 S3 中是否有一些漂亮的额外功能可以为我自动执行此操作?
我正在部署我的第一个磁带备份解决方案(使用 Quantum Superloader 3 LTO-7、CentOS 6.9),我对 Bacula 和 Amanda 看似令人生畏的配置要求感到惊讶和困惑。
我被 Amanda 关于使用现有通用工具和格式的哲学方法所吸引。这就是我多年来进行基于磁盘的备份的方式。问题是,当我在网上寻找提示时,我只能找到 2000 年代早期(2010 年左右为数不多)关于仅将几 GB 备份到只有几十 GB 的磁带的帖子。此外,存在于新yum install amanda-server配置文件中的参数/etc/amanda/DailySet1/amanda.conf似乎与这些类型的数字一致(例如,bumpsize 是 20MB!)。这似乎与现代现实完全脱节。我正在处理多个高度可压缩的 40+ TB 文件系统和 16 磁带自动加载机上的 6 TB 磁带。
当然,不合时宜本身并不重要,但在网络上没有任何集体智慧的情况下,我对如何配置参数(例如 dumpcycle、runspercycle、tapecycle、bumpsize、etimeout)感到茫然。默认值似乎很糟糕。此外,理所当然地,我没有在许多大磁带上轮换许多小备份,而是混合了许多适合磁带的小备份,这些小备份必然与必须跨越多个磁带的大备份共存,我需要确保磁带没有被覆盖。自动加载器中的磁带肯定有足够的容量来容纳多个 0 级和多个 1 级,但我不知道如何配置它。
所以我的问题:
如果这些问题看起来不了解,我深表歉意。我已经阅读文学好几天了,但这对我来说是不透明的。非常感谢在现代操作系统上使用现代磁带在现代自动装载机上开始进行数十 TB 备份的任何帮助或指南!
半高 LTO-6 驱动器的所有 LED 都以 ~ 4 Hz 的频率闪烁。LTO-5 磁带仍在里面,驱动器对命令没有反应,在重启后继续闪烁。
我在 Tandberg 手册中找不到错误代码。该驱动器已有大约 3 年的历史,并且只有大约 15 次完整备份的历史记录,磁带已写入两次。所以我不指望机械磨损,而是电子问题。
这款 Tandberg LTO-6 驱动器是单独外壳中的 LTO-6 HP 驱动器,因此了解此代码对于 HP LTO-6 驱动器的含义也将有所帮助。
谁知道代码的含义以及它在哪里记录?
我们在远程服务器上有大量文件,我想定期备份到本地系统以获得额外的冗余。一些细节:
相似:
0123456789/
0123456
abc/
1.fff
2.fff
3.fff
xyz/
9.fff
8.fff
7.fff
9877656578/
5674563
abc/
1.fff
2.fff
3.fff
xyz/
9.fff
8.fff
7.fff
Run Code Online (Sandbox Code Playgroud)
成千上万的根文件夹仅包含一些内部文件夹/文件结构 - 但所有根文件夹都是数字(0-9)。
我rsync -aP第一次用直线跑了,结果花了3196m20.040s. 部分原因是因为远程服务器在rsync2.6.6 上,我无法使用 3.xx 中的增量文件功能。编译文件列表需要将近 12 个小时 - 每 10 秒运行大约 500 个文件。我不认为后续运行会花费这么长时间,因为初始运行必须重新下载所有内容 - 然而,即使 12 小时仅用于文件列表也太长了。
文件夹命名分解如下:
$ ls | grep "^[^67]" | wc -l …Run Code Online (Sandbox Code Playgroud) 我发誓,我已经阅读了我能找到的所有文档,并尝试了所有内容,包括 AWS 策略生成器 UI 和手动编辑策略 JSON,但无论我尝试什么,当我尝试删除任何这些资源时,我都会得到大红色标题与Access denied Insufficient privileges to perform this action. Please consult with the account administrator for necessary permissions.
看来我需要做的就是在策略中显式列出 arn,而不使用通配符,例如:
{
"Version": "2012-10-17",
"Statement": [
{
"Sid": "VisualEditor0",
"Effect": "Allow",
"Action": "backup:DeleteBackupPlan",
"Resource": "arn:aws:backup:<and the rest of the actual arn here>>"
}
]
}
Run Code Online (Sandbox Code Playgroud)
但没有运气。
任何人都可以向我指出文档或描述如何实际删除 AWS 备份保管库、恢复点和备份计划资源吗?我是否缺少一些必需的权限,或者只是做错了?
- 更新 -
经过大量试验和错误后,删除备份还原点奏效了。
我必须前往包含的备份库并编辑资源策略。原来是这样的:
{
"Version": "2012-10-17",
"Statement": [
{
"Effect": "Deny",
"Principal": {
"AWS": "*"
},
"Action": [
"backup:DeleteBackupVault", …Run Code Online (Sandbox Code Playgroud)