关于hbase拆分和合并文件问题(江湖救急)

沉沦 2017-12-27 04:19:45

关于hbase文件的拆分和合并

问题 1.
设置memstore为5MB
hbase.hregion.preclose.fulsh.size = 5MB

设置最大拆分为6MB
hbase.hregion.max.filesize = 6MB


问:因为在每个familycolumns里,每次memstore满了之后会刷新到磁盘上.
因为memstore=5MB,最大拆分阈值是=6M.
那么我可以认为hbase永远不会对数据进行拆分,除非单个语句一次性进来一个大于6M的数据.hbase只有强行写一个大于6M的文件才可能去拆分? (我理解的对吗?)

#######################################################################

问题 2.
设置memstore为5MB
hbase.hregion.preclose.fulsh.size = 5MB

设置最大拆分为6MB
hbase.hregion.max.filesize = 6MB

问:如果memstore=5MB,最大拆分阈值是=6M,
那么每个文件都会拆分成2.5M ?

#########################################################################

问题 3.
设置memstore为5MB
hbase.hregion.preclose.fulsh.size = 5MB

设置最大拆分为5MB
hbase.hregion.max.filesize = 5MB

region 合并处理的文件数
hbase.hstore.compaction.max.size = 10

region 合并文件最小值
hbase.hstore.compaction.min.size = 2M


问:如果设置memstore为5MB,设置最大拆分为5MB,合并文件最小值为2M,合并文件数是10
那么当每个文件拆分成2.5M之后,然后又要合并.10个2.5M = 25M.
那么合并的数据又大于最大拆分数(5M以上),然后又对这25M拆分? 无限循环?

#################################################################

问题 4.
设置memstore为5MB
hbase.hregion.preclose.fulsh.size = 5MB

设置最大拆分为5MB
hbase.hregion.max.filesize = 5MB

region 合并处理的文件数
hbase.hstore.compaction.max.size = 10

region 合并文件最小值
hbase.hstore.compaction.min.size = 3M


问:如果设置memstore为5MB,设置最大拆分为5MB,合并文件最小值为3M,合并文件数是10
那么当每个文件拆分成2.5M之后,然而合并文件最小值为3M.那么数据将永远不会合并.

###########################################################

问题 5.
设置memstore为5MB
hbase.hregion.preclose.fulsh.size = 5MB

设置最大拆分为5MB
hbase.hregion.max.filesize = 5MB

region 合并处理的文件数
hbase.hstore.compaction.max.size = 10

region 合并文件最小值
hbase.hstore.compaction.min.size = 2M


问:如果设置memstore为5MB,设置最大拆分为5MB,合并文件最小值为2M,合并文件数是10
那么当每个文件拆分成2.5M之后,然而合并文件最小值为1M.那么它将会合并 10 * 2.5M = 25M
这时,这个新文件(25M)是大于最小合并字节的1M.
那么下次合并,这个25M的文件还会参与合并操作吗?

#####################################################

问题 6.
大家都是如何设置这几个值的.能否给一个参考
...全文
867 回复 打赏 收藏 转发到动态 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
内容概要:本文针对网型T型三电平逆变器的低电压穿越(LVRT)能力及其综合控制策略开展深入研究,重点分析电网电压跌落条件下逆变器的动态响应特性与稳定性控制方法。研究基于Simulink平台构建详细的系统仿真模型,融合改进的电流环控制策略与中点电位平衡控制算法,有效提升逆变器在故障工况下的电流跟踪精度、过流抑制能力和直流侧中点电压稳定性。通过多场景仿真验证,所提出的综合控制策略能够显著增强逆变器在低电压穿越过程中的鲁棒性与电能质量,确保新能源系统在电网扰动下的持续可靠并网运行。; 适合人群:电力电子、新能源发电、电力系统自动化等相关专业的研究生、科研人员及从事并网逆变器设计与控制的工程技术人员。; 使用场景及目标:①深入理解三电平逆变器在电网故障下的运行机理与控制挑战;②掌握低电压穿越技术中电流限幅、故障响应及中点电位平衡的核心控制方法;③应用于光伏、风电等新能源并网系统的控制策略开发与仿真验证; 阅读建议:建议结合提供的Simulink仿真模型进行动手实践,重点关注控制器参数设计、中点电位观测与调节模块的实现逻辑,并通过对比不同电压跌落深度和控制策略的仿真结果,深化对系统动态行为与控制性能的理解。
yolo算法港口码头船舶目标检测数据集 目标类别:['ship'] 中文类别:['船舶'] 训练集:16046 张 验证集:1971 张 测试集:983 张 总计:19000 张 该数据集提供了data.yaml文件,内容如下: train: ../train/images val: ../valid/images test: ../test/images nc: 1 names: ['ship'] 该数据集聚焦于港口码头及近海水域的船舶检测任务,涵盖多种类型船舶在不同天气、光照和水文条件下的真实场景。图像样本覆盖了货轮、客轮、拖船、油轮及工程船等典型船只,充分体现了海上交通与港口作业的复杂性与多样性。通过高精度标注,该数据集为海上智能监控、船舶识别与航行安全预警系统提供了高质量的数据支撑,具有重要的实际应用价值。 该数据集在训练集、验证集和测试集之间实现了科学合理的分布,训练集包含16046张图像,验证集1971张,测试集983张,总计19000张。这种分布结构确保了模型在训练过程中具备充足的样本学习能力,同时验证集与测试集规模适中,能够有效评估模型的泛化性能与稳定性,符合深度学习项目对数据划分的标准要求。 该数据集的标注工作严谨规范,所有船舶均采用精确边界框进行标注,覆盖了不同尺寸、姿态和视角下的目标实例。标注框紧密贴合船舶轮廓,未出现明显偏移或遗漏,且在复杂背景(如水面反光、雾天、桥梁遮挡)下仍保持高一致性。标注信息完整可靠,为后续模型训练提供了坚实基础。 该数据集可广泛应用于港口自动化管理、海上交通监控、船舶动态跟踪、航道安全预警以及海洋执法等领域。其丰富的场景覆盖和多样化的船舶类型使其特别适用于智慧港口建设、海上搜救系统开发及航运物流智能化升级,能够有效提升相关系统的识别准确率与响应效率,推动海洋经济数字化转型。

20,842

社区成员

发帖
与我相关
我的任务
社区描述
Hadoop生态大数据交流社区,致力于有Hadoop,hive,Spark,Hbase,Flink,ClickHouse,Kafka,数据仓库,大数据集群运维技术分享和交流等。致力于收集优质的博客
社区管理员
  • 分布式计算/Hadoop社区
  • 涤生大数据
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧