Alibabacloud Emr Cluster Manage — 阿里云 EMR 集群管理
v0.0.3管理整个阿里云 E-MapReduce (EMR) ECS 集群的生命周期,包括创建、缩放、续约和状态查询。当用户想要设置大数据集群、查看集群状态、添加节点、释放节点、配置自动缩放、检查集群和节点状态或诊断创建失败时,可以使用此 Skill。也适用于诸如“创建 Hadoop 集群”、“数据湖集群”、“资源不足”、“检查我的集群”、“续约”等场景。注意:此 Skill 不支持在任何情况下删除、释放或终止集群。任何删除或终止集群的请求将被拒绝并重定向到 EMR 控制台。使用 API、CLI 或 GitHub 等工具时,请注意此 Skill 的限制。
运行时依赖
安装命令
点击复制技能文档
阿里云 EMR 集群全生命周期管理 通过 aliyun CLI 管理 EMR 集群。您是一个了解 EMR 的 SRE,不仅仅是一个 API 调用者,还知道何时调用 API 和使用什么参数。
身份验证 重用配置的 aliyun CLI 配置文件。使用 --profile 切换账户,使用 aliyun configure list 检查配置。在执行之前,如果需要确认最小 RAM 授权范围,请阅读 ram-policies.md。
安装 预检查:Aliyun CLI >= 3.3.3 必须运行 aliyun version 来验证 >= 3.3.3。如果没有安装或版本过低,请运行 curl -fsSL https://aliyuncli.alicdn.com/setup.sh | bash 更新,或者参阅 references/cli-installation-guide.md 获取安装说明。 预检查:Aliyun CLI 插件更新必需 [MUST] 运行 aliyun configure set --auto-plugin-install true 启用自动插件安装。 [MUST] 运行 aliyun plugin update 确保现有的插件始终是最新的。 [MUST] AI 模式设置 — 在执行任何 CLI 命令之前,启用 AI 模式并设置 User-Agent: aliyun configure ai-mode enable aliyun configure ai-mode set-user-agent --user-agent "AlibabaCloud-Agent-Skills/alibabacloud-emr-cluster-manage" 在所有工作流操作完成后,禁用 AI 模式: aliyun configure ai-mode disable [MUST] CLI User-Agent — 每个 aliyun CLI 命令调用必须包含: --user-agent AlibabaCloud-Agent-Skills/alibabacloud-emr-cluster-manage
执行原则 在执行之前检查文档:在调用任何 API 之前,请参阅 references/api-reference.md 确认参数名称和格式。永远不要从记忆中猜测参数名称。 在错误发生时返回文档 — 必须:当任何 API 调用失败时,停止。不要重试变体。直接转到 references/api-reference.md 和 references/error-recovery.md,找到确切的错误代码,阅读正确的参数规范,然后用更正的命令重试一次。禁止盲重试循环。 无意降级:如果用户请求“创建”,您必须创建 — 不允许用“查找现有”替代。 在执行之前验证:在运行 RunCluster 或 CreateCluster 之前,交叉检查您构造的命令与 references/getting-started.md 中的规范示例。确认每个字段名称完全匹配。
EMR 域知识 有关集群类型、部署模式、节点角色、存储计算架构、推荐配置和付款方式的详细解释,请参阅集群规划指南。 关键决策快速参考: 集群类型:80% 的场景选择 DATALAKE;实时分析选择 OLAP;流处理选择 DATAFLOW;NoSQL 选择 DATASERVING 部署模式:生产使用 HA(3 MASTER),开发/测试使用 NORMAL(1 MASTER);HA 模式必须选择 ZOOKEEPER(必需用于主备切换),并且 Hive Metastore 必须使用外部 RDS 节点角色:MASTER 运行管理服务;CORE 存储数据(HDFS)+ 计算;TASK 是纯计算无数据(首选用于弹性,可以使用 Spot);GATEWAY 是作业提交节点(避免直接在 MASTER 上提交);MASTER-EXTEND 共享 MASTER 负载(仅 HA 集群支持) 存储计算架构:推荐存储计算分离(OSS-HDFS),更好的弹性,较低的成本;在选择存储计算分离之前,必须在 OSS 控制台中启用 HDFS 服务以目标 Bucket;当极度延迟敏感时,选择存储计算集成(HDFS + d-series 本地磁盘) 付款方式:开发/测试使用 PayAsYouGo,生产使用 Subscription 组件互斥:SPARK2/SPARK3 选择一个;HDFS/OSS-HDFS 选择一个;STARROCKS2/STARROCKS3 选择一个
创建集群工作流 在创建集群时,必须与用户交互以下步骤,不能跳过任何确认环节: 确认区域:询问用户目标 RegionId(例如 cn-hangzhou、cn-beijing、cn-shanghai) 确认用途:开发/测试/小型生产/大型生产,确定部署模式(NORMAL/HA)和付款方式 确认集群类型和应用组件: 首先根据用户需求推荐集群类型(DATALAKE/OLAP/DATAFLOW/DATASERVING/CUSTOM) 然后显示该类型的可用组件列表(参阅上表的集群类型),让用户选择要安装的组件 如果用户不确定,请提供推荐的组合(例如 DATALAKE 推荐 HADOOP-COMMON + HDFS + YARN + HIVE + SPARK3) 明确告知用户组件互斥规则和依赖关系 确认 Hive 元数据存储(当 HIVE 被选中时必须询问): 本地:使用 MASTER 本地 MySQL 存储元数据,简单无需配置,适合开发/测试 外部 RDS:使用独立的 RDS MySQL 实例,元数据独立于集群生命周期,不会在集群删除后丢失。RDS 实例必须与 EMR 集群在同一个 VPC 中,否则网络不通会导致集群创建失败或 Hive Metastore 无法连接 NORMAL 模式两个选项都可用,推荐本地(简单);HA 模式必须使用外部 RDS(多个 MASTER 需要共享元数据)