数据治理中心 DATAARTS STUDIO-新建DataArts Studio与MRS Hive数据湖的连接:前提条件

时间:2024-09-13 17:14:08

前提条件

  • 在创建数据连接前,请确保您已创建所要连接的 数据湖 (如 DataArts Studio 所支持的数据库、云服务等)。
    • 在创建DWS类型的数据连接前,您需要先在DWS服务中创建集群,并且具有KMS密钥的查看权限。
    • 在创建 MRS HBase、MRS Hive等MRS类型的数据连接前,需确保您已购买MRS集群,并且集群中包含所需要的组件。
  • 在创建数据连接前,请确保待连接的数据湖与DataArts Studio实例之间网络互通。
    • 如果数据湖为云下的数据库,则需要通过公网或者专线打通网络,确保数据源所在的主机可以访问公网,并且防火墙规则已开放连接端口。
    • 如果数据湖为云上服务(如DWS、MRS等),则网络互通需满足如下条件:
      • DataArts Studio实例(指DataArts Studio实例中的 CDM 集群)与云上服务处于不同区域的情况下,需要通过公网或者专线打通网络。
      • DataArts Studio实例(指DataArts Studio实例中的CDM集群)与云上服务同区域情况下,同虚拟私有云、同子网、同安全组的不同实例默认网络互通;如果同虚拟私有云但是子网或安全组不同,还需配置路由规则及安全组规则,配置路由规则请参见如何配置路由规则章节,配置安全组规则请参见如何配置安全组规则章节。
      • 此外,您还必须确保该云服务的实例与DataArts Studio工作空间所属的企业项目必须相同,如果不同,您需要修改工作空间的企业项目。
  • 如果使用企业模式,您还需要注意以下事项:
    由于企业模式下需要区分开发环境和生产环境,因此您需要分别准备对应生产环境和开发环境的两套数据湖服务,用于隔离开发和生产环境:
    • 对于集群化的数据源(例如MRS、DWS、RDS、MySQL、Oracle、DIS、E CS ),如果使用两套集群DataArts Studio通过管理中心的创建数据连接区分开发环境和生产环境的数据湖服务,在开发和生产流程中自动切换对应的数据湖。因此您需要准备两套数据湖服务,且两套数据湖服务的版本、规格、组件、区域、VPC、子网以及相关配置等信息,均应保持一致。创建数据连接的详细操作请参见创建DataArts Studio数据连接
    • 对于Serverless服务(例如 DLI ),DataArts Studio通过管理中心的环境隔离来配置生产环境和开发环境数据湖服务的对应关系,在开发和生产流程中自动切换对应的数据湖。因此您需要在Serverless数据湖服务中准备两套队列、数据库资源,建议通过名称后缀进行区分,详细操作请参见配置DataArts Studio企业模式环境隔离
    • 对于DWS、MRS Hive和MRS Spark这三种数据源,如果在创建数据连接时选择同一个集群,则需要配置数据源资源映射的DB数据库映射关系进行开发生产环境隔离,详细操作请参见DB配置
    • 离线处理集成作业不支持在企业模式下运行。

    例如,当您的数据湖服务为MRS集群时,需要准备两套MRS集群,且版本、规格、组件、区域、VPC、子网等保持一致。如果某个MRS集群修改了某些配置,也需要同步到另一套MRS集群上。

support.huaweicloud.com/usermanual-dataartsstudio/dataartsstudio_01_0351.html