-
管理脱敏算法 - 数据治理中心 DataArts Studio
格式的表。 Hive列加密不支持视图以及Hive over HBase场景。 支持配置加密类型。 新建脱敏算法 在DataArts Studio控制台首页,选择实例,单击“进入控制台”,选择对应工作空间的“数据安全”模块,进入数据安全页面。 图1 选择数据安全 在数据安全控制台左
-
MongoDB/DDS增量迁移 - 数据治理中心 DataArts Studio
时间-偏移量”。 在创建CDM表/文件迁移的作业,源连接选择为MongoDB连接或者DDS连接时,高级属性的可选参数中可以配置查询筛选。 图1 MongoDB查询筛选 此参数支持配置为时间宏变量,例如起始时间配置为{"ts":{$gte:ISODate("${dateformat
-
打不开作业日志,返回404报错? - 数据治理中心 DataArts Studio
编辑”,弹出“空间信息”弹窗。 在“空间信息”中,单击“作业日志OBS路径”后的“请选择”按钮,选择日志存储路径,可选择某个具体的目录。 图1 修改日志存储路径 修改完成后,单击“确定”,即完成作业日志存储路径的修改。 用户在创建作业时,会默认创建dlf-log-{project
-
如何降低CDM使用成本? - 数据治理中心 DataArts Studio
创建NAT网关,注意选择和CDM集群相同的VPC、子网。 创建完NAT网关后,回到NAT网关控制台列表,单击创建好的网关名称,然后选择“添加SNAT规则”。 图1 添加SNAT规则 选择子网和弹性IP,如果没有弹性IP,需要先申请一个。 完成之后,就可以到CDM控制台,通过Internet迁移公网的
-
MongoDB/DDS增量迁移 - 数据治理中心 DataArts Studio
时间-偏移量”。 在创建CDM表/文件迁移的作业,源连接选择为MongoDB连接或者DDS连接时,高级属性的可选参数中可以配置查询筛选。 图1 MongoDB查询筛选 此参数支持配置为时间宏变量,例如起始时间配置为{"ts":{$gte:ISODate("${dateformat
-
调用API - 数据治理中心 DataArts Studio
调用失败,请谨慎操作。 图2 应用详情 (可选)将API授权给应用 当待调用的API为APP认证方式时,需要进行此操作。 在DataArts Studio控制台首页,选择实例,单击“进入控制台”,选择对应工作空间的“数据服务”模块,进入数据服务页面。 图3 选择数据服务 在左侧导
-
新建数据连接 - 数据治理中心 DataArts Studio
单击,进入连接目录列表。 在连接目录中,右键单击对应的连接,选择“查看引用”,弹出“引用列表”窗口。 在引用列表窗口,可以查看该连接被作业或脚本引用的情况。 图1 引用列表 父主题: 数据管理
-
性能调优 - 数据治理中心 DataArts Studio
cdm.large 8核 16GB 16 cdm.xlarge 16核 32GB 32 cdm.4xlarge 64核 128GB 128 图1 集群最大抽取并发数配置 作业抽取并发数的配置原则如下: 迁移的目的端为文件时,CDM不支持多并发,此时应配置为单进程抽取数据。 表中每行
-
创建MySQL连接器 - 数据治理中心 DataArts Studio
接器名称和驱动文件路径。 在“集群管理”界面,单击集群后的“作业管理”,选择“连接管理 > 新建连接”,进入连接器类型的选择界面,如图1所示。 图1 选择连接器类型 连接器类型选择“MySQL”后单击“下一步”,配置MySQL连接的参数。 表1 MySQL连接参数 参数名 说明 取值样例
-
数据开发概述 - 数据治理中心 DataArts Studio
块。 数据开发简介 使用数据开发模块,用户可进行数据管理、脚本开发、作业开发、作业调度、运维监控等操作,轻松完成整个数据的处理分析流程。 图1 数据开发模块架构 数据开发的主要功能 表1 数据开发的主要功能 支持的功能 说明 数据管理 支持管理DWS、DLI、MRS Hive等多种数据仓库。
-
身份认证与访问控制 - 数据治理中心 DataArts Studio
Arts Studio提供了系统角色+工作空间角色授权的能力,由工作空间角色授权具体的操作权限,并支持自定义不同权限点的工作空间角色。 如图1和表1所示,DataArts Studio的IAM系统角色包括DAYU Administrator和DAYU User;工作空间角色是基于IAM角色DAYU
-
文件增量迁移 - 数据治理中心 DataArts Studio
文件过滤器:配置为“*${dateformat(yyyyMMdd,-1,DAY)}*”(这是CDM支持的日期宏变量格式,详见时间宏变量使用解析)。 图1 文件过滤 配置作业定时自动执行,“重复周期”为1天。 这样每天就可以把昨天生成的文件都导入到目的端目录,实现增量同步。 文件增量迁移场景
-
基本概念 - 数据治理中心 DataArts Studio
默认的项目中创建子项目,并在子项目中创建资源,然后以子项目为单位进行授权,使得用户仅能访问特定子项目中资源,使得资源的权限控制更加精确。 图1 项目隔离模型 父主题: 使用前必读
-
认证鉴权 - 数据治理中心 DataArts Studio
您可以通过如下方式获取访问密钥。 登录控制台,在用户名下拉列表中选择“我的凭证”。 进入“我的凭证”页面,选择“访问密钥 > 新增访问密钥”,如图1所示。 图1 单击新增访问密钥 单击“确定”,根据浏览器提示,保存密钥文件。密钥文件会直接保存到浏览器默认的下载文件夹中。打开名称为“credentials
-
文件增量迁移 - 数据治理中心 DataArts Studio
文件过滤器:配置为“*${dateformat(yyyyMMdd,-1,DAY)}*”(这是CDM支持的日期宏变量格式,详见时间宏变量使用解析)。 图1 文件过滤 配置作业定时自动执行,“重复周期”为1天。 这样每天就可以把昨天生成的文件都导入到目的端目录,实现增量同步。 文件增量迁移场景
-
什么是数据血缘关系? - 数据治理中心 DataArts Studio
层次性:数据的血缘关系是有层次的。对数据的分类、归纳、总结等对数据进行的描述信息又形成了新的数据,不同程度的描述信息形成了数据的层次。 图1 数据血缘关系示例 父主题: 数据目录
-
DataArts Studio的工作空间可以删除吗? - 数据治理中心 DataArts Studio
在“删除工作空间”对话框中,如果确认删除,请单击“确认”。 如果当前各组件内还有业务资源,则您需要根据失败提示窗口,删除对应业务资源后再次重试删除。 图1 删除失败提示 父主题: 咨询与计费
-
解绑/绑定集群的EIP - 数据治理中心 DataArts Studio
已创建CDM集群。 已拥有EIP配额,才能绑定EIP。 操作步骤 登录CDM管理控制台。单击左侧导航上的“集群管理”,进入集群管理界面。 图1 集群列表 “创建来源”列仅通过DataArts Studio服务进入数据集成界面可以看到。 对相应需要操作的集群可以进行绑定EIP或解绑EIP的操作。
-
如何查看审计日志 - 数据治理中心 DataArts Studio
分类: CDM:数据集成组件的事件。 DLF:数据开发组件的事件。 DLG:管理中心、数据架构、数据质量、数据目录和数据服务组件的事件。 图1 CDM操作事件 在需要查看的事件左侧,单击事件名称左侧箭头,展开该记录的详细信息。 在需要查看的记录右侧,单击“查看事件”,弹窗中显示了该操作事件结构的详细信息。
-
数据管理流程 - 数据治理中心 DataArts Studio
如果您在使用数据开发前,已创建了数据连接和对应的数据库和数据表,则可跳过数据管理操作,直接进入脚本开发或作业开发。 数据管理的使用流程如下: 图1 数据管理流程 创建数据连接,连接相关数据湖底座服务。具体请参见新建数据连接。 基于相应服务,新建数据库。具体请参见新建数据库。 如果是D