离线批处理方案的应用场景不包括?
占用计算存储资源多
快速高效,实时的数据处理
数据处理格式多样
处理大规模数据
以下关于公共安全行业专题分析与查询业务场景描述错误的选项是。
适用标准SQL语句进行查询,根据查询结果筛选目标人群,侦办案件
原始数据经过批处理后结果写入到指定的文件目录,供交互式查询
临时交互式查询任务对数据进行精确或者模糊查询
数据湖内多个数据源只能单独访问再呈现结果
以下选项中关于HDFS的文件块的描述不准确的是。
HDFS文件块的大小在1.0版本时是64M,在2.0的时候是128M。
文件块(片)被存在哪个集群谁有权限查看、修改这个文件等信息放在元数据Metadata中。
文件块越大寻址时间越短。
文件块的大小设置原则最大化寻址开销。
当大数据业务人员希望通过like关键字来查询Hive表中的某些数据时,需要添加以下哪个关键字符用于匹配数据?
%
A
$
&
当Spark发生Shuffle时,MapTask的运算结果会通过()的形式把运算结果分发到对应的任务上去。
序列化
键值对
二进制
RDD
Loader页面是基于( )开源的图形化数据迁移管理工具。
Hadoop
Hue
Kettle
Sqoop
银行进行客户购买力分析首先获取客户历史账单,确定其中各项商品的计算权重,得出每位客户的购买力评分并存储记录。最后将结果以图表显示。请问该过程对应于以下哪个项目数据流程设计。
数据可视化>数据源>数据落地>数据处理
数据源>数据落地>数据处理>数据可视化
数据源>数据处理>数据落地>数据可视化
数据可视化>数据源>数据处理>数据落地
离线批处理工具不包含以下哪项?
Spark
MapReduce
Storm
SQL
第三次信息化浪潮标志不包含以下哪项?
互联网
云计算
物联网
大数据
Hive中的解释器(complier)、优化器(optimizer)、执行器(executor)组件用于HQL语句从词法分析、语法分析、编译,优化以及查询计划的生成。生成的查询计划存储在()中,并在随后由()调用执行。
HDFS、MapReduce
内存、MapReduce
HDFS、Yarn
HBase、Yarn
Hive创建()时,会将数据移动到数据仓库指向的路径;创建(),仅记录数据所在的路径,不对数据的位置做任何改变
内部表、外部表
内部表、元数据
原元数据、外部表
外部表、托管表
大数据技术的4V特征不包括以下哪项?
Virtual
Velocity
Variety
Volume
以下关于DataNode的描述不正确的是?
DataNode管理数据块元数据
DataNode执行数据块的读/写操作。
DataNode的数量受数据规模影响。
DataNode是用来存储数据库。
Spark读取任务参数的优先级是?
代码配置>动态参数>配置文件
动态参数>代码配置>配置文件
配置文件>代码配置>动态参数
动态参数>配置文件>代码配置
智能数据湖运营平台指的是以下哪个选项?
VAS(video Analysis Service)
ModelArts
CSS
DAYU
下列哪个选项对批量数据处理组件的描述是不正确的?
Hive传统SQL批处理引擎,用于处理SQL类批处理作业,使用广泛海量数据下表现稳定,但是处理速度较慢。
MapReduce传统批处理引擎,用于处理非SQL类,尤其是数据挖掘和机器学习类批处理作业,使用广泛,海量数据下表现不稳定,但是处理速度较快。
SparkSQL新型SQL批处理引擎,用于处理SQL类批处理作业,适合海量数据.处理速度高效。
Spark新型批处理引擎,可以用于处理非SQL类,尤其是数据挖掘和机器学习类批处理作业,适合海量数据,处理速度高效。
以下哪一选项不属于MRS日常运维不影响业务这一特性?
滚动升级/补丁
修改配置滚动重启
单集群跨AZ高可用
扩缩容业务无感知
Action是RDD的算子的一个类型,不可以将结果写入()
磁盘
CPU
HDFS
数据库
ETL工具工作过程不包含以下哪项?
清洗
传递
加载
转换
以下哪些选项不属于大数据时代到来的必要条件?
存储设备容量提升
CPU计算性能提升
超级计算机的出现
网络带宽提升
以下关于HDFS适合做什么描述不正确的是?
流式数据读取
大文件存储与访问
大数据量吞吐
低延迟读取
某大数据业务人员对某些数据创建Hive表结构,其中某个数据为时间类型yyyyMMdd,那么可以使用以下哪一项作为字段类型?
varchar
string
double
int
某公司计划上线新系统,数据库工程师使用Hive数据仓库进行数据分析,现在界面提示:"ojdbc:hive2://192.168.0.186:2181/>"信息,现已完成数据库的创建工作,那么他将如何继续开始数据库的使用?
use database
start database
restart database
continue database
电商公司数据库高级工程师进行大数据分析,现在界面提示:"0:jdbe:hive2://192.168.0.186:2181/>"信息,那么他最有可能在进行什么场景的数据分析工作?
实时检索场景
离线批处理场景
图搜索场景
实时流开发场景
Hive调优中,当连接一个较小和较大表的时候,把()的表直接放到内存中去,然后再对()的表进行map操作。
小,小
小,大
大,小
大,大
关于Spark中RDD的描述不准确的是的?
RDD可以从HDFS输入创建,或从与Hadoop兼容的其他存储系统中输入创建。
Spark的所有Transform操作都是基于RDD来实现的。
RDD是只读和可分区的。要想对RDD进行操作,只能重新生成一个新的RDD
当前RDD默认是存储于内存,当内存不足时,RDD也不会溢出到磁盘中。
以下哪种Hive的方法可以用来对数据求和?
trim
data
avg
sum
企业数据分析平台在根据不同的业务场景需求,搭建不同的大数据分析平台,如适应离线批处理的Hadoop平台适应实时处理的流计算平台等,这种架构属于哪种类型的架构?
分离架构
单一架构
融合架构
多维架构
alter table tableName set tblproperties(EXTERNAL'='FALSE');执行该Hive命令能实现以下哪一个目标?
修改外部表tableName为内部表
删除tableName表的元数据信息
修改内部表tableName为外部表
移动tableName数据到外部存储系统
关于RDD,下列说法错误的是哪一项?
RDD具有血统机制(Lineage)
RDD默认存储在磁盘
RDD是一个只读的,可分区的分布式数据集
RDD是Spark对基础数据的抽象
从数据库架构设计来看,主要有以下哪些设计思路?
Shared-Disk
Shared-Everying
Shared-Nothing
以上全正确
以下关于HDFS的特点描述不正确的是?
大数据量吞吐
低延迟读取
流式数据读取
大文件存储与访问
关于华为云MRS中Loader的描述,以下哪些选项是正确的?
Loader提供可视化向导式的作业配置管理界面
Loader页面是基于开源Sqoop WebUI的图形化数据迁移管理工具,该页面托管在Hue的WebUI中
Loader提供定时调度任务,周期性执行ETL作业
Loader在界面中可指定多种不同的数据源、配置数据的清洗和转换步骤、配置集群存储系统等
Google发布的三篇论文是哪些?
GFS
HDFS
MapReduce
BigTable
所谓的大数据技术融合主要指哪些方面?
数据融合
算力融合
计算融合
批-流融合
现代企业数据分析平台向着云化和融合发展的优势有哪些?
超敏捷应用
资源弹性分配
多场景分析
交叉融合分析
大数据离线批处理场景中常见的数据源包括?
数据库
批量文件数据
流式数据Socket流
网页日志流
以下哪些是离线批处理的特点?
处理数据格式多样
支持SQL类作业和自定义作业
处理数据量巨大
处理时间要求高
以下哪些选项属于离线批处理的特点?
处理时间相对较长
数据不落地、存储量不大
数据吞吐量较大
处理数据量相对较大
Hive数据存储规模包括哪些成分?
分区
表
数据库
桶
大数据其中一个最明显的特征是数据量巨大,那么所谓的数据量巨大主要指哪些级别的数据量?
MB
TB
ZB
PB
Hive业务场景中,常常会出现某一张大表连接一张较小的维表,那么为了提高这个JoIN操作的效率,可以进行如下哪些操作?
大表在前小表在后
小表在前大表在后
设置参数hive.auto.convert.join为true
设置参数hive.groupby.skewindata为true
关于表扫描算子的说法正确的是?
对于点查或者范围扫描等过滤大量数据的查询,如果使用SeqScan全表扫描会比较快。
表的数目比较少的时候,使用Seqscan效率更高。
SQL的执行计划第一步就是从表扫描算子开始的。
SeqScan是指顺序扫描表的所有信息。
以下Hive数据仓库数据表分层的描述,准确的是?
ADS层,为各种统计报表提供数据,做分析处理同步到RDS数据库里边。
DWD层结构和粒度与原始表保持一致,简单清洗,数据明细详情,去除空值,脏数据,超过极限范围的明细解析。
ODS层,通常表述原始数据存储表,Hv接收到原始的数据通常是杂乱无章的,但是又具有安全隐私考虑,通常应用侧是不能看到的
DWS层,以DWD为基础,进行轻度汇总。
随着大数据越来越被重视,数据采集的挑战也变的尤为突出,常见的挑战包括?
数据量大
数据源多种多样
数据采集的可靠性保障
避免重复数据
以下关于Loader特点描述正确的是?
图形化:提供UI图形化配置、监控界面,操作便捷。
安全认证:Kerberos认证作业权限管理
高性能:利用MapReduce并行处理数据。
高可靠:Loader Server采用主备双机作业通过MaReduce执行,支持失败重试。作业失败后,不会残留数据。
以下关于Transformation的说法正确的是?
它的返回值还是一个RDD
是RDD的算子类型
属于懒操作
mapfunc属于Transformation
以下关于Loader的描述中,正确的有哪几项?
提供可视化向导式的作业配置管理界面。
是基于开源Flume研发,做了大量优化和扩展。
提供定时调度任务,周期性执行Loader作业。
在界面中可指定多种不同的数据源、配置数据的清洗和转换步骤、配置集群存储系统。
大数据场景化解决方案包含以下哪些选项?
离线检索
实时检索
离线批处理
实时流处理
数据仓库分层的优点包括以下哪些选项?
减少重复开发量
提高资源协调能力
隔离原始数据
简化复杂问题
Spark是基于内存的,处理数据时产生的中间产物(计算结果)是存放在内存中,减少了对磁盘的I/O操作,大大的提升了数据的处理速度。
因不同的数据类型存储的空间大小不一样,所以在选择数据类型时,只需考虑数据类型损耗的存储空间大小。
离线批处理,通常是指对海量数据进分析和处理,形成结果数据,供下一步数据应用使用,离线处理对处理时间要求不高。
HDFS中的DataNode用于存储实际的数据,将自己管理的数据块上报给Client,运行多个实例。
离线批处理通常通过MR作业、Spark作业或者HQL作业实现。