离线批处理场景练习

离线批处理场景练习

收藏豆荚
剥了 3 次
年级:其他
科目:其他
BigData
2025-01-12
55 颗豆豆
1. 单选题
30 秒

离线批处理方案的应用场景不包括?

占用计算存储资源多

快速高效,实时的数据处理

数据处理格式多样

处理大规模数据

2. 单选题
30 秒

以下关于公共安全行业专题分析与查询业务场景描述错误的选项是。

适用标准SQL语句进行查询,根据查询结果筛选目标人群,侦办案件

原始数据经过批处理后结果写入到指定的文件目录,供交互式查询

临时交互式查询任务对数据进行精确或者模糊查询

数据湖内多个数据源只能单独访问再呈现结果

3. 单选题
30 秒

以下选项中关于HDFS的文件块的描述不准确的是。

HDFS文件块的大小在1.0版本时是64M,在2.0的时候是128M。

文件块(片)被存在哪个集群谁有权限查看、修改这个文件等信息放在元数据Metadata中。

文件块越大寻址时间越短。

文件块的大小设置原则最大化寻址开销。

4. 单选题
30 秒

当大数据业务人员希望通过like关键字来查询Hive表中的某些数据时,需要添加以下哪个关键字符用于匹配数据?

%

A

$

&

5. 单选题
30 秒

当Spark发生Shuffle时,MapTask的运算结果会通过()的形式把运算结果分发到对应的任务上去。

序列化

键值对

二进制

RDD

6. 单选题
30 秒

Loader页面是基于( )开源的图形化数据迁移管理工具。

Hadoop

Hue

Kettle

Sqoop

7. 单选题
30 秒

银行进行客户购买力分析首先获取客户历史账单,确定其中各项商品的计算权重,得出每位客户的购买力评分并存储记录。最后将结果以图表显示。请问该过程对应于以下哪个项目数据流程设计。

数据可视化>数据源>数据落地>数据处理

数据源>数据落地>数据处理>数据可视化

数据源>数据处理>数据落地>数据可视化

数据可视化>数据源>数据处理>数据落地

8. 单选题
30 秒

离线批处理工具不包含以下哪项?

Spark

MapReduce

Storm

SQL

9. 单选题
30 秒

第三次信息化浪潮标志不包含以下哪项?

互联网

云计算

物联网

大数据

10. 单选题
30 秒

Hive中的解释器(complier)、优化器(optimizer)、执行器(executor)组件用于HQL语句从词法分析、语法分析、编译,优化以及查询计划的生成。生成的查询计划存储在()中,并在随后由()调用执行。

HDFS、MapReduce

内存、MapReduce

HDFS、Yarn

HBase、Yarn

11. 单选题
30 秒

Hive创建()时,会将数据移动到数据仓库指向的路径;创建(),仅记录数据所在的路径,不对数据的位置做任何改变

内部表、外部表

内部表、元数据

原元数据、外部表

外部表、托管表

12. 单选题
30 秒

大数据技术的4V特征不包括以下哪项?

Virtual

Velocity

Variety

Volume

13. 单选题
30 秒

以下关于DataNode的描述不正确的是?

DataNode管理数据块元数据

DataNode执行数据块的读/写操作。

DataNode的数量受数据规模影响。

DataNode是用来存储数据库。

14. 单选题
30 秒

Spark读取任务参数的优先级是?

代码配置>动态参数>配置文件

动态参数>代码配置>配置文件

配置文件>代码配置>动态参数

动态参数>配置文件>代码配置

15. 单选题
30 秒

智能数据湖运营平台指的是以下哪个选项?

VAS(video Analysis Service)

ModelArts

CSS

DAYU

16. 单选题
30 秒

下列哪个选项对批量数据处理组件的描述是不正确的?

Hive传统SQL批处理引擎,用于处理SQL类批处理作业,使用广泛海量数据下表现稳定,但是处理速度较慢。

MapReduce传统批处理引擎,用于处理非SQL类,尤其是数据挖掘和机器学习类批处理作业,使用广泛,海量数据下表现不稳定,但是处理速度较快。

SparkSQL新型SQL批处理引擎,用于处理SQL类批处理作业,适合海量数据.处理速度高效。

Spark新型批处理引擎,可以用于处理非SQL类,尤其是数据挖掘和机器学习类批处理作业,适合海量数据,处理速度高效。

17. 单选题
30 秒

以下哪一选项不属于MRS日常运维不影响业务这一特性?

滚动升级/补丁

修改配置滚动重启

单集群跨AZ高可用

扩缩容业务无感知

18. 单选题
30 秒

Action是RDD的算子的一个类型,不可以将结果写入()

磁盘

CPU

HDFS

数据库

19. 单选题
30 秒

ETL工具工作过程不包含以下哪项?

清洗

传递

加载

转换

20. 单选题
30 秒

以下哪些选项不属于大数据时代到来的必要条件?

存储设备容量提升

CPU计算性能提升

超级计算机的出现

网络带宽提升

21. 单选题
30 秒

以下关于HDFS适合做什么描述不正确的是?

流式数据读取

大文件存储与访问

大数据量吞吐

低延迟读取

22. 单选题
30 秒

某大数据业务人员对某些数据创建Hive表结构,其中某个数据为时间类型yyyyMMdd,那么可以使用以下哪一项作为字段类型?

varchar

string

double

int

23. 单选题
30 秒

某公司计划上线新系统,数据库工程师使用Hive数据仓库进行数据分析,现在界面提示:"ojdbc:hive2://192.168.0.186:2181/>"信息,现已完成数据库的创建工作,那么他将如何继续开始数据库的使用?

use database

start database

restart database

continue database

24. 单选题
30 秒

电商公司数据库高级工程师进行大数据分析,现在界面提示:"0:jdbe:hive2://192.168.0.186:2181/>"信息,那么他最有可能在进行什么场景的数据分析工作?

实时检索场景

离线批处理场景

图搜索场景

实时流开发场景

25. 单选题
30 秒

Hive调优中,当连接一个较小和较大表的时候,把()的表直接放到内存中去,然后再对()的表进行map操作。

小,小

小,大

大,小

大,大

26. 单选题
30 秒

关于Spark中RDD的描述不准确的是的?

RDD可以从HDFS输入创建,或从与Hadoop兼容的其他存储系统中输入创建。

Spark的所有Transform操作都是基于RDD来实现的。

RDD是只读和可分区的。要想对RDD进行操作,只能重新生成一个新的RDD

当前RDD默认是存储于内存,当内存不足时,RDD也不会溢出到磁盘中。

27. 单选题
30 秒

以下哪种Hive的方法可以用来对数据求和?

trim

data

avg

sum

28. 单选题
30 秒

企业数据分析平台在根据不同的业务场景需求,搭建不同的大数据分析平台,如适应离线批处理的Hadoop平台适应实时处理的流计算平台等,这种架构属于哪种类型的架构?

分离架构

单一架构

融合架构

多维架构

29. 单选题
30 秒

alter table tableName set tblproperties(EXTERNAL'='FALSE');执行该Hive命令能实现以下哪一个目标?

修改外部表tableName为内部表

删除tableName表的元数据信息

修改内部表tableName为外部表

移动tableName数据到外部存储系统

30. 单选题
30 秒

关于RDD,下列说法错误的是哪一项?

RDD具有血统机制(Lineage)

RDD默认存储在磁盘

RDD是一个只读的,可分区的分布式数据集

RDD是Spark对基础数据的抽象

31. 单选题
30 秒

从数据库架构设计来看,主要有以下哪些设计思路?

Shared-Disk

Shared-Everying

Shared-Nothing

以上全正确

32. 单选题
30 秒

以下关于HDFS的特点描述不正确的是?

大数据量吞吐

低延迟读取

流式数据读取

大文件存储与访问

33. 多选题
30 秒

关于华为云MRS中Loader的描述,以下哪些选项是正确的?

Loader提供可视化向导式的作业配置管理界面

Loader页面是基于开源Sqoop WebUI的图形化数据迁移管理工具,该页面托管在Hue的WebUI中

Loader提供定时调度任务,周期性执行ETL作业

Loader在界面中可指定多种不同的数据源、配置数据的清洗和转换步骤、配置集群存储系统等

34. 多选题
30 秒

Google发布的三篇论文是哪些?

GFS

HDFS

MapReduce

BigTable

35. 多选题
30 秒

所谓的大数据技术融合主要指哪些方面?

数据融合

算力融合

计算融合

批-流融合

36. 多选题
30 秒

现代企业数据分析平台向着云化和融合发展的优势有哪些?

超敏捷应用

资源弹性分配

多场景分析

交叉融合分析

37. 多选题
30 秒

大数据离线批处理场景中常见的数据源包括?

数据库

批量文件数据

流式数据Socket流

网页日志流

38. 多选题
30 秒

以下哪些是离线批处理的特点?

处理数据格式多样

支持SQL类作业和自定义作业

处理数据量巨大

处理时间要求高

39. 多选题
30 秒

以下哪些选项属于离线批处理的特点?

处理时间相对较长

数据不落地、存储量不大

数据吞吐量较大

处理数据量相对较大

40. 多选题
30 秒

Hive数据存储规模包括哪些成分?

分区

数据库

41. 多选题
30 秒

大数据其中一个最明显的特征是数据量巨大,那么所谓的数据量巨大主要指哪些级别的数据量?

MB

TB

ZB

PB

42. 多选题
30 秒

Hive业务场景中,常常会出现某一张大表连接一张较小的维表,那么为了提高这个JoIN操作的效率,可以进行如下哪些操作?

大表在前小表在后

小表在前大表在后

设置参数hive.auto.convert.join为true

设置参数hive.groupby.skewindata为true

43. 多选题
30 秒

关于表扫描算子的说法正确的是?

对于点查或者范围扫描等过滤大量数据的查询,如果使用SeqScan全表扫描会比较快。

表的数目比较少的时候,使用Seqscan效率更高。

SQL的执行计划第一步就是从表扫描算子开始的。

SeqScan是指顺序扫描表的所有信息。 

44. 多选题
30 秒

以下Hive数据仓库数据表分层的描述,准确的是?

ADS层,为各种统计报表提供数据,做分析处理同步到RDS数据库里边。

DWD层结构和粒度与原始表保持一致,简单清洗,数据明细详情,去除空值,脏数据,超过极限范围的明细解析。

ODS层,通常表述原始数据存储表,Hv接收到原始的数据通常是杂乱无章的,但是又具有安全隐私考虑,通常应用侧是不能看到的

DWS层,以DWD为基础,进行轻度汇总。

45. 多选题
30 秒

随着大数据越来越被重视,数据采集的挑战也变的尤为突出,常见的挑战包括?

数据量大

数据源多种多样

数据采集的可靠性保障

避免重复数据

46. 多选题
30 秒

以下关于Loader特点描述正确的是?

图形化:提供UI图形化配置、监控界面,操作便捷。

安全认证:Kerberos认证作业权限管理

高性能:利用MapReduce并行处理数据。

高可靠:Loader Server采用主备双机作业通过MaReduce执行,支持失败重试。作业失败后,不会残留数据。

47. 多选题
30 秒

以下关于Transformation的说法正确的是?

它的返回值还是一个RDD

是RDD的算子类型

属于懒操作

mapfunc属于Transformation

48. 多选题
30 秒

以下关于Loader的描述中,正确的有哪几项?

提供可视化向导式的作业配置管理界面。

是基于开源Flume研发,做了大量优化和扩展。

提供定时调度任务,周期性执行Loader作业。

在界面中可指定多种不同的数据源、配置数据的清洗和转换步骤、配置集群存储系统。

49. 多选题
30 秒

大数据场景化解决方案包含以下哪些选项?

离线检索

实时检索

离线批处理

实时流处理

50. 多选题
30 秒

数据仓库分层的优点包括以下哪些选项?

减少重复开发量

提高资源协调能力

隔离原始数据

简化复杂问题

51. 判断题
30 秒

Spark是基于内存的,处理数据时产生的中间产物(计算结果)是存放在内存中,减少了对磁盘的I/O操作,大大的提升了数据的处理速度。

52. 判断题
30 秒

因不同的数据类型存储的空间大小不一样,所以在选择数据类型时,只需考虑数据类型损耗的存储空间大小。

53. 判断题
30 秒

离线批处理,通常是指对海量数据进分析和处理,形成结果数据,供下一步数据应用使用,离线处理对处理时间要求不高。

54. 判断题
30 秒

HDFS中的DataNode用于存储实际的数据,将自己管理的数据块上报给Client,运行多个实例。

55. 判断题
30 秒

离线批处理通常通过MR作业、Spark作业或者HQL作业实现。

剥豆豆
金牌
会员
无限剥豆豆游戏,更详尽的游戏报告,更多学员的支持
仅需0.6/日
你可能喜欢
互动问答
剥了 2 次
看图猜台词
剥了 2 次
看图猜台词
剥了 2 次
Hotel Tour 互动游戏
剥了 2 次
药品管理法,GMP基础知识
剥了 2 次