python数据挖掘试题_机器学习算法与Python学习-数据挖掘过
关40题
1.某超市研究销售纪录数据后发现,买啤酒的⼈很⼤概率也会购买尿布,这种属于数据挖掘的哪类问题?
A.关联规则发现
B.聚类
python数据分析基础教程答案C.分类
D.⾃然语⾔处理
2.以下两种描述分别对应哪两种对分类算法的评价标准?
(a)警察抓⼩偷,描述警察抓的⼈中有多少个是⼩偷的标准。
(b)描述有多少⽐例的⼩偷给警察抓了的标准。
A.Precision,Recall
B.Recall,Precision
C.Precision,ROC
D.Recall,ROC
3.将原始数据进⾏集成、变换、维度规约、数值规约是在以下哪个步骤的任务?
A.频繁模式挖掘
B.分类和预测
C.数据预处理
D.数据流挖掘
4.当不知道数据所带标签时,可以使⽤哪种技术促使带同类标签的数据与带其他标签的数据相分离?
A.分类
B.聚类
C.关联分析
D.隐马尔可夫链
5.什么是KDD?
A.数据挖掘与知识发现
B.领域知识发现
C.⽂档知识发现
D.动态知识发现
6.使⽤交互式的和可视化的技术,对数据进⾏探索属于数据挖掘的哪⼀类任务?
A.探索性数据分析
B.建模描述
D.寻模式和规则
7.为数据的总体分布建模;把多维空间划分成组等问题属于数据挖掘的哪⼀类任务?
A.探索性数据分析
B.建模描述
C.预测建模
D.寻模式和规则
8.建⽴⼀个模型,通过这个模型根据已知的变量值来预测其他某个变量值属于数据挖掘的哪⼀类任务?
A.根据内容检索
B.建模描述
C.预测建模
D.寻模式和规则
9.⽤户有⼀种感兴趣的模式并且希望在数据集中到相似的模式,属于数据挖掘哪⼀类任务?
A.根据内容检索
B.建模描述
C.预测建模
D.寻模式和规则
10.以下属于可伸缩聚类算法的是。
A、CURE
B、DENCLUE
C、CLIQUE
D、OPOSSUM
11.下⾯哪种不属于数据预处理的⽅法?
A 变量代换
B 离散化
C 聚集
D估计遗漏值
12.假设12个销售价格记录组已经排序如下:5,10,11,13,15,35,50,55,72,92,204,215使⽤如下每种⽅法将它们划分成四个箱。等频(等深)划分时,15在第⼏个箱⼦内?
A 第⼀个
B 第⼆个
C 第三个
D 第四个
13.上题中,等宽划分时(宽度为50),15⼜在哪个箱⼦⾥?
B 第⼆个
C 第三个
D 第四个
14.下⾯哪个不属于数据的属性类型:
A 标称
B 序数
C 区间
D 相异
15.在上题中,属于定量的属性类型是:
A 标称
B 序数
C 区间
D 相异
16.只有⾮零值才重要的⼆元属性被称作:
A 计数属性
B 离散属性
C ⾮对称的⼆元属性
D 对称属性
17.以下哪种⽅法不属于特征选择的标准⽅法:
A 嵌⼊
B 过滤
C 包装
D 抽样
18.下⾯不属于创建新属性的相关⽅法的是:
A 特征提取
B 特征修改
C 映射数据到新的空间
D 特征构造
19.考虑值集{1、2、3、4、5、90},其截断均值(p=20%)是
A 2
B 3
C 3.5dds文件查看器
D 5
A 傅⽴叶变换
B 特征加权
C 渐进抽样
D 维归约
21.熵是为消除不确定性所需要获得的信息量,投掷均匀正六⾯体骰⼦的熵是:
A1 ⽐特
B 2.6⽐特
C 3.2⽐特
D 3.8⽐特
22.假设属性income的最⼤最⼩值分别是12000元和98000元。利⽤最⼤最⼩规范化的⽅法将属性的值映射到0⾄1的范围内。对属性income的73600元将被转化为:
A 0.821
B 1.224
C 1.458
D 0.716
23.假定⽤于分析的数据包含属性age。数据元组中age的值如下(按递增序):
13,15,16,16,19,20,20,21,22,22,25,25,25,30,33,33,35,35,36,40,45,46,52,70,问题:使⽤按箱平均值平滑⽅法对上述数据进⾏平滑,箱的深度为3。第⼆个箱⼦值为:
A 18.3
B 22.6
C 26.8
D 27.9
24.考虑值集{12243324556826},其四分位数极差是:
A 31
B 24
C 55
D 3
25.⼀所⼤学内的各年级⼈数分别为:⼀年级200⼈,⼆年级160⼈,三年级130⼈,四年级110⼈。则年级属性的众数是:
A ⼀年级
B ⼆年级
C 三年级
D 四年级
26.下列哪个不是专门⽤于可视化时间空间数据的技术:
A 等⾼线图
C 曲⾯图
D ⽮量场图
27.在抽样⽅法中,当合适的样本容量很难确定时,可以使⽤的抽样⽅法是:
A 有放回的简单随机抽样
B ⽆放回的简单随机抽样
C 分层抽样
D 渐进抽样
28.数据仓库是随着时间变化的,下⾯的描述不正确的是
A.数据仓库随时间的变化不断增加新的数据内容;
B.捕捉到的新数据会覆盖原来的快照;
C.数据仓库随事件变化不断删去旧的数据内容;
D.数据仓库中包含⼤量的综合数据,这些综合数据会随着时间的变化不断地进⾏重新综合.
29.关于基本数据的元数据是指:
A.基本元数据与数据源,数据仓库,数据集市和应⽤程序等结构相关的信息;
B.基本元数据包括与企业相关的管理⽅⾯的数据和信息;
C.基本元数据包括⽇志⽂件和简历执⾏处理的时序调度信息;
D.基本元数据包括关于装载和更新处理,分析处理以及管理⽅⾯的信息
30.下⾯关于数据粒度的描述不正确的是:
A.粒度是指数据仓库⼩数据单元的详细程度和级别;
B.数据越详细,粒度就越⼩,级别也就越⾼;
C.数据综合度越⾼,粒度也就越⼤,级别也就越⾼;
D.粒度的具体划分将直接影响数据仓库中的数据量以及查询质量.
31.有关数据仓库的开发特点,不正确的描述是:
A.数据仓库开发要从数据出发;
B.数据仓库使⽤的需求在开发出去就要明确;
关联的句柄怎么鸡米花英文C.数据仓库的开发是⼀个不断循环的过程,是启发式的开发;
电脑access数据库下载D.在数据仓库环境中,并不存在操作型环境中所固定的和较确切的处理流,数据仓库中数据分析和处理更灵活,且没有固定的模式
32.在有关数据仓库测试,下列说法不正确的是:
linux根目录建立文件夹A.在完成数据仓库的实施过程中,需要对数据仓库进⾏各种测试.测试⼯作中要包括单元测试和系统测试.
B.当数据仓库的每个单独组件完成后,就需要对他们进⾏单元测试.
C.系统的集成测试需要对数据仓库的所有组件进⾏⼤量的功能测试和回归测试.
D.在测试之前没必要制定详细的测试计划.
33.OLAP技术的核⼼是:

版权声明:本站内容均来自互联网,仅供演示用,请勿用于商业和其他非法用途。如果侵犯了您的权益请与我们联系QQ:729038198,我们将在24小时内删除。