全国大学生大数据分析技术技能大赛-题库知识点
·
一、抽样
- 整群抽样优点:①方便②成本低③误差小
- 系统抽样是把总体的单位进行编号排序后,再计算出某种间隔,然后按这一固定的间隔抽取个体的号码来组成样本的方法。这种方法要求有完整的抽样框,并且样本的抽取是直接从总体中抽取个体,没有其他中间环节。
- 配额抽样,一种非概率抽样方法,将调查总体样本按一定标志分类或分层,确定各类(层)单位的样本数额,在配额内任意抽选样本的抽样方式。
- 滚雪球抽样(Snowball Sampling)是一种非概率抽样方法,通常用于难以找到完整样本框或目标总体不明确的情况下。它从一个或几个初始样本开始,然后通过这些初始样本介绍或推荐更多的样本,类似于滚雪球一样逐渐扩大样本量,其结果的可推论性(即能否将结果推广到整个总体)通常较低。
- 整群抽样的特点确实在于抽取样本时只需要群的抽样框,而不必要求包括所有单位的抽样框。
- 整群抽样又称聚类抽样,是将总体中各单位归并成若干个互不交叉、互不重复的集合,称之为群。然后以群为抽样单位抽取样本的一种抽样方式。应用整群抽样时,要求各群有较好的代表性,即群内各单位的差异要大,群间差异要小。
- 分层抽样是指在抽样时,将总体分成互不相交的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,将各层取出的个体合在一起作为样本的方法。要求各层之间的差异很大,层内个体或单元差异小。
- 随机起点对称等距抽样:在总体奇数段抽取第jk+i单位(j=0,2,4…),其中j表示段数,k表示抽样距离,i表示随机起点。在总体偶数段抽取与奇数段对称的样本单位,但具体的计算公式可能因抽样设计而异。一般地,可以描述为在偶数段抽取与奇数段相对应位置(但考虑抽样距离和随机起点的偏移)的样本单位。
- 在多阶段抽样中,每个阶段都可以采用不同的抽样方法。
- 判断抽样是一种非概率抽样方法,指研究者或专家根据自己的研究目的、专业知识和经验来判断并选取样本的方法。在这种方法中,样本的选择是基于研究者对总体的了解和判断,而不是基于随机原则。
- 非概率抽样不遵循随机原则,样本可能无法准确反映总体的特征,因此通常不具有代表性。
- 最优分配分层抽样的核心思想是根据各层的变异程度来分配样本量,使得在总样本量固定的情况下,抽样误差达到最小。
二、参数和统计量
- 总体参数的真实值是唯一确定的未知的常数,无法测量的,实际抽样误差也是未知的,根据研究目的所确定的观察单位的集合是总体
- 样本统计量的值不是唯一的不可知的,是随机变量,它是样本的函数,不能含有任何未知参数
- 参数是描述总体特征的固定数值,如总体均值,总体方差等
- 如果一个样本统计量的数学期望等于它所估计的总体参数,我们称该统计量为该参数的无偏估计
- 充分统计量的定义:如果一个统计量包含了样本中所有关于参数的信息,那么该统计量就是充分统计量,所以我们可以通过这个统计量完全恢复出原始样本中有关参数的所有信息,一定存在,似然函数是充分统计量函数
三、分布
- 正态分布曲线由参数μ和σ决定,μ决定的是对称轴,σ越大,图像越矮
- t分布在自由度相同时,t的绝对值越大,概率p越小。自由度通常指的是样本大小减去用于估计的参数数量。自由度越小,t分布曲线越平坦,中间越低,双侧尾部越高;自由度较小的时候,t分布是均匀分布。自由度越大,越趋近于正态分布曲线,t分布时一组曲线,每条曲线对应不同的自由度,t分布的期望为0,方差与自由度有关。
- 关于卡方分布,随着自由度的增大,分布趋近于正态分布,像正无穷方向延伸,曲线越来越低阔,越趋近于对称,卡方分布的数学期望等于它的自由度,方差等于自由度的两倍
- F分布的F取值是非负的,图形是非对称的,是正偏态分布(在F值较小时较为密集,在F值较大时逐渐稀疏),有两个自由度参数分别是两个卡方分布的自由度,两个卡方分数除以其自由度后的比值的位置不可互换,是一个以自由度和为参数的分布族,n越小偏态越严重。当F分布的分子自由度为1,分母自由度为ν时,F分布与t分布(自由度为ν)之间存在一种关系:F值等于t值的平方。
- 当正态总体方差未知且样本为小样本时,样本均值服从自由度为n-1的t分布,计算样本方差时,每个观测值与样本均值的差异会损失一个自由度;z分布通常用于总体方差已知的情况。
四、检验
- t检验统计量主要用于比较两个总体的均值是否相等,或者检验一个总体均值与一个已知值是否相等。统计量越大,越有理由认为梁总体均值不相等
- Z检验统计量通常用于大样本情况下(样本量趋于无穷大时),检验一个总体均值与一个已知值是否相等,或者比较两个大样本总体的均值是否相等。
- 卡方检验统计量主要用于检验分类变量的频数分布是否与期望的频数分布相符,或者用于检验两个分类变量是否独立。
- F检验统计量通常用于比较两个总体的方差是否相等,如果两个样本分别来自两个正态总体,且样本量较大(通常认为大于30),那么可以使用F检验来比较这两个总体的方差。
- U检验通常用于小样本且总体分布未知的情况下的两样本比较,但它并不要求方差齐性
五、误差
- 标准误是样本统计量(如样本均值)的标准差,反映了样本统计量对总体参数的估计精度。标准误越小,表示样本统计量越接近总体参数,估计越精确
- 标准误的大小跟原始数据离异度和样本量有关。①样本量一定时,离异度越大,标准误越大②离异度一定时,样本量越大,标准误越小。
- 当样本量n足够大时,样本均值抽样分布的标准差(标准误)=
- 抽样误差特指偶然性误差
- 样本容量越大,取样误差越小
- 测量误差最常用的指标就是抽样方差
六、其他
- 原始数据变异度指总体或样本数据的离散程度,可以用标准差来衡量。标准差越大,数据点越分散,变异度越大
- 样本是从母体中随机抽取的一部分个体或对象。母体则是包含所有可能研究对象或个体的整体集合。
- 通过个别认识一般的思维方法是归纳,通过一般认识个别的思维方法是演绎
- 统计推理是利用样本数据来推断总体特征或参数的过程(点估计、区间估计)
- 点估计:使用样本统计量(如样本均值、样本方差等)来估计总体参数(如总体均值、总体方差等)的值,结果通常以一个具体的数值表示。
- 区间估计:基于样本统计量和样本分布的特性,以一定的可靠程度(通常称为置信水平:表示我们对置信区间包含总体真实参数的信心程度)推断总体参数可能所在的区间范围。
- 参数估计样本容量越大,估计越精确
- 指标对比分析法是将两个或两个以上有内在联系的、具有可比性的指标进行对比,借以确定指标之间差异的分析方法.指标对比分析法要求对比的指标在经济内容上具有可比的共同基础,即对比的指标应该是同一性质或同一类别的。如果对比的指标性质不同,那么分析的结果将没有意义或可能导致误导。
- 企业的战略指标一般可分为三个层级:战略层指标、业务层指标()、执行层指标
- 竞争者分析诊断要素:未来目标、现行战略、竞争对手的优势和劣势
- 直接资料:实际发生的事件或现象,通过观察、记录等方式获得,用词专业
- 一手资料:研究者与研究对象的直接交互,通过实验、调查,原始语言
- 二手资料:已经存在并由其他机构或个体收集、整理的资料
- 公共资料:偏向于资料的可访问性或共享性,而非资料的原始性或收集方式
- 结构相对指标:通过将某一组(或某一类)的数值与总体数值进行比较来计算的,结构相对指标的主要作用之一是揭示总体内部各部分之间的数量对比关系或比例关系,即反映总体的内部结构
- 调和平均数:各数值的倒数的平均数的倒数,调和平均数易受极端值的影响,且受极小值的影响比受极大值的影响更大。
- 统计学是一门方法论科学
- 四分位是将一组数据从小到大排序后,分成四个等份的数值,即第25百分位数(下四分位数)、第50百分位数(中位数)、第75百分位数(上四分位数)。四分位距(IQR)是上四分位数与下四分位数之差,它反映了数据中间50%的离散程度。与全距(最大值与最小值之差)相比,四分位距不受极端值的影响,因为极端值位于数据的两端,不影响四分位数的位置。
- 当从一个总体中抽取样本时,样本比例的标准差可以通过以下公式计算:样本比例的标准差=,p是总体的比例,n是样本容量
- 有效性通常指的是估计量的方差大小,方差越小,估计量越有效。
- 多个标准正态分布变量的平方和服从卡方分布
- 置信区间的宽度取决于多个因素,包括样本容量、总体方差、置信水平等。在样本容量和总体方差相同的情况下,置信水平越高,所需的置信区间通常越宽,以包含更多的不确定性。然而,如果样本容量足够大,这种差异可能会减小。
- 在置信水平和总体方差相同的情况下,样本容量越小,置信区间的宽度通常越大。
- 假设检验时,我们通常设定两个假设:原假设(H0)和备选假设(H1) 第一类错误(弃真错误):当原假设H0为真时,却错误地拒绝了它。这通常表示为α,即显著性水平。第二类错误(取伪错误):当原假设H0不真时,却未能拒绝它,即接受了错误的假设。这通常与检验的效力(power of the test)有关,表示为1−β,其中β是第二类错误的概率。
- 当有足够的证据表明原假设不真时,接受备择假设是避免犯第二类错误的一种做法。降低显著性水平可以减少第一类错误的发生,但同时也会增加第二类错误的风险。
- 显著性水平(通常表示为α)在假设检验中的意义:显著性水平是事先确定的一个概率值,用于判断统计上是否拒绝原假设。它代表了犯第一类错误(即错误地拒绝实际为真的原假设)的概率。
- 临界值是根据显著性水平α和所选的统计检验方法计算出来的,用于区分接受域和拒绝域的具体数值。
- 大数据的5v特征:数据量大、种类繁多、价值密度低、速度快、真实性
- 在求解非线性最优化问题中,拉格朗日乘子法和KKT 条件法是两种最常用的方法。拉格朗日乘子法主要用于处理等式约束的优化问题,KKT条件法主要用于处理既有等式约束又有不等式约束的优化问题,即一般约束优化问题
- 决策树的一个重要功能就是通过递归地分割数据集来识别哪些变量(特征)对决策属性(目标变量)有重要影响,可以识别出不同类别样本的特征。在树的每个节点上,根据某个变量的值将数据集分割成子集,直到满足停止条件(如子集纯度达到某个阈值或节点包含的样本数过少)。
- 一维搜索中,试探法常用的具体方法包括斐波那契法和黄金分割法(0.618法)等。这些方法通过按照一定的规律在搜索区间内选择试算点,并比较各试算点的函数值大小,从而逐步缩小搜索区间。
- 在一维搜索中,插值法通过已知的函数值来构造一个近似的多项式函数(或其他形式的函数),然后利用这个近似函数来逼近目标函数,从而找到函数的极小点或满足某种条件的点。常用的插值法包括牛顿法等。牛顿法是一种函数逼近法,其基本思想是在极小点附近用二阶泰勒多项式近似代替目标函数,然后求解这个近似多项式的极小点作为目标函数的极小点的近似值。
- 当函数具有较好的解析性质时(比如函数是光滑的、可导的等),插值法通常能够更高效地利用函数值信息来逼近极值点。
- “机器学习”是一种计算机程序
- 二分类问题只需一个判别函数即可,k分类问题可以等效于k-1个二分类问题
- 聚类分析是一种无监督学习方法,它不需要事先定义好的类别标签来训练模型。相反,聚类算法会根据样本之间的相似性自动将样本分组到不同的簇中。聚类分析目标是使同一个簇中的样本相似度较高,而不同簇间的样本相似度较低。
- 朴素贝叶斯其前置模型是特征值条件独立,朴素贝叶斯的基本思想是通过计算待分类项在给定类别下的条件概率(即后验概率),并选择具有最大后验概率的类别作为预测结果。
- 市场领导者:是指在市场上占据主导地位,拥有最大的市场份额,并对市场价格和竞争策略有显著影响的企业。
- 市场挑战者:是指在市场上处于次要地位,但有能力对市场领导者发起挑战,试图扩大市场份额的企业。
- 市场跟随者:是指那些在市场上模仿市场领导者,跟随其定价、促销和新产品开发策略的企业。
- 市场补缺者:是指专注于服务细分市场,通过提供特定的产品或服务来满足小众市场需求的企业。这些企业通常不参与广泛的市场竞争,而是专注于自己的细分市场。
- 战略方案是根据企业目前所处的营销环境来确定,他在企业中的地位是最高层次
- 数据清洗包括处理缺失值,去除重复数据,处理异常值,格式转换,数据整合,标准化,纠正错误数据。
- 政府债券的发行主要是政府为了筹集资金而进行的融资行为。
- 计划完成相对数指标是用来衡量实际完成情况与计划目标之间关系的指标,它通常通过比较实际完成数与计划数来计算。
- 质量指标是反映社会经济现象相对水平或平均水平的统计指标
- 定距尺度:是对事物之间等级差或距离差的一种测量,能够确定事物之间数量上的差异和间隔,但不能确定零点的绝对位置。例如,温度就是一个典型的定距尺度,我们可以说30度比20度高10度,但0度并不代表“没有”温度。
- 定比尺度:又称比率尺度,是在定距尺度的基础上,再确定一个绝对零点,不仅表示数量上的差别,还能进行数量对比和计算比率。例如,收入就是一个定比尺度,0收入表示完全没有收入,而且不同收入之间可以进行比率计算。
- 总体变异性不能消除
- 皮尔逊相关系数(也称为积差相关系数)本身就是一种相关系数,用于衡量两个连续变量之间的线性相关程度。它的值介于-1和1之间,表示完全负相关、无相关和完全正相关。
- 相关系数的平方是判定系数
- 云计算的特点:虚拟化、分布式、并行计算
- 比较相对指标是在同一时间不同对象之间的对比
- 样本均值抽样分布的均值等于总体均值,标准差小于总体标准差
- 大数据的复杂性体现在两个方面,一是变化快,二是类型复杂
- 在工程优化设计问题中,大多是多变量有约束的非线性模型
- 大数据思维包括效率思维和全样思维
- 分层抽样的目的主要是缩小抽样误差,而整群抽样的目的主要是简化组织工作
- 有了充分统计量我们就可以扔掉样本
- 总体是正态分布,那么样本容量不管多大,都是正态分布
- 结构相对指标是总体中部分数值与全部数值的比率
- 按计量单位的不同,业务指标可以被分为实物指标和价值指标。
- 95%的置信区间:100次抽样结果所得的100个95%的置信区间中,平均有95个区间包含了真实的总体均值
- 置信区间的大小表达了区间估计的准确性
- 统计推断的两个重要方面是参数估计和假设检验
- 云计算包括3种典型的服务模式:基础设施即服务、软件即服务、平台即服务
- 共轭梯度法介于最速下降法与牛顿法之间,是一种无约束优化算法。共轭梯度法不仅具有超线性的收敛速度,而且算法结构简单,容易编程实现。基本思想是利用一组“共轭”的搜索方向来迭代地逼近最优解。这些搜索方向是互相共轭的,即它们关于目标函数的Hessian矩阵共轭。在每个迭代步骤中,共轭梯度法计算一个新的搜索方向,并利用这个方向在一维空间上进行线搜索,找到使目标函数最小化的步长。然后,根据这个步长更新当前解,并计算下一个搜索方向。共轭梯度法具有二次收敛性。共轭梯度法的第一个搜索方向应取为负梯度方向。共轭梯度法的收敛速度比最速下降法快。除第一步以外的其余各步的搜索方向是将负梯度偏转一个角度。
- 参数估计构造估计量的方法:矩法估计、最小二乘估计、最大似然估计、贝叶斯估计、最大后验概率估计;估计量的性质:一致性、无偏性、有效性
- 拒绝域:由给定的小概率α(显著性水平)所确定的,用于拒绝原假设的统计量的取值范围。如果利用样本观测结果计算出来的检验统计量的具体数值落在了拒绝域内,就拒绝原假设;否则,就不能拒绝原假设。
- 非参数统计方法无需假定总体分布,非参数统计适用面更广,非参数统计通过样本信息来推断总体分布位置
- 聚类是将数据集中的对象分成若干个子集(称为簇)的过程,使得同一个簇内的对象彼此相似,而不同簇的对象彼此不相似(类似分层)
- 聚类是一种无监督学习方法,它不需要事先标记好的训练数据(即无标签数据)。聚类算法会根据数据本身的特征来发现数据的内在结构和模式
- 有监督算法:使用包含输入和正确输出(标签)的训练数据;无监督算法:处理未标记的数据,即只有输入特征,没有输出值。
- 复合形法:这是一种直接用于求解有约束优化问题的算法
- 简约梯度法:这种方法通常用于处理线性规划问题,并且是在有约束的条件下直接求解
- 罚函数法:这是一种常用的将有约束优化问题转化为无约束优化问题的方法
- 共轭梯度法:这是一种用于求解无约束优化问题的算法
- 无约束问题可用:梯度下降法、牛顿法、共轭梯度法
- 卡方检验自由度:适合度检验时,自由度df=类别数-1,对于r×c的列联表,自由度通常是(r-1)×(c-1)
- U检验通常用于小样本且总体分布未知的情况下的两样本比较,但它并不要求方差齐性
- 当偏态系数接近0时,表示数据分布接近对称。
- 当偏态系数小于0时,表示数据分布是左偏的,即数据的左端有较多的极端值,而右端则相对较少。
- 当偏态系数大于0时,表示数据分布是右偏的,即数据的右端有较多的极端值,而左端则相对较少。
- 比例相对指标是反映总体中各组成部分之间数量对比关系的统计指标
- 当总体分布的范围相对集中时,研究者通常会采用简单随机抽样或分层抽样等方法,而不是多段抽样。多段抽样一般适用于总体分布较为分散的情况
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)