高级统计师
简答题请结合实际,分析统计调查过程中数据缺失现象产生的主要原因,并说明相应的处理方法。
参考答案:暂无进入在线模考
在一项调查中要得到100%调查数据是非常困难的,因为有许多因素发生影响,主要有:初始阶段,调查人员无法与被调查者接触,也许地址不详,也许人已搬迁,也许被调查者不在家,也许被调查对象不允许调查;在调查进行阶段,拒访是最常见的现象。拒访的原因出有多种,如对方没时间,或对调查不感兴趣,或出于安全考虑,甚至不让调查人员入户;在数据整理阶段,研究人员将不符合逻辑的数据剔除出会造成数据缺失。
1.在存储数据的过程中由于机器的损坏造成数据存储失败。
2.调查员在采集数据过程中由于主观因素人为地认为数据不重要或无用而私自丢弃数据。
3.调查员信息录入失误。
4.受访者拒绝透露被调查信息,或回答错误信息。
5.受访者选取失误。例如调查工资情况,选取的受访者是婴幼儿。
6.有些信息的获取代价太大。如调查企业的人数,或财务数据,或对信息投资的情况。
数据缺失的处理办法:
数据缺失在统计过程中是一个很重要的问题,全世界都很关注,他的处理方法更是一个新兴的领域,综合各个国家的研究结果,大致有以下几种方法。
(一)删除法:这种方法非常简单,当被调查对象出现缺失的变量值,并且这些缺失的变量值占总体数据的总量很小的情况下,这种方法非常有效。解决方法就是将存在缺失的变量值删除,形成一个完整的调查表。但是这种方法有它的不足之处,在删除缺失数据的过程中,减少了原始的数据,导致了信息的损耗,而且丢失了很多包含在被删除数据中的信息。特别是当被研究的数据本身数量很少的时候,删除少量数据就足以影响整体结果的客观性以及正确性。所以,当缺失数据占总体数据比例很大时,这种方法将会导致错误结。
(二)填补法:当有数据缺失的记录在整个数据中只占一个很小比例时,可以直接删除缺失记录,对余下的完全数据进行处理。但是在实际数据中,往往缺失数据占有相当的比重,这样做不仅会产生偏差,甚至会得出有误导性的结论,同时丢失大量信息,造成浪费。因此我们使用一种新的方法不同条件下的数据缺失会对统计工作造成不同的影响。针对数据缺失产生的原因及类型,必须采用不同的方法进行处理。每种方法都有不同的特点,适合解决不同类型的数据缺失问题,应充分分析、理解其内涵和外延,使不完全样本的已有信息得到最佳利用。来进行处理。
目前,填补法是处理数据缺失时普遍使用的一种技术,就是说给各个缺失数据找一个填充值,用这样的方法得到“完整数据”,然后用标准正常的完整数据的统计方法进行数据分析和推断。
1.人工填写法
专家根据专业知识对缺失数据进行填补,这是一种非常精确的方法。但是他的缺点是费时又费力,当缺失的数值很多时,使用这种方法是基本不可能的。
2.平均值填充法
删除法用以解决少量缺失值,但是当缺失值大量出现时我们就需要使用一种新的方法,即平均值填充法。在处理数据时可以把变量分为数值型和非数值型。
如果是非数值型的缺失数据,运用统计学中众数的原理,用此变量在其他对象中取值频数最多的值来填充缺失值;
如果是数值型的缺失值,则取此变量在其他所有对象的取值均值来补齐缺失值。这种方法的优点是简便、快速,缺点是要建立在完全随机缺失的假设之上。
3.热卡填充法或就近补齐对于一个包含空值的变量,本方法是在完整数据中找到一个与空值最相似的变量,然后用这个相似的值来进行填充。与均值替换法相比,本方法简单易懂还可以保持数据本身的类型,利用本方法填充数据后,其变量值与填充前很接近。但是这种方法也存在不足之处,就是其主观因素较多,还比较耗时。
4.使用任何可能的值填充
这种方法是用缺失值所有可能的数值来填充,能够起到一个补齐效果。而这种方法的缺点是,当要研究的数据量很大或者缺失的数值较多时,他的计算量很大,需要测试的方案很多。针对其缺点有另外的一种方法,用一样的方法来填补缺失数,不同的是从结果相同的对象中选择所有可能情况的数值,而不是根据所有情况的对象进行尝试,这样能够在一定程度上缓解原方法的不足。
5.多重填补法
多重填补的原理是首先为缺失值产生一系列用来填充的数值,把这个系列中的每一个值都用来填充,产生相对应的一系列的完整的数据集合。再将这些经过填充过的数据集合使用完整数据的方法进行研究。最后把各个填充过的数据集合结果进行综合考量得出结论,这个结论考虑到了数据填补过程中产生的各种不确定性。这种方法的缺点也是不能不重视的:
第一,计算很复杂
第二,是要求数据集满足贝叶斯假设,这个在现实中很难实现;
第三,是多重填补法只适用于统计分析,不适合数据挖掘的需要。
(三)不处理
既然每种方法都有其不足之处,那么就直接在包含空值的数据上进行数据挖掘。这样既节省了时间又减轻了负担。但是这种方法也不是完美的,也有其弱点,现实工作中,大家对数据是没有前期知识的,而采用此种方法要求使用者对部分数据先进行假设,但是在没有任何前期知识的情况下,很容易假设出错误的结论,而且即使知道数据中的一些参数,要估计出正确的数值也需要很长的时间,所以说也不是非常实用的。
综合以上三种方法,可以知道,每种方法都适用于不同的条件,而每种方法都有其不足之处。在实际的工作中,我们要根据实际情况正确选择解决方法。
当数据样本很大,而缺失数据所占比例很小的情况下我们可以使用“删除法”;
当数据缺失值形式是完全随机缺失,并且样本容量并不大的情况下,可采用“填补法”;
当以上两种方法都不实用的情况下我们可以考虑使用“不处理”的方法。
针对不同的问题我们不能一概而论,关键是要分清实质,寻找到在当前条件下最适宜的方法,使不完全样本的已有信息得到最佳利用。
1.在存储数据的过程中由于机器的损坏造成数据存储失败。
2.调查员在采集数据过程中由于主观因素人为地认为数据不重要或无用而私自丢弃数据。
3.调查员信息录入失误。
4.受访者拒绝透露被调查信息,或回答错误信息。
5.受访者选取失误。例如调查工资情况,选取的受访者是婴幼儿。
6.有些信息的获取代价太大。如调查企业的人数,或财务数据,或对信息投资的情况。
数据缺失的处理办法:
数据缺失在统计过程中是一个很重要的问题,全世界都很关注,他的处理方法更是一个新兴的领域,综合各个国家的研究结果,大致有以下几种方法。
(一)删除法:这种方法非常简单,当被调查对象出现缺失的变量值,并且这些缺失的变量值占总体数据的总量很小的情况下,这种方法非常有效。解决方法就是将存在缺失的变量值删除,形成一个完整的调查表。但是这种方法有它的不足之处,在删除缺失数据的过程中,减少了原始的数据,导致了信息的损耗,而且丢失了很多包含在被删除数据中的信息。特别是当被研究的数据本身数量很少的时候,删除少量数据就足以影响整体结果的客观性以及正确性。所以,当缺失数据占总体数据比例很大时,这种方法将会导致错误结。
(二)填补法:当有数据缺失的记录在整个数据中只占一个很小比例时,可以直接删除缺失记录,对余下的完全数据进行处理。但是在实际数据中,往往缺失数据占有相当的比重,这样做不仅会产生偏差,甚至会得出有误导性的结论,同时丢失大量信息,造成浪费。因此我们使用一种新的方法不同条件下的数据缺失会对统计工作造成不同的影响。针对数据缺失产生的原因及类型,必须采用不同的方法进行处理。每种方法都有不同的特点,适合解决不同类型的数据缺失问题,应充分分析、理解其内涵和外延,使不完全样本的已有信息得到最佳利用。来进行处理。
目前,填补法是处理数据缺失时普遍使用的一种技术,就是说给各个缺失数据找一个填充值,用这样的方法得到“完整数据”,然后用标准正常的完整数据的统计方法进行数据分析和推断。
1.人工填写法
专家根据专业知识对缺失数据进行填补,这是一种非常精确的方法。但是他的缺点是费时又费力,当缺失的数值很多时,使用这种方法是基本不可能的。
2.平均值填充法
删除法用以解决少量缺失值,但是当缺失值大量出现时我们就需要使用一种新的方法,即平均值填充法。在处理数据时可以把变量分为数值型和非数值型。
如果是非数值型的缺失数据,运用统计学中众数的原理,用此变量在其他对象中取值频数最多的值来填充缺失值;
如果是数值型的缺失值,则取此变量在其他所有对象的取值均值来补齐缺失值。这种方法的优点是简便、快速,缺点是要建立在完全随机缺失的假设之上。
3.热卡填充法或就近补齐对于一个包含空值的变量,本方法是在完整数据中找到一个与空值最相似的变量,然后用这个相似的值来进行填充。与均值替换法相比,本方法简单易懂还可以保持数据本身的类型,利用本方法填充数据后,其变量值与填充前很接近。但是这种方法也存在不足之处,就是其主观因素较多,还比较耗时。
4.使用任何可能的值填充
这种方法是用缺失值所有可能的数值来填充,能够起到一个补齐效果。而这种方法的缺点是,当要研究的数据量很大或者缺失的数值较多时,他的计算量很大,需要测试的方案很多。针对其缺点有另外的一种方法,用一样的方法来填补缺失数,不同的是从结果相同的对象中选择所有可能情况的数值,而不是根据所有情况的对象进行尝试,这样能够在一定程度上缓解原方法的不足。
5.多重填补法
多重填补的原理是首先为缺失值产生一系列用来填充的数值,把这个系列中的每一个值都用来填充,产生相对应的一系列的完整的数据集合。再将这些经过填充过的数据集合使用完整数据的方法进行研究。最后把各个填充过的数据集合结果进行综合考量得出结论,这个结论考虑到了数据填补过程中产生的各种不确定性。这种方法的缺点也是不能不重视的:
第一,计算很复杂
第二,是要求数据集满足贝叶斯假设,这个在现实中很难实现;
第三,是多重填补法只适用于统计分析,不适合数据挖掘的需要。
(三)不处理
既然每种方法都有其不足之处,那么就直接在包含空值的数据上进行数据挖掘。这样既节省了时间又减轻了负担。但是这种方法也不是完美的,也有其弱点,现实工作中,大家对数据是没有前期知识的,而采用此种方法要求使用者对部分数据先进行假设,但是在没有任何前期知识的情况下,很容易假设出错误的结论,而且即使知道数据中的一些参数,要估计出正确的数值也需要很长的时间,所以说也不是非常实用的。
综合以上三种方法,可以知道,每种方法都适用于不同的条件,而每种方法都有其不足之处。在实际的工作中,我们要根据实际情况正确选择解决方法。
当数据样本很大,而缺失数据所占比例很小的情况下我们可以使用“删除法”;
当数据缺失值形式是完全随机缺失,并且样本容量并不大的情况下,可采用“填补法”;
当以上两种方法都不实用的情况下我们可以考虑使用“不处理”的方法。
针对不同的问题我们不能一概而论,关键是要分清实质,寻找到在当前条件下最适宜的方法,使不完全样本的已有信息得到最佳利用。
最新试题
2015 年 4 月,某市调查机构就当地食品安全状况调查了 99 位市民,得出“有近两成市民认为食品安全状况堪忧”的结论
类型:简答题2018-01-26
下图反映了我国 2013 年 9 月至 2014 年 9 月居民消费价格月度环比和同比的变化情 况。要求:
类型:简答题2018-01-26
固定资本形成总额和全社会固定资产投资是我国用于反映固定资产投资规模的两个主要指标,近年来两者数值差异明显,请阐述产生这种
类型:简答题2018-01-26
下面是一份关于居民出行情况调查问卷的主体部分,请指出问卷设计中存在的问 题。 Q1. 您的月均收入是____
类型:简答题2018-01-26
简述固定样本连续调查的优缺点。
类型:简答题2018-01-26
居民在股市中的投资收益包括分红和价差收益两部分。根据国民经济核算原理,这两种收益应如何记录在住户部门账户中?
类型:简答题2018-01-26
对于统计部门发布的职工平均工资、人均可支配收入等平均数指标,社会上常有疑问,部分人抱怨“被平均”了。请根据统计学原理对此
类型:简答题2018-01-26
有观点认为现在是大数据时代,传统抽样调查没用了。你如何看待这个问题?
类型:简答题2018-01-26
欲采用随机抽样方式对游客的旅游消费支出情况进行问卷调查。简述:(1)应调查的主要内容;(2)如何选择调查对象进行信息采集
类型:简答题2018-01-24
有一种观点认为,仅用电商数据就可以直接编制消费者价格指数(CPI),给出你的评论。
类型:简答题2018-01-24
