商品详情
图解统计学思维
作者:[日]高桥洋一
书号:324265
定价:¥59 元
字数:108 千字
印次:1-2
开本:大32
出版时间:2024-02-01
ISBN:978-7-300-32426-5
包装:平
内容简介
统计学思维是用统计学原理和方法来思考和解决问题的思维方式,强调数据的收集、分析和解释,并基于概率和变异性的认识来推断和做出决策,也是培养批判性思维、科学素养和数据技能的重要一环。
统计学思维的核心特征包括:
◎数据导向——通过数据来获取信息和洞察;
◎概率和不确定性——识别并量化风险,理解可能性的范围,并在不确定性的条件下权衡选项;
◎变异性和样本——观察和测量结果之间的变异性,并通过样本来推断总体特征;
◎统计推断和推理——从有限的数据中得出一般的结论,并了解我们对问题的理解程度;
◎数据解释和可视化——将复杂的数据和统计分析转化为更容易理解和传播的形式。
本书通过对统计学中的直方图、均值、方差、标准差、正态分布、二项分布等关键概念进行图文并茂的讲解,力求为初学者指引有效学习统计学的途径,帮助读者破除学习统计学的恐惧心理,推动更多人树立逻辑推断和数据驱动决策的思维方式。
作者介绍
作者简介
[日]髙桥洋一
曾任日本政府负责经济和财政政策的参事,因在一线指挥日本泡沫经济破灭后的不良债权处理而闻名。现任嘉悦大学商业创造学部教授,株式会社政策工房代表董事长。他出版了多本经济学、会计学相关畅销书。
译者简介
佟凡
日语自由译者,日本文学硕士,毕业于西安交通大学,曾在同志社大学留学一年。
在朝九晚五工作三年后,选择做一名自由译者,希望在书籍中寻找一个个新奇的世界,借助自己的微薄之力,让读者领略更多元的文化。已出版数十本译作,代表译作有《金阁寺》《假面自白》《山河犹存》《爱的勇气》等。
目 录
第 1 章 “统计学”究竟是什么——减少金钱和劳动力的浪费
统计学中常见的“误解 /003
无须调查全部样本就能在一定程度上掌握整体情况 / 007
统计学的前提是没有偏误 /009
有时也需要有偏误的数据/013
随机比想象中困难 /015
很难做到恰到好处/019
第 2 章 直方图、均值、方差、标准差——“统计学”从这里开始
最大众化的统计学——直方图 /025
人人都能尝试的骰子直方图 /025
“频数”和“组距”是什么 /029
计算“均值”和“方差” /035
统计学中的“均值”计算方法 /035
表示数据离散程度的“差” /039
直接用数值表示“标准差” /044
你知道偏差值的计算方法吗 /045
偏差值究竟是什么 /045
计算偏差值 /051
标准差会让偏差值上升还是下降 /053
一次考试无法测出学力 /057
第 3 章 正态分布——最常见的“分布之王”
什么是“正态分布” /065
表格像左右对称的山峰 /065
什么样的数据会形成“正态分布” /067
“均值”和“方差”为什么重要 /070
高斯证明的“标准正态分布” /073
什么是“误差” /073
为什么“标准正态分布”是特殊的 /079
将数据“正态化” /083
为什么正态分布让统计学变得轻松 /090
统计学首先要建立“假设” /090
第 4 章 二项分布——这里有社会上的各种现象
什么是“二项分布” /097
二项分布是一种概率分布 /097
理解二项分布的前提是“组合” /101
了解“组合”与“排列” /102
什么是“组合” /102
什么是“排列” /107
在组合被视为“重复”,在排列中被视为“不同” /112
不需要记住公式也能解开数学题 /115
用骰子理解二项分布 /118
什么是“伯努利试验” /118
各种值的范围——“随机变量” /121
用骰子解读二项分布 /123
理解二项分布的定理式 /130
第 5 章 正态分布与二项分布——两种重要分布的关系是什么
希望大家牢记“中心极限定理” /137
什么是“中心极限定理” /137
中心极限定理与二项分布 /143
用“三项数值”理解统计图表 /145
二项分布的“均值”与“方差” /145
正态分布的特征同样适用于二项分布 /149
第 6 章 收视率、投票站出口调查的原理——用统计学解释世界上的神奇之处
日本的家庭总数为5800万,为什么用1/8400的样本量就能算出收视率 /157
收视率真的准确吗 /157
随机果然很难 /159
收视率有±2%的误差 /161
收视率的“均值”与“方差” /165
为什么不能用90户家庭作为样本 /167
选举投票站出口调查为什么能锁定当选者 /171
什么是投票站出口调查 /171
有两名候选人的选区 /173
从投票站出口调查中能看到什么 /176
前提仍是“随机” /182
了解统计学并不是结束 /188
结 语 / 191
精彩样章
前 言
如果有年轻人问我“今后应该学些什么”,我会给出以下三项答案:语言学、会计学和数学。
近年来,人们对数学领域中的统计学越来越感兴趣。在这个互联网普及的时代,收集大量的数据变得轻而易举,但 整理、存储和分析这些数据,让人们意识到统计学是必不可 少的。
于是,书店里涌现出各种各样的统计学入门书籍。出版社里一名重度“数字过敏”的编辑联系我(希望我能写一本统计 学的入门书籍),对此我并不感到意外。
“统计学好难。”“不管看了哪本书都看不明白。”
“必须要用公式才能理解吗?”
她(出版社的编辑)是一名典型的“数字过敏者”,经常提出类似的委托,以前我也因为同样的原因写过关于经济学和会计学的入门书籍。
市面上关于这些领域的入门书籍中,确实有不少书的内容对于初学者来说过于复杂和专业。
我能理解编辑想要叹气的心情。
“经济学好难!”“会计学好难!”……我写书就是为了解除以上误解。
然而,统计学很不一样。为什么这么说?因为统计学是真的很难。
数学与统计学密不可分
统计学确实很难:没办法抄近路,也没办法举一反三。如果你也觉得统计学很难,那绝非误解,因为事实如此。
统计学这门学科原本属于数学。学会利用公式是理解统计学的前提。数字和公式是统计学的“语言”,如果没有数字和公式,就无法理解统计学。这就相当于不懂某一门语言,自然 没办法看懂用这门语言写成的书。
对于那些一看到数字就头疼的“数字过敏者”来说,想要学习统计学就相当于要一头扎进充满过敏原的环境里。
既然统计学这么难,为什么现在讲统计学的书卖得这么好呢?或许是因为大部分人不了解吧。
我想应该也有不少人因为看不懂一些书半途而废,然后又去买另一本书吧。
这些书中有些没有用太多公式,会让读者感觉读过之后对统计学有了模糊的理解,但那不过是蒙混过关而已。
读过那些书之后,读者并没有办法利用统计学进行思考,也没办法在工作中有效利用统计学。
我想写的并不是那种蒙混过关的书。
所以,如果要认真讲述统计学,哪怕只是讲述基础知识,那之前提到的那位编辑自不必说,我想大部分读者应该无法理解。
统计学就是这样一门艰深的学问。
身边来自统计学的恩惠
另一方面,统计学很长时间以来就在我们的日常生活中得到了充分利用。
举例来说,电视节目的收视率就是其中的典型案例之一。
媒介研究公司进行的收视率调查显示,日本关东地区大约生活着1800万户家庭,但调查样本量却只有900户家庭。
大家听到这个数字之后有什么想法?
仅仅凭借两万分之一的样本,真的能够得出准确的收视 率吗?
大家之所以这样想,是因为不理解统计学。如果大家懂得统计学,就完全不会产生这样的怀疑。
就算没有进行全面调查,也能够在一定程度上掌握整体情况,这就是统计学的作用。
统计学的应用领域非常广泛,收视率调查只是我们所熟知的一种应用。另一个简单易懂的例子是选举速报。
在众议院和参议院进行选举投票的日子里,NHK电视台 和私营电视台一定会在晚上播放开票速报,在节目开始的同时,各个电视台相继发布确定当选的候选人。
也许有人不明白,这到底是怎么回事呢?
节目开始时,开票工作应该刚刚开始才对。既然如此,电视台是如何从候选者中找出谁能确定当选的呢?
这是因为各家电视台都会在投票站出口对选民的投票情况 进行现场调查。简单来说,就是大量询问离开投票站的人们“你给谁投了票”或“你给哪个政党投了票”。可是,记者没办法问到所有人,被问到的人也不见得都会 回答。
尽管如此,但只要能够收集一定数量的样本,就能在尚未开票时推断确定当选的人。
这同样是统计学的功劳。
自以为理解就够了吗
统计学的确很难,而且学得越多,越会觉得它复杂艰深。大部分人不是数学家,有耐心理解公式的人更是少之又少。
总而言之,写不出所有人都能看懂的统计学入门书的理由实在太多了!
可是,无论我说多少遍“做不到”,编辑都会一遍又一遍地催我动笔。所以,我只好试着潜心思考一下了。 我想说,统计学虽然很难,但它的确就在我们身边。
如果想要了解我刚才介绍的收视率和投票站出口调查的原理,并不需要深入理解统计学中那些艰深的部分。
我一次次地强调统计学很难,但也正因为难,所以就算是基础内容,也很少有人能扎实地掌握。
更准确地说,有太多人自以为理解了,其实没有完全理解。
既然各位难得买下了这本书,我希望各位不仅仅停留在“自以为理解”的程度。
于是,我想出了一种方法。
我要将统计学中甚至称不上基础的初级内容,也就是最浅显的部分,尽可能地掰开揉碎、耐心详尽地介绍给大家。
换言之,就是只要充分掌握初中数学的内容,稍微努力一下就能理解。
因此,我没办法夸海口,说出“只要读了这本书,任何人都能熟练运用统计学”这种话,但这本书能够让大家真切地感 受到统计学存在的价值,明白为什么就算没有进行全面调查, 也能在一定程度上掌握整体情况。
我想,这本书还能够帮大家理解,为什么我会将统计学列为重要学科之一。
只需要理解非常基础的统计学知识,大家看待世界的方法就会发生改变。你会发现,人们在生活和工作中做了多少无用 功和效率低下的事情。
只需要理解统计学的一些基础知识,就能切实提高你的认 知水平。
重要的是,拿起纸和笔,自己动手去计算一下。
数学和统计学绝非仅仅是看着书上的文字和数字就能理解的,只有自己动手尝试才能真正理解。在此我坦言本书的创作方法:我以不擅长数学的人(比如 那位编辑)为对象,一边在纸上进行计算,一边为其讲解,然 后让听讲的人整理出原稿,最后由我进行修改、订正,最终完 成了这本书的写作。
为什么要用这种方法呢?因为我认为这种方法可以让那些对数学缺乏自信的人更容易理解。
所以,已经对数学有一定了解的人,或许会对书中列举的某些具体例子感到不耐烦。
不过,这本书最主要的目的是让“数字过敏者”能够粗略 地理解“统计学就是这样的内容”,因此请大家见谅。
本书是写给看不懂市面上那些统计学入门书籍的读者的,书中介绍了统计学最初级的内容,这是鲜有人写过的领域。
能够理解这本书的人,一定会有动力继续学习其他的统计学入门书籍。
虽然本书讲的是基础中的基础,但如果你能够认真对待,扎实地掌握其中的内涵,那么你所掌握的统计学知识一定会成为你处理生活和工作问题的利器。
我希望大家相信这一点,一定要坚持读到最后。
第1章 “统计学”究竟是什么——减少金钱和劳动力的浪费
统计学中常见的“误解”
接下来,我将为大家介绍统计学的基础知识。不过,在这之前,我想问大家一个问题:对于统计学在现实生活中的应用有哪些,大家是否拥有准确的概念呢?
不了解统计学的人往往容易产生误解,认为随着电脑和网络的普及,统计学只在有效整理和处理海量数据,即进行所谓的大数据分析时,才会发挥重要作用。
统计学确实有这方面的功效,而且近些年随着技术革新得到了日渐广泛的应用。这一点与传统的统计学略有不同。
大家在日常生活中能够接触到的统计学典型案例,应该是 前文提到的电视节目的收视率。
提到“收视率”时,一般指的是家庭收视率。
截至2018年,日本大约有5800万户家庭,其中有多少户家庭观看了同一档电视节目,用数值表现出来就是收视率。
前文已经提到,调查收视率的装置并没有安装在所有家庭。
媒介研究公司公布的数据显示,在关东地区生活的家庭1800万户,参与调查收视率的样本数量只有900户,关西地区、名古屋地区各600户,再加上全国其他地区,样本数量总共只有6900户。
日本的家庭总数量大约有5800万户,所以样本数量不过1/8400。
此时了解统计学的人肯定明白,根据这些样本数量统计出 的收视率是准确可信的。而不了解统计学的人则会心存怀疑,认为不进行全面调查就无法得出准确的统计数字。
当然,我写这本书的目的就是为了让后者了解统计学究竟是一门怎样的学科。
就像收视率和选举时的投票站出口调查一样,为什么用数量有限的样本就能掌握整体情况呢?
我相信大家只要静下心来读进去,最后一定能理解这个问题。
现在我会以收视率为例,简单解释一下统计学是什么,让大家对于统计学有一个感性认识。
说得简短一些,假设只有一户有一台电视的家庭安装了调查收视率的装置,结果会怎样呢?
我们能够知道这一户家庭“有没有看电视”,也就是说,这项数据能够计算出的结果只有“0%”和“100%”。这个结果 与实际收视率,也就是进行全面调查后计算出来的数值之间是存在巨大偏差的。
接下来,如果增加一户家庭,调查两户家庭的收视率,结果又会怎样呢?
用A家庭和B家庭代表两户家庭,看了节目的标记为○, 没有看节目的则标记为 ×,那么收视情况如表1–1所示。
表 1–1
A 家庭 ○ ○ × ×
B 家庭 ○ × ○ ×
收视率 100% 50% 50% 0%
统计结果只会有以上四种情况。
实际计算这四种情况可知,一档节目的收视率会因为每种情况发生的概率不同而变化。
可是,根据两户家庭的数据能够得出的收视率只会是 0%、50%、100%中的一种。
与调查一户家庭的数据相比,虽然与实际收视率之间的偏差依然很大,但多少会有些进步。
那么,当样本数增加到三户家庭时,情况又如何呢?我们 通过表1–2可以观察。
表 1–2
A 家庭 ○ ○ ○ × ○ × × ×
B 家庭 ○ ○ × ○ × ○ × ×
C 家庭 ○ × ○ ○ × × ○ ×
收视率 100% 67% 67% 67% 33% 33% 33% 0%
如表 1–2 所示,收视情况变成了八种,那么收视率会如何呢?分类如下:
• 三户家庭全都收看:100%;
• 两户家庭收看:67%;
• 只有一户家庭收看:33%;
• 所有家庭都不收看:0%。
虽说与实际收视率之间仍然存在巨大偏差,但与只有一户家庭或两户家庭的数据相比,可以说调查三户家庭后得到的数 据与实际收视率更接近了一些。
当样本数量增加到四户家庭、五户家庭,甚至100户家庭、1000户家庭、10 000户家庭时,样本数量越多,实际收视率与根据样本计算出的收视率之间的偏差就会逐渐缩小。
无须调查全部样本就能在一定程度上掌握整体情况就算不进行全面调查,只要收集了一定数量的样本,就能了解实际收视率吗?仅仅利用统计学收集一定数量的样本,就能了解整体情况吗? 严格来说并非如此。
因为样本调查与全面调查之间一定会产生偏差,无法将偏差缩小为 0。
不过,充分利用统计学便可以肯定,只要收集这么多样本,就能把结果与准确值之间的偏差控制在1以内;只要收集这么多样本,那么准确值就能在99%这个范围之内。
也就是说,就算不进行全面调查,只需要少量样本,就能 计算出无限接近于全面调查结果的数值。
这就是统计学的魅力。请大家想一想。
收集1800万户家庭的数据,与只收集900户家庭的数据 所得出的数值相比,如果二者的偏差非常小会怎么样?
调查1000户家庭与调查900户家庭后计算出的收视率相比,如果二者几乎没有偏差又会怎么样?
如此情况下,再特意花费人力、物力、财力去收集海量数据就是一种浪费。
统计学恰恰能够有效地消除此类浪费。
统计学的前提是没有偏误
虽然统计学能够用更少的费用和劳动力掌握基本准确的整体情况,但是否能够得出基本准确的结果,还要看样本的选择方式。比如,在调查收视率时,一家人收看的节目类型会随着 年代和家庭构成的变化而发生变化。
如果样本偏向于20~30岁的年轻人,或者反过来偏向于70岁以上的老年人,那么结果同样会有所偏差。也就是说,一旦样本出现偏误,就无法得出准确结果。
所以,统计学者很重视如何抽取样本,以保证不会出现偏误。报纸和电视上的新闻节目常会进行舆论调查。大部分情况 下,它们会采取电话调查的形式,给各地的家庭打电话,询问政治问题或时事议题,让受访者从几个选项中选择答案。
这种情况下,要给谁打电话是随机抽样决定的。随机可以保证所有人被抽到的可能性都是均等的。
那么用什么样的方法可以保证随机呢?以前的方法是使用电话本。
虽然现在已经不常用电话本了,但在几乎所有家庭都有固定电话的时代,电话本非常重要,因为上面记着绝大部分人的电话号码。
那以前是如何从电话本中进行随机抽样的呢?
通常是这样的,一个人随意翻动电话本,另一个人喊停,再由第三个人选择一个电话号码拨打。
这种方法的效果怎么样呢?乍一看似乎是随机选择,然而实际操作后会发现,电话本 的前几页和最后几页上的号码很难被选到,选出的号码会集中在中间部分。
既然如此,该如何改进呢?
首先,随便选择一个电话号码。然后制定规则,在选择某一页中的某个电话号码后,根据“从前一个电话号码开始数第50个”,或者“从上一页开始向后数第15页”等规则,遵循相 同的间隔选择电话号码。
这种方法在随机抽样中被称为系统抽样法,是很久以前经常使用的方法。
随着时代的发展,用电话本进行随机抽样的方法已经不符合现状了,因为手机已经广泛普及了。
如今,无论男女老少,都有了自己的功能手机或智能手机,只有老年人家里可能还在继续使用固定电话。
另外,从个人信息保护的角度出发,越来越多的人并不会
把家里的电话号码登记在电话本上。
因此,现在的主流方式是工作人员用电脑随机组合数字形成电话号码,然后拨打这些号码。如果对方符合条件,就请求对方配合调查,这种方法被称为随机数字拨号(random digit dialing,RDD)。
从 2016 年开始,调查者已经使用这样的方法对功能手机和智能手机的用户进行调查了。
归根结底,从固定电话号码中抽取的样本依然会偏向老年人,而且手机的机主很可能不会接听陌生号码的电话。
虽说是随机,其实无法避免会出现一定程度的偏误。统计学成立的前提是没有偏误的样本调查。
如果在研究领域进行存在偏误的调查,可能就会引起人们对其真实性的怀疑,认为其动机不纯。
判断是否存在偏误,研究该如何才能避免偏误,同样是统计学中不可或缺的重要一环。
- 人民大学出版社微店 (微信公众号认证)
- 人大出版社自营微店,正版人大出版社书籍直发,品质保证!
- 扫描二维码,访问我们的微信店铺
- 随时随地的购物、客服咨询、查询订单和物流...