百摩网
当前位置: 首页 生活百科

线性回归分析的内容(广义线性回归分析模型Logistic)

时间:2023-08-10 作者: 小编 阅读量: 1 栏目名: 生活百科

结合本例,如果我们将是否患有糖尿病与各个X进行回归,也会得到Y的估计值。当我们从概率的角度进行线性回归时,得到的模型特称为“线性概率模型”。这个地方需要特别理清的是,每一个研究对象是否患有糖尿病我们提前已经知晓。确实如此,上述线性概率模型并非理论假想,而是存在实际应用,它与多重线性回归的思路和操作方法完全相同。

作者:丁点helper

来源:丁点帮你

前文我们已经讲解了相关与回归的基础知识,并且重点讨论了多重线性回归的应用与诊断分析。今天的文章,我们来看看日常学习和科研中应用同样广泛的另一类回归分析——Logistic回归。

Logisti回归与多重线性回归的区别

多重线性回归,一般是指有多个自变量X,只有一个因变量Y。前面我们主要是以简单线性回归为例在介绍,两者的差距主要在于自变量X的数量,在只有一个X时,就称简单线性回归。

读过我们前面“线性回归”系列文章的同学,肯定已经知道,采用线性回归的第一准则:因变量Y需要是“定量变量”。

例如得分、收入等连续型的,可以计算均数和标准差的变量。而Logistic回归最大的不同在于:Y是分类变量。

Logistic回归的Y是分类变量(这句话希望大家在心里默读三遍)这是进行Logistic回归最基本的条件。

什么是分类变量呢?大家最常见的可能是:发病与不发病。

比如我们用Y来表示“是否患有糖尿病”,用Y=1表示“患病”;用Y=0,表示“不患病”,这里的Y就是一个典型的二分类变量。

此时,当我们希望通过回归分析的方法来探讨“糖尿病患病与否的影响因素”,则应该选择“Logistic回归分析”。

同多重线性回归一致,对进行Logistic回归分析的自变量X并没有限制,可以是定量变量,如年龄,也可以是分类变量,如性别等等。

所以,按照我们前面文章所强调的,进行研究前首先要找XYZ(自变量、因变量和控制变量),当考虑是进行多重线性回归,还是Logistic回归时,原则上只需看Y(即因变量、或称反应变量)的类型:

定量变量就用多重线性回归,分类就用Logistic回归。

线性概率模型

多重线性回归,一般是指有多个自变量X,只有一个因变量Y。前面我们主要是以简单线性回归为例在介绍,两者的差距主要在于自变量X的数量,在只有一个X时,就称简单线性回归。

理清了Logistic回归与一般线性回归的区别后,我们再来看看Logistic回归是如何构造出来的。

在这之间,我们要先介绍一个新词:线性概率模型。什么叫线性概率模型,它与Logistic回归有什么关系?我们一一道来。

首先,既然大家都叫“回归”,Logistic回归与线性回归当然存在联系的。

实际上,Logistic回归仅仅只是对线性回归的因变量进行了一个变换,模型的主体结构仍然属于“线性回归”。

仍然以“糖尿病患病的影响因素”为例进行说明。

某研究团队想要探讨某地区糖尿病患病的影响因素,收集了如下数据:

上述数据的赋值说明如下:

本研究的目的是获得“影响因素”,因此,除变量Y(是否患病)以外,其他所有因素都可以作为潜在的影响因素(即自变量X纳入)模型。如上表,Y属于二分类变量,其取值模式是“0、0、0…1、1、1”,其中“1”表示“是”;“0”表示“否”,所以符合进行Logistic回归的基本条件。

在Logistic回归诞生之前,人们首先考虑的是按照“多重线性回归”的方法,忽略变量Y的变量类型,直接将Y与各个X强行进行多重线性回归

在前文,我们讲过Y上面添加一个“^”符号,表示Y的估计值。结合本例,如果我们将是否患有糖尿病与各个X进行回归,也会得到Y的估计值。可是如何解释这个估值值呢?人们想出一个办法:概率。

概率是我们在中学就接触过的内容,表示的是“某个事件发生可能性的大小”,比如某人患糖尿病的概率是80%,意味着他的患病风险比较高。

当我们从概率的角度进行线性回归时,得到的模型特称为“线性概率模型”。

如上式,我们用P来表示Y的估计值,专门代表患病概率。什么意思呢?我们现在构造的模型是用来研究各个影响因素与糖尿病患病概率的相关关系,不再是是否发病。

也就是说,通过模型,我们可以计算出预测值,此时的预测值代表该对象患糖尿病的可能性大小。

这个地方需要特别理清的是,每一个研究对象是否患有糖尿病我们提前已经知晓。如上表,变量Y=0,意味着“没有患病”,Y=1,表示“患病”。

可是现在又说预测值代表他患病的可能性大小,都已经患病了,再算患病可能性还有意义吗?

当然是有的,这就是回归分析,或者整个统计学的思想,用已经发生的事情作为样本来推测事物间的规律。

这里的预测值是根据模型(即根据X所计算的),虽然并非实际情况,但我们可以推测:如果模型预测效果好,那对于某一名已经患病的对象而言,其预测值(即患病概率)应该接近于1,表明患糖尿病概率很高。

反之,对于没有患病的人群(即Y=0),根据模型计算的患病概率则应该接近0,即患病概率低。

确实如此,上述线性概率模型并非理论假想,而是存在实际应用,它与多重线性回归的思路和操作方法完全相同。

唯一特殊的是,这里“Y”的预测值专门由“P”表示,指代概率。这种方法在经济学等社会科学领域十分广泛,常与Logistic回归结合使用。

Logistic回归的由来

多重线性回归,一般是指有多个自变量X,只有一个因变量Y。前面我们主要是以简单线性回归为例在介绍,两者的差距主要在于自变量X的数量,在只有一个X时,就称简单线性回归。

但是,这个“线性概率模型”有一个很严重或者说“致命”的问题。根据模型来看,Y的估计值(即这里的P)理论上可以取所有实数。可是,对于大于1或者小于0的预测值,该做何种解释呢?

常识告诉我们,概率(即可能性)不会大于“1”或者小于“0”,可是通过模型计算出来的预测概率几乎一定会出现大于1或小于0的情形

为了解决这个问题,人们就考虑对P进行变换。数学上发现,通过对P进行如下变换即可解决问题:logit (P) = ln (P/1-P),(其中ln为自然对数函数)。

这个变换即所谓的“logit”变换,通过对P进行变换之后再次纳入回归模型,得到的模型即为“Logistic回归模型”:

在实际应用中,这些变换当然不再需要我们手动操作,只需要把数据整理成上述上述表格中的形式,SPSS软件会进行完整的分析过程。

但我们需要特别明确的是,进行Logistic回归后,软件输出的“预测值”,就是这里的“P”,即概率,均是0-1的数字

所以,如果从整体来看(将logit(P)看做一个整体),Logistic回归模型仍然是一个线性回归模型,一般称作“广义线性回归”。

    推荐阅读
  • 真假翡翠手镯对比(真假翡翠手镯有什么区别)

    颜色不同真的翡翠手镯,颜色纯,有光泽,不会掺杂其他杂色。所以,对比翡翠手镯真假时,可以将其拿到阳光下仔细端详,检查颜色、光泽度等;假的多数颜色看起来是很不自然的,有发灰发白的现象。重量不同相同体积大小的情况下,真的翡翠手镯,掂在手上时能感觉到明显的分量,有厚重感,而不像玻璃仿制品,感觉轻飘飘的;这是因为翡翠手镯内部结构紧密,硬度大。

  • 揭露泰国变性手术后遗症(泰国人妖晚年有多惨)

    而在今天,泰国人妖的数量已经达到64万人左右,约占泰国男性总数的2%。因为入行者的逐渐增多,泰国人妖的手术和药物费用价格实际上也是逐年攀升。有相当部分的泰国人妖,会选择投靠佛门寺庙,充当自己后半生的庇护所。在2015年之前的泰国法律中,明确规定泰国人妖虽经历过变性手术,但是在法理上却依然被视为男性。而这样的法律规定,也为不少泰国人妖带来了各种各样的困扰。

  • 氟蛋白泡沫灭火剂有腐蚀性吗(氟蛋白泡沫灭火剂要注意哪些问题)

    氟蛋白泡沫与干粉相结合的灭火技术不仅能充分发挥泡沫灭火的完整性和干粉灭火的快速优势,而且能克服泡沫灭火的缓慢性和干粉灭火的重燃缺陷,达到良好的灭火效果。这是因为氟蛋白泡沫的表面张力低于燃料的表面张力,不仅能抵抗燃料,还能抵抗干粉的污染和破坏,从而达到更好的灭火效果。使用一段时间后,同时喷洒,效果优于单独使用氟蛋白泡沫。氟蛋白泡沫灭火剂主要有以下问题需要注意:尽量减少机械冲击。

  • 实践单位评语内容(万能模板)

    以下内容大家不妨参考一二希望能帮到您!实践单位评语内容某某工作认真刻苦,服务态度非常好,使经理在XXXXX的时候没有后顾之忧;工作积极,热情周到,有一定的领导能力,专业技能业务水平优秀,业务水平也在不断提高,关心每一位合鑫人,是我们大家学习的榜样;能胜任本职工作,爱岗敬业、乐于助人,与同事相处融洽,服从整体安排,对本职工作兢兢业业,锐意进取,起榜样作用,为我们树立良好形象。

  • 怎么清除qq上面的缓存(如何清理QQ缓存)

    跟着小编一起来看一看吧!怎么清除qq上面的缓存今天我要和大家分享的是如何清理QQ缓存,希望能够帮助到大家。首先在我们的手机桌面上找到QQ并点击它。然后点击屏幕左上方的个人头像。接着等待扫描完成。最后点击清空缓存数据就可以了。

  • 活好你自己吧(活好自己就够了)

    近日,李小璐接受媒体采访,被问到“对于那些揪着自己过去不放的人有什么想说的”,李小璐霸气回应:“活好你自己吧”。据悉,自从李小璐官宣与贾乃亮离婚之后,围绕着她的所有消息基本上都有些负面。面对外界的质疑与冷落,李小璐也对外展现出了好心态。

  • 太瘦了怎么办(太瘦了怎么解决)

    下面内容希望能帮助到你,我们来一起看看吧!太瘦了怎么办如果是偏食、挑食、进食食物过少,饮食不规律导致的要改变饮食习惯,保持三餐规律饮食,要多吃一些蛋类、肉类、豆类以及维生素含量高的食物,注意不要节食和挑食。甲状腺功能亢进症病人身体消瘦,应该根据甲状腺功能检查结果服用甲巯咪唑或者丙硫氧嘧啶等药物,治疗要控制碘含量高食物的摄入,多做有氧的运动。

  • 关于田园风光的诗句(描写田园风光诗句有哪些)

    ——孟浩然《过故人庄》昨夜斗回北,今朝岁起东。——孟浩然《过故人庄》八年十二月,五日雪纷纷。——白居易《村居苦寒》自去自来堂上燕,相亲相近水中鸥。——杜牧《清明》清江一曲抱村流,长夏江村事事幽。——杜甫《江村》牧童归去横牛背,短笛无腔信口吹。——杜甫《羌村三首·其三》千里莺啼绿映红,水村山郭酒旗风。——杜牧《江南春》莫辞酒味薄,黍地无人耕。——杜甫《羌村三首·其三》孤村芳草远,斜日杏花飞。

  • 茯苓很硬怎么煮粥(如何用茯苓煮粥)

    茯苓很硬怎么煮粥食材:鲜土茯苓适量、鲜茅根适量、鲜芦根适量、凉粉粉50g、茯苓茅根水1800毫升、黑白淡奶适量、炼奶适量。首先呢我们需要做的就是将土茯苓、茅根、芦根洗净,放锅里加适量水煲约1.5小时离火。然后留出1800毫升煮好的茯苓水,再取200毫升放凉,将放凉后的茯苓水倒入50克的凉粉拌直到没有粉粒为止。最后再用小刀随便切一下,加入适量炼奶和黑白淡奶拌匀,清热去湿、爽滑可口的茯苓膏就完成啦。