百摩网
当前位置: 首页 生活百科

线性回归分析的内容(广义线性回归分析模型Logistic)

时间:2023-08-10 作者: 小编 阅读量: 3 栏目名: 生活百科

结合本例,如果我们将是否患有糖尿病与各个X进行回归,也会得到Y的估计值。当我们从概率的角度进行线性回归时,得到的模型特称为“线性概率模型”。这个地方需要特别理清的是,每一个研究对象是否患有糖尿病我们提前已经知晓。确实如此,上述线性概率模型并非理论假想,而是存在实际应用,它与多重线性回归的思路和操作方法完全相同。

作者:丁点helper

来源:丁点帮你

前文我们已经讲解了相关与回归的基础知识,并且重点讨论了多重线性回归的应用与诊断分析。今天的文章,我们来看看日常学习和科研中应用同样广泛的另一类回归分析——Logistic回归。

Logisti回归与多重线性回归的区别

多重线性回归,一般是指有多个自变量X,只有一个因变量Y。前面我们主要是以简单线性回归为例在介绍,两者的差距主要在于自变量X的数量,在只有一个X时,就称简单线性回归。

读过我们前面“线性回归”系列文章的同学,肯定已经知道,采用线性回归的第一准则:因变量Y需要是“定量变量”。

例如得分、收入等连续型的,可以计算均数和标准差的变量。而Logistic回归最大的不同在于:Y是分类变量。

Logistic回归的Y是分类变量(这句话希望大家在心里默读三遍)这是进行Logistic回归最基本的条件。

什么是分类变量呢?大家最常见的可能是:发病与不发病。

比如我们用Y来表示“是否患有糖尿病”,用Y=1表示“患病”;用Y=0,表示“不患病”,这里的Y就是一个典型的二分类变量。

此时,当我们希望通过回归分析的方法来探讨“糖尿病患病与否的影响因素”,则应该选择“Logistic回归分析”。

同多重线性回归一致,对进行Logistic回归分析的自变量X并没有限制,可以是定量变量,如年龄,也可以是分类变量,如性别等等。

所以,按照我们前面文章所强调的,进行研究前首先要找XYZ(自变量、因变量和控制变量),当考虑是进行多重线性回归,还是Logistic回归时,原则上只需看Y(即因变量、或称反应变量)的类型:

定量变量就用多重线性回归,分类就用Logistic回归。

线性概率模型

多重线性回归,一般是指有多个自变量X,只有一个因变量Y。前面我们主要是以简单线性回归为例在介绍,两者的差距主要在于自变量X的数量,在只有一个X时,就称简单线性回归。

理清了Logistic回归与一般线性回归的区别后,我们再来看看Logistic回归是如何构造出来的。

在这之间,我们要先介绍一个新词:线性概率模型。什么叫线性概率模型,它与Logistic回归有什么关系?我们一一道来。

首先,既然大家都叫“回归”,Logistic回归与线性回归当然存在联系的。

实际上,Logistic回归仅仅只是对线性回归的因变量进行了一个变换,模型的主体结构仍然属于“线性回归”。

仍然以“糖尿病患病的影响因素”为例进行说明。

某研究团队想要探讨某地区糖尿病患病的影响因素,收集了如下数据:

上述数据的赋值说明如下:

本研究的目的是获得“影响因素”,因此,除变量Y(是否患病)以外,其他所有因素都可以作为潜在的影响因素(即自变量X纳入)模型。如上表,Y属于二分类变量,其取值模式是“0、0、0…1、1、1”,其中“1”表示“是”;“0”表示“否”,所以符合进行Logistic回归的基本条件。

在Logistic回归诞生之前,人们首先考虑的是按照“多重线性回归”的方法,忽略变量Y的变量类型,直接将Y与各个X强行进行多重线性回归

在前文,我们讲过Y上面添加一个“^”符号,表示Y的估计值。结合本例,如果我们将是否患有糖尿病与各个X进行回归,也会得到Y的估计值。可是如何解释这个估值值呢?人们想出一个办法:概率。

概率是我们在中学就接触过的内容,表示的是“某个事件发生可能性的大小”,比如某人患糖尿病的概率是80%,意味着他的患病风险比较高。

当我们从概率的角度进行线性回归时,得到的模型特称为“线性概率模型”。

如上式,我们用P来表示Y的估计值,专门代表患病概率。什么意思呢?我们现在构造的模型是用来研究各个影响因素与糖尿病患病概率的相关关系,不再是是否发病。

也就是说,通过模型,我们可以计算出预测值,此时的预测值代表该对象患糖尿病的可能性大小。

这个地方需要特别理清的是,每一个研究对象是否患有糖尿病我们提前已经知晓。如上表,变量Y=0,意味着“没有患病”,Y=1,表示“患病”。

可是现在又说预测值代表他患病的可能性大小,都已经患病了,再算患病可能性还有意义吗?

当然是有的,这就是回归分析,或者整个统计学的思想,用已经发生的事情作为样本来推测事物间的规律。

这里的预测值是根据模型(即根据X所计算的),虽然并非实际情况,但我们可以推测:如果模型预测效果好,那对于某一名已经患病的对象而言,其预测值(即患病概率)应该接近于1,表明患糖尿病概率很高。

反之,对于没有患病的人群(即Y=0),根据模型计算的患病概率则应该接近0,即患病概率低。

确实如此,上述线性概率模型并非理论假想,而是存在实际应用,它与多重线性回归的思路和操作方法完全相同。

唯一特殊的是,这里“Y”的预测值专门由“P”表示,指代概率。这种方法在经济学等社会科学领域十分广泛,常与Logistic回归结合使用。

Logistic回归的由来

多重线性回归,一般是指有多个自变量X,只有一个因变量Y。前面我们主要是以简单线性回归为例在介绍,两者的差距主要在于自变量X的数量,在只有一个X时,就称简单线性回归。

但是,这个“线性概率模型”有一个很严重或者说“致命”的问题。根据模型来看,Y的估计值(即这里的P)理论上可以取所有实数。可是,对于大于1或者小于0的预测值,该做何种解释呢?

常识告诉我们,概率(即可能性)不会大于“1”或者小于“0”,可是通过模型计算出来的预测概率几乎一定会出现大于1或小于0的情形

为了解决这个问题,人们就考虑对P进行变换。数学上发现,通过对P进行如下变换即可解决问题:logit (P) = ln (P/1-P),(其中ln为自然对数函数)。

这个变换即所谓的“logit”变换,通过对P进行变换之后再次纳入回归模型,得到的模型即为“Logistic回归模型”:

在实际应用中,这些变换当然不再需要我们手动操作,只需要把数据整理成上述上述表格中的形式,SPSS软件会进行完整的分析过程。

但我们需要特别明确的是,进行Logistic回归后,软件输出的“预测值”,就是这里的“P”,即概率,均是0-1的数字

所以,如果从整体来看(将logit(P)看做一个整体),Logistic回归模型仍然是一个线性回归模型,一般称作“广义线性回归”。

    推荐阅读
  • 关于鲁迅创新的名言(关于鲁迅创新的名言有哪些)

    关于鲁迅创新的名言“猛兽永远独行,牛羊才成群结队。”此句话看过鲁迅有名的《狂人日记》就会知道此话的含义,主要就是在一个落后守旧的时代下发出的牢骚,是不甘于一直守旧,要勇敢的革新与创新。特别是在以前鲁迅的时代下,不能眼睁睁的看着别人遭受欺凌或者自己受到欺负,从来不敢站起来反抗,一定要勇敢的站起来向传统与权威说不!不过鲁迅说此话的时候,我国正在遭受着敌人的入侵。

  • 手机版qq自动回复怎么弄(qq怎样搞自动回复,手机版)

    手机版qq自动回复怎么弄1、打开手机QQ主页,点击qq头像右下角的状态,选择要设置的状态,2、在设置、以及这三种状态时会提醒自动回复模板或是自定义回复内容,3、点击“点击可修改”链接,可以添加自定义回复,4、输入完自定义内容后点击“完成”,这样在线状态和自动回复就设置好了。上述就是关于手机版qq自动回复怎么弄的内容介绍了,希望能对小伙伴们有所帮助。

  • 桂花戚风蛋糕教程(桂花戚风蛋糕怎么做)

    下面更多详细答案一起来看看吧!桂花戚风蛋糕教程食材:鸡蛋2个、低筋面粉38克、纯牛奶30克、玉米油15g、糖桂花35g。把鸡蛋的蛋清和蛋黄分离,放置两个容器中。在蛋黄中加入玉米油,牛奶和低筋面粉,搅拌均匀。把纯净水,面粉,盐和糖桂花加入蛋清中,打发到蛋白霜发泡。烤箱预热,把模具放入烤箱中烤制。上火110度,下火130度,时间为55分钟。美味的桂花戚风蛋糕做好啦!

  • 红楼梦贾宝玉与秦可卿(贾宝玉梦中与秦可卿成亲)

    贾宝玉在梦游太虚幻境前,有过三个特殊的行为。秦可卿所有正是出场说话贾宝玉都在身边。最后,秦可卿对贾母打包票说安排好贾宝玉午睡,贾宝玉对房间不满意。秦可卿是贾宝玉选定的第一个性启蒙者。绝不是薛宝钗和林黛玉此时小女孩能替代。贾宝玉意淫秦可卿,毫无疑问指向了贾珍“爬灰”的丑事。贾宝玉身体力行证明了贾珍觊觎秦可卿,秦可卿同样不会迎合,淫的人是贾珍。综上,贾宝玉对秦可卿梦中幽会,是谓意淫。

  • 重别周尚书古诗(重别周尚书古诗意思和赏析)

    译文阳关与故国相隔万里之遥,年年盼望却至今不能南归。诗中的“阳关万里道”是喻指长安与金陵之间的交通要道。下旬“不见一人归”的“一人”指庾信自己而言,这二句说在长安至金陵的阳关大道上,有多少南北流离之士已经归还故国了。这是知人论世之见,于诗歌鉴赏尤为重要。此诗表现手法有两个特点:一是借代手法,开头即用“阳关万里道”借指长安至金陵的交通大道。

  • 开车的时候如何判断右边距离?(掌握这2个小技巧秒变老司机)

    但是我必须要跟你强调一下,这是一般普通轿车的判断方法。而且即使是普通轿车,雨刮片的布置形式也有不同表现的,千万不要把我的办法当成放之四海而皆准的原则。如果你在掌握了我说得几个判断距离的方法后,你在积累了一定的经验后,再来在其他运动条件下判断距离,你就一定能提高自己的驾驶水平。判断距离是也是一个技术员的最基本基本技能,看起来简单,其实很重要的。

  • 有机宝石琥珀介绍(神奇的天然琥珀珠宝玉石)

    据记载,赵飞燕选为皇后时,女弟子以黄金步摇、琥珀枕相赠。琥珀也是佛教七宝之一,珍贵异常,达官贵人喜爱佩戴,认为有福泽加持。“虫珀”是琥珀里比较珍稀的一种,实际上不仅仅是包裹昆虫,那些包含有植物、动物,甚至是真菌的琥珀都称为虫珀。实际上天然的花珀数量稀少,市场上很多花珀可能是人为优化的。现代中医也在用琥珀安神汤治疗脑震荡伤或老年性顽固失眠等疾病。

  • 留下一句你收藏了很久的文案吧(能不能给我看看你们喜欢了好久的文案)

    我抓不住时间但我拍下的瞬间即是永恒大家好像都很着急急着到达急着超越急着相爱急着再见可是我坐在天台上常常在想我到底为什么而活风会缠绕着我然后什么东西把我击碎又匆忙的安装回去留下一个分散的我“什么是你”我不知道那时候他爱自由厌倦我一天又一天带有约束的陪伴后来他不再属于我天高任鸟飞除非你郑重其事的捧着199朵白玫瑰除非你凌晨三点淋雨陪我去看海我想做这山上最有名的卦师到时等你来向我求一卦我也借机会告诉你你

  • 五谷杂粮怎么做(美味的五谷杂粮怎么做)

    五谷杂粮粥用料:燕麦米、大黄米、黑糯米、大红枣、即食燕麦片、薏米、荞麦米、红稻米、黑米、糙米、红豆、黑豆、莲子、葡萄干、枸杞子、核桃仁、燕麦片、紫薯、山药。焖一个小时后,打开锅盖,米豆均已软,莲子也快熟了。第二次焖够1小时后,所有材料已经彻底熟透,粥便煮好了。如果觉得水有些多,可以倒入一些即食燕麦片增加浓稠度。

  • 华为nova 6发布会易烊千玺(三种款式易烊千玺代言月底见)

    而今天早上,华为终端官方微博也正式官宣了华为nova5,如果不出意外的话应该本月底就会发布,而华为nova系列一直都在长沙发布,所以华为nova5系列也毫无疑问会在长沙发布。当然,华为nova系列产品也是一直注重自拍的,所谓海报级自拍。而产品的形态,据透露从华为nova5i到华为nova5再到华为nova5Pro会把升降全面屏、打孔屏都用到,也就是说华为nova5系列可能是目前华为在国内的第一款升降摄像头全面屏手机!