作者anovachen (@@)
看板Statistics
标题[问题] Logistic回归--当信赖区间与p值矛盾时??
时间Wed Dec 28 01:26:46 2011
各位好:
最近我的研究遇到一个很诡异的问题,
首先我分析的资料样本数高达两千多万...
做logistic regression只有一个应变数(二分变数)和五个自变数(连续/类别等)。
使用SAS 9.2进行运算後发现,
有些变数odds ratio的95%信赖区间包含1,但是p<0.05(实际上在我的案例中p<0.0001)。
或者是p>0.05但是95%CI不包含1。
(p-value以Analysis of Maximum Likelihood Estimates报表中的
Wald chi-square Pr>ChiSq为主。)
我谘询过两位教生统的老师,
其中一位说一定是我资料key-in错误,因为这不可能发生...@@"
另一位说,他听说过有这种情况,但是自己从来没遇到过,
也不晓得要如何解释数据...
请问各位,遇到这种情况时该以p-value为判定显着与否的标准,
还是以CI为主?或者这样的数据毫无意义?
或者...是我SAS的程式写错了???= ="
恳请赐教,谢谢!!^^
ps.
(到了要上台报告的前天才发现这问题...
害得我辛苦了两周的logistic regression model
都作废不能拿来报告了T^T)
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 122.117.192.49
1F:推 FSGuitar:恭喜你 我不久前也发现过这个问题 请看 12/28 01:35
2F:→ FSGuitar:#1EdK6TR4 这篇文章 或是搜寻我的ID 12/28 01:36
3F:→ yhliu:信赖区间与假说检定不配套时可能产生不一致结论, 就像对同一 12/28 08:33
4F:→ yhliu:假说采用两种不同检定程序可能结论不一致. 例如普通列联表卡 12/28 08:34
5F:→ yhliu:方检定, 采用 Pearson chi-squared 与 LR G-squared 可能结 12/28 08:35
6F:→ yhliu:论不同. 而在本例样本数极大, p-value 除了做为统计显着性判 12/28 08:37
7F:→ yhliu:别(显着/不显着)以外, 无任何参考价值. 倒是信赖区间比较能 12/28 08:38
8F:→ yhliu:显示实质显着性. 既然 OR 的 C.I. 包含 1, 显示关联性可认为 12/28 08:39
9F:→ yhliu:不存在. 事实上只要 C.I. 接近 1 而不一定包含 1, 就可说不 12/28 08:40
10F:→ yhliu:具实质显着性. 12/28 08:40
11F:→ yhliu:当然以上是假设资料及计算都没问题. 12/28 08:41
12F:→ yhliu:再者, 会有这样的现象, 在本例大样本情况, 很可能是 0-1 比 12/28 08:42
13F:→ yhliu:例太悬殊, 以致中央极限定理适用性有点问题.(卡方及 OR C.I. 12/28 08:44
14F:→ yhliu:之分析程序,都是建立在大样本理论,也就是套用 CLT 的结果.) 12/28 08:45
15F:→ yhliu:简言之: p-value 小而 C.I. 显示无关联性, 或 p-value 大, 12/28 08:47
16F:→ yhliu:都可视为无关联, 至少是无显着关联. 12/28 08:48
17F:推 imaltar:我猜是你的class是用内设的effect coding 参考组是设为-1 12/28 08:48
18F:→ yhliu:修正: 会有 CLT 不适用, 一是二元反应之 0-1 比例太悬殊, 12/28 08:49
19F:→ yhliu:二是解释变数为类别而某一类样本数太少. 12/28 08:49
20F:→ imaltar:参数在估计就是用effect coding 但是程式在计算OR时 12/28 08:49
21F:→ imaltar:是用dummy coding 也就是参考组设为0 所以有时会产生 12/28 08:50
22F:→ imaltar:OR信赖区间显着 参数p-value却不显着的情形 12/28 08:53
23F:→ imaltar:所以 class那边修改成 class var1 var2..../param=ref; 12/28 08:55
24F:推 tew:先把应变数的叙述统计资料秀出来 12/28 09:10
25F:→ yhliu:如果如 imaltar 所说的, p-value 是对整个变数的检定, 而 OR 12/28 09:23
26F:→ yhliu:的区间估计是对多分类变数单一类别系数之推论, 则二者虽有关 12/28 09:24
27F:→ yhliu:联但不在前述我所论的范围. 此种情形亦非 dummy coding 或 12/28 09:25
28F:→ yhliu:effect coding 的问题. 而若 p-value 与 C.I. 都是针对单一 12/28 09:26
29F:→ yhliu:类别,但比较基础不一(这应是 imaltar 所论本意),则更不足论. 12/28 09:27
30F:→ yhliu:所以,问者应把问题叙述清楚,否则答者只是白费力气! 12/28 09:29
31F:推 imaltar:我是单纯针对原PO code方面 到是没像y大从理论去解释 12/28 11:04
32F:→ anovachen:谢谢各位热心回答!! 我的程式码的确没有/param=ref 12/28 17:08
33F:→ anovachen:现在补上了,正在执行程式当中...= =" 12/28 17:08
34F:→ anovachen:这个资料库的应变数1,0比例悬殊,大约是1:10000 12/28 17:10
35F:→ anovachen:所以也不能排除yhliu所说的比例差太多的可能性。 12/28 17:11
36F:推 imaltar:1:10000 有点大XD 12/28 18:08
37F:推 goshfju:1:10000 XD 12/28 18:46
38F:→ anovachen:刚才跑完之後CI还是一样,p value终於"正常"了 ^^" 12/28 22:40
39F:→ anovachen:这样我的报告终於交的出去了(好担心干扰作用探讨要重写 12/28 22:40
40F:→ anovachen:这是罕见疾病的研究,所以1:10000还不算最夸张的XD 12/28 22:41
41F:→ anovachen:谢谢各位!!^^ 12/28 22:42
42F:推 imaltar:对照组太大的话 可以考虑用配对 12/28 23:03
43F:→ yhliu:配对是为了缩小需要蒐集资料的样本. 资料已在那里, 弃而不用 12/29 12:19
44F:→ yhliu:而强行 "配对", 似乎没必要. 12/29 12:19
45F:→ bmka:同意y大,不过有时候配对也有好处,比如说如果是依年龄配对 12/29 13:42
46F:→ bmka:(假设年龄有影响但并不是有兴趣的变数), 12/29 13:44
47F:→ bmka:那麽就不必model age effect,可以减少model misspecification 12/29 13:46
48F:→ bmka:可能带来的问题,也就是说牺牲efficiency(丢data),但是可以换 12/29 13:47
49F:→ bmka:来robustness of inferential results. 12/29 13:48
50F:→ bmka:做研究设计时这些trade-offs要好好考虑 12/29 13:52
51F:→ bmka:题外话,在台湾能拿健保资料来做研究真是奢侈的幸福啊 12/29 13:53
52F:→ FSGuitar:之前北医有一个教授 光用健保资料库就发了一百多篇PAPER 12/29 19:46
53F:推 imaltar:楼上说的士林恒庆老师 12/29 19:52
54F:→ clickhere:Google: zero-inflated logistic regression 12/29 21:25
55F:推 cuteship:很有趣且罕见的状况。Y 12/30 21:12