史战文, 靳韶佳
广义病例队列(GCC) 抽样设计在大规模队列研究中被广泛应用, 旨在降低与协变量测量相关的成本. 尤其当流行病学研究中的发病率处于中等或较高水平时,GCC 设计允许仅对部分病例个体的协变量信息进行测量, 从而有效控制了成本和时间. 面对众多的研究中所涉及的大体量协变量, 一种高效且精准的变量选择策略显得尤为重要.本研究聚焦于在具有发散参数(即协变量维数$p_n$, 随样本量递增$n$, 增长速率慢于$n^{1/4}$) 的GCC 设计框架下, 采用平滑剪切绝对偏差(SCAD) 惩罚函数的变量选择方法, 并对其性质进行了深入探讨. 我们不仅构建了相应的惩罚伪偏似然估计量, 还证明了该估计量的相合性以及渐近正态性. 更重要的是, 研究表明该方法具备理想的渐近预言(oracle) 性质, 意味着它能够如同先知一般准确地识别出真正重要的变量. 为了进一步验证所提方法在实际应用中的表现, 我们通过一系列详尽的数值模拟实验, 比较了基于Akaike 信息准则(AIC) 和贝叶斯信息准则(BIC) 两种不同调节参数选取方式下的有限样本性能, 并根据实验结果总结出了在不同情境下更优的选择方案. 最后, 将提出的方法应用于Wilms 瘤数据进行实例分析.