eICU 数据库完全指南:208 家医院、20 万次住院的多中心 ICU 重症库

2026/9/9 医嘉研团队 42 阅读

MIMIC 之后做 ICU(Intensive Care Unit,重症监护室)重症研究,最常被问的一句话是:单中心数据,结论能推广吗?这一篇讲的就是答案——eICU(Collaborative Research Database,源自 Philips 远程重症系统),同是 ICU 重症数据库,却覆盖全美 208 家医院、335 个 ICU、超 20 万次 ICU 住院,正好补上 MIMIC 单中心天花板。老规矩——认识它(01)→ 拿到它(02)→ 看懂它(03)→ 用对它(04)→ 做研究(05)→ 发论文(06),先看图。

全称:eICU Collaborative Research Database

维护机构:Philips Healthcare 提供数据 + MIT 计算生理学实验室(LCP)维护

数据发布:PhysioNet eICU-CRD v2.0(2019)

数据年份:2014-2015,覆盖全美 208 家医院、335 个 ICU

规模:超 20 万次 ICU 住院、约 13.9 万名患者

eICU 全景速览:数据规模、Philips+MIT、与 MIMIC 分工、访问方式、常见研究设计与能力边界

01 认识它:真正的多中心 ICU 重症库

eICU 数据的来源是 Philips eICU 远程重症系统——一个覆盖全美的远程医疗平台,众多医院把 ICU 的监护数据实时上传,供远程重症医生 24 小时协作。MIT 计算生理学实验室把这些脱敏后的数据整理成科研库发布在 PhysioNet,这就是 eICU-CRD。

它的核心价值是"多中心"208 家医院、335 个 ICU、超 20 万次 ICU 住院、约 13.9 万名患者(2014-2015)。相比之下 MIMIC 是波士顿 BIDMC(Beth Israel Deaconess Medical Center,贝斯以色列女执事医疗中心)一家医院的 ICU 数据——单中心样本再大,结论也难回避"能不能推广到别的医院"的质疑;eICU 一上来就覆盖了遍布全美、规模与地区各异的医院,让你可以既做全局分析,又做医院间差异的研究。

eICU 官网首页:Philips 与 MIT 合作的资料库,超 20 万住院人次

02 拿到它:和 MIMIC 同一套访问体系

eICU 和 MIMIC 一样由 PhysioNet 发布,访问流程基本一致,如果你已经弄过 MIMIC,可以直接复用:

  • 第 1 步:在 PhysioNet(physionet.org)注册账号
  • 第 2 步:完成 CITI(Collaborative Institutional Training Initiative,协作机构伦理培训平台)的 "Data or Specimens Only Research"(数据或标本专用研究,属人体受试者研究类)培训,取得证书
  • 第 3 步:在 PhysioNet 签署数据使用协议(DUA),申请 eICU-CRD 访问权限
  • 第 4 步:获批后下载数据,再把数据导入本地数据库(如 PostgreSQL)进行分析

整个流程完全免费,但与 MIMIC 一样需要提交伦理培训证明并遵守数据使用协议。对国内研究者来说,CITI 培训证书用英文版即可,全程线上完成。

PhysioNet eICU-CRD v2.0 页面:数据规模 20 万住院/13.9 万患者/335 ICU/208 医院,及数据内容描述

03 看懂它:数据包里有什么

eICU-CRD 是一个关系型数据库,各表通过 ID 键(如 patientunitstayid)相互关联。核心表包括:

  • patient:每次 ICU 住院(patientunitstayid)的患者基本信息与出入院时间
  • vitalPeriodic / vitalAperiodic:周期性/非周期性生命体征(心率、血压、呼吸、体温、血氧饱和度 SpO₂ 等)
  • lab:实验室检查(血常规、生化、血气等)
  • medication:用药记录(反映的是下达的用药医嘱,不等同于实际给药)
  • diagnosis / admissiondx:入院诊断(admissiondx)与结构化时间戳诊断(diagnosis,来自问题列表)
  • apachePatientResult:APACHE IV 严重度评分(Acute Physiology and Chronic Health Evaluation,急性生理与慢性健康评估,ICU 常用病情严重度评分)与预测死亡风险
  • carePlanCareProvider / note:主管/会诊医师的专科与干预级别记录(carePlanCareProvider)与结构化病程记录(note)——叙事性自由文本已移除,并无 MIMIC 式的临床自由文本笔记

数据覆盖 2014-2015 两年,不同医院接入的模块(interface)不同,某家医院可能缺某几张表的数据——分析前要按医院核对该表的覆盖情况,这是多中心数据特有的坑。

04 用对它:多中心数据的三个操作

  • 分清层级:eICU 的核心结构是"医院(hospitalid)→ 每次 ICU 住院(patientunitstayid)"两层;同一个患者(uniquepid)可能发生过多次 ICU 住院。分析时要把单位定在"每次 ICU 住院"还是"每位患者",多次住院不能当成相互独立的样本
  • 医院异质性:208 家医院的监护习惯、检验频率、APACHE 填报完整度差异很大——做预测或比较时用医院分层或医院固定效应(即把医院作为分组变量纳入模型,控制医院间基线差异)处理,并报告各医院样本量
  • 数据完整性:先核对目标表在哪些医院有覆盖——某表缺失会影响结论,务必报告缺失情况并做敏感性分析

05 做研究:eICU 高频发文方向

  • ICU 结局预测:基于 APACHE 或机器学习预测住院死亡率/ICU 死亡率——多中心数据让模型可以报告跨医院表现
  • 脓毒症早期识别:用生命体征+实验室做脓毒症早期预警模型,eICU 的多中心性适合验证泛化能力
  • 机器学习外部验证:在 MIMIC 上训练的模型,拿到 eICU 上做外部验证——这是 MIMIC 论文常用的互补策略
  • 医院间结局差异:不同规模/类型医院的 ICU 结局差异及其决定因素
  • 生命体征/实验室轨迹分析:异常值检测、趋势预测、亚临床恶化识别

能力边界明确:只有 2014-2015 两年,不是持续更新库;主要是重症人群,无普通病房、门诊数据;随访受限,缺院后结局;某些表在部分医院缺失。

06 发论文:多中心招牌 + 与 MIMIC 互补

eICU 最适合的是"需要证明结论能泛化"的研究——尤其机器学习模型。一个典型的高引用路径是在 MIMIC 上开发模型、在 eICU 上外部验证:既用 MIMIC 的逐小时精细数据做特征工程,又用 eICU 的大样本多中心证明模型不局限在单一医院。想单独用 eICU 撑一篇论著,则要落在医院异质性、差异分析这类只有多中心才能回答的问题上。

我们辅导的常规路径:选题查新与数据可用性评估(先核对目标表覆盖,1-2 周)→ eICU 表结构理解与访问(1-2 周)→ 特征提取、建模与跨院验证(3-6 周)→ TRIPOD(Transparent Reporting of a multivariable prediction model for Individual Prognosis Or Diagnosis,多变量预测模型透明报告规范)写作与投稿(4-8 周)。导师一对一示范与把关,分析与写作由你本人完成。

下一篇讲 DHS(Demographic and Health Surveys,人口与健康调查)——1984 年起覆盖 90 多个国家、400 多项调查的家庭健康调查数据库,做妇幼健康、营养、全球健康研究的常用资源,也是本系列收官篇。关注医嘉研科研资讯,九大临床公共数据库逐个讲透。

话题eICU公共数据库重症医学
Get Started

需要科研辅导服务?

专业团队为您提供从选题到发表的全流程支持

查看服务