eICU 讲完,九大数据库到了收官这篇。前八个库里,ICU 重症(MIMIC、eICU)是"临床监护数据",疾病负担与肿瘤(GBD、SEER、GCO)是"登记与估计",老龄化(HRS)是"追踪面板"——最后一篇的 DHS(Demographic and Health Surveys,人口与健康调查)则是另一种物种:走进发展中国家家庭做出来的全国代表性健康调查。1984 年至今 90 多个国家、400 多项调查,是研究全球健康绕不开的一个数据源。老规矩——认识它(01)→ 拿到它(02)→ 看懂它(03)→ 用对它(04)→ 做研究(05)→ 发论文(06),先看图。
全称:The Demographic and Health Surveys (DHS) Program
运营机构:ICF(美国的一家研究咨询公司)。1984 年起由美国国际开发署 USAID 资助 40 年;2025 年 2 月 USAID 支持结束后,2025 年 7 月获盖茨基金会 3 年"紧急稳定"资助
官网:dhsprogram.com
规模:90+ 国家、400+ 项调查(数据档案内可下载 90+ 国家、300+ 项调查的数据)
数据类型:家庭问卷调查为主 + 贫血检测、身高体重等生物标志物

01 认识它:走进家庭的全球健康调查
DHS 的做法是入户调查:经过培训的调查员拿着标准化问卷,进入抽中的家庭,对育龄妇女(15-49 岁)、男性、家庭成员逐一访谈,部分调查还现场做贫血检测、量儿童身高体重。每 5 年左右在一个国家重复一轮,几十年下来就形成了一个国家健康指标的"时间序列"。
它最大的价值是标准化:埃塞俄比亚和孟加拉国的"5 岁以下儿童死亡率"、尼日利亚和肯尼亚的"住院分娩率",用的是同一套问卷、同一个指标定义——所以 90 多个国家可以放在一起比较,这一点靠各国各自为政的调查数据很难做到。DHS 的调查类型也不止一种:主体是 DHS(人口与健康调查),还有针对疟疾的 MIS(疟疾指标调查)、评估医疗机构的 SPA(卫生服务提供评估),以及定性研究和其他定量调查。

02 拿到它:免费注册,按国家申请
DHS 数据对合法学术研究完全免费,流程如下:
- ① 注册账号:在 dhsprogram.com 注册账号
- ② 按国家申请:提交数据申请——需要填写联系方式、研究项目题目和拟做的分析描述
- ③ 等待审核:官网口径为 24-48 小时内回复(周一至周五),通常 1-2 个工作日;获批后该国的全部无限制数据集都能下载
- ④ 登录下载:登录下载数据,提供 Stata / SPSS / SAS 等格式
流程适用于 DHS、MIS、AIS(艾滋病指标调查)、SPA 各类数据集。两点提醒:一是 HIV 和 GIS(地理信息)数据集需要在线确认使用条件,少数数据集属于受限数据、申请方式略有不同;二是想先试试水,官网提供模型数据集(model datasets),不用注册就能下载练手,问卷、变量说明也都在官网开放。

03 看懂它:Recode 文件体系
每轮 DHS 调查发布的是一组按对象拆分的 Recode 文件(DHS 把原始数据按统一变量定义重新编码后的标准化文件,各国变量同名同义),文件名后缀对应内容:
- IR:育龄妇女个体文件(15-49 岁)——生育史、孕产、避孕、营养都在这张表里,多数分析从它开始
- BR:全部出生史文件(每个出生记录一行,含已故儿童)——做生育率、儿童死亡率、出生间隔分析用
- KR:调查前 5 年内出生儿童文件(每个孩子一行,0-59 月龄)——免疫覆盖、儿童疾病、营养身高体重都在这
- MR:男性文件,HR:家庭户文件,PR:家庭成员文件
变量名全球统一:v001 是抽样簇、v005 是抽样权重、v012 是受访妇女年龄——换一个国家,代码几乎不用改,这是 DHS 对新手很友好的地方。官网为每轮调查提供问卷、Recode 手册和变量字典,做分析前先读变量定义,别凭变量名猜。
04 用对它:调查数据的三件套
- 加权:DHS 是复杂抽样(先把全国分成城乡/区域层,再在每层里整群抽样入户),不同地区抽中概率不同,直接跑回归等于把样本当简单随机抽样——结果偏误。权重的作用是把样本结构还原回总体人口结构。Stata 里先用 svyset 命令声明抽样设计:权重用 v005,PSU(初级抽样单元,DHS 里通常就是抽样簇)用 v021 或等价的簇号 v001,分层用 v022;分析时用 svy 命令族,报告时带上设计效应(衡量复杂抽样比简单随机抽样损失了多少精确度)
- 定层级:IR 文件一行是一个妇女,KR 文件一行是一个儿童——分析单位跟着文件走,别把同户同母的儿童当独立样本,聚类效应用 svyset 的簇变量处理
- 算儿童月龄:儿童营养分析(低体重、生长迟缓、消瘦)要按月龄算 Z 评分(实测值与同月龄同性别参考中位数相差的标准差个数),官方手册里有标准算法(近年调查采用 WHO 2006 生长标准)。日期变量要先换算——DHS 日期以世纪月码存储(自 1900 年 1 月起累计的月数),这是新手容易出错的地方
还有一个使用常识:DHS 是横断面调查(在同一个时点对人群做一次"快照")——同一轮调查里所有人在同一时点被问,不能像 HRS 那样跟踪同一个人几年;"同一国家多轮"是重复横断面——每轮重新抽一批人,看的是总体趋势,不是个体变化。
05 做研究:DHS 高频发文方向
- 时间趋势:一国两轮以上调查对比——儿童死亡率降了多少、避孕普及率升了多少,政策评估类文章的经典做法
- 跨国比较:90+ 国家的统一指标做多国横断面分析,或按区域(撒哈拉以南非洲/南亚/东南亚)分组比较
- 健康不平等:DHS 自带财富指数五等分(按家庭资产与居住条件综合评分,把全国家庭从最穷到最富分成五档)——"最富和最穷 20% 的住院分娩率差多少"是不平等研究的标准切口
- 影响因素分析:住院分娩、产前检查、儿童免疫、母乳喂养的社会决定因素(母亲教育、城乡、财富)
- 儿童营养:生长迟缓/低体重/消瘦的流行率与多因素分析,营养学期刊的主战场
能力边界明确:以自报为主,生物标志物有限(贫血、疟疾、HIV、身高体重),没有临床诊断和病例级医疗记录;每国约 5 年一轮,最新数据可能已过 1-2 年;只覆盖发展中国家(中低收入国家为主)。
06 发论文:全球健康的招牌数据
DHS 最适合回答"某个国家/某片区域的人群健康现状与变化"——政策相关性强,方法门槛适中,是公共卫生、全球健康、营养方向发文的常备数据。用 DHS 做研究要注意三点:一是指标定义要跟官方报告对齐(官网每个国家的最终报告都给出各指标的定义和官方数值,先对齐再自算);二是跨国比较要核对各轮问卷版本差异(DHS 问卷分阶段更新,老调查没有新指标);三是权重和聚类信息要在方法和结果里写清楚,这是审稿人必查项。
我们辅导的常规路径:选题查新与指标定义核对(1-2 周)→ 数据申请与文件结构熟悉(1-2 周,含 svyset 搭建)→ 清洗、加权分析与出表(2-4 周)→ 按目标期刊规范写作与投稿(4-8 周)。导师一对一示范与把关,分析与写作由你本人完成。
系列收官。九大临床公共数据库到这里全部讲完:NHANES、CHARLS、GBD、MIMIC、SEER、GCO、HRS、eICU、DHS——三种物种各有分工:临床数据库(MIMIC/eICU)回答"医院里的病人怎么了",登记与估计数据(SEER/GCO/GBD)回答"疾病负担有多大",人群调查(NHANES/CHARLS/HRS/DHS)回答"人群健康怎么样"。
