CHNS中国居民健康与营养调查数据库下载与使用全流程实操指南

发布时间:2026/10/6 14:17:36
CHNS中国居民健康与营养调查数据库下载与使用全流程实操指南 在课题组带新人的时候我常遇到一个看起来简单、实际很费劲的问题师兄CHNS数据到底从哪里下 中国居民健康与营养调查CHNS数据库是营养学、公共卫生和劳动经济学研究里绕不开的一个长期追踪数据源但它的官网结构、下载权限和文件组织方式跟那种首页挂个下载中心的思路完全不一样。第一次上手的人十有八九会在注册环节卡住或者在下载完一堆压缩包之后不知道该用哪个文件。这篇文章是《健康营养统计实务》系列第9篇第1章第1节的配套实操笔记按2026年版资料整理了官网各个区域的功能定位、注册与申请流程、数据下载路径以及拿到数据后必须先做的三件事。无论你是写毕业论文、准备课题申报还是单纯想用公开数据练一练分析技能都可以按这篇的步骤把CHNS数据真正拿到手。1. 先搞清楚CHNS是什么量级的数据库才不会白下数据1.1 一组追踪了三四十年的家庭与个人记录CHNSChina Health and Nutrition Survey中文翻译是中国居民健康与营养调查。它不是一个普通的一次性横断面问卷而是从1989年就开始追踪的纵向面板数据。每一轮调查都会回到同一批社区重新访问其中的住户和个人同时吸收少量新增样本以保持代表性和年龄结构。这意味着同一个人的健康指标、营养摄入、收入职业等信息可以跨年份串起来看变化——在研究小时候的营养状态如何影响多年后的健康这类问题上普通静态调查很难替代它。从1989年启动至今CHNS陆续公开了多个调查轮次覆盖了从经济欠发达到相对发达的多类地区。样本设计采用分层多阶段随机抽样家庭层面和个人层面都有对应的样本编号所以做多水平分析也站得住脚。对于硕博论文和课题申报来说这种有几十年视野的数据库非常少见这是CHNS历久弥新的核心原因。2026年版的教程也主要是冲着最新轮次数据的结构和文件组织方式来的。1.2 营养、健康、经济三个领域共同的高频选择CHNS的数据内容分四个层面社区、家庭、个人、营养。社区层面居委会和村委会层面的基础设施、食品价格、医疗机构可达性等研究食物环境与肥胖会用到。家庭层面家庭人口结构、收入、支出、住房、做饭燃料等经济学者主要盯这一层。个人层面性别、年龄、教育、职业、吸烟饮酒、身体活动、身高体重、血压血糖等公共卫生研究的主力。营养层面24小时膳食回顾、连续三天的家庭称重记膳、主要营养素估算值营养学研究靠这一层。这些层面之间靠统一的ID体系关联。只要不把ID合并错就能在同一个数据文件里得到社区—家庭—个人的完整链条。经常有人问CHNS和CFPS、CHARLS有什么区别简单说CFPS和CHARLS更偏家庭与社会经济CHNS最突出的优势是膳食营养和身体测量数据非常详细且历史轮次够长。这也决定了它适合研究营养转型、膳食结构、慢性病长期趋势这类问题。第1章第1节只解决拿到数据的问题但如果不先理解数据分层后面下载时你连该选哪几个压缩包都不知道。2. 官网首页解析数据藏在哪一层菜单里2.1 两个入口先把主次分清楚CHNS数据目前最权威的发布渠道是北卡罗来纳大学教堂山分校卡罗来纳人口中心Carolina Population Centercpc.unc.edu的CHNS项目主页。国内也有一些门户或镜像站会转载CHNS相关资料但作为数据用户我建议一律以项目主页发布的内容为准。原因很简单数据文件的更新、勘误、版本说明都会最先出现在主页上。镜像站可能滞后甚至可能保留旧版本的错误文件。访问项目主页之后建议先看首页上的最新公告部分。CHNS会不定期发布轮次更新、变量勘误、文档替换说明。我曾经遇到过同行用旧版本合并脚本跑完程序才发现数据文件被官方勘误过白白浪费了一周时间。所以下载前先看公告应该是使用这个数据库的第一条准则。2.2 一级菜单分别放什么CHNS主页的一级菜单结构比较传统常见的大致是这几个栏目项目介绍、数据、文档、出版成果、联系我们。项目介绍里写的是调查背景、抽样设计、历次轮次、合作机构。如果你要在论文里介绍数据来源背景这段文字就是现成素材。数据栏目是下载的核心入口点进去一般会看到公开使用数据和受限数据两类。文档栏目放的是问卷、编码手册、技术报告、数据字典。很多人跳过这里直接下载拿到数据后才发现变量标签看不懂还得回头翻文档。我个人的习惯是先把文档栏目里跟最新轮次对应的问卷和编码说明下载下来再开始动数据。出版成果栏收录了使用CHNS数据发表的主要论文写致谢和引用格式时可以直接参考。这几个栏目的分工看似简单但确实影响你的操作顺序。先读文档再下数据最后看出版成果里的方法学文章这一套流程基本不会踩大坑。2.3 为什么首页看不到一键下载很多第一次来找数据的人会在首页上浪费大量时间找下载按钮。原因不是眼力不行而是CHNS确实没有公开裸下载这个选项——它需要你先确认身份和研究用途再开放下载权限。这个机制主要有两层考虑。第一层是伦理和数据安全。CHNS虽然发布的是匿名化数据但里面包含了健康指标、膳食摄入、家庭收支这类细颗粒信息理论上仍存在间接识别的可能性。数据提供方需要通过用户注册来约束使用范围也方便在有新勘误时通知到人。第二层是数据质量控制。通过申请制官方可以统计谁在用数据、用在什么研究上后续回访和版本维护也更有针对性。这和很多国际纵向数据库的做法一致并不是故意为难使用者。所以正常流程是进入数据栏目先找到申请入口填写基本信息与使用承诺等待后台开放下载。对大部分硕士生和博士生来说申请的是公开使用数据审核周期一般不会太长。3. 注册申请环节最容易翻车的一步3.1 标准注册流程拆开来看虽然官网界面会改版但申请的核心步骤基本固定在数据下载页面找到访问申请入口一般是一个申请数据访问的按钮或在线表格。填写姓名、所属机构、单位邮箱、研究目的等基本信息。研究目的建议直接写明是毕业论文、课题申报还是期刊论文并描述清楚准备研究什么问题。阅读并同意数据使用协议。核心条款通常包括不将数据传输给未经授权的第三方、不试图重新识别个人身份、仅用于申请时声明的学术研究用途、发表成果时按规定致谢。提交后等待审核。审核通过的标志一般是注册邮箱收到下载链接或者账号状态变为可下载。在下载页面选择需要的轮次和文件打包下载。不少人第一次填英文界面的申请表会在研究目的这个自由文本栏里写得特别短。我见过只写一个research就被退回的。倒不是审核方苛刻而是数据提供方有义务了解数据会被用在哪里。正常写一两句话比如研究中国城乡居民膳食结构变化与超重肥胖趋势的关系就够了。这里不需要长篇大论但必须让审核人员看到具体方向。3.2 公开使用数据和受限数据的区别对比维度公开使用数据受限数据获取方式在线申请、邮箱审核通常较快放行需要单独提交详细材料有的需要导师签字、机构背书数据内容匿名化处理后的社区、家庭、个人、营养核心变量可能包含更精确的地理位置、特殊群体标识等敏感字段适合场景课程作业、毕业论文、一般期刊论文涉及空间分析、精细地理信息的研究使用成本免费需遵守使用协议免费但流程更长、约束更严大部分学生用的都是公开使用数据。如果只是做常规论文不建议一开始就碰受限版。受限数据申请流程长、材料多还可能连累导师签字。等研究设计确实需要更细的地理颗粒度时再走受限申请路线也不迟。这个选择想清楚可以帮你节省大量时间。3.3 几个我实测过的小提醒注册邮箱建议用机构邮箱或长期稳定的个人邮箱一定不要用那种收不到境外邮件的临时邮箱。审核结果和下载链接都是通过邮件发的漏掉一封就可能耽误一周。申请之后几天没动静可以在官网联系方式处礼貌写封邮件询问进度说明自己已提交申请、请帮忙确认。不要频繁重复提交表单反而会造成后台数据混乱。还有一点提醒记住自己注册时填的是什么用途。后面如果因为换题目、换毕业年份需要变更研究目的最好主动联系数据方更新信息而不是悄悄改变数据用途。这类长期数据库对使用记录的信用是有记忆的。4. 下载后的文件结构与第一次打开4.1 一个压缩包里装着什么审核通过后你会得到下载入口里面通常是按轮次组织的压缩包。有的轮次是把全部数据文件打包成一个ZIP有的则按社区、家庭、个人、营养分成多个压缩包。下载下来后先别急着重命名统一放进一个以本轮次命名的文件夹里。解压后根目录一般会出现三类东西数据文件常见格式是SAS的.sas7bdat、Stata的.dta个别轮次也提供CSV或文本格式。文档文件数据字典、问卷副本、变量编码表、读取说明。脚本示例官方有时会附上读取合并的示例脚本SAS、Stata、R版本都可能有。别小看这些脚本它们通常是官方认可的合并方式比自己从头写merge要稳。文件名里的缩写也值得注意常见的会带chn、hh、ind、nut这些片段分别对应社区、家庭、个人和营养层面。每一轮的具体命名以压缩包内的README为准不要靠猜。4.2 用Stata或R把数据读进来打开数据的工具最主流的是Stata和R。SAS格式的.sas7bdat文件R里可以用haven包的read_sas读取Stata格式的.dta文件Stata里直接useR里用haven::read_dta。无论哪种方式核心注意点都一样先把路径设置成存放本轮数据的文件夹再逐个层面读入先不要急着跨轮次合并。下面给一个R读取的极简示例假设你已把某个轮次的数据解压到工作目录下的chns某个文件夹文件是个人层面的.dta格式library(haven) ind - read_dta(chns_round/person.dta) View(ind)命令行敲完之后第一件事不是分析而是用str()或dim()看行数、列数和变量类型。如果发现数据文件里出现大量缺失或者列数和官方文档对不上先不要怀疑自己的代码优先去官网检查是否有更新版本。数据文件的版本号经常藏在README或文件名末尾先记录版本号再动手是明智的。4.3 第一次打开数据后的三查拿到数据后我建议先做三个动作再做任何统计。第一查缺失值比例。特别是你论文要用的核心变量比如收入、身高体重、膳食摄入量。缺失比例过高说明该轮次样本存在问题要么换变量定义要么在论文里如实说明决不能让缺失值悄悄影响结果。第二查标识变量能否唯一识别记录。个人数据的ID可能只在家庭内唯一如果没有把社区、家庭ID一起带上合并就会串人。这就是为什么合并前必须先看官方文档里的ID层级说明构造主键后再合并。第三查轮次之间的口径差异。CHNS每轮问卷都会有微调同一道题的选项编号可能变收入变量的口径也可能调整。跨年比较时务必逐年阅读问卷原文确认口径一致后再合并。这个坑后面章节会专门展开但拿到数据的第一天就要有这根弦。提示下载任何一个轮次的数据前都先回官网首页看一眼最新公告。CHNS偶尔会发布变量勘误和文件替换说明用旧文件就算跑通了程序结果也可能是不成立的。5. 学术使用规范和让人头疼的细节5.1 引用与致谢怎么写用CHNS数据写论文一般需要在正文描述数据来源时写清楚CHNS的名称、调查年份、数据访问渠道。期刊要求的数据可用性声明里也应明确写出。如果觉得不好措辞可以直接参考官网出版成果栏目或文档页面提供的推荐引用文本照抄并调整作者顺序即可。多数期刊还要求对数据提供方致谢放在Acknowledgements部分写清数据来自中国居民健康与营养调查CHNS感谢项目组和研究对象的贡献。这个环节看着琐碎但确实关系到数据后续能否持续开放值得规范操作。还有一个细节容易忽略审稿人会认真核对数据来源描述和研究时限。如果你在方法部分写了使用某年至某年数据正文里就要保证引用的轮次确实包含这些年份。CHNS的轮次编号和自然年份通常一致但下载时仍要以数据文件里标注的调查年份为准。5.2 跨轮次合并时最容易出的错第一收入口径。CHNS的收入和支出变量在不同轮次之间的定义有调整金额单位也可能变化。如果直接用变量名合并后对比金额可能看到的是没有意义的收入暴涨。正确做法是先读每轮的技术报告和编码手册找出收入变量的实际含义必要时按物价指数折算或统一口径再比较。第二年龄口径。同一轮数据的年龄变量有时是实足年龄有时是调查时年龄。建议尽早把出生年份当作更稳定的标识避免直接用年龄跨轮匹配尤其是研究队列变化时。第三抽样权重。CHNS的抽样设计在不同轮次之间可能因补充样本而调整测算总体水平指标时要用官方提供的调查权重否则结果可能严重偏倚。如果只是做回归是否使用权重要看研究问题但至少要检查官方文档里有没有建议使用的权重变量。5.3 伦理与合规底线即使CHNS数据已经匿名化使用中仍要守住几条红线不尝试通过任何变量组合还原个人身份不把数据向无关人员转发或上传到公开平台发表结果时不能出现可间接定位到个体的描述申请时的研究用途与实际用途保持一致。如果只是课程作业或毕业设计使用还要看看所在院校是否有额外要求。部分高校对涉及健康数据的研究会要求先做伦理备案即使数据来自公开数据库也可能需要提交伦理申请或豁免说明。建议在开题阶段就去科研管理部门问清楚不要等论文写完再补那时候会很被动。最后再强调一个容易被忽略的细节CHNS的数据文件虽然免费开放但免费不代表没有约束。下载页面的用户协议具有效力转许可和商业用途通常被明确禁止。我见过有人把下载的数据放到课题组共享网盘里严格来说这已经超出了个人使用范围。正确做法是让合作者各自单独申请资料齐全后再一起分析。规范化使用公开数据既是对项目组的尊重也是在维护所有研究者免费使用数据的权利。这篇的内容先解决把数据拿到手这一步。说实话CHNS的官网和下载流程不算复杂但它跟国内用户熟悉的下载模式差别大所以第一次走的人总觉得到处是坑。按照上面这些步骤操作正常情况下半小时左右就能完成申请和下载。我在实操里最想再强调一遍的还是两条一是下载前先看公告二是合并前先读README。这两条在课题组里我重复过无数遍每次有人不听后面都要花两三天来补救。等后面写到第9篇第1章第2节、第3节我会继续拆CHNS的数据合并和变量口径问题。这次就先聊到这。