三个容易混淆的统计对象
收入是在一段时期内获得的资源流量,财富是在某个时点拥有的资产减负债。市场收入描述劳动、经营和资本形成的初次收入;可支配收入在此基础上加入现金转移,再扣除所得税和社会缴款。三种对象都能计算不平等程度,但彼此不能互换。
世界银行的世界发展指标通常把基尼系数写成 0 到 100,OECD 的收入不平等指标通常写成 0 到 1。两者只相差表达尺度:40 与 0.40 可以代表同一个面积比例。真正影响可比性的,是收入或消费口径、家庭规模调整、人口覆盖和调查年份。
正文中的国际定义来自世界银行和 OECD,现实收入示例来自中华人民共和国国家统计局公布的 2024 年居民收入数据。下列链接均指向发布机构的一手页面。
一手来源
世界银行 · WDI 元数据
提供基尼系数、洛伦兹曲线、0–100 表达方式及跨国可比性限制。元数据说明,相同系数可能来自不同曲线,且该指标不能简单分解为组内与组间成分。
世界银行 · 开放数据
提供各经济体的基尼指标入口、年份与下载选项。不同观测有的基于收入、有的基于消费,调查年份也并非完全同步。
OECD · 收入不平等指标
解释家庭可支配收入口径:雇员和自雇收入、资本收入、现金转移之和,扣除所得税和社会缴款;其页面通常用 0 到 1 表达系数。
OECD · 收入分配数据库指南
详细说明市场收入、可支配收入、家庭等值尺度、人口单位和质量控制。正文中的家庭人数平方根示例依据该指南的常用等值方法。
OECD · Data Explorer
用于查询收入分配数据库中的可用序列。引用具体数字时,应保存指标名称、收入定义、单位、年份与下载日期,而不只复制图表中的单个值。
国家统计局 · 2024 年居民收入
正文引用全国居民人均可支配收入 41,314 元、中位数 34,707 元及 84.0% 比例。发布同时说明住户调查的分层、多阶段、与人口规模成比例抽样,以及约 16 万调查户。
教学案例的边界
五户家庭收入 2、4、6、8、20 是人为构造的演算数据,单位可以理解为同一种任意收入单位。五户被假定具有相同家庭规模和相同调查权重,收入均为正,并处于同一参考期。它的唯一目的,是把累计份额、梯形面积和 0.40 的结果连接起来。
该案例不代表中国或任何国家的收入分布,也不主张 0.40 是政策警戒线。现实分布包含成千上万条加权记录、家庭规模调整、零值或负值处理、缺失数据和尾部校准。正文将复杂性分层引入,是为了让读者先掌握机制,再知道机制在真实数据中会遇到什么限制。
图中的洛伦兹曲线由表格数据手工绘制,并附有标题、文字描述和同值表格。阴影只帮助识别面积关系,精确结果来自表中节点的梯形求和。颜色不是信息的唯一载体,完全平等线还使用虚线区分。
不同资料为什么会给出不同数字
住户调查擅长覆盖大多数家庭的收入与消费,却可能遗漏极高收入者或低估资本收入;税务行政资料对申报收入记录更细,但人口覆盖和收入定义受税制影响。将两类资料校准后得到的顶端份额,可能高于单独住户调查的结果。
收入与消费也对应不同时间尺度。家庭在收入暂时下降时可以动用储蓄维持消费,因此消费分布通常比当期收入分布平滑。财富则会随房价、金融市场和负债变化,集中程度往往高于收入。数据库在指标名称旁保留这些口径,正是因为“基尼系数”本身不足以说明底层对象。
调查方法更新还会在时间序列中形成断点。抽样框、问卷、家庭等值尺度、零值与负值处理、缺失值填补或顶端校准发生变化时,数字可能跳变。此类变化属于测量体系的一部分,并不必然对应同等幅度的社会变化。